Suivre les crawlers IA et auditer son robots.txt avec Vurto
Vurto suit le passage des crawlers IA sur votre site et audite votre robots.txt, pour vérifier que vos pages leur sont réellement accessibles.
Vurto suit le passage des crawlers IA (GPTBot, ClaudeBot, PerplexityBot, et autres) sur votre site et audite votre fichier robots.txt, pour vérifier que ces bots peuvent effectivement accéder aux pages que vous voulez voir citées dans les réponses génératives.
Pourquoi ce suivi compte
Un contenu peut être parfaitement structuré et pertinent : si les crawlers des IA génératives n'y accèdent pas, il ne sera jamais cité. Le fichier robots.txt et le contrôle des crawlers IA sont la première porte d'entrée technique de votre visibilité générative : avant de travailler le contenu ou le scoring sémantique d'une page, il faut s'assurer qu'elle est accessible aux bots qui alimentent ChatGPT, Claude, Gemini ou Perplexity.
Ce que Vurto montre sur le passage des crawlers
Vurto suit quels crawlers IA identifiés passent sur votre site et à quelle fréquence, ce qui donne une indication concrète de l'attention que les moteurs génératifs portent déjà à vos pages. Un site régulièrement visité par GPTBot, ClaudeBot et PerplexityBot est un site activement exploré comme source potentielle ; un site où le passage de ces bots est rare ou inexistant sur certaines sections indique une zone d'ombre à corriger avant toute chose.
Un signal à lire dans la durée, pas en instantané
Le passage d'un crawler IA un jour donné ne dit pas grand-chose isolément : ce qui compte est la régularité de ce passage sur plusieurs semaines. Un crawler qui visitait régulièrement une section du site et cesse brutalement de le faire est un signal à traiter en priorité, même en l'absence de tout changement apparent sur le site — cela peut indiquer un problème d'infrastructure (temps de réponse du serveur, erreurs techniques intermittentes) qui n'est pas nécessairement lié au robots.txt. À l'inverse, un crawler qui n'a jamais visité une section n'indique pas forcément un blocage : il se peut simplement que cette section n'ait encore jamais été jugée suffisamment pertinente par le moteur concerné pour justifier une exploration plus poussée.
L'audit du robots.txt
Vurto analyse votre fichier robots.txt pour identifier si des règles bloquent, intentionnellement ou par erreur, l'accès des crawlers IA à tout ou partie de votre site. Une règle bloquante peut être ancienne, héritée d'une configuration générique, et ne visait peut-être jamais spécifiquement les bots IA : c'est un cas fréquent, notamment sur des sites où le robots.txt n'a pas été revu depuis l'arrivée de ces nouveaux crawlers. L'audit permet de repérer précisément quelles règles s'appliquent à quels bots, plutôt que de deviner à partir d'un fichier texte brut.
Interpréter une absence de passage ou un blocage
Deux situations distinctes appellent des réponses différentes. Si le robots.txt bloque explicitement un crawler IA, la correction est directe : ajuster la règle pour autoriser l'accès aux sections concernées. Si en revanche rien ne bloque le crawler mais qu'il ne passe simplement pas, ou peu, le sujet n'est pas technique mais éditorial ou structurel — le site n'est peut-être pas encore considéré comme une source suffisamment pertinente ou à jour dans votre secteur, ce qui rejoint les enjeux traités par l'analyse de vos sources de citations.
Que corriger, et dans quel ordre
Commencez toujours par les blocages explicites dans le robots.txt : ce sont les corrections les plus rapides et au plus fort impact, puisqu'elles lèvent un obstacle total à l'accès. Une fois ces blocages levés, surveillez le retour du passage des crawlers sur les pages concernées lors des vagues d'analyse suivantes — un délai de quelques jours à quelques semaines est normal avant de voir un effet sur vos scores de visibilité. Intégrez cette vérification à votre suivi hebdomadaire : un audit robots.txt n'est utile qu'une fois, mais surveiller que rien ne se rebloque après une mise à jour technique du site est un contrôle à répéter régulièrement.
Ce que révèle un écart entre sections du site
Le passage des crawlers n'est pas nécessairement uniforme sur tout un site. Il est fréquent que les pages catégories et la page d'accueil soient régulièrement visitées, tandis que des sections plus profondes — fiches produit individuelles, pages FAQ, contenus de blog anciens — le sont beaucoup moins. Avant de conclure à un problème d'accès, vérifiez que ces pages sont bien liées depuis le reste du site (maillage interne, sitemap à jour) : un crawler, IA ou non, ne visite que ce qu'il peut atteindre en suivant des liens ou en lisant le sitemap. Un simple oubli de mise à jour du sitemap après l'ajout de nouvelles fiches produit peut expliquer une absence de passage aussi bien qu'un blocage dans le robots.txt.
Un cas fréquent
Une mise à jour technique du site (changement de CMS, migration d'hébergeur, nouvelle configuration de sécurité) peut réintroduire un blocage sans intervention volontaire — un pare-feu applicatif ou une règle anti-bot générique peut traiter les crawlers IA comme du trafic indésirable. C'est pour cette raison que l'audit robots.txt doit rester un contrôle récurrent plutôt qu'une vérification ponctuelle faite une seule fois au démarrage.