Votre site reçoit chaque jour la visite de robots d’intelligence artificielle. Certains viennent entraîner des modèles avec votre contenu, d’autres viennent le citer en réponse à des questions d’utilisateurs (avec un lien vers vous). Tout l’enjeu du fichier robots.txt moderne est de distinguer les deux. Beaucoup d’entreprises se trompent de réglage, dans un sens ou dans l’autre.
Comprendre qui frappe à votre porte
Les robots IA se rangent en trois familles, aux intérêts très différents pour vous :
Les robots d’entraînement
GPTBot (OpenAI), Google-Extended, ou encore CCBot collectent du contenu pour entraîner les futurs modèles. Votre contenu enrichit le modèle, sans citation ni trafic en retour. Les autoriser est un choix philosophique plus que commercial.
Les robots de recherche IA
OAI-SearchBot (ChatGPT Search), PerplexityBot, et les robots qui alimentent les réponses en temps réel : quand un utilisateur pose une question, ils consultent les sources et citent les sites avec des liens. Les bloquer, c’est renoncer à exister dans les réponses des IA : exactement ce qu’on cherche à éviter avec le GEO.
Les aspirateurs sans scrupule
Des robots agressifs qui ignorent parfois le robots.txt, surchargent les serveurs et ne rapportent rien. Eux se gèrent au niveau serveur (pare-feu, limitation de débit), pas par politesse déclarative.
La position que nous recommandons (et appliquons)
Autoriser les moteurs de recherche IA qui citent leurs sources : c’est de la visibilité gratuite auprès d’utilisateurs en recherche active. Maîtriser les robots d’entraînement purs selon votre sensibilité. Bloquer les aspirateurs abusifs au niveau serveur. C’est le réglage du site que vous lisez.
Le réglage type, expliqué
Un robots.txt moderne se construit par strates :
Votre robots.txt face aux IA : la méthode
- Lister les robots qui visitent réellement votre site (journaux serveur)
- Autoriser explicitement les moteurs de recherche classiques et IA
- Décider du sort des robots d'entraînement (autoriser, limiter ou bloquer)
- Bloquer les zones sans valeur publique (admin, paniers, recherche interne)
- Garder le sitemap déclaré et à jour
- Réévaluer tous les 6 mois : de nouveaux robots apparaissent sans cesse
Ce que le robots.txt ne fait pas
Soyons clairs sur ses limites : c’est une demande polie, pas une barrière. Les robots respectueux s’y conforment ; les autres l’ignorent. Il ne protège pas non plus vos contenus déjà absorbés par le passé. Pour les données réellement sensibles, la réponse n’est pas le robots.txt mais l’authentification et l’architecture : ne jamais exposer publiquement ce qui ne doit pas l’être. C’est l’un des sujets de notre offre de protection de l’intelligence numérique.
Un choix stratégique, à poser explicitement
Bloquer tous les robots IA « par prudence » revient à s’effacer des moteurs de demain. Tout autoriser sans réfléchir revient à donner son fonds de commerce éditorial. Entre les deux, il y a un réglage adapté à votre activité : c’est typiquement une décision que nous documentons lors d’un audit GEO.
Analyse de vos journaux serveur, réglage robots.txt adapté à votre stratégie, et suivi des citations IA : on s'en occupe dans le cadre de l'offre SEO & GEO.