Robots d’entraînement
GPTBot, ClaudeBot, Google-Extended, CCBot et d’autres collectent du contenu pour entraîner les futurs modèles. Les bloquer est un choix de licence.
Outil gratuit de TK WebHosts
ChatGPT, Claude et Perplexity peuvent-ils vraiment lire votre site ? Vérifiez quels robots votre robots.txt autorise — séparés entre robots d’entraînement et agents en direct qui décident si les réponses IA vous citent.
| Robot | Opérateur | Accès |
|---|
Ajoutez ceci à votre robots.txt pour ouvrir les robots de réponse (les robots d’entraînement peuvent rester bloqués) :
GPTBot, ClaudeBot, Google-Extended, CCBot et d’autres collectent du contenu pour entraîner les futurs modèles. Les bloquer est un choix de licence.
OAI-SearchBot, ChatGPT-User, Claude-SearchBot et PerplexityBot consultent votre page quand un utilisateur pose une question — c’est ainsi que les assistants IA vous citent.
Googlebot et Bingbot restent le socle. Les bloquer par accident est fatal — ce vérificateur l’affiche immédiatement en rouge.
GPTBot collecte des pages pour entraîner les futurs modèles. ChatGPT-User et OAI-SearchBot consultent et citent vos pages en direct. Bloquer GPTBot ne concerne que l’entraînement.
Non. Robots d’entraînement et robots de réponse sont des user-agents distincts avec des règles distinctes. Beaucoup d’éditeurs bloquent l’entraînement tout en restant citables.
Sans robots.txt, tous les robots sont autorisés — ce n’est pas une erreur. Une erreur serveur sur le fichier est grave : Google la traite comme « ne pas crawler ».
C’est une convention, pas un verrou. Les grands opérateurs s’y conforment publiquement ; cela n’arrête pas un scraper qui ignore les règles.
Lancez l’analyseur SEO complet — dix catégories notées, une liste de tâches priorisée et un rapport partageable.
Lancer un audit SEO gratuit