Robots IA et crawlers

Une nouvelle generation de robots explore le web pour alimenter les modeles d'intelligence artificielle. Trois categories, trois decisions differentes pour votre visibilite.

24robots
3categories
11entrainement

Trois usages, trois impacts differents. Bloquer un robot d'entrainement protege votre contenu sans rien vous couter en visibilite. Bloquer un robot d'indexation vous retire des reponses IA. Bloquer un robot de visite empeche vos lecteurs d'acceder a votre page via un assistant.

Entrainement des modeles (11 robots)

1GPTBot(OpenAI)
Collecte du contenu pour l'entrainement des modeles GPT.
Documentation officielle
2ClaudeBot(Anthropic)
Collecte du contenu pour l'entrainement des modeles Claude.
Documentation officielle
3Google-Extended(Google)
Determine si Google peut utiliser vos pages pour entrainer Gemini, sans affecter votre presence dans la recherche.
Documentation officielle
4GoogleOther(Google)
Usages internes de Google, hors recherche publique.
Documentation officielle
5CCBot(Common Crawl)
Robot de l'archive publique Common Crawl, dont les donnees servent de source a de nombreux modeles.
Documentation officielle
6Applebot-Extended(Apple)
Controle l'usage de vos pages pour entrainer les modeles Apple, sans sortir de Siri.
Documentation officielle
7Meta-ExternalAgent(Meta)
Collecte pour l'entrainement des modeles Llama.
Documentation officielle
8Bytespider(ByteDance)
Collecte pour les modeles de ByteDance, repute peu respectueux du robots.txt.
9cohere-ai(Cohere)
Collecte pour les modeles de Cohere.
10Diffbot(Diffbot)
Transforme les pages en donnees structurees, revendues notamment pour l'entrainement.
Documentation officielle
11omgili(Webz.io)
Indexe forums et discussions, revendus comme corpus d'entrainement.

Indexation pour les reponses IA (9 robots)

12OAI-SearchBot(OpenAI)
Indexe le web pour la recherche de ChatGPT, sans impact sur l'entrainement.
Documentation officielle
13Claude-SearchBot(Anthropic)
Indexe le web pour les reponses de Claude.
Documentation officielle
14Googlebot(Google)
Robot principal de la recherche Google, alimente aussi les AI Overviews.
Documentation officielle
15PerplexityBot(Perplexity)
Indexe le web pour le moteur de reponses Perplexity.
Documentation officielle
16bingbot(Microsoft)
Robot de Bing, alimente aussi les reponses de Copilot.
Documentation officielle
17Applebot(Apple)
Alimente Siri et les suggestions Spotlight.
Documentation officielle
18Amazonbot(Amazon)
Alimente Alexa et les services Amazon.
Documentation officielle
19DuckAssistBot(DuckDuckGo)
Alimente les reponses assistees de DuckDuckGo.
Documentation officielle
20YouBot(You.com)
Indexe le web pour You.com.
Documentation officielle

Visite a la demande (4 robots)

21ChatGPT-User(OpenAI)
Visite une page quand un utilisateur de ChatGPT la demande.
Documentation officielle
22Claude-User(Anthropic)
Visite une page a la demande d'un utilisateur de Claude.
Documentation officielle
23Perplexity-User(Perplexity)
Visite une page quand un utilisateur clique sur une source dans Perplexity.
Documentation officielle
24MistralAI-User(Mistral)
Visite une page a la demande d'un utilisateur du Chat Mistral.
Ce qu'il faut retenir
Trois categories, trois decisions differentes. Bloquer l'entrainement protege votre contenu sans consequence sur votre visibilite. Bloquer l'indexation vous retire des reponses des assistants IA. Bloquer les visites a la demande empeche vos lecteurs d'acceder a votre page.

Chaque editeur publie sa documentation avec les regles a appliquer dans votre fichier robots.txt. Les liens ci-dessus pointent directement vers ces documentations officielles.

Pour aller plus loin : decouvrez notre catalogue de formations ou rejoignez l'Academie BusinessDigital.

Article redige par Franck PARIENTI, fondateur de BusinessDigital.fr, organisme de formation certifie Qualiopi specialise en Intelligence Artificielle.