CCBot
Robot opéré par Common Crawl. Ce robot collecte du contenu pour entraîner des modèles. Le bloquer est un choix éditorial parfaitement légitime, et sans effet direct sur vos citations : c’est le seul cas où le refus ne vous coûte pas de visibilité.
- Opérateur
- Common Crawl
- Finalité
- Entraînement
- Applique robots.txt
- oui
- Chaîne d’agent utilisateur
- CCBot/2.0 (https://commoncrawl.org/faq/)
L’autoriser
À placer dans le robots.txt servi à la racine de votre domaine. Les groupes de robots.txt ne se cumulent pas : un robot n’applique que le groupe le plus spécifique qui le nomme, donc une règle générale plus permissive ne s’ajoutera pas à celle-ci.
L’autoriser laisse votre contenu entrer dans des corpus d’entraînement. Aucun effet direct sur vos citations : ce n’est pas ce robot-là qui les alimente.
User-agent: CCBot Allow: /
Le refuser
Le refus est immédiat pour les robots qui appliquent robots.txt, et sans effet rétroactif : ce qui a déjà été collecté l’est.
Le refuser est un choix éditorial légitime et sans coût de visibilité, le seul cas du répertoire où c’est vrai. À condition de ne pas refuser en même temps le robot de recherche du même opérateur.
User-agent: CCBot Disallow: /
Comment vérifier son passage chez vous
Cherchez la chaîne d’agent utilisateur ci-dessus dans vos journaux serveur : c’est la seule preuve qu’un robot est réellement venu. Une directive écrite dans robots.txt dit ce que vous demandez, pas ce qui se passe.
Les autres robots de Common Crawl
Common Crawl ne publie qu’un seul robot. Une directive écrite pour lui ne concerne aucun autre jeton de cet opérateur.
Les autres robots de même finalité
Une décision prise ici se prend rarement seule : ces robots relèvent du même arbitrage.