meta-externalagent
Robot opéré par Meta. Ce robot collecte du contenu pour entraîner des modèles. Le bloquer est un choix éditorial parfaitement légitime, et sans effet direct sur vos citations : c’est le seul cas où le refus ne vous coûte pas de visibilité.
- Opérateur
- Meta
- Finalité
- Entraînement
- Applique robots.txt
- oui
- Chaîne d’agent utilisateur
- meta-externalagent/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler)
L’autoriser
À placer dans le robots.txt servi à la racine de votre domaine. Les groupes de robots.txt ne se cumulent pas : un robot n’applique que le groupe le plus spécifique qui le nomme, donc une règle générale plus permissive ne s’ajoutera pas à celle-ci.
L’autoriser laisse votre contenu entrer dans des corpus d’entraînement. Aucun effet direct sur vos citations : ce n’est pas ce robot-là qui les alimente.
User-agent: meta-externalagent Allow: /
Le refuser
Le refus est immédiat pour les robots qui appliquent robots.txt, et sans effet rétroactif : ce qui a déjà été collecté l’est.
Le refuser est un choix éditorial légitime et sans coût de visibilité, le seul cas du répertoire où c’est vrai. À condition de ne pas refuser en même temps le robot de recherche du même opérateur.
User-agent: meta-externalagent Disallow: /
Comment vérifier son passage chez vous
Cherchez la chaîne d’agent utilisateur ci-dessus dans vos journaux serveur : c’est la seule preuve qu’un robot est réellement venu. Une directive écrite dans robots.txt dit ce que vous demandez, pas ce qui se passe.
Les autres robots de Meta
-
meta-externalfetcher
Va chercher une page qu’un humain a demandée.
Les autres robots de même finalité
Une décision prise ici se prend rarement seule : ces robots relèvent du même arbitrage.