meta-externalfetcher
Robot opéré par Meta. Ce robot va chercher une page précise parce qu’un utilisateur vient de la demander. Le trafic est faible et intentionnel ; le bloquer revient à refuser de répondre à quelqu’un qui vous cherche.
- Opérateur
- Meta
- Finalité
- Requête d’un utilisateur
- Applique robots.txt
- non
- Chaîne d’agent utilisateur
- meta-externalfetcher/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler)
L’autoriser
À placer dans le robots.txt servi à la racine de votre domaine. Les groupes de robots.txt ne se cumulent pas : un robot n’applique que le groupe le plus spécifique qui le nomme, donc une règle générale plus permissive ne s’ajoutera pas à celle-ci.
L’autoriser coûte quelques requêtes par jour, toutes déclenchées par une personne qui vous cherchait. C’est le trafic le plus intentionnel qu’un robot puisse produire.
User-agent: meta-externalfetcher Allow: /
Le refuser
Le refus est immédiat pour les robots qui appliquent robots.txt, et sans effet rétroactif : ce qui a déjà été collecté l’est.
Le refuser fait répondre à cette personne que la page est inaccessible. Elle ne saura pas que c’est une décision de votre part.
Ce robot n’applique pas robots.txt : cet extrait ne l’arrêtera pas. Le refuser exige un filtrage côté serveur, sur son adresse ou sa chaîne d’agent utilisateur.
User-agent: meta-externalfetcher Disallow: /
Comment vérifier son passage chez vous
Cherchez la chaîne d’agent utilisateur ci-dessus dans vos journaux serveur : c’est la seule preuve qu’un robot est réellement venu. Une directive écrite dans robots.txt dit ce que vous demandez, pas ce qui se passe.
Les autres robots de Meta
-
meta-externalagent
Collecte pour l’entraînement des modèles.
Les autres robots de même finalité
Une décision prise ici se prend rarement seule : ces robots relèvent du même arbitrage.