phpBB-Lab-Bot : le robot de l’annuaire

Le compte phpBB-Lab-Bot est l’auteur des fiches importées par le robot de découverte de l’annuaire. Celui-ci aide l’équipe à repérer des sites et à préparer leurs fiches. Cette page explique ses visites et permet aux responsables de sites de contacter l’équipe.

Ses requêtes s’identifient dans l’en-tête User-Agent sous le nom PHPBBLabBot.

Comment fonctionne le robot ?

L’exploration part de sources fournies avec l’extension ou choisies par l’équipe. En mode autonome, elle se poursuit de site en site par les liens publics autorisés. Chaque source conserve son périmètre et les visites restent limitées en profondeur et en volume.

  • Le robot relève notamment le titre, les descriptions disponibles et la langue dans le HTML reçu. Il peut consulter les pages de présentation du même site pour compléter ces informations. En mode autonome, il classe chaque site d’après son contenu et les catégories de l’annuaire. Les extraits proviennent du site source ; ils ne sont pas présentés comme des textes originaux.
  • Les logos repérés sur le site peuvent être préparés dans un espace privé. Les images acceptées sont contrôlées et réencodées. Leur publication automatique exige une autorisation de reprise déclarée pour le domaine concerné.
  • La découverte d’une adresse ne suffit pas à publier une fiche. Le robot ne soumet à validation que les propositions disposant des informations requises, d’une catégorie suffisamment fiable et d’un logo exploitable. Les préparations insuffisantes restent hors de cette validation. La publication automatique, lorsqu’elle est autorisée pour une source examinée, exige notamment les droits de reprise et l’absence d’alerte imposant une vérification.

Le robot n’explore pas l’ensemble du Web. Les pages dont le contenu dépend de JavaScript peuvent rester incomplètes. La présence dans l’annuaire ne garantit ni l’indexation ni une position dans Google ou un autre moteur de recherche.

Respect de votre site

  • Le robot consulte robots.txt et respecte les règles applicables à son agent. Si ces règles ne peuvent pas être récupérées, il reporte l’exploration. Il tient également compte des consignes noindex, nofollow et des restrictions de reprise reconnues.
  • Les visites sont espacées et limitées par domaine ainsi que par un quota global quotidien. Les délais reconnus dans robots.txt et les demandes d’attente du serveur peuvent reporter une visite, qui sera reprise par la programmation. Lorsque le serveur le permet, des requêtes conditionnelles évitent de transférer à nouveau un contenu inchangé.
  • Le robot ne se connecte pas à un compte, ne soumet pas de formulaire et n’exécute pas le JavaScript des sites. Il ne contourne pas les protections d’accès et ne consulte pas les adresses de réseaux privés.

Des filtres recherchent certains indices de contenu sensible ou indésirable. Ils peuvent manquer un problème ou écarter un site légitime ; les signalements et la vérification humaine restent nécessaires.

Pour refuser les prochaines explorations par cet agent, vous pouvez ajouter ces lignes au fichier robots.txt situé à la racine de votre domaine :

User-agent: PHPBBLabBot
Disallow: /

Cette règle bloque l’exploration ; elle ne supprime pas une fiche déjà présente dans l’annuaire. Pour une correction ou un retrait, contactez l’équipe ci-dessous.

Correction, signalement ou retrait

Indiquez l’URL de votre site, celle de sa fiche si vous la connaissez, et le motif de votre demande. Précisez si vous souhaitez corriger des informations, signaler un contenu, retirer la fiche ou exclure le domaine des découvertes futures.

Une adresse de site et une brève explication suffisent pour commencer. N’envoyez pas de mot de passe ni de document sensible.

Contacter l’équipe

Consulter l’annuaire