Trois agents, trois fonctions à distinguer
La documentation OpenAI distingue OAI-SearchBot pour la recherche, GPTBot pour des contenus susceptibles de servir à l’entraînement, et ChatGPT-User pour certaines visites déclenchées par un utilisateur. Les choix concernant OAI-SearchBot et GPTBot sont indépendants. Une visite ChatGPT-User ne constitue donc pas une preuve d’inclusion dans la recherche.
Écrivez la décision attendue avant toute intervention : quelles pages publiques doivent être découvertes, quels usages sont acceptés et quelles ressources doivent rester privées ? Une règle globale copiée sans ce cadrage risque de contredire les attentes du propriétaire du site.
Contrôler plusieurs couches d’accès
Le fichier robots.txt indique des règles d’exploration ; il ne remplace pas un contrôle d’accès aux contenus confidentiels. Google rappelle aussi qu’une URL bloquée à l’exploration peut encore être connue et apparaître dans ses résultats. Il faut donc distinguer exploration, indexation et protection réelle.
Pour une page destinée à être publique, examinez la réponse HTTP, les redirections, les directives d’indexation et la réponse du CDN ou du pare-feu. Un navigateur connecté peut afficher une page qu’un visiteur non authentifié ne reçoit pas. Un test réussi sur la page d’accueil ne valide pas automatiquement une fiche produit ou un sous-domaine.
Vérifier des pages représentatives
Choisissez un petit ensemble de pages qui portent les informations commerciales essentielles. L’objectif est d’isoler les obstacles, pas de désactiver toutes les protections du site. Faites confirmer les changements par la personne responsable de l’infrastructure et gardez un moyen de revenir à la configuration précédente.
- Une page d’offre, une page de preuve et une page d’identité.
- Le HTML réellement reçu, les codes de réponse et les redirections.
- Les règles robots, les restrictions réseau et les journaux disponibles.
- La date du contrôle, la modification proposée et son responsable.
Livrer un constat, pas une promesse de citation
Après correction, refaites les mêmes contrôles et conservez les réponses obtenues. Si vous identifiez un robot dans les journaux, ne vous fiez pas uniquement au nom déclaré dans son user-agent : rapprochez les informations disponibles de la documentation officielle du fournisseur.
Un accès fonctionnel enlève un obstacle technique. Il ne permet pas de promettre que le moteur choisira cette page, la citera ou générera un contact. Le dossier de sortie doit séparer les blocages résolus, les décisions du propriétaire et les vérifications qui restent à faire. C’est cette distinction qui rend l’intervention exploitable par l’agence et son client.
À retenir
La bonne question n’est pas « tous les robots sont-ils autorisés ? », mais « le bon contenu est-il accessible pour l’usage choisi, sans ouvrir ce qui doit rester privé ? ».