# ============================================================================= # robots.txt — Comparateur Notes de Frais # https://comparateur-notes-de-frais.fr # ============================================================================= # Site statique 100 % indexable. Aucune section privée, aucun paywall, aucune # zone admin exposée publiquement. Le sitemap-index est généré automatiquement # par @astrojs/sitemap au build (cf. astro.config.mjs). # # Stratégie IA : # - On BLOQUE les crawlers d'entraînement (GPTBot, ClaudeBot, Google-Extended, # etc.) → notre contenu ne sert pas à entraîner les modèles concurrents. # - On AUTORISE les crawlers de réponse en direct (ChatGPT-User, OAI-SearchBot, # Claude-User, Claude-SearchBot, PerplexityBot) → on reste citable dans les # réponses génératives = trafic référent indirect. # # Attention au nommage Anthropic : `ClaudeBot` est le crawler d'entraînement # (bloqué en section 2), `Claude-User` est déclenché par la question d'un # utilisateur et `Claude-SearchBot` alimente l'index de recherche de Claude # (autorisés en section 3). `Claude-Web` est l'ancien nom, conservé pour la # rétro-compatibilité. # # Note : le toggle "Managed robots.txt" de Cloudflare AI Crawl Control DOIT # rester DÉSACTIVÉ pour que ce fichier soit servi tel quel, sans la directive # expérimentale `Content-Signal:` que Lighthouse rejette comme invalide. # ============================================================================= # ----------------------------------------------------------------------------- # 1. Règle par défaut : tout indexable pour les crawlers SEO classiques # SAUF les redirections d'affiliation `/go//` qui sont des 302 # sortantes (pas d'intérêt SEO, signal de trust négatif si indexées). # # On autorise explicitement les surfaces de discovery destinées aux # moteurs de réponse en direct et aux clients MCP : # - /llms.txt : index markdown des URL éditoriales # - /.well-known/mcp/ : manifeste de découverte du serveur MCP # - /mcp : endpoint JSON-RPC du serveur MCP # ----------------------------------------------------------------------------- User-agent: * Allow: / Allow: /llms.txt Allow: /.well-known/mcp/ Allow: /mcp Disallow: /go/ Disallow: /admin/ # ----------------------------------------------------------------------------- # 2. Crawlers d'entraînement IA — BLOQUÉS # Justification : pas de consentement explicite à l'entraînement de modèles # génératifs concurrents. Référence : opt-out documenté par chaque éditeur. # ----------------------------------------------------------------------------- # OpenAI — bot dédié au scraping pour entraînement GPT # Doc : https://platform.openai.com/docs/bots User-agent: GPTBot Disallow: / # Anthropic — bot dédié au scraping pour entraînement Claude # Doc : https://docs.anthropic.com/en/docs/claude/crawler User-agent: anthropic-ai Disallow: / # ClaudeBot est le crawler d'entraînement Anthropic. A ne pas confondre avec # Claude-User et Claude-SearchBot, autorisés en section 3. User-agent: ClaudeBot Disallow: / # Google — opt-out pour l'entraînement de Bard/Gemini, sans impact sur le SEO # Doc : https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers User-agent: Google-Extended Disallow: / # Apple Intelligence — opt-out pour l'entraînement Apple Foundation Models # Doc : https://support.apple.com/en-us/119829 User-agent: Applebot-Extended Disallow: / # Meta AI (Llama) — opt-out pour l'entraînement User-agent: meta-externalagent Disallow: / User-agent: FacebookBot Disallow: / # ByteDance (TikTok / Doubao) User-agent: Bytespider Disallow: / # Amazon (Alexa LLM, Titan) User-agent: Amazonbot Disallow: / # Common Crawl — alimente massivement les datasets d'entraînement publics # (C4, RedPajama, etc.). On opt-out pour éviter ces datasets en aval. User-agent: CCBot Disallow: / # Cohere User-agent: cohere-ai Disallow: / # You.com (YouBot) User-agent: YouBot Disallow: / # Omgili (datasets B2B alimentés revendus aux LLMs) User-agent: Omgilibot Disallow: / User-agent: Omgili Disallow: / # Diffbot (datasets B2B revendus) User-agent: Diffbot Disallow: / # Timpi (moteur alternatif à mining intensif) User-agent: Timpibot Disallow: / # Image scrapers IA User-agent: ImagesiftBot Disallow: / # ----------------------------------------------------------------------------- # 3. Crawlers de réponse en direct (citation IA) — AUTORISÉS # Justification : ces user-agents sont déclenchés par une requête utilisateur # final ; nous citer dans la réponse = trafic référent (citation source). # Ils n'entraînent PAS le modèle, ils lisent une page à la demande. # ----------------------------------------------------------------------------- # OpenAI — bot déclenché par les "browsing" actions de ChatGPT User-agent: ChatGPT-User Allow: / # OpenAI — bot d'indexation pour ChatGPT Search User-agent: OAI-SearchBot Allow: / # Anthropic : bot déclenché par la question d'un utilisateur dans Claude User-agent: Claude-User Allow: / # Anthropic : bot d'indexation pour la recherche de Claude User-agent: Claude-SearchBot Allow: / # Anthropic : ancien user-agent, conservé pour la rétro-compatibilité User-agent: Claude-Web Allow: / # Perplexity — bot d'indexation pour le moteur de réponse Perplexity User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / # ----------------------------------------------------------------------------- # 4. Sitemap # ----------------------------------------------------------------------------- Sitemap: https://comparateur-notes-de-frais.fr/sitemap-index.xml