Los crawlers de IA son los programas que usan empresas como OpenAI, Google, Anthropic o Perplexity para leer sitios web. El archivo robots.txt de tu sitio define si pueden entrar o no. Si querés que la IA te lea y te cite, tenés que asegurarte de no estar bloqueándolos, algo que pasa más seguido de lo que pensás.

Te cuento por qué escribimos esta nota. Cuando revisamos sitios de empresas que no aparecen en ChatGPT, una de las primeras cosas que miramos es el robots.txt. Y cada tanto encontramos una línea que bloquea a todos los bots de IA, puesta "por las dudas" hace un tiempo. Con esa línea, todo el trabajo de contenido queda invisible para la IA.

¿Qué es el robots.txt?

Es un archivo de texto en la raíz de tu sitio (tudominio.com/robots.txt) que les indica a los bots qué partes pueden rastrear. No es una barrera de seguridad, es una indicación que los bots serios respetan.

Los crawlers de IA más importantes

Bot De quién es Para qué lo usa
GPTBot OpenAI Recopilar contenido para entrenar sus modelos
OAI-SearchBot OpenAI Indexar sitios para la búsqueda dentro de ChatGPT
ChatGPT-User OpenAI Acceder a una página cuando un usuario lo pide en una conversación
Google-Extended Google Controlar el uso del contenido para entrenar Gemini (no afecta el buscador)
PerplexityBot Perplexity Indexar sitios para sus respuestas
ClaudeBot Anthropic Recopilar contenido para sus modelos

La distinción entre entrenamiento y búsqueda importa: podés tener razones para no querer que usen tu contenido para entrenar, pero si bloqueás los bots de búsqueda, directamente no vas a aparecer en las respuestas que consultan la web.

Un robots.txt recomendado para aparecer en la IA

Si tu objetivo es ganar visibilidad, algo así funciona bien:

User-agent: *
Allow: /

User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

Sitemap: https://tudominio.com/sitemap.xml

Si hay partes del sitio que no querés que se rastreen (un área privada, por ejemplo), sumá las líneas Disallow que correspondan.

¿Y si no quiero que entrenen con mi contenido?

Es una decisión válida. En ese caso, podés bloquear los bots de entrenamiento (como GPTBot o Google-Extended) y dejar abiertos los de búsqueda (como OAI-SearchBot, ChatGPT-User y PerplexityBot). Así protegés tu contenido del entrenamiento, pero seguís siendo visible cuando la IA busca en la web.

Para la mayoría de las empresas de servicios que quieren ser recomendadas, nuestra recomendación es dejar todo abierto.

Cómo revisar tu robots.txt en cinco minutos

  1. Entrá a tudominio.com/robots.txt.
  2. Buscá líneas con Disallow: / debajo de alguno de los bots de la tabla.
  3. Buscá también reglas generales (User-agent: * con Disallow: /) que bloqueen todo.
  4. Si usás un plugin de seguridad o un CDN, revisá que no esté bloqueando bots de IA por su cuenta.
  5. Sumá la línea del sitemap si no está.

Robots.txt, llms.txt y sitemap: cómo se complementan

  • robots.txt: quién puede entrar.
  • sitemap.xml: qué páginas existen.
  • llms.txt: qué es lo más importante y cómo está organizado. Te lo explicamos en Qué es llms.txt.

¿Querés que revisemos tu sitio?

Es una de las primeras cosas que miramos en el diagnóstico de nuestro servicio de SEO, GEO y AEO. A veces, un cambio de cinco minutos destraba todo lo demás. Escribinos.