¿Qué es un archivo robots.txt?
Un archivo robots.txt es un archivo de texto plano en la raíz de un sitio web (ejemplo.com/robots.txt) que indica a los rastreadores de los buscadores qué URLs pueden solicitar y cuáles no, según el Protocolo de Exclusión de Robots. Controla el rastreo, no la indexación: para mantener una página fuera de Google, usa una etiqueta noindex o protección con contraseña.
Más sobre el archivo robots.txt
Un archivo robots.txt no es estrictamente necesario. Si no existe, los rastreadores asumen que no hay restricciones: Google trata un robots.txt ausente (un 404) como si el archivo no existiera y puede rastrear todo lo que encuentre. Aun así, a la mayoría de los sitios les conviene tener uno para orientar a los rastreadores.
Un archivo robots.txt puede permitir o bloquear el rastreo de ciertas páginas, permitir páginas específicas que una regla más amplia bloquearía y señalar a los rastreadores dónde está tu mapa del sitio (sitemap). Lo que no puede hacer es forzar el rastreo de una página, y tampoco es una forma confiable de mantener una página fuera de los resultados de búsqueda; para eso usa una etiqueta noindex.
Cómo funciona un archivo robots.txt
Antes de rastrear un sitio, la araña del buscador solicita el archivo desde la raíz del sitio: ejemplo.com/robots.txt. Es un archivo de texto plano organizado en grupos. Cada grupo empieza con una línea User-agent que indica a qué bot se aplican las reglas (Googlebot, Bingbot o para todos), seguida de líneas Disallow y Allow con las rutas que ese bot puede o no solicitar. Un bot busca primero un grupo con su propio nombre y, si no lo encuentra, sigue el grupo .

El alcance es limitado a propósito: las reglas solo cubren el host exacto donde vive el archivo. Por eso blog.ejemplo.com necesita su propio robots.txt; el de ejemplo.com no lo cubre. ¿Y el nombre distingue entre mayúsculas y minúsculas? Sí: el archivo debe llamarse robots.txt, todo en minúsculas, y vivir en la raíz del sitio, porque su URL distingue entre mayúsculas y minúsculas como cualquier otra. Los rastreadores tampoco buscan el archivo en subdirectorios, así que uno en ejemplo.com/carpeta/robots.txt se ignora.
Cómo se ve un archivo robots.txt
¿WordPress crea este archivo automáticamente? Sí: si no existe un robots.txt físico, WordPress responde a las solicitudes de /robots.txt con un archivo virtual predeterminado que bloquea /wp-admin/ y permite admin-ajax.php. Para personalizarlo, sube tu propio archivo a la raíz del sitio o edita el archivo virtual con un plugin de SEO.
Este es el robots.txt típico de un sitio WordPress, con solo 4 líneas:
- `User-agent: *` indica que las reglas que siguen se aplican a cualquier bot que no tenga un grupo propio.
- `Disallow: /wp-admin/` pide a los rastreadores no solicitar nada dentro del área de administración de WordPress.
- `Allow: /wp-admin/admin-ajax.php` abre una excepción: un archivo que los temas y los plugins usan en páginas públicas.
- `Sitemap: https://ejemplo.com/sitemap.xml` señala a los rastreadores tu mapa de sitio XML, la lista de URLs que sí quieres que se rastreen. Si tu archivo no tiene una línea Sitemap, agrégala con la URL completa de tu sitemap.
Dos errores causan la mayor parte del daño con robots.txt. El primero es `Disallow: /`: la barra por sí sola coincide con todas las URLs, así que bloquea el rastreo del sitio completo, y casi siempre es un sobrante del entorno de pruebas (staging) que se publicó junto con el sitio. El segundo es bloquear los directorios de CSS o JavaScript: Google necesita esos archivos para renderizar tus páginas, y bloquearlos puede afectar cómo se evalúan. Si tu tráfico de búsqueda cae justo después de un lanzamiento, revisa este archivo primero.
¿Cómo probar tu archivo robots.txt?
Usa el informe de robots.txt de Google Search Console: ahí ves qué archivos robots.txt encontró Google para los 20 hosts principales de tu sitio, cuándo rastreó cada uno por última vez y qué errores o advertencias de análisis detectó, y puedes solicitar un nuevo rastreo después de corregir algo.
Robots.txt frente a noindex
El error más común con robots.txt es tratarlo como herramienta de eliminación. La documentación de Google es directa: robots.txt “no es un mecanismo para mantener una página web fuera de Google”. Los dos controles se reparten el trabajo así:
- Robots.txt controla el rastreo. Decide qué URLs puede solicitar un bot, nada más.
- Una página bloqueada puede indexarse de todos modos. Si otras páginas enlazan a una URL que robots.txt bloquea, Google puede indexarla sin visitarla nunca; Search Console reporta esas URLs con el estado de indexadas aunque robots.txt las bloquea. Si te pasa, la solución tiene tres pasos: desbloquea la ruta en robots.txt, agrega una etiqueta noindex a la página y solicita un nuevo rastreo en Search Console; mientras la página siga bloqueada, no puede mostrarle a Google su etiqueta noindex.
- Una etiqueta noindex saca una página de los resultados, pero el rastreador tiene que verla. Una página bloqueada en robots.txt nunca llega a mostrar su etiqueta noindex, así que no combines los dos.
La regla de decisión: usa robots.txt para administrar el tráfico de rastreadores y cuidar tu presupuesto de rastreo, una etiqueta noindex para mantener páginas fuera de los resultados de búsqueda y una contraseña para lo genuinamente privado. Un sitio de staging es el ejemplo clásico: ahí robots.txt es la herramienta equivocada por partida doble, porque una página bloqueada puede indexarse de todos modos y porque el archivo es público, así que una línea Disallow con una ruta privada anuncia exactamente dónde está. Mejor protege tus sitios de staging con contraseña.
Reglas voluntarias, no control de acceso
Robots.txt es una petición, no un candado. El Protocolo de Exclusión de Robots nació como una convención informal en 1994 y apenas en septiembre de 2022 se convirtió en un estándar formal de internet, el RFC 9309 (en inglés). El propio RFC deja claro que estas reglas no son una forma de autorización de acceso. Los rastreadores serios las respetan; los scrapers y los bots maliciosos las ignoran. Y como cualquiera puede abrir tu robots.txt en un navegador, nunca incluyas rutas que quieras mantener en secreto. Usa autenticación real para lo privado y trata robots.txt solo como señalización de tráfico.
Cómo bloquear los rastreadores de IA
Robots.txt también es donde defines reglas para los bots de IA. OpenAI documenta dos rastreadores principales (en inglés), y ambos respetan robots.txt: GPTBot recopila contenido para entrenar sus modelos, mientras que OAI-SearchBot muestra sitios en la búsqueda de ChatGPT. Cada uno se controla por separado. Para excluirte del entrenamiento de IA, agrega un grupo con `User-agent: GPTBot` y `Disallow: /`. OpenAI señala que la búsqueda de ChatGPT puede tardar alrededor de 24 horas en detectar un cambio en robots.txt.
Antes de bloquear, considera lo que está en juego: los sitios que bloquean a OAI-SearchBot no aparecen en las respuestas de la búsqueda de ChatGPT, así que bloquear los rastreadores de IA puede costarte la visibilidad y el tráfico de referencia que esas respuestas generan. Decidas lo que decidas, empieza por abrir tudominio.com/robots.txt en un navegador y leer lo que ya hay ahí: es la auditoría de robots.txt más rápida que puedes hacer.