SEO

Generador de robots.txt

Crea el archivo robots.txt de tu web añadiendo bloques de User-agent, reglas Allow y Disallow, y un sitemap opcional, listo para copiar.

Presets rápidos
Bloque 1

Sin rutas añadidas.

Sin rutas añadidas.

Los datos se procesan en tu navegador. No se envían ni se guardan en ningún servidor.

robots.txt generado

Paso a paso

Cómo usar esta herramienta

  1. 1

    Elige un preset rápido si quieres empezar de una plantilla habitual, o edita el bloque por defecto.

  2. 2

    Indica el User-agent del bloque (usa «*» para dirigirte a todos los rastreadores).

  3. 3

    Añade las rutas que quieres permitir en «Allow» y las que quieres bloquear en «Disallow».

  4. 4

    Añade más bloques si necesitas reglas distintas para robots distintos, incluye el sitemap si lo tienes y copia el resultado.

Metodología

Cómo se construye el archivo robots.txt

Cada bloque agrupa un User-agent con sus rutas permitidas y bloqueadas; el resultado se genera siguiendo ese orden.

Estructura de un bloque

User-agent: * ⏎ Allow: /ruta ⏎ Disallow: /ruta

Cada bloque empieza declarando a qué robot se dirige y a continuación lista las rutas permitidas y bloqueadas para ese robot.

Bloquear todo el sitio

User-agent: * ⏎ Disallow: /

La barra sola como valor de Disallow bloquea el rastreo de todo el sitio para ese User-agent.

Referencia al sitemap

Sitemap: https://tudominio.com/sitemap.xml

Es una línea independiente, fuera de los bloques de User-agent, que indica dónde está el mapa del sitio.

Casos prácticos

Ejemplos de bloques de robots.txt

Permitir el rastreo completo

Preset «Permitir todo»

User-agent: * ⏎ Allow: /

Es el comportamiento habitual por defecto: no hace falta bloquear nada si quieres que todo el rastreo esté permitido.

Sitio en construcción

Preset «Bloquear todo el rastreo»

User-agent: * ⏎ Disallow: /

Impide que los rastreadores accedan a ninguna parte del sitio mientras esté en desarrollo.

Bloquear una carpeta interna

Disallow: /admin/

User-agent: * ⏎ Disallow: /admin/

El rastreo queda bloqueado solo para esa carpeta; el resto del sitio sigue siendo rastreable.

Reglas distintas por robot

Bloque 1: User-agent Googlebot-Image, Disallow /fotos-privadas/. Bloque 2: User-agent *, Allow /

Dos bloques independientes en el mismo archivo

Cada User-agent puede tener sus propias reglas dentro del mismo robots.txt.

Guía

Guía sobre robots.txt: rastreo e indexación

Qué es robots.txt y qué controla

robots.txt es un archivo de texto público que se coloca en la raíz de un dominio para indicar a los rastreadores automáticos qué partes del sitio pueden recorrer y cuáles no. Es una convención que la mayoría de buscadores respeta, aunque no es una medida de seguridad ni un control de acceso.

Su función es controlar el rastreo: decide qué páginas puede visitar un robot para leerlas. No decide qué páginas aparecen en los resultados de búsqueda.

Rastreo e indexación no son lo mismo

Rastrear una página significa que un robot la visita y lee su contenido. Indexarla significa que ese contenido se guarda y se puede mostrar en los resultados de búsqueda. robots.txt actúa solo sobre el primer paso.

Si bloqueas una página con Disallow pero esa página ya tiene enlaces desde otros sitios, un buscador puede seguir mostrándola en los resultados con la URL y sin descripción, porque nunca llegó a rastrear el contenido para saber si debía excluirla. robots.txt no elimina páginas del índice de un buscador.

Cómo evitar que una página aparezca en Google

Para impedir que una página concreta aparezca en los resultados de búsqueda, la vía adecuada es añadir una etiqueta noindex en esa página (o una cabecera HTTP equivalente) y permitir que el robot pueda rastrearla para leer esa instrucción, o bien eliminar la página y que devuelva un código de error o una redirección.

Usar Disallow en robots.txt para ese objetivo no es fiable, porque impide precisamente que el robot llegue a leer la etiqueta noindex de esa página.

  • Para no indexar una página: usa noindex, no Disallow.
  • Para no rastrear una carpeta pesada o irrelevante: usa Disallow.
  • Para eliminar contenido ya indexado: elimina la página o bloquéala con noindex y espera a que el buscador la vuelva a rastrear.

Respuestas claras

Preguntas frecuentes