Estructura de un bloque
User-agent: * ⏎ Allow: /ruta ⏎ Disallow: /rutaCada bloque empieza declarando a qué robot se dirige y a continuación lista las rutas permitidas y bloqueadas para ese robot.
SEO
Crea el archivo robots.txt de tu web añadiendo bloques de User-agent, reglas Allow y Disallow, y un sitemap opcional, listo para copiar.
Los datos se procesan en tu navegador. No se envían ni se guardan en ningún servidor.
Paso a paso
Elige un preset rápido si quieres empezar de una plantilla habitual, o edita el bloque por defecto.
Indica el User-agent del bloque (usa «*» para dirigirte a todos los rastreadores).
Añade las rutas que quieres permitir en «Allow» y las que quieres bloquear en «Disallow».
Añade más bloques si necesitas reglas distintas para robots distintos, incluye el sitemap si lo tienes y copia el resultado.
Metodología
Cada bloque agrupa un User-agent con sus rutas permitidas y bloqueadas; el resultado se genera siguiendo ese orden.
User-agent: * ⏎ Allow: /ruta ⏎ Disallow: /rutaCada bloque empieza declarando a qué robot se dirige y a continuación lista las rutas permitidas y bloqueadas para ese robot.
User-agent: * ⏎ Disallow: /La barra sola como valor de Disallow bloquea el rastreo de todo el sitio para ese User-agent.
Sitemap: https://tudominio.com/sitemap.xmlEs una línea independiente, fuera de los bloques de User-agent, que indica dónde está el mapa del sitio.
Casos prácticos
Es el comportamiento habitual por defecto: no hace falta bloquear nada si quieres que todo el rastreo esté permitido.
Impide que los rastreadores accedan a ninguna parte del sitio mientras esté en desarrollo.
El rastreo queda bloqueado solo para esa carpeta; el resto del sitio sigue siendo rastreable.
Cada User-agent puede tener sus propias reglas dentro del mismo robots.txt.
Guía
robots.txt es un archivo de texto público que se coloca en la raíz de un dominio para indicar a los rastreadores automáticos qué partes del sitio pueden recorrer y cuáles no. Es una convención que la mayoría de buscadores respeta, aunque no es una medida de seguridad ni un control de acceso.
Su función es controlar el rastreo: decide qué páginas puede visitar un robot para leerlas. No decide qué páginas aparecen en los resultados de búsqueda.
Rastrear una página significa que un robot la visita y lee su contenido. Indexarla significa que ese contenido se guarda y se puede mostrar en los resultados de búsqueda. robots.txt actúa solo sobre el primer paso.
Si bloqueas una página con Disallow pero esa página ya tiene enlaces desde otros sitios, un buscador puede seguir mostrándola en los resultados con la URL y sin descripción, porque nunca llegó a rastrear el contenido para saber si debía excluirla. robots.txt no elimina páginas del índice de un buscador.
Para impedir que una página concreta aparezca en los resultados de búsqueda, la vía adecuada es añadir una etiqueta noindex en esa página (o una cabecera HTTP equivalente) y permitir que el robot pueda rastrearla para leer esa instrucción, o bien eliminar la página y que devuelva un código de error o una redirección.
Usar Disallow en robots.txt para ese objetivo no es fiable, porque impide precisamente que el robot llegue a leer la etiqueta noindex de esa página.
Respuestas claras