← Todas las herramientas gratuitas
FUKAMO · HERRAMIENTAS GRATUITAS

Comprobación de robots.txt

Lee el archivo robots.txt del sitio y evalúa las reglas de rastreo para la página indicada.

COMPROBACIÓN GRATUITA DE UNA URL PÚBLICA

Comprobación de robots.txt

Lee el archivo robots.txt del sitio y evalúa las reglas de rastreo para la página indicada.

Comprobación de una URL pública. El resultado se basa en el HTML descargado.
ANTES DE LA COMPROBACIÓN

Sepa qué está comprobando.

Robots.txt controla el acceso de los rastreadores que respetan sus reglas. Para Googlebot, el grupo User-agent y la ruta coincidente más específica determinan el acceso. Una regla Disallow por sí sola puede dejar la URL visible en los resultados.

Cuándo utilizar esta comprobación

¿Desea limitar el rastreo, excluir una página del índice o proteger datos privados? Son tres tareas distintas. Las reglas de Googlebot que se describen aquí no reflejan necesariamente el comportamiento de otros rastreadores.

Ejemplo práctico

User-agent: *
Disallow: /offers/
Allow: /offers/public/
Sitemap: https://example.com/sitemap.xml

Error frecuente

Disallow no elimina de forma fiable una URL de las búsquedas ni protege datos privados. Un fallo del servidor de robots.txt tampoco equivale a un archivo vacío que permite todo; investigue la disponibilidad antes de cambiar las reglas de rutas.

ROBOTS.TXT · COMPROBADOR DE REGLAS

Pruebe sus reglas de robots.txt

Pegue el contenido del archivo, introduzca una URL y seleccione un rastreador. Fukamo mostrará la regla que determina el acceso a esa ruta.

Todo se evalúa en el navegador. No se carga ningún sitio web. El límite de la herramienta es de 50 000 caracteres.

Se aplica el grupo de rastreador más específico y la coincidencia de ruta más larga; en caso de empate, prevalece Allow. Se ignora el fragmento #. No se comprueban la respuesta HTTP, el WAF ni las visitas reales del rastreador. El comportamiento de cada proveedor puede variar.

Permitir el rastreo no demuestra que la página esté indexada. Disallow no equivale a noindex. Este comprobador evalúa Allow y Disallow; no valida el archivo completo. Google robots.txt ↗ · OpenAI bots ↗

Cómo utilizar el resultado

Pruebe https://example.com/offers/public/bike y https://example.com/offers/draft/bike con el ejemplo. La ruta pública debe estar permitida y la de borrador bloqueada. Tenga en cuenta la versión almacenada por el rastreador después de publicar.

Qué comprobar después
  1. Recupere /robots.txt del host exacto y compruebe su estado de respuesta.
  2. Seleccione el grupo User-agent aplicable y pruebe una URL permitida y otra bloqueada.
  3. Compruebe las mayúsculas de la ruta y su especificidad; para Googlebot, Allow prevalece si ambas reglas son igual de específicas.
  4. Publique la corrección y vuelva a probar el archivo servido, incluidos los recursos necesarios para renderizar.

Entienda el resultado. Aplique el cambio adecuado.

A qué rastreador y host se aplica robots.txt

Compruebe el robots.txt del protocolo, host y puerto exactos. El archivo del dominio principal no describe automáticamente un subdominio separado.

  • Seleccione el grupo User-agent aplicable antes de leer sus rutas.
  • Para Googlebot, los grupos específicos son independientes del grupo comodín.
  • Conserve una URL de prueba permitida y otra bloqueada junto a cada regla modificada.
Cómo probar las reglas Allow y Disallow

En el ejemplo anterior, /offers/public/bike está permitido y /offers/draft/bike bloqueado. Una ruta similar fuera de /offers/ debe quedar sin cambios.

  • Las rutas distinguen mayúsculas; pruebe /Offers/ por separado.
  • Una ruta coincidente más larga es más específica; para Google, Allow gana si la especificidad es igual.
  • No confunda un Disallow vacío con Disallow: /, que abarca todo el sitio.
Cuándo usar robots.txt, noindex o autenticación

Disallow gestiona el rastreo. No protege un documento privado ni elimina de forma fiable de las búsquedas una URL ya conocida.

  • Para excluir del índice, permita que el rastreador recupere noindex.
  • Exija autenticación para contenido privado.
  • Mantenga accesibles los recursos del renderizado público al comprobar SEO JavaScript.
Cómo comprobar disponibilidad y tamaño de robots.txt

Una configuración correcta del CMS no basta si el recurso público devuelve errores o contenido antiguo. Compruebe la respuesta antes de interpretar el comportamiento del rastreador.

  • Confirme que es texto, no una página HTML de acceso o error.
  • Google ignora el contenido posterior a 500 KiB; consolide listas de reglas excesivas.
  • Investigue respuestas 5xx y 429. Un 404 de robots.txt no prohíbe el rastreo de Google.

Google — especificación de robots.txt ↗

Referencia principal: developers.google.com ↗

Preguntas frecuentes

¿Disallow elimina una URL de Google?

Disallow restringe el rastreo, no necesariamente la aparición de una URL en los resultados. Un rastreador bloqueado puede no llegar a ver el noindex de la página. Para excluir una página pública, permita recuperarla y use la directiva de indexación adecuada. Proteja el contenido privado mediante autenticación; robots.txt no es un control de acceso.

¿Robots.txt debe estar en la carpeta de una página?

Los rastreadores buscan /robots.txt en la raíz del host correspondiente. Los subdominios no heredan automáticamente las reglas de otros. Compruebe el archivo en el host que sirve la URL inspeccionada.

¿Por qué no basta un comprobador de robots.txt?

Un comprobador evalúa las reglas proporcionadas para un agente y una ruta elegidos. La CDN, el cortafuegos, la exigencia de iniciar sesión o la respuesta del servidor pueden afectar al acceso independientemente. Compare el resultado con una solicitud y respuesta reales.

Cuándo puede cerrar la tarea

Compruebe la regla efectiva para la ruta y el agente exactos e inspeccione después la respuesta sin autenticar de la página. Un archivo válido no basta si su comportamiento contradice la política de acceso prevista.

FUKAMO / PRIVACIDAD

Tú controlas tu privacidad.

Estas opciones se aplican tanto a las cookies como al almacenamiento del navegador. La auditoría funciona igual sin almacenamiento opcional.

Lista de cookies y terceros ↗