Lee el archivo robots.txt del sitio y evalúa las reglas de rastreo para la página indicada.
COMPROBACIÓN GRATUITA DE UNA URL PÚBLICA
Comprobación de robots.txt
Lee el archivo robots.txt del sitio y evalúa las reglas de rastreo para la página indicada.
ANTES DE LA COMPROBACIÓN
Sepa qué está comprobando.
Robots.txt controla el acceso de los rastreadores que respetan sus reglas. Para Googlebot, el grupo User-agent y la ruta coincidente más específica determinan el acceso. Una regla Disallow por sí sola puede dejar la URL visible en los resultados.
01
Cuándo utilizar esta comprobación
¿Desea limitar el rastreo, excluir una página del índice o proteger datos privados? Son tres tareas distintas. Las reglas de Googlebot que se describen aquí no reflejan necesariamente el comportamiento de otros rastreadores.
Disallow no elimina de forma fiable una URL de las búsquedas ni protege datos privados. Un fallo del servidor de robots.txt tampoco equivale a un archivo vacío que permite todo; investigue la disponibilidad antes de cambiar las reglas de rutas.
ROBOTS.TXT · COMPROBADOR DE REGLAS
Pruebe sus reglas de robots.txt
Pegue el contenido del archivo, introduzca una URL y seleccione un rastreador. Fukamo mostrará la regla que determina el acceso a esa ruta.
Se aplica el grupo de rastreador más específico y la coincidencia de ruta más larga; en caso de empate, prevalece Allow. Se ignora el fragmento #. No se comprueban la respuesta HTTP, el WAF ni las visitas reales del rastreador. El comportamiento de cada proveedor puede variar.
Permitir el rastreo no demuestra que la página esté indexada. Disallow no equivale a noindex. Este comprobador evalúa Allow y Disallow; no valida el archivo completo. Google robots.txt ↗ · OpenAI bots ↗
Cómo utilizar el resultado
Pruebe https://example.com/offers/public/bike y https://example.com/offers/draft/bike con el ejemplo. La ruta pública debe estar permitida y la de borrador bloqueada. Tenga en cuenta la versión almacenada por el rastreador después de publicar.
Qué comprobar después
Recupere /robots.txt del host exacto y compruebe su estado de respuesta.
Seleccione el grupo User-agent aplicable y pruebe una URL permitida y otra bloqueada.
Compruebe las mayúsculas de la ruta y su especificidad; para Googlebot, Allow prevalece si ambas reglas son igual de específicas.
Publique la corrección y vuelva a probar el archivo servido, incluidos los recursos necesarios para renderizar.
Entienda el resultado. Aplique el cambio adecuado.
A qué rastreador y host se aplica robots.txt
Compruebe el robots.txt del protocolo, host y puerto exactos. El archivo del dominio principal no describe automáticamente un subdominio separado.
Seleccione el grupo User-agent aplicable antes de leer sus rutas.
Para Googlebot, los grupos específicos son independientes del grupo comodín.
Conserve una URL de prueba permitida y otra bloqueada junto a cada regla modificada.
Cómo probar las reglas Allow y Disallow
En el ejemplo anterior, /offers/public/bike está permitido y /offers/draft/bike bloqueado. Una ruta similar fuera de /offers/ debe quedar sin cambios.
Las rutas distinguen mayúsculas; pruebe /Offers/ por separado.
Una ruta coincidente más larga es más específica; para Google, Allow gana si la especificidad es igual.
No confunda un Disallow vacío con Disallow: /, que abarca todo el sitio.
Cuándo usar robots.txt, noindex o autenticación
Disallow gestiona el rastreo. No protege un documento privado ni elimina de forma fiable de las búsquedas una URL ya conocida.
Para excluir del índice, permita que el rastreador recupere noindex.
Exija autenticación para contenido privado.
Mantenga accesibles los recursos del renderizado público al comprobar SEO JavaScript.
Cómo comprobar disponibilidad y tamaño de robots.txt
Una configuración correcta del CMS no basta si el recurso público devuelve errores o contenido antiguo. Compruebe la respuesta antes de interpretar el comportamiento del rastreador.
Confirme que es texto, no una página HTML de acceso o error.
Google ignora el contenido posterior a 500 KiB; consolide listas de reglas excesivas.
Investigue respuestas 5xx y 429. Un 404 de robots.txt no prohíbe el rastreo de Google.
Disallow restringe el rastreo, no necesariamente la aparición de una URL en los resultados. Un rastreador bloqueado puede no llegar a ver el noindex de la página. Para excluir una página pública, permita recuperarla y use la directiva de indexación adecuada. Proteja el contenido privado mediante autenticación; robots.txt no es un control de acceso.
¿Robots.txt debe estar en la carpeta de una página?
Los rastreadores buscan /robots.txt en la raíz del host correspondiente. Los subdominios no heredan automáticamente las reglas de otros. Compruebe el archivo en el host que sirve la URL inspeccionada.
¿Por qué no basta un comprobador de robots.txt?
Un comprobador evalúa las reglas proporcionadas para un agente y una ruta elegidos. La CDN, el cortafuegos, la exigencia de iniciar sesión o la respuesta del servidor pueden afectar al acceso independientemente. Compare el resultado con una solicitud y respuesta reales.
Cuándo puede cerrar la tarea
Compruebe la regla efectiva para la ruta y el agente exactos e inspeccione después la respuesta sin autenticar de la página. Un archivo válido no basta si su comportamiento contradice la política de acceso prevista.
FUKAMO / TU PRIVACIDAD
Su sitio web. Usted decide.
Con su consentimiento, recordaremos las direcciones recientes y los resultados de auditoría, y mediremos las visitas con Google Analytics y Google Tag Manager. Puede elegir por separado el historial y las estadísticas. No utilizamos cookies publicitarias.