GUÍA DE FUKAMO · SEO en la era de la IA

Rastreadores de IA

Los servicios automáticos recuperan contenido con finalidades distintas. La búsqueda, el entrenamiento y la recuperación solicitada por el usuario pueden usar mecanismos diferentes. El propietario del contenido debe decidir qué usos permite.

¿Puedo permitir la recuperación para búsquedas y restringir el entrenamiento?

Defina su política antes de editar robots.txt. Consulte la documentación actual del proveedor en lugar de copiar una lista antigua de nombres de rastreadores. Las reglas de la CDN y del cortafuegos también pueden afectar al acceso.

Qué hacer paso a paso

  1. Registre la política de acceso prevista.
  2. Verifique los identificadores actuales en la documentación del proveedor.
  3. Compruebe las reglas efectivas para la ruta concreta.
  4. Revise las respuestas de red y del cortafuegos.
  5. Registre los cambios e inspeccione los registros pertinentes del servidor.

Ejemplo práctico

Un editor quiere permitir el descubrimiento en buscadores y restringir otro uso. Un bloqueo general User-agent: * afectaría a más servicios de los previstos, por lo que debe identificar primero los controles pertinentes.

Error frecuente

Las cadenas User-agent se pueden imitar. Robots.txt es un protocolo cooperativo, no un mecanismo de autenticación ni una prueba de que todos los visitantes cumplan las reglas.

AUDITORÍA DE NUESTRO SITIO WEB

Pruebe el informe con nuestro sitio web.

Consulte el ejemplo del informe y después introduzca su propia URL. Obtendrá hallazgos, pruebas HTML y un plan de correcciones para su página.

Iniciar mi auditoría

fukamo.com/sk

59/100Su sitio web necesita ajustes.

  • Correctas 241
  • Pendiente de revisión 17
  • Fallidas 7
  • No disponibles 8
Buscar en los hallazgos…Por gravedadCSV
  • Crítica 0
  • Prioridad alta 5
  • Prioridad estándar 2
  • Pendiente de revisión 17
  • 01Datos estructuradosPrioridad alta×2
  • 02SeguridadPrioridad alta
  • 03Indicadores de rendimientoPrioridad alta
  • 04RendimientoPrioridad alta
  • Hallazgos7 por corregir241 comprobaciones correctas
  • Plan de reparación24 tareas7 reparaciones · 17 revisiones
  • Datos de la página3243 palabras10 imágenes sin texto alternativo
  • Rendimiento y accesibilidad66 / 100Móvil · Lighthouse
  • Enlaces y servidor282 enlaces23 enlaces externos
Informe completoEnviar por correo electrónicoCopiar enlaceCompartir enlaceVolver al sitio
La captura del ejemplo está en inglés; el informe de su auditoría se muestra en español.

OAI-SearchBot y GPTBot tienen finalidades distintas

OpenAI documenta controles separados para descubrimiento de búsqueda mediante OAI-SearchBot y entrenamiento mediante GPTBot. Una regla para uno no expresa toda la política de ambos usos.

  • Decida qué material público puede apoyar las búsquedas.
  • Registre aparte las restricciones de entrenamiento.
  • Mantenga las cuentas privadas tras autenticación.

Fuente OpenAI · finalidades de los rastreadores ↗

¿A qué rastreador de Anthropic debe aplicarse la regla?

Anthropic distingue ClaudeBot, Claude-SearchBot y Claude-User. Conserve su documentación junto a la política para que futuros editores entiendan cada regla.

  • Relacione el identificador con su finalidad documentada.
  • Defina el host y la ruta afectados.
  • Asigne un responsable y un motivo para revisar la regla.

Fuente Anthropic · rastreadores ↗

Por qué HTTP 200 puede ocultar un rastreador bloqueado

Un desafío del WAF puede devolver estado satisfactorio sustituyendo el artículo. La ausencia de encabezados puede describir ese desafío, no la página.

  • Compruebe URL final, cuerpo y cadena de redirecciones.
  • Compare un artículo público con una ruta restringida.
  • Verifique la identidad del rastreador con el método documentado por el proveedor.

Cómo verificar cambios de acceso

Separe la verificación de configuración de las visitas reales del rastreador. Que no visite inmediatamente tras publicar no demuestra que falló una regla.

  • Recupere el robots.txt publicado.
  • Compruebe URL representativas permitidas y restringidas.
  • Guarde historial de configuración y respuestas significativas de los registros.

Cómo verificar el resultado

Pruebe una ruta permitida y otra restringida para el rastreador previsto. Guarde la regla efectiva de robots.txt y la respuesta del servidor; siga las indicaciones de verificación del proveedor al interpretar visitas en los registros.

Documentación oficial developers.openai.com ↗

Preguntas frecuentes

¿Puedo permitir la recuperación para búsquedas y restringir el entrenamiento?

Los proveedores pueden ofrecer identificadores y controles distintos para finalidades diferentes. Base sus decisiones en la documentación actual del servicio concreto. Bloquear todos los rastreadores también puede impedir el acceso de búsqueda que quería permitir. La política de un proveedor no se aplica automáticamente a otro.

Cuándo puede cerrar la tarea

Registre la finalidad, la fuente del identificador y la fecha de verificación. Compare robots.txt con los controles de CDN y las respuestas reales. Un nombre User-agent declarado no autentica por sí solo al visitante.

Guías SEO relacionadas

DE LA LECTURA A TU PROPIO SITIO WEB

Analice una página concreta.

Fukamo muestra los hallazgos, las pruebas y el siguiente paso.

Iniciar auditoría gratuita ↗

836 reglas + mediciones de SEO, legibilidad para la IA, rendimiento y accesibilidad gratis.

Comprobador de accesibilidad

FUKAMO / PRIVACIDAD

Tú controlas tu privacidad.

Estas opciones se aplican tanto a las cookies como al almacenamiento del navegador. La auditoría funciona igual sin almacenamiento opcional.

Lista de cookies y terceros ↗