Ir al contenido principal
GEO / visibilidad IA

Acceso al rastreador de IA

El acceso al rastreador de IA verifica si los rastreadores de búsqueda e IA importantes están bloqueados por reglas de robots, estado de la página, configuraciones de noindex u otras restricciones de acceso.

El acceso al rastreador de IA verifica si los sistemas de recuperación de IA y los rastreadores de búsqueda pueden descubrir y recuperar una página. Es un requisito previo para muchas mejoras de visibilidad de la IA.

El informe debería distinguir el bloqueo intencional del bloqueo accidental. Un sitio puede optar por restringir algunos rastreadores, pero esa decisión debe ser explícita.

En el informe, use este elemento como evidencia. No lo trate como una regla independiente a menos que el contexto de la página respalde la misma conclusión.

Grupos de problemas en este módulo

Estas etiquetas coinciden con los grupos expandibles en la vista general del módulo GEO. Añada con el id del problema de la URL del informe para saltar del problema de página a la misma sección aquí.

Crawler access data unavailable

This report does not include AI Crawler Access analyzer data for these pages. Re-run the report to populate robots, policy, discovery, and retrieval readiness checks.

Fix robots policy and bot access

Pages where robots/meta directives may block or confuse AI retrieval crawlers. Separate retrieval access from training restrictions.

Expose LLM policy guidance

Publish llms.txt (or equivalent) at the site origin for AI crawler permissions. Fix once on the start page — not per crawled URL.

Improve crawler discovery paths

Pages missing sitemap hints or enough contextual internal links for retrieval crawlers to discover canonical and deep content.

Add canonical URL signals

Pages missing canonical URL hints, making it harder for AI crawlers to resolve duplicate URL variants consistently.

Cómo interpretarlo

  • Las páginas públicas importantes devuelven respuestas HTTP exitosas y no son bloqueadas accidentalmente por robots.txt o noindex.
  • Las políticas de los rastreadores se documentan, revisan y alinean con la estrategia empresarial para la visibilidad de la IA.
  • Las reglas específicas de los bots se prueban después de la implementación, pero no se supone que funcionen.

Ejemplo de robots.txt

User-agent: GPTBot
Allow: /guides/
Disallow: /account/

User-agent: *
Allow: /

Errores frecuentes

  • Bloquear un camino completo en robots.txt sin darse cuenta de que allí se encuentra contenido importante.
  • Usar noindex en páginas que la empresa espera que citen los sistemas de búsqueda o de inteligencia artificial.
  • Permitir rastreadores en todas partes sin revisar la propiedad del contenido, las licencias y las restricciones de privacidad.

Referencias útiles

Preguntas frecuentes

¿Deberían permitirse todos los rastreadores de IA?

No. Permitir rastreadores de IA depende de la estrategia del sitio y de la posición de la licencia de contenido.

¿Se puede clasificar o citar el contenido si está bloqueado?

Es mucho menos probable que el contenido bloqueado sea descubierto, actualizado o citado por sistemas que dependen del rastreo.

Artículos relacionados