Volver a todas las herramientas
🛰️

AI Readiness Scanner — Comprueba si ChatGPT, Claude y Perplexity pueden leer tu sitio

Gratis y sin registro

#AI#GEO#SEO
★★★★
4.7(34)

Comprueba si GPTBot, ClaudeBot, PerplexityBot, Googlebot y otros 11 agentes de IA pueden acceder realmente a tu página. Analiza las reglas de robots.txt y las respuestas reales del servidor, con soluciones concretas.

Inicializando Módulo

Optimizando recursos y preparando el espacio de trabajo de alta fidelidad...

Análisis detallado

¿Qué es AI Readiness Scanner — Comprueba si ChatGPT, Claude y Perplexity pueden leer tu sitio?

La mayoría de los propietarios de sitios web no tienen ni idea de qué sistemas de IA pueden leer sus páginas. La información está repartida en tres lugares distintos: un archivo robots.txt que pocos leen con atención, un panel de CDN con un interruptor que nadie recuerda haber activado, y una decisión de renderizado tomada por quien construyó el frontend.

Esos tres lugares se contradicen más a menudo de lo que coinciden. Un robots.txt puede dar la bienvenida a todos los rastreadores de IA mientras la regla "Block AI Scrapers" de Cloudflare devuelve silenciosamente un 403 a todos ellos. Un sitio puede pasar todas las comprobaciones técnicas y aun así entregar un div vacío a cualquier cosa que no ejecute JavaScript.

AI Readiness Scanner comprueba los tres puntos en una sola pasada.

Primero, robots.txt. El escáner implementa correctamente las reglas de coincidencia de RFC 9309: gana el token de user-agent coincidente más largo, dentro de él gana el patrón de ruta coincidente más largo, y en caso de empate Allow gana a Disallow. Esto importa: una comprobación ingenua informaría que `User-agent: Google-Extended / Disallow: /` bloquea a Googlebot. No es así — son tokens de producto distintos con consecuencias completamente diferentes.

Segundo, la respuesta en vivo. Para cada agente, el escáner realiza una petición real con su User-Agent y compara el resultado con una petición de navegador estándar. Un 403, un 429, una pantalla de verificación de Cloudflare o una respuesta HTTP 402 de pay-per-crawl aparecen aquí, incluso cuando robots.txt dice que el agente es bienvenido.

Tercero, el renderizado. El escáner lee el HTML que tu servidor realmente envía, antes de que se ejecute ningún script, y busca la señal de una SPA sin hidratar: un punto de montaje del framework que llegó vacío. Si tu contenido solo aparece tras la hidratación, todos los rastreadores de IA excepto Googlebot ven una página en blanco.

El informe separa los rastreadores que construyen un índice de los agentes que abren una página en vivo cuando un usuario pregunta, porque bloquear uno es una decisión muy distinta a bloquear el otro. Cada hallazgo incluye la regla exacta que lo causó y el cambio concreto que lo soluciona.

Características clave

  • 15 agentes de IA analizados, agrupados según lo que realmente cuesta bloquearlos: indexación de búsqueda, acceso en vivo o entrenamiento de modelos
  • Coincidencia de robots.txt según RFC 9309 — token de user-agent más largo, patrón de ruta más largo, Allow gana los empates
  • Sondeos de User-Agent en vivo que detectan bloqueos de CDN y WAF que robots.txt desconoce por completo
  • Detecta el pay-per-crawl de Cloudflare (HTTP 402) e interstitials de verificación de bots
  • Detección de renderizado en el cliente: encuentra contenido que existe en el navegador pero no en el HTML que reciben los rastreadores
  • Comprueba datos estructurados, meta robots, X-Robots-Tag, señales noai, sitemap, llms.txt y TTFB
  • Cada hallazgo incluye la regla exacta responsable y una solución concreta
  • Explica con claridad lo que este método no puede ver, en lugar de sugerir una certeza que no tiene

Casos de uso comunes

  • Marketers que comprueban por qué una página bien posicionada nunca aparece en las respuestas de ChatGPT o Perplexity
  • Desarrolladores que verifican que un sitio en Next.js o React renderiza el contenido en el servidor para los rastreadores de IA
  • Propietarios de sitios que auditan un robots.txt heredado que nunca leyeron por completo
  • Agencias que preparan una comprobación de visibilidad en IA rápida y respaldada por datos para un cliente potencial
  • Cualquiera que activó un interruptor de protección contra bots en su CDN y quiere saber qué bloqueó exactamente
Cómo funciona esta herramienta

Esta herramienta se ejecuta en nuestros servidores

AI Readiness Scanner te dice si los asistentes de IA pueden leer realmente tu sitio web. Introduce una URL y comprobará 15 agentes de IA — GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, Googlebot, bingbot, Applebot-Extended, meta-externalagent, Amazonbot y CCBot — contra las reglas de tu robots.txt, y luego enviará una petición real con el User-Agent de cada agente para ver si tu servidor o tu CDN los rechaza de todos modos. También comprueba si tu contenido existe en el HTML original, porque ningún rastreador de IA excepto Googlebot ejecuta JavaScript.

Nosotros descargamos la página
Resultados en caché 24 horas
Sin cuenta

Cómo usarlo

1

Introduce tu URL

Pega la dirección de cualquier página pública. El esquema es opcional — ejemplo.com funciona igual que https://ejemplo.com/pagina.

2

Ejecuta el escaneo

El escáner descarga tu robots.txt, envía un sondeo en vivo para cada uno de los 15 agentes de IA y lee el HTML original que devuelve tu servidor.

3

Revisa la matriz de acceso

Los agentes están agrupados por finalidad. El rojo significa bloqueado — por una regla de robots.txt o por un rechazo directo del servidor.

4

Repasa los hallazgos

Los hallazgos están ordenados por gravedad. Abre cualquiera para ver la regla exacta que lo causó y el cambio que lo soluciona.

5

Vuelve a escanear tras corregir

Los resultados se guardan en caché 24 horas por URL, tenlo en cuenta al verificar un cambio.

Preguntas frecuentes

?¿Bloquear GPTBot me elimina de ChatGPT?

No, y este es el malentendido más común. GPTBot recopila datos para el entrenamiento del modelo. Los resultados de búsqueda de ChatGPT provienen de OAI-SearchBot, y ChatGPT-User es lo que abre una página cuando alguien pregunta por un enlace concreto. Bloquear GPTBot mientras permites los otros dos es una decisión perfectamente coherente: tu contenido queda fuera del entrenamiento pero sigue apareciendo en las respuestas.

?¿Afecta Google-Extended a los AI Overviews?

No. Google-Extended controla solo si tu contenido se usa para entrenar y fundamentar Gemini. Los AI Overviews se generan a partir del índice de búsqueda normal de Google, que construye Googlebot. Si quieres quedar fuera de los AI Overviews, Google-Extended no es el control que lo consigue.

?¿Por qué el escáner dice que un bot está bloqueado si mi robots.txt lo permite?

Porque robots.txt no es lo único que decide. Ese resultado significa que tu servidor o tu CDN devolvió un rechazo — un 403, un límite de peticiones o una pantalla de verificación — a una petición con el User-Agent de ese agente. La causa más habitual es la opción "Block AI Scrapers and Crawlers" de Cloudflare, y anula lo que diga tu robots.txt.

?¿Los sondeos se envían desde las direcciones IP reales de los rastreadores?

No. Salen desde nuestros servidores con el User-Agent del rastreador. Eso detecta la gran mayoría de los bloqueos, que se basan en el User-Agent. No puede detectar bloqueos por rango de IP o ASN — para eso necesitas revisar los registros de tu propio servidor, el único lugar donde está la verdad completa.

?¿Necesito un archivo llms.txt?

No mucho, y preferimos decírtelo claramente antes que venderte una casilla marcada. Hoy ningún rastreador de IA importante consume llms.txt. El escáner informa de si tienes uno porque comprobarlo no cuesta nada, pero pesa poco en la puntuación y no debería ser prioridad frente a renderizar tu contenido en el servidor.

?¿Ser accesible significa que me van a citar?

No. El acceso es necesario, pero no suficiente. Una página abierta, rápida y bien marcada puede seguir sin ser mencionada por ningún asistente, porque citar depende de si tu contenido responde realmente a lo que la gente pregunta. Este escáner mide si la puerta está abierta, no si alguien la cruza.

?¿El escaneo es gratuito?

Sí. Funciona con comprobaciones HTTP normales sin ninguna llamada a un modelo de IA, así que ejecutarlo nos cuesta casi nada. Hay un límite por hora por visitante para evitar que se use como proxy gratuito para rastrear sitios ajenos.

¿Necesita una herramienta personalizada?

Constantemente añadimos nuevas herramientas. Sugiera una o informe de un error.

Herramientas relacionadas que podrías necesitar