Entrar

Herramienta gratis

¿Tu web deja pasar a las IAs?

Pega la dirección de tu web y te decimos, uno por uno, si los rastreadores de ChatGPT, Perplexity, Gemini y Claude pueden leerla. Sin registro. Tarda dos segundos.

Qué comprueba

Cada IA tiene su propio rastreador, con su nombre, y tu robots.txt puede dejar pasar a unos y cerrar la puerta a otros. Estos son los que miramos y para qué sirve cada uno:

RastreadorQuién es y para qué lo usa
OAI-SearchBot ChatGPT, cuando busca en internet para contestar
ChatGPT-User ChatGPT, cuando un usuario le pide que abra una página
GPTBot OpenAI, para entrenar sus modelos
PerplexityBot Perplexity, para su índice de búsqueda
Perplexity-User Perplexity, cuando un usuario le pide que abra una página
Google-Extended Google, para Gemini y sus modelos
ClaudeBot Anthropic (Claude), para entrenar y buscar
Claude-User Claude, cuando un usuario le pide que abra una página
Applebot-Extended Apple, para sus modelos de IA
meta-externalagent Meta, para entrenar sus modelos (Meta AI)
Bytespider ByteDance (TikTok), para sus modelos
CCBot Common Crawl, un archivo público del que se alimentan varios modelos

Si algo sale bloqueado: cómo arreglarlo

  1. Mira de dónde viene el bloqueo. Abre tuweb.com/robots.txt en el navegador. Si ves líneas como User-agent: GPTBot seguidas de Disallow: /, ahí está. Si es User-agent: * con Disallow: /, tu web está cerrada para todo el mundo, Google incluido.
  2. Si usas WordPress, casi siempre lo ha puesto un plugin de SEO (Yoast, Rank Math, AIOSEO tienen una opción para bloquear bots de IA). Búscala en los ajustes del plugin y desactívala. No edites el fichero a mano si lo genera un plugin: lo volverá a escribir.
  3. Si tu web pasa por Cloudflare, entra en tu panel, sección Security → Bots, y comprueba que Block AI bots (o «AI Scrapers and Crawlers») esté apagado. Ese interruptor bloquea en la red, antes de llegar a tu web, y no se ve en ningún robots.txt.
  4. Si editas el fichero tú, basta con quitar las líneas del bloqueo. Para decirlo explícitamente, este robots.txt deja pasar a todos:
    User-agent: *
    Allow: /
    
    Sitemap: https://tuweb.com/sitemap.xml
    Y si quieres dejar pasar a las IAs cuando buscan, pero no cuando entrenan, este es el punto medio:
    User-agent: GPTBot
    User-agent: CCBot
    Disallow: /
    
    User-agent: *
    Allow: /
  5. Vuelve a comprobarlo aquí. Los cambios en robots.txt son inmediatos; los rastreadores tardan días o semanas en volver a pasar.

Preguntas frecuentes

¿Qué es robots.txt?

Un fichero de texto que está en la raíz de toda web (tuweb.com/robots.txt) y que les dice a los rastreadores automáticos qué pueden leer y qué no. Google lo lleva usando veinte años. Las IAs tienen sus propios rastreadores y también lo obedecen.

Si mi web deja pasar a las IAs, ¿ya salgo en ChatGPT?

No. Que puedan leerte es la condición mínima, no la garantía. Que te recomienden depende de lo que digan de ti los sitios que consultan (directorios, reseñas, guías) y de que tu web cuente claro qué haces y dónde. Esto es lo que mide 7GEO.

¿Cómo puede estar bloqueada mi web sin que yo lo sepa?

Tres formas habituales: Cloudflare tiene un interruptor de «bloquear bots de IA» que en muchas cuentas viene activado; algunos plugins de SEO para WordPress añaden el bloqueo por defecto; y hay plantillas de robots.txt copiadas de internet que traen las reglas ya puestas. En los tres casos nadie decidió bloquear nada.

¿Debería bloquear a las IAs para que no entrenen con mi contenido?

Para un medio o una editorial puede tener sentido. Para un negocio local, no: tu web existe para que te encuentren, y bloquear a las IAs es cerrarles la puerta a los clientes que ya preguntan por ahí. Si quieres un punto medio, bloquea solo los bots de entrenamiento (GPTBot, CCBot) y deja pasar a los de búsqueda (OAI-SearchBot, PerplexityBot).

¿Esta herramienta lo ve todo?

Ve lo que dice tu robots.txt, que es lo que obedecen los rastreadores. No ve un bloqueo en el cortafuegos (por ejemplo, el de Cloudflare a nivel de red) ni si tu web tarda tanto en cargar que el rastreador desiste. Si robots.txt está bien y aun así no sales, el informe de 7GEO mira el resto.