Bot Identificar Googlebot, Bingbot y Crawlers de IA
Cómo verificar una solicitud real de Googlebot o Bingbot, los user agents de crawlers de IA (GPTBot, ClaudeBot, CCBot) y cómo bloquearlos o permitirlos.
La cadena User-Agent sola no prueba nada
Cualquiera puede mandar una solicitud con User-Agent: Googlebot en el encabezado — muchos scrapers hacen justamente eso, esperando que el sitio trate el tráfico de "Googlebot" con más permisividad (saltándose límites de tasa, evitando un paywall, etc.). La cadena User-Agent es una declaración, no una prueba. Verificar que un crawler es realmente Google, Bing u otro bot con nombre requiere revisar de dónde vino realmente la solicitud.
Verificar Googlebot
Google publica los rangos de IP desde donde rastrea Googlebot y documenta dos formas de confirmar que una solicitud es genuina:
- Coincidencia de DNS inverso y directo — hacer una consulta DNS inversa sobre la IP de origen de la solicitud; un Googlebot real resuelve a un hostname que termina en
.googlebot.como.google.com. Después, hacer una consulta DNS directa sobre ese hostname y confirmar que resuelva de vuelta a la misma IP. Ambas direcciones deben coincidir. - Rangos de IP publicados — Google publica una lista JSON con los rangos de IP actuales de Googlebot en developers.google.com/static/search/apis/ipranges/googlebot.json, que se puede revisar directamente en vez de hacer consultas DNS por cada solicitud.
Bing documenta un proceso de verificación por DNS inverso equivalente para Bingbot, que resuelve a un hostname que termina en .search.msn.com.
Las variantes de Googlebot
"Googlebot" no es un solo crawler — Google opera varios, cada uno identificándose con su propio token de User-Agent para un propósito específico:
| Token de User-Agent | Propósito |
|---|---|
Googlebot | Crawler principal para Search — rastrea sobre todo como user agent de smartphone (indexación mobile-first) desde 2019 |
Googlebot-Image | Rastrea imágenes para Google Imágenes |
Googlebot-Video | Rastrea contenido de video para Google Video / resultados enriquecidos de video |
Googlebot-News | Rastrea para Google Noticias |
AdsBot-Google | Revisa la calidad de las páginas de destino de anuncios — no afecta la indexación orgánica |
Google-InspectionTool | Impulsa la Inspección de URLs y la prueba de resultados enriquecidos de Search Console |
GoogleOther | Crawler de uso general para investigación interna y necesidades de producto de Google, no ligado directamente a la indexación de Search |
User agents de crawlers de IA
Varias empresas de IA rastrean la web para entrenar modelos o responder consultas en vivo, y — tras la presión por el scraping sin licencia — ahora se identifican con un User-Agent propio y documentado para que los dueños de sitios puedan permitirlos o bloquearlos deliberadamente vía robots.txt.
| Token de User-Agent | Operador | Propósito |
|---|---|---|
GPTBot | OpenAI | Rastrea páginas para entrenar futuros modelos |
ChatGPT-User | OpenAI | Busca una página en vivo cuando un usuario le pide a ChatGPT que la navegue |
OAI-SearchBot | OpenAI | Rastrea para los resultados de la función de búsqueda de ChatGPT |
ClaudeBot | Anthropic | Rastrea páginas para entrenar futuros modelos |
Claude-User | Anthropic | Busca una página en vivo durante una conversación con Claude |
PerplexityBot | Perplexity | Rastrea para el índice de su motor de respuestas |
CCBot | Common Crawl | Archivo público de la web que muchos laboratorios de IA usan para entrenar de forma indirecta |
Google-Extended | Controla el uso de contenido ya rastreado para entrenar Gemini/IA, algo separado de la indexación de búsqueda de Googlebot | |
Applebot-Extended | Apple | Controla el uso de contenido ya rastreado para Apple Intelligence, algo separado de la indexación de Siri/Spotlight de Applebot |
Permitir o bloquear crawlers en robots.txt
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /private/
User-agent: Googlebot
Allow: /robots.txt es una convención de adhesión voluntaria — los crawlers serios (incluidos todos los mencionados arriba) lo revisan y respetan las reglas Disallow, pero el archivo en sí no impone nada técnicamente. Un crawler que lo ignore por completo no se va a detener solo con robots.txt; eso requiere bloquear por rango de IP o por User-Agent a nivel del servidor o del firewall.
Frequently asked questions
Si el User-Agent de una solicitud dice Googlebot, ¿es seguro asumir que es realmente Google?
No. Falsificar el encabezado User-Agent no cuesta nada, así que muchos scrapers dicen ser Googlebot precisamente porque algunos sitios lo tratan con más permisividad. Confirmarlo requiere una consulta DNS inversa sobre la IP de origen (o revisarla contra los rangos de IP publicados por Google) — el texto del encabezado por sí solo no prueba nada.
¿Cómo veo o simulo mi página como la ve Googlebot?
La forma más precisa es la herramienta de Inspección de URLs de Google Search Console — muestra el HTML real que rastreó Googlebot y la captura renderizada después de ejecutar el JavaScript, de un rastreo real. Una aproximación más liviana es mandar una solicitud con la cadena User-Agent de Googlebot uno mismo (por ejemplo, curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://ejemplo.com) — eso muestra lo que responde el servidor, pero no cómo Googlebot renderiza o ejecuta el JavaScript, así que es una simulación parcial en el mejor de los casos.
¿Por qué Googlebot está bloqueado por robots.txt en mi sitio?
Las causas más comunes: un Disallow: / general que quedó de un entorno de staging y terminó en producción, una opción del CMS de "desalentar a los buscadores de indexar este sitio" que quedó activada, o una regla Disallow más amplia de lo previsto (por ejemplo, bloqueando una ruta que también sirve CSS/JS que Googlebot necesita para renderizar la página). Revisa el archivo en vivo en tudominio.com/robots.txt directamente, o el informe de robots.txt de Search Console, para ver exactamente qué regla está afectando a Googlebot.
¿Bloquear GPTBot en robots.txt evita que OpenAI use mi contenido para siempre?
Evita que el crawler documentado de OpenAI rastree páginas nuevas para entrenamiento de ahí en adelante, solo para OpenAI. No tiene efecto sobre el contenido ya recolectado antes del bloqueo, sobre los crawlers de otras empresas, ni sobre contenido al que se llega indirectamente por una fuente como Common Crawl que no opera OpenAI.
¿Hay una sola regla de robots.txt que bloquee todos los crawlers de IA a la vez?
No existe un único token documentado que cubra todos los crawlers de IA — cada empresa opera su propio bot bajo su propio nombre, y van apareciendo otros nuevos con el tiempo. Bloquear de forma exhaustiva significa listar cada token de User-Agent conocido individualmente (o bloquear por rango de IP, que da más mantenimiento pero no depende del nombre autodeclarado del crawler).