Si tu robots.txt bloquea Google-NotebookLM, desde esta semana ya no bloquea nada. Google renombró ese user agent a Google-GeminiNotebook y el cambio deja al descubierto un problema más grande: la mayoría de los medios tiene reglas de IA escritas hace dos años que ya no hacen lo que creen que hacen.
El cambio concreto
Google renombró NotebookLM a Gemini Notebook y, en consecuencia, actualizó el nombre del user agent correspondiente: Google-NotebookLM pasó a ser Google-GeminiNotebook.
Es un fetcher disparado por usuario, no un crawler automático. La distinción no es menor y volveremos sobre ella. Pero el efecto práctico es inmediato: cualquier regla en tu robots.txt dirigida al nombre viejo quedó apuntando a un agente que ya no existe.
En la misma semana Google actualizó la documentación de Storebot-Google, con aclaraciones sobre user agents, verificación de robots.txt, bloqueos por IP, problemas de velocidad y tiempos de reprocesamiento de landing pages. Menos relevante para medios puros, importante para cualquier operación con comercio asociado.
Mapa 2026: crawlers, fetchers y tokens de control
Google agrupa sus agentes en tres categorías que conviene no mezclar:
Crawlers comunes. Rastrean de forma automática y siempre obedecen robots.txt. Acá entran Googlebot (que cubre Search, Discover, Images, Video y News), Googlebot-Image, Googlebot-Video, Googlebot-News, Storebot-Google, Google-InspectionTool, GoogleOther, GoogleOther-Image, GoogleOther-Video y Google-CloudVertexBot.
Fetchers disparados por usuario. Se activan cuando una persona pide algo, no en un rastreo programado. Google-GeminiNotebook es uno de ellos.
Tokens de control. Google-Extended es el caso especial: no tiene un user agent propio en las peticiones HTTP. El rastreo se hace con los agentes existentes y el token sirve exclusivamente como mecanismo de control en robots.txt.
Si querés el panorama completo del funcionamiento de estos sistemas, lo desarrollamos en nuestra guía completa sobre web crawlers.
Qué bloquea de verdad Google-Extended (y qué no)
Acá está el malentendido más costoso que vemos en medios.
Google-Extended controla si el contenido que Google rastrea de tu sitio puede usarse para entrenar futuras generaciones de modelos Gemini —los que alimentan las Gemini Apps y la API de Vertex AI— y para grounding en esas mismas superficies. Google es explícito en su documentación: Google-Extended no afecta la inclusión de un sitio en Google Search ni se usa como señal de ranking.
El corolario incomoda: bloquear Google-Extended no te saca de AI Overviews ni de AI Mode. Esas son funciones dentro de Search, y el control para Search es Googlebot. Si querés limitar lo que se muestra de tus páginas en resultados —incluidas las funciones de IA—, las herramientas son nosnippet, data-nosnippet, max-snippet o noindex.
Lo cual plantea el dilema real, y no tiene solución técnica: no existe una forma de estar en Google Search y simultáneamente fuera de sus funciones de IA. Bloquear el snippet te saca de las respuestas generativas, pero también te degrada en los resultados clásicos. Es una decisión de negocio, no de configuración. Sobre cómo se está posicionando la industria frente a esto escribimos cuando salió la encuesta donde un tercio de los SEOs declaró que bloquearía AI Overviews.
La revisión que recomendamos hacer esta semana
- Auditá los nombres. Buscá
Google-NotebookLMen tu robots.txt y actualizalo aGoogle-GeminiNotebooksi querés mantener la intención original de la regla. - Verificá que las reglas apunten a agentes vigentes. Las reglas escritas contra nombres viejos no rompen nada, simplemente no se aplican. Es el peor escenario: creés que estás protegido y no lo estás.
- Separá la decisión de entrenamiento de la de visibilidad. Son dos discusiones distintas con dos controles distintos. Mezclarlas produce configuraciones que no cumplen ningún objetivo.
- Revisá el CDN y el WAF, no sólo el robots.txt. Muchos bloqueos efectivos están en capas que el equipo editorial ni ve, y a veces bloquean cosas que nadie decidió bloquear.
- Mirá los logs de servidor. El user agent HTTP se puede falsificar; Google publica rangos de IP y métodos de verificación por DNS inverso. Si vas a tomar decisiones sobre bots, verificá que sean quienes dicen ser.
- Cuidado con el impacto en crawl budget. Bloquear agentes no ayuda a que Googlebot rastree mejor. Ese es otro problema, con otras soluciones.
La decisión editorial detrás del robots.txt
Un robots.txt en un medio no es un archivo técnico: es la expresión operativa de una política editorial sobre quién puede usar tu contenido y para qué. Cuando esa política no está escrita en ningún lado, el archivo termina siendo una acumulación de reglas heredadas que nadie recuerda haber puesto.
El cambio de esta semana es menor en sí mismo. Lo que revela no lo es: los nombres de los agentes van a seguir cambiando, y sin un proceso de revisión periódica, tu configuración envejece sin que nadie se entere.
Acompañamos a medios y grandes empresas en esa definición —qué bloquear, qué abrir y cómo sostenerlo en el tiempo— desde nuestra consultoría SEO para medios digitales. Si necesitás una auditoría técnica que incluya gestión de crawlers, está dentro de nuestros servicios SEO.
