glossary

Bloquear OAI-SearchBot vs GPTBot le cuesta dos cosas distintas

Taras Shynkarenko
Taras Shynkarenko
Updated: 9 lectura mínima
Bloquear OAI-SearchBot vs GPTBot le cuesta dos cosas distintasBloquear OAI-SearchBot vs GPTBot le cuesta dos cosas distintas

TL;DR

9 lectura mínima

OpenAI documenta tres agentes web con tres trabajos: GPTBot rastrea para entrenar modelos fundacionales de IA generativa, OAI-SearchBot rastrea para mostrar sitios en la función de búsqueda de ChatGPT, y ChatGPT-User descarga una sola página que una persona pidió abrir a ChatGPT. Desautorizar GPTBot retira sus páginas de la entrada de entrenamiento y deja intacta la búsqueda de ChatGPT, y desautorizar OAI-SearchBot lo retira de la superficie que la gente lee y donde hace clic. Los dueños de sitios que quieren salir del entrenamiento y conservar el tráfico deberían nombrar solo a GPTBot.

¿Cuál es la diferencia entre OAI-SearchBot vs GPTBot?

OpenAI ejecuta OAI-SearchBot vs GPTBot como dos rastreadores con dos trabajos sin relación: OAI-SearchBot descarga páginas para que la función de búsqueda de ChatGPT pueda mostrarlas, y GPTBot descarga páginas para entrenar los modelos fundacionales de IA generativa de OpenAI, según la propia documentación de bots de OpenAI en developers.openai.com, consultada el 9 September 2026. Cada uno lee su propio bloque con nombre en robots.txt, y una regla escrita para uno no tiene efecto sobre el otro. Esa separación es todo el sentido del diseño: OpenAI afirma que "usa las etiquetas de robots.txt de OAI-SearchBot y GPTBot para permitir a los webmasters gestionar cómo funcionan sus sitios y su contenido con la IA".

¿Cuáles son las cadenas de user agent exactas de los rastreadores de OpenAI?

OpenAI publica la cadena de user agent completa de cada agente que opera, y cada una lleva una URL autodescriptiva que puede comprobar. Cópielas carácter por carácter cuando escriba un filtro de registro, porque una coincidencia de subcadena solo con GPT capturará tres agentes distintos a la vez.

AgenteCadena de user agent completaRangos de IP publicados
GPTBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbotopenai.com/gptbot.json
OAI-SearchBotMozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbotopenai.com/searchbot.json
ChatGPT-UserMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/botopenai.com/chatgpt-user.json
OAI-AdsBotMozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbotopenai.com/adsbot.json

OAI-SearchBot envía además una segunda variante documentada que inserta el token robots.txt antes de la URL: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; robots.txt; +https://openai.com/searchbot. Escriba su filtro de registro contra el token desnudo OAI-SearchBot para que ambas variantes caigan en el mismo cubo.

Un desarrollador edita el archivo robots.txt de un sitio web, en referencia a la decisión de qué bot de OpenAI bloquear.

¿A qué bot de OpenAI debería bloquear en realidad?

Bloquee aquel cuya salida no quiere, y la columna del coste que aparece abajo es la parte que los dueños de sitios se saltan. OpenAI ata cada agente a una superficie de producto distinta, así que las tres reglas compran tres resultados distintos.

AgentePara qué lo usa OpenAIQué le cuesta bloquearloDirectiva de robots.txt
GPTBotRastrea contenido para entrenar modelos fundacionales de IA generativaSus páginas dejan de alimentar el entrenamiento futuro de modelos a través de este rastreo. La búsqueda de ChatGPT no se ve afectada.User-agent: GPTBot y luego Disallow: /
OAI-SearchBotImpulsa las funciones de búsqueda de ChatGPT para mostrar sitios web en los resultadosOpenAI afirma que los sitios excluidos "no se mostrarán en las respuestas de búsqueda de ChatGPT, aunque todavía pueden aparecer como enlaces de navegación".User-agent: OAI-SearchBot y luego Disallow: /
ChatGPT-UserGestiona acciones iniciadas por el usuario en ChatGPT y en los GPT personalizadosChatGPT no puede abrir su página cuando una persona pega el enlace y pregunta por él. OpenAI señala que las reglas de robots.txt pueden no aplicarse aquí, porque la petición sigue a una acción de usuario en vivo.User-agent: ChatGPT-User y luego Disallow: /

El comportamiento completo de ese tercer agente, incluido por qué una regla de robots.txt se comporta de forma distinta ante una descarga activada por el usuario, está cubierto en la página dedicada a ChatGPT-User.

¿Por qué la mayoría de los dueños de sitios bloquea al equivocado?

El error es tratar "bloquear los rastreadores de IA" como una sola decisión cuando OpenAI lo construyó como dos. GPTBot es el nombre que la gente reconoce de la cobertura sobre datos de entrenamiento de IA, así que entra en una regla general junto a OAI-SearchBot, y esa regla general retira el sitio de la superficie que envía lectores reales. El tráfico de la función de búsqueda de ChatGPT depende de que OAI-SearchBot tenga permiso para leer la página que cita; la entrada de entrenamiento no envía a nadie a su sitio. Decida las dos preguntas por separado y luego escriba dos bloques.

¿Qué robots.txt debería copiar para cada intención?

Elija la intención que encaja con su negocio y pegue el bloque correspondiente en la raíz de su dominio. Cada grupo User-agent va por su cuenta, así que una directiva bajo un nombre nunca alcanza a otro.

Quedarse fuera del entrenamiento de modelos y conservar el tráfico de la búsqueda de ChatGPT. Este es el ajuste que quieren la mayoría de los editores y sitios SaaS:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Salir de OpenAI por completo, incluida la superficie de búsqueda y las descargas pedidas por el usuario:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

Permitirlo todo salvo las rutas que nunca deberían llegar a un modelo ni a una respuesta:

User-agent: GPTBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

User-agent: OAI-SearchBot
Disallow: /members/
Disallow: /checkout/
Disallow: /account/

Las reglas de precedencia que deciden qué línea gana cuando Allow y Disallow coinciden con una misma URL viven en la referencia completa de robots.txt.

¿Robots.txt se hace cumplir o solo se respeta?

Robots.txt se respeta por convención y no lo hace cumplir nada. El RFC 9309, el estándar del Robots Exclusion Protocol publicado en septiembre de 2022, afirma sin rodeos en sus Security Considerations que "el Robots Exclusion Protocol no sustituye a medidas válidas de seguridad del contenido", y su sección inicial señala que estas reglas "no son una forma de autorización de acceso". Una línea Disallow es una petición que un rastreador bien educado lee antes de descargar, y que uno mal educado puede ignorar sin consecuencia técnica alguna. Si una página no debe ser leída por nadie fuera de su muro de acceso, póngala detrás de autenticación o de una regla de IP en el servidor, y trate la entrada de robots.txt como documentación de su intención para los rastreadores que sí cumplen.

Filas de racks de servidores en un centro de datos, en referencia a la infraestructura que registra y verifica las direcciones IP de los rastreadores.

¿Cómo se verifica que una petición vino realmente de OpenAI?

Compare la dirección IP de origen con los archivos JSON que publica OpenAI, porque una cadena de user agent es una cabecera que cualquier cliente puede escribir. OpenAI lista los rangos actuales en openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json y openai.com/adsbot.json, y cada archivo lleva un campo creationTime y un array de prefijos CIDR. Consultado el 9 September 2026, openai.com/searchbot.json listaba 35 prefijos IPv4 con un creationTime de 2026-01-02, y openai.com/gptbot.json listaba 21 prefijos con un creationTime de 2025-10-30. Vuelva a descargar el archivo de forma periódica en lugar de fijar los rangos en el código, y trate cualquier petición que lleve un token de OpenAI desde una dirección fuera de la lista actual como una suplantación, no como un rastreador que ignora sus reglas.

RedReplier
RedReplier

Comenzar

Reddit, X, Bluesky y HN

Alertas de intención en tiempo real

Respuestas IA ilimitadas

Ordenado por intención de compra

¿Cuánto tarda un cambio en robots.txt en llegar a OpenAI?

La documentación de OpenAI afirma que, para los resultados de búsqueda, "puede tardar ~24 horas desde la actualización del robots.txt de un sitio hasta que nuestros sistemas se ajusten". Ese retraso se aplica a la superficie de búsqueda, así que un sitio que pase OAI-SearchBot de desautorizado a permitido debería esperar en torno a un día antes de que el comportamiento de la búsqueda de ChatGPT lo refleje. Publique el cambio, anote la marca de tiempo y aguante sin hacer una segunda edición hasta que pase un día entero, porque dos cambios dentro de la ventana de propagación vuelven ilegible el resultado.

Bloquee al agente correcto y después confirme que se mantuvo
1
Decida el objetivo. GPTBot alimenta el entrenamiento de modelos, OAI-SearchBot alimenta la búsqueda de ChatGPT. Elija uno, ambos o ninguno.
2
Escriba un bloque separado para cada agente. Una regla bajo un nombre de user agent nunca llega a otro.
3
Espere alrededor de 24 horas. La documentación de OpenAI dice que sus sistemas tardan cerca de un día en reflejar un cambio de robots.txt en la búsqueda.
4
Verifique la IP de origen, no solo el user agent. Compare las peticiones con los rangos CIDR publicados por OpenAI antes de confiar en una línea de registro.
Cada paso cierra el hueco que deja el anterior, desde elegir un agente hasta confirmar que el bloqueo realmente se mantuvo.

¿Qué debería seguir después de fijar las reglas?

Siga si ChatGPT lo cita de verdad, porque un robots.txt correcto es una entrada y una cita es el resultado. La monitorización de marca en la búsqueda con IA observa dónde referencian una marca ChatGPT, Claude y Gemini en sus respuestas, que es la única lectura directa de si permitir OAI-SearchBot le compró algo. La misma división entre entrenamiento y búsqueda aparece en las pilas de otros proveedores: Applebot-Extended es la exclusión de entrenamiento de Apple que deja en paz a Siri, Spotlight y la búsqueda de Safari, y CCBot es el archivo abierto de Common Crawl que laboratorios externos filtran para armar conjuntos de entrenamiento. Que lo citen es una disciplina aparte de que lo rastreen, que es lo que cubre la optimización para motores de respuesta.

Preguntas frecuentes

¿Bloquear GPTBot me retira de la búsqueda de ChatGPT?

No. OpenAI documenta GPTBot como el rastreador para entrenar modelos fundacionales de IA generativa y OAI-SearchBot como el rastreador que impulsa las funciones de búsqueda de ChatGPT. Un Disallow bajo User-agent: GPTBot deja a OAI-SearchBot libre para rastrear, así que la búsqueda de ChatGPT puede seguir mostrando y citando sus páginas.

¿Qué pasa si bloqueo OAI-SearchBot?

OpenAI afirma que los sitios excluidos de OAI-SearchBot "no se mostrarán en las respuestas de búsqueda de ChatGPT, aunque todavía pueden aparecer como enlaces de navegación". Pierde la cita y el clic que viene con ella. OpenAI recomienda permitir OAI-SearchBot en robots.txt para ayudar a que un sitio aparezca en los resultados de búsqueda.

¿Existe una sola directiva que bloquee todos los bots de OpenAI a la vez?

Ningún token único los cubre. OpenAI documenta GPTBot, OAI-SearchBot, ChatGPT-User y OAI-AdsBot como tokens de user-agent separados en robots.txt, y cada uno necesita su propio grupo con nombre. Un grupo comodín User-agent: * se aplica a los rastreadores que cumplen y no encuentran ningún grupo que los nombre específicamente, así que un agente con su propio bloque lee ese bloque en su lugar.

¿Cuál de los agentes de OpenAI no es un rastreador?

ChatGPT-User. OpenAI lo documenta como el que gestiona acciones iniciadas por el usuario en ChatGPT y en los GPT personalizados, es decir, descarga una página porque una persona pidió a ChatGPT que abriera ese enlace. OpenAI señala que las reglas de robots.txt pueden no aplicársele de la misma forma, ya que la petición depende de una acción de usuario en vivo.

¿Qué hace OAI-AdsBot?

OpenAI documenta OAI-AdsBot como el agente que valida la seguridad de las páginas web enviadas como anuncios de ChatGPT, y afirma que "los datos recogidos por OAI-AdsBot no se usan para entrenar modelos fundacionales de IA generativa". Tiene su propio token de robots.txt y su propia lista de IP publicada en openai.com/adsbot.json. Está separado tanto del rastreo de entrenamiento como del de búsqueda.

¿Puede un rastreador ignorar mi archivo robots.txt?

Sí. El RFC 9309 describe el Robots Exclusion Protocol como un conjunto de reglas que los rastreadores leen, y su sección Security Considerations afirma que el protocolo "no sustituye a medidas válidas de seguridad del contenido". Nada en el protocolo bloquea una petición en la capa de red, así que todo lo que deba permanecer privado necesita autenticación o un bloqueo en el servidor.

¿Debería fijar en el código los rangos de IP publicados por OpenAI en lugar de volver a consultarlos?

Los archivos de rangos de IP de OpenAI incluyen un campo creationTime que cambia cada vez que el rango se actualiza, así que una copia fija queda desactualizada en cuanto OpenAI rota su infraestructura. Vuelva a consultar openai.com/gptbot.json, searchbot.json, chatgpt-user.json o adsbot.json según un calendario, y trate cualquier petición con un user agent de OpenAI desde una dirección fuera de la lista actual como una suplantación, no como un rastreador que ignora robots.txt.

¿Por qué no conviene hacer un segundo cambio en robots.txt justo después del primero?

La documentación de OpenAI fija el tiempo de propagación para la búsqueda en aproximadamente 24 horas tras una actualización de robots.txt. Un segundo cambio dentro de esa ventana llega antes de que el primero termine de surtir efecto, así que el resultado que se ve después no puede atribuirse a ninguno de los dos con certeza. Aplique un cambio, anote la hora, y espere el día completo antes de tocar el archivo otra vez.

El RFC 9309 declara en su sección inicial que las reglas de robots.txt "no son una forma de autorización de acceso". Una línea Disallow le pide a un rastreador que cumple las normas que omita una página, pero no tiene ningún mecanismo contra uno que no las cumple. El contenido que de verdad necesita protección va detrás de un muro de acceso o una regla de IP en el servidor, y la entrada en robots.txt sirve solo como constancia de la intención.

¿Pueden convivir las reglas de GPTBot y OAI-SearchBot en el mismo archivo robots.txt?

Pueden, y esa combinación de Disallow para GPTBot y Allow para OAI-SearchBot es justo lo que la separación de OpenAI permite a los sitios que quieren salir del entrenamiento sin perder el tráfico de la búsqueda de ChatGPT. Cada grupo de User-agent se lee por separado, así que el bloque de GPTBot y el de OAI-SearchBot nunca interfieren entre sí dentro del mismo archivo.

Vernos más en Google

Un clic marca RedReplier como fuente preferida y nuestros artículos aparecen más arriba en tus Noticias destacadas, el modo IA y los resúmenes con IA.

Antes de irte...

RedReplier

RedReplier

Detecta a cada comprador que busca lo que vendes

RedReplier vigila Reddit, X, Bluesky y Hacker News en tiempo real, clasifica cada hilo por intención de compra y redacta tu respuesta, para que llegues primero.

Reddit, X, Bluesky y HN

Alertas de intención en tiempo real

Respuestas IA ilimitadas

Ordenado por intención de compra

Artículos relacionados