glossary

¿Cuándo es legal el scraping de Reddit? El User Agreement responde antes que cualquier tribunal

Taras Shynkarenko
Taras Shynkarenko
•Updated: •10 lectura mínima
¿Cuándo es legal el scraping de Reddit? El User Agreement responde antes que cualquier tribunal¿Cuándo es legal el scraping de Reddit? El User Agreement responde antes que cualquier tribunal

TL;DR

10 lectura mínima

Hacer scraping de páginas de Reddit visibles públicamente no es un delito federal en Estados Unidos después de Van Buren y hiQ, pero incumple el Reddit User Agreement, que prohíbe hacer scraping de los Services sin el consentimiento previo por escrito de Reddit y concede permiso de rastreo solo dentro de robots.txt, donde reddit.com envía hoy Disallow barra a todo user agent. Reddit hace cumplir ese contrato con revocación de tokens, suspensión de cuentas y apps, derechos de auditoría y acuerdos de licencia de datos. La vía conforme es la Data API oficial tras la aprobación, con un acuerdo escrito aparte para cualquier uso comercial.

Ninguna ley de Estados Unidos responde a si es legal el scraping de Reddit, así que Reddit lo responde por contrato: el Reddit User Agreement prohíbe hacer scraping de los Services sin el consentimiento previo por escrito de Reddit y concede permiso para rastrear solo dentro de los parámetros de su archivo robots.txt. El derecho penal de acceso informático y el derecho contractual deciden por separado, y Reddit actúa por el lado contractual, donde no necesita a un fiscal. Lea los propios términos de Reddit para su caso de uso antes de escribir un cliente, porque esos términos obligan a su cuenta sea cual sea la respuesta penal.

El derecho general aquí, incluido lo que Van Buren v. United States sostuvo sobre "exceeds authorized access" (excede el acceso autorizado) y lo que hiQ Labs v. LinkedIn sostuvo sobre el scraping de páginas públicas bajo la Computer Fraud and Abuse Act, está en la página sobre cuándo es legal el web scraping. Esta página cubre lo que exige Reddit, Inc. Ninguna de las dos es asesoramiento legal.

¿Qué dice el Reddit User Agreement sobre el scraping?

El Reddit User Agreement prohíbe el scraping sin matices y permite el rastreo solo de forma condicional. La sección 7, "Things You Cannot Do", dice que usted no puede "Access, search, or collect data from the Services by any means (automated or otherwise) except as permitted in these Terms or in a separate agreement with Reddit (we conditionally grant permission to crawl the Services in accordance with the parameters set forth in our robots.txt file, but scraping the Services without Reddit's prior written consent is prohibited)." (acceder, buscar o recoger datos de los Services por cualquier medio, automatizado o no, salvo lo permitido en estos Terms o en un acuerdo aparte con Reddit; concedemos permiso condicional para rastrear los Services conforme a los parámetros fijados en nuestro archivo robots.txt, pero está prohibido hacer scraping de los Services sin el consentimiento previo por escrito de Reddit). Ese texto procede del User Agreement con efecto July 1, 2026, revisado por última vez el May 26, 2026, en redditinc.com/policies/user-agreement.

La prohibición cubre la recogida "by any means (automated or otherwise)" (por cualquier medio, automatizado o no), así que un navegador headless y un bucle de curl caen en la misma cláusula. Reddit incluye la sección 7 entre las secciones que sobreviven a la terminación, así que borrar la cuenta desde la que hizo scraping no retira la obligación.

Las manos de un desarrollador sobre el teclado de un portátil, junto a la sección sobre si el robots.txt de Reddit permite rastrear el sitio.

¿El robots.txt de Reddit permite rastrear el sitio?

El robots.txt de Reddit hoy prohíbe todo rastreador en toda ruta. El archivo en reddit.com/robots.txt contiene un solo grupo de reglas, "User-agent: *" seguido de "Disallow: /", bajo un comentario de cabecera que dice "Reddit believes in an open internet, but not the misuse of public content" (Reddit cree en una internet abierta, pero no en el uso indebido del contenido público) y que remite a la Public Content Policy de Reddit. El permiso condicional de rastreo de la sección 7 equivale por tanto a ningún permiso para un rastreador general hoy.

Un archivo robots.txt no tiene fuerza por sí mismo, como expone la explicación de robots.txt. El User Agreement de Reddit lo convierte en una frontera contractual al conceder el permiso de rastreo por referencia a lo que diga el archivo en el momento en que usted lo lee.

¿Qué cuenta como uso comercial de los datos de Reddit?

Reddit define el uso comercial como cualquier uso por parte de una empresa, en nombre de una empresa o como parte de un producto o servicio monetizado. El artículo de ayuda "Developer Platform and Accessing Reddit Data" enumera apps móviles con anuncios o muros de pago, servicios de suscripción, servicios o acceso a datos por una tarifa, publicar contenido de Reddit en sitios monetizados y vender acceso a modelos entrenados con datos de Reddit. El mismo artículo afirma que usted no puede mostrar contenido de Reddit y publicar anuncios en su app, sitio web o servicio.

Los dos contratos derivan el uso comercial a un acuerdo firmado. Los Data API Terms 3.1 dicen que para "commercial purposes, research in excess of rate limits, or for any use that is not expressly permitted" (fines comerciales, investigación por encima de los límites de tasa o cualquier uso no permitido expresamente), usted "will need to enter into a separate agreement with Reddit" (tendrá que celebrar un acuerdo aparte con Reddit). Los Developer Terms 4.1 lo repiten y vetan el acceso "by or on behalf of a business or as part of a service or product that is monetized" (por una empresa o en su nombre, o como parte de un servicio o producto monetizado) sin aprobación por escrito.

Vía de acceso a los datos de RedditQué dice la política de RedditFuente principal
Scraping de páginas públicasProhibido sin el consentimiento previo por escrito de RedditUser Agreement, sección 7
Rastreo conforme a robots.txtPermitido de forma condicional, y el archivo en vivo envía Disallow: / a todo user agentUser Agreement sección 7, reddit.com/robots.txt
Data API, no comercialPermitido después de solicitar acceso y de que Reddit apruebe el caso de usoResponsible Builder Policy
Data API, comercialExige un acuerdo escrito aparte con RedditData API Terms 3.1, Developer Terms 4.1
Investigación académicaSolo a través del programa Reddit for ResearchersDeveloper Platform and Accessing Reddit Data
Entrenar un modelo de IAProhibido sin permiso de Reddit y de los titulares de derechosData API Terms 2.4, Developer Terms 4.2

¿Qué cambió en el acceso a los datos de Reddit en 2023?

Reddit publicó nuevos Data API Terms con efecto June 19, 2023, y ese documento sigue vigente, revisado por última vez el July 20, 2026. Da a Reddit el derecho de "set and enforce limits on your use of the Data APIs" (fijar y hacer cumplir límites a su uso de las Data APIs) a su entera discreción bajo la sección 2.9, le prohíbe eludir esos límites bajo la sección 3.2 y exige borrar el User Content en caché al terminar el acuerdo, bajo la sección 6. El desglose de los precios de la API de Reddit cubre las tarifas que llegaron después, y los límites de tasa de la API de Reddit cubren la mecánica de cuotas que su cliente tiene que respetar.

Pushshift, el archivo sobre el que corría la mayor parte de la investigación sobre Reddit, dejó de servir al público general en ese mismo periodo. Su serie de volcados termina en March 2023, que es donde la retoma el archivo Arctic Shift. Pushshift restringe ahora el acceso tras una comprobación de moderador: sus condiciones de registro exigen al usuario certificar que es moderador registrado de Reddit y limitan el acceso a "community moderation, enforcing Reddit community guidelines, and ensuring community member safety" (moderación de la comunidad, aplicación de las normas de la comunidad de Reddit y garantía de la seguridad de los miembros de la comunidad).

¿Cómo hace cumplir Reddit sus términos?

Reddit actúa mediante controles de acceso, auditorías y licencias, no mediante denuncia penal. La Responsible Builder Policy enumera las medidas sin rodeos: revocar sus tokens de acceso, suspender su app o su cuenta y suspender cuentas, bots, dominios o subreddits asociados. Los Developer Terms 2.2 añaden un derecho de auditoría: Reddit vigila su uso, exige pruebas de cumplimiento y puede "use any technical measures to prevent, block, or otherwise overcome the interference" (emplear cualquier medida técnica para prevenir, bloquear o superar de otro modo la interferencia).

El lado de las licencias viene de la Public Content Policy. Reddit dice que celebra acuerdos de licencia para poder saber quién accede al contenido público y por qué, imponer restricciones contractuales de uso y asegurar que los licenciatarios respeten los borrados que hacen los redditors. Esa política señala el acceso no autorizado "by scraping or using data brokers" (mediante scraping o mediante brókers de datos) como la conducta que el programa de licencias existe para desplazar.

Una persona revisa un contrato impreso en un escritorio, junto a la sección sobre la forma conforme de recoger datos de Reddit.

Cómo escala Reddit la aplicación de sus reglas
1
Revocar los tokens de acceso. Según la Responsible Builder Policy, Reddit retira primero los tokens OAuth.
2
Suspender la app o la cuenta. Después corta el acceso de la app o cuenta concreta.
3
Suspender cuentas, bots, dominios o subreddits asociados. También da de baja cuentas conectadas, bots, dominios y subreddits.
4
Bloquear el acceso a la Data API de forma permanente. Data API Terms 3.2 añade un bloqueo permanente cuando Reddit considera que hubo una infracción de la cláusula de límites.
Cuatro pasos con los que Reddit castiga una infracción de la cláusula de scraping, desde la Section 7 hasta el bloqueo permanente.

¿Cuál es la forma conforme de recoger datos de Reddit?

Registre una app, solicite acceso a la Data API para un caso de uso declarado y firme un acuerdo aparte con Reddit antes de que ningún dinero toque el resultado. La Responsible Builder Policy fija tres condiciones para todo acceso a datos de Reddit: aprobación antes de acceder a nada, nada de ocultar cómo y por qué accede a los datos, y nada de eludir ni superar los límites de acceso. Los Data API Terms 2.8 concretan la segunda, al exigir el token OAuth que emitió Reddit y prohibir enmascarar el user agent o la identidad OAuth.

RedReplier
RedReplier

Comenzar

Reddit, X, Bluesky y HN

Alertas de intención en tiempo real

Respuestas IA ilimitadas

Ordenado por intención de compra

De ahí salen tres obligaciones. Los Data API Terms 3.2 le exigen borrar cualquier dato que no necesite el caso de uso aprobado. Los Developer Terms 3.3 le exigen retirar el User Content en cuanto Reddit o su autor lo borren. Los Data API Terms 2.4 no conceden ningún derecho de entrenamiento, así que un modelo necesita su propio permiso. Si esa ingeniería no compensa, compre el acceso: RedReplier comparado con construir sobre la API de Reddit expone el intercambio, y el monitoreo de palabras clave en Reddit entrega las mismas conversaciones en forma de alertas.

Preguntas frecuentes

Que sean públicas resuelve la cuestión penal y no la contractual. Los tribunales estadounidenses dejaron de tratar el acceso a páginas públicas como una infracción de la Computer Fraud and Abuse Act, algo que cubre la página general sobre web scraping, pero el User Agreement de Reddit prohíbe el scraping sin consentimiento previo por escrito, exija o no la página iniciar sesión. La Public Content Policy de Reddit dice lo mismo: los terceros no tienen derecho a usar indebidamente el contenido público solo porque sea público.

¿El robots.txt de Reddit bloquea a todos los rastreadores?

Sí. El archivo en vivo en reddit.com/robots.txt contiene un solo grupo, "User-agent: *" con "Disallow: /", así que no nombra excepción alguna para ningún rastreador. El User Agreement de Reddit concede permiso de rastreo solo "in accordance with the parameters set forth in our robots.txt file" (conforme a los parámetros fijados en nuestro archivo robots.txt), así que el archivo actual deja esa concesión vacía.

¿Puedo usar la Data API de Reddit dentro de un producto de pago?

No sin un acuerdo aparte. Los Data API Terms 3.1 derivan los fines comerciales a un acuerdo aparte con Reddit, y los Developer Terms 4.1 vetan el acceso por una empresa o en su nombre, o como parte de un producto monetizado, sin aprobación por escrito. La documentación de ayuda de Reddit cuenta como comerciales los servicios de suscripción, las apps con muro de pago y el acceso a datos por una tarifa.

¿Puedo entrenar un modelo de IA con posts de Reddit?

No sin permiso de Reddit y de los titulares de derechos. Los Data API Terms 2.4 no conceden derecho a usar el User Content "for training a machine learning or AI model, without the express permission of rightsholders" (para entrenar un modelo de machine learning o de IA, sin el permiso expreso de los titulares de derechos), y los Developer Terms 4.2 vetan acceder a los datos de Reddit por API, indexación, caché o rastreo para entrenar modelos sin permiso de Reddit. La documentación de ayuda de Reddit añade que el uso comercial de un modelo entrenado con datos de Reddit necesita aprobación explícita.

¿Sigue disponible Pushshift?

Pushshift sirve ahora solo a moderadores de Reddit. Sus condiciones de registro exigen al usuario certificar que es moderador registrado de Reddit y limitan el uso a la moderación de la comunidad, la aplicación de las normas y la seguridad de los miembros. Su serie pública de volcados termina en March 2023, y Arctic Shift continúa la serie desde ahí.

¿Qué pasa si Reddit le pilla haciendo scraping?

Reddit revoca los tokens de acceso, suspende la app o la cuenta y suspende cuentas, bots, dominios o subreddits asociados, medidas que la Responsible Builder Policy enumera como sus acciones de cumplimiento. Los Data API Terms 3.2 añaden un bloqueo permanente del acceso a la Data API cuando Reddit cree que usted incumplió la cláusula de límites. Como el incumplimiento es contractual, Reddit actúa por su propia autoridad y no espera a ningún tribunal.

¿Qué pasa con mi acceso si cierro la cuenta de Reddit después de hacer scraping?

Cerrar la cuenta no elimina la obligación. Reddit incluye la Section 7, la cláusula que prohíbe el scraping, entre las secciones que sobreviven a la terminación del contrato. La reclamación contractual se basa en el acto de scraping, no en si la cuenta sigue existiendo.

¿Cómo decide Reddit a quién le da un acuerdo de licencia de datos?

La Public Content Policy de Reddit plantea la licencia como una forma de controlar el acceso, no como un mercado abierto a cualquiera. Reddit firma estos acuerdos para saber quién accede al contenido público y por qué, imponer restricciones contractuales de uso y obligar a los licenciatarios a respetar las eliminaciones de contenido que hacen los usuarios. La política señala el scraping no autorizado y los data brokers como el comportamiento que la licencia busca reemplazar.

¿Pueden los investigadores universitarios obtener un acceso especial a los datos de Reddit?

La investigación académica pasa por un canal separado de la Data API estándar. Reddit la dirige al programa Reddit for Researchers en lugar de la aprobación general de la API o el scraping. El scraping y el uso no aprobado de la API quedan fuera de los límites para la investigación igual que para cualquier otro caso de uso.

¿Puede Reddit cambiar los límites de la Data API cuando quiera?

Esa decisión queda en manos de Reddit. Data API Terms 2.9 le da a Reddit el derecho de fijar y hacer cumplir límites de uso de las Data API a su entera discreción, y la sección 3.2 prohíbe a los desarrolladores eludir el límite vigente en cada momento. Un cliente construido para los límites de hoy puede verse limitado o bloqueado mañana sin negociación.

Vernos más en Google

Un clic marca RedReplier como fuente preferida y nuestros artículos aparecen más arriba en tus Noticias destacadas, el modo IA y los resúmenes con IA.

Antes de irte...

RedReplier

RedReplier

Detecta a cada comprador que busca lo que vendes

RedReplier vigila Reddit, X, Bluesky y Hacker News en tiempo real, clasifica cada hilo por intención de compra y redacta tu respuesta, para que llegues primero.

Reddit, X, Bluesky y HN

Alertas de intención en tiempo real

Respuestas IA ilimitadas

Ordenado por intención de compra

Artículos relacionados