glossary

Quando fazer scraping do Reddit é legal? O User Agreement responde antes de qualquer tribunal

Taras Shynkarenko
Taras Shynkarenko
•Updated: •9 minutos de leitura
Quando fazer scraping do Reddit é legal? O User Agreement responde antes de qualquer tribunalQuando fazer scraping do Reddit é legal? O User Agreement responde antes de qualquer tribunal

TL;DR

9 minutos de leitura

Fazer scraping de páginas publicamente visíveis do Reddit não é crime federal nos Estados Unidos depois de Van Buren e hiQ, mas viola o Reddit User Agreement, que proíbe fazer scraping dos Services sem o consentimento prévio por escrito do Reddit e concede permissão de rastreamento apenas dentro do robots.txt, onde reddit.com hoje envia Disallow barra para todo user agent. O Reddit faz valer esse contrato com revogação de token, suspensão de conta e de aplicativo, direitos de auditoria e acordos de licenciamento de dados. O caminho em conformidade é o Data API oficial depois da aprovação, com um acordo por escrito separado para qualquer uso comercial.

Nenhuma lei dos Estados Unidos responde se fazer scraping do Reddit é legal, então o Reddit responde por contrato: o Reddit User Agreement proíbe fazer scraping dos Services sem o consentimento prévio por escrito do Reddit e concede permissão de rastreamento apenas dentro dos parâmetros do seu arquivo robots.txt. O direito penal de acesso a computadores e o direito contratual decidem separadamente, e o Reddit atua do lado contratual, onde não precisa de um promotor. Leia os próprios termos do Reddit para o seu caso de uso antes de escrever um cliente, porque esses termos vinculam a sua conta qualquer que seja a resposta criminal.

O direito geral aqui, incluindo o que Van Buren v. United States decidiu sobre "exceeds authorized access" e o que hiQ Labs v. LinkedIn decidiu sobre scraping de páginas públicas sob o Computer Fraud and Abuse Act, está na página sobre quando o web scraping é legal. Esta página cobre o que a Reddit, Inc. exige. Nenhuma das duas é aconselhamento jurídico.

O que o Reddit User Agreement diz sobre scraping?

O Reddit User Agreement proíbe scraping de forma direta e permite rastreamento apenas de forma condicional. A seção 7, "Things You Cannot Do", diz que você não pode "Access, search, or collect data from the Services by any means (automated or otherwise) except as permitted in these Terms or in a separate agreement with Reddit (we conditionally grant permission to crawl the Services in accordance with the parameters set forth in our robots.txt file, but scraping the Services without Reddit's prior written consent is prohibited)." Esse texto vem do User Agreement em vigor desde July 1, 2026, revisado pela última vez em May 26, 2026, em redditinc.com/policies/user-agreement.

A proibição cobre a coleta "by any means (automated or otherwise)", então um navegador headless e um loop de curl caem na mesma cláusula. O Reddit lista a seção 7 entre as seções que sobrevivem à rescisão, então apagar a conta com que você fez scraping não encerra a obrigação.

As mãos de um desenvolvedor no teclado de um notebook, ao lado da seção sobre se o robots.txt do Reddit permite rastreamento.

O robots.txt do Reddit permite rastreamento?

O robots.txt do Reddit hoje bloqueia todo rastreador em todo caminho. O arquivo em reddit.com/robots.txt contém um único grupo de regras, "User-agent: *" seguido de "Disallow: /", sob um comentário de cabeçalho que diz "Reddit believes in an open internet, but not the misuse of public content" e aponta para a Public Content Policy do Reddit. A permissão condicional de rastreamento da seção 7 se resolve, portanto, como nenhuma permissão para um rastreador geral hoje.

Um arquivo robots.txt não tem força própria, como o explicativo sobre robots.txt estabelece. O Reddit User Agreement o converte em uma fronteira contratual ao conceder permissão de rastreamento por referência ao que o arquivo disser no momento em que você o ler.

O que conta como uso comercial dos dados do Reddit?

O Reddit define uso comercial como qualquer uso por uma empresa, em nome de uma empresa, ou como parte de um produto ou serviço monetizado. O artigo de ajuda "Developer Platform and Accessing Reddit Data" lista aplicativos móveis com anúncios ou paywalls, serviços por assinatura, serviços ou acesso a dados mediante pagamento, publicação de conteúdo do Reddit em sites monetizados, e venda de acesso a modelos treinados com dados do Reddit. O mesmo artigo afirma que você não pode exibir conteúdo do Reddit e rodar anúncios no seu aplicativo, site ou serviço.

Os dois contratos direcionam o uso comercial para um acordo assinado. O Data API Terms 3.1 diz que, para "commercial purposes, research in excess of rate limits, or for any use that is not expressly permitted", você "will need to enter into a separate agreement with Reddit". O Developer Terms 4.1 repete isso e barra o acesso "by or on behalf of a business or as part of a service or product that is monetized" sem aprovação por escrito.

Caminho até os dados do RedditO que a política do Reddit dizFonte primária
Scraping de páginas públicasProibido sem o consentimento prévio por escrito do RedditUser Agreement, seção 7
Rastreamento sob o robots.txtPermitido condicionalmente, e o arquivo ao vivo envia Disallow: / para todo user agentUser Agreement seção 7, reddit.com/robots.txt
Data API, não comercialLiberado depois que você solicita acesso e o Reddit aprova o caso de usoResponsible Builder Policy
Data API, comercialExige um acordo por escrito separado com o RedditData API Terms 3.1, Developer Terms 4.1
Pesquisa acadêmicaSomente pelo programa Reddit for ResearchersDeveloper Platform and Accessing Reddit Data
Treinar um modelo de IAProibido sem a permissão do Reddit e a permissão dos titulares de direitosData API Terms 2.4, Developer Terms 4.2

O que mudou no acesso aos dados do Reddit em 2023?

O Reddit publicou novos Data API Terms em vigor desde June 19, 2023, e esse documento continua valendo, revisado pela última vez em July 20, 2026. Ele dá ao Reddit o direito de "set and enforce limits on your use of the Data APIs" a seu exclusivo critério na seção 2.9, proíbe você de contornar esses limites na seção 3.2, e exige a exclusão do User Content em cache na rescisão na seção 6. A análise dos preços da API do Reddit cobre as tarifas que vieram depois, e os limites de taxa da API do Reddit cobrem a mecânica de cota que o seu cliente precisa respeitar.

O Pushshift, o arquivo em que rodava a maior parte da pesquisa sobre o Reddit, parou de atender o público geral no mesmo período. Sua série de dumps termina em March 2023, que é onde o arquivo Arctic Shift a retoma. O Pushshift agora condiciona o acesso a uma verificação de moderador: seus termos de cadastro exigem que a pessoa certifique ser um moderador registrado do Reddit e limitam o acesso a "community moderation, enforcing Reddit community guidelines, and ensuring community member safety".

Como o Reddit faz valer seus termos?

O Reddit atua por controles de acesso, auditorias e licenciamento, e não por representação criminal. A Responsible Builder Policy lista as medidas de forma direta: revogar seus tokens de acesso, suspender seu aplicativo ou conta, e suspender contas, bots, domínios ou subreddits associados. O Developer Terms 2.2 acrescenta um direito de auditoria: o Reddit monitora seu uso, exige comprovação de conformidade, e pode "use any technical measures to prevent, block, or otherwise overcome the interference".

O lado do licenciamento vem da Public Content Policy. O Reddit diz que firma acordos de licenciamento para poder saber quem está acessando conteúdo público e por quê, impor restrições contratuais de uso, e garantir que os licenciados honrem as exclusões feitas pelos Redditors. Essa política nomeia o acesso não autorizado "by scraping or using data brokers" como o comportamento que o programa de licenciamento existe para substituir.

Uma pessoa revisa um contrato impresso em uma mesa, ao lado da seção sobre a forma de coletar dados do Reddit em conformidade.

Como o Reddit escalona a aplicação das regras
1
Revogar os tokens de acesso. Segundo a Responsible Builder Policy, o Reddit retira primeiro os tokens OAuth.
2
Suspender o app ou a conta. Em seguida corta o acesso do app ou da conta específica.
3
Suspender contas, bots, domínios ou subreddits associados. Contas conectadas, bots, domínios e subreddits também são desativados.
4
Bloquear o acesso à Data API permanentemente. A Data API Terms 3.2 prevê um bloqueio permanente quando o Reddit entende que houve violação da cláusula de limites.
Quatro etapas pelas quais o Reddit pune uma violação da cláusula de scraping, da Section 7 até o bloqueio permanente.

Qual é a forma de coletar dados do Reddit em conformidade?

Registre um aplicativo, solicite acesso ao Data API para um caso de uso declarado, e assine um acordo separado com o Reddit antes de qualquer dinheiro tocar o resultado. A Responsible Builder Policy impõe três condições a todo acesso a dados do Reddit: aprovação antes de você acessar qualquer coisa, nenhum mascaramento de como e por que você está acessando os dados, e nenhum contorno ou excesso sobre os limites de acesso. O Data API Terms 2.8 torna a segunda concreta, ao exigir o token OAuth que o Reddit emitiu e nenhum mascaramento do user agent ou da identidade OAuth.

RedReplier
RedReplier

Começar

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Três obrigações vêm em seguida. O Data API Terms 3.2 exige que você apague qualquer dado que não seja necessário ao caso de uso aprovado. O Developer Terms 3.3 exige que você remova o User Content assim que o Reddit ou seu autor o apagar. O Data API Terms 2.4 não concede direito de treinamento, então um modelo precisa da própria permissão. Se essa engenharia não vale a construção, compre o acesso: a comparação entre a RedReplier e construir sobre a API do Reddit apresenta o tradeoff, e o monitoramento de palavras-chave no Reddit entrega as mesmas conversas como alertas.

Perguntas frequentes

A visibilidade pública resolve a questão criminal e não a questão contratual. Os tribunais dos EUA pararam de tratar o acesso a páginas públicas como violação do Computer Fraud and Abuse Act, o que a página geral sobre web scraping cobre, mas o Reddit User Agreement proíbe scraping sem consentimento prévio por escrito, exija ou não a página um login. A Public Content Policy do Reddit diz o mesmo: terceiros não têm direito de fazer mau uso de conteúdo público só porque ele é público.

O robots.txt do Reddit bloqueia todos os rastreadores?

Sim. O arquivo ao vivo em reddit.com/robots.txt contém um único grupo, "User-agent: *" com "Disallow: /", então não nomeia exceção para nenhum rastreador. O Reddit User Agreement concede permissão de rastreamento apenas "in accordance with the parameters set forth in our robots.txt file", então o arquivo atual deixa essa concessão vazia.

Posso usar o Reddit Data API dentro de um produto pago?

Não sem um acordo separado. O Data API Terms 3.1 direciona finalidades comerciais para um acordo separado com o Reddit, e o Developer Terms 4.1 barra o acesso por uma empresa ou em nome dela, ou como parte de um produto monetizado, sem aprovação por escrito. A documentação de ajuda do Reddit conta serviços por assinatura, aplicativos com paywall e acesso a dados mediante pagamento como uso comercial.

Posso treinar um modelo de IA com posts do Reddit?

Não sem permissão do Reddit e dos titulares de direitos. O Data API Terms 2.4 não concede direito de usar User Content "for training a machine learning or AI model, without the express permission of rightsholders", e o Developer Terms 4.2 barra o acesso a dados do Reddit por API, indexação, cache ou rastreamento para treinar modelos sem a permissão do Reddit. A documentação de ajuda do Reddit acrescenta que o uso comercial de um modelo treinado com dados do Reddit precisa de aprovação explícita.

O Pushshift ainda está disponível?

O Pushshift hoje atende apenas moderadores do Reddit. Seus termos de cadastro exigem que a pessoa certifique ser um moderador registrado do Reddit e limitam o uso a moderação de comunidade, aplicação das diretrizes e segurança dos membros. Sua série pública de dumps termina em March 2023, e o Arctic Shift continua a série a partir dali.

O que acontece se o Reddit pegar você fazendo scraping?

O Reddit revoga tokens de acesso, suspende o aplicativo ou a conta, e suspende contas, bots, domínios ou subreddits associados, medidas que a Responsible Builder Policy lista como suas ações de enforcement. O Data API Terms 3.2 acrescenta um bloqueio permanente ao Data API quando o Reddit entende que você violou a cláusula de limites. Como a violação é contratual, o Reddit age por autoridade própria e não espera um tribunal.

O que acontece com meu acesso se eu fechar a conta do Reddit depois de fazer scraping?

Fechar a conta não cancela a obrigação. O Reddit lista a Section 7, a cláusula que proíbe scraping, entre as seções que sobrevivem ao encerramento do contrato. A reivindicação contratual se apoia no próprio ato de scraping, não no fato de a conta continuar existindo.

Como o Reddit decide quem recebe um acordo de licenciamento de dados?

A Public Content Policy do Reddit trata o licenciamento como uma forma de controlar o acesso, não como um mercado aberto a qualquer um. O Reddit firma esses acordos para saber quem acessa o conteúdo público e por quê, impor restrições contratuais de uso e obrigar os licenciados a respeitar as exclusões de conteúdo feitas pelos usuários. A política aponta o scraping não autorizado e os data brokers como o comportamento que o licenciamento busca substituir.

Pesquisadores universitários podem ter acesso especial aos dados do Reddit?

A pesquisa acadêmica passa por um canal separado da Data API padrão. O Reddit direciona esse acesso para o programa Reddit for Researchers, em vez da aprovação geral da API ou do scraping. Scraping e uso não aprovado da API continuam fora dos limites para pesquisa, assim como para qualquer outro caso de uso.

O Reddit pode mudar os limites da Data API quando quiser?

Essa decisão fica nas mãos do Reddit. A Data API Terms 2.9 dá ao Reddit o direito de definir e aplicar limites de uso das Data API a seu exclusivo critério, e a seção 3.2 proíbe desenvolvedores de contornar o limite vigente. Um cliente construído para os limites de hoje pode ser limitado ou bloqueado amanhã, sem negociação.

Veja-nos mais no Google

Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.

Antes de você ir...

RedReplier

RedReplier

Alcance cada comprador que procura o que você vende

O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.

Reddit, X, Bluesky e HN

Alertas de intenção em tempo real

Respostas IA ilimitadas

Classificado por intenção de compra

Artigos relacionados