TL;DR
9 minutos de leituraFazer scraping de páginas publicamente visíveis do Reddit não é crime federal nos Estados Unidos depois de Van Buren e hiQ, mas viola o Reddit User Agreement, que proíbe fazer scraping dos Services sem o consentimento prévio por escrito do Reddit e concede permissão de rastreamento apenas dentro do robots.txt, onde reddit.com hoje envia Disallow barra para todo user agent. O Reddit faz valer esse contrato com revogação de token, suspensão de conta e de aplicativo, direitos de auditoria e acordos de licenciamento de dados. O caminho em conformidade é o Data API oficial depois da aprovação, com um acordo por escrito separado para qualquer uso comercial.
Fazer scraping do Reddit é legal?
Nenhuma lei dos Estados Unidos responde se fazer scraping do Reddit é legal, então o Reddit responde por contrato: o Reddit User Agreement proíbe fazer scraping dos Services sem o consentimento prévio por escrito do Reddit e concede permissão de rastreamento apenas dentro dos parâmetros do seu arquivo robots.txt. O direito penal de acesso a computadores e o direito contratual decidem separadamente, e o Reddit atua do lado contratual, onde não precisa de um promotor. Leia os próprios termos do Reddit para o seu caso de uso antes de escrever um cliente, porque esses termos vinculam a sua conta qualquer que seja a resposta criminal.
O direito geral aqui, incluindo o que Van Buren v. United States decidiu sobre "exceeds authorized access" e o que hiQ Labs v. LinkedIn decidiu sobre scraping de páginas públicas sob o Computer Fraud and Abuse Act, está na página sobre quando o web scraping é legal. Esta página cobre o que a Reddit, Inc. exige. Nenhuma das duas é aconselhamento jurídico.
O que o Reddit User Agreement diz sobre scraping?
O Reddit User Agreement proíbe scraping de forma direta e permite rastreamento apenas de forma condicional. A seção 7, "Things You Cannot Do", diz que você não pode "Access, search, or collect data from the Services by any means (automated or otherwise) except as permitted in these Terms or in a separate agreement with Reddit (we conditionally grant permission to crawl the Services in accordance with the parameters set forth in our robots.txt file, but scraping the Services without Reddit's prior written consent is prohibited)." Esse texto vem do User Agreement em vigor desde July 1, 2026, revisado pela última vez em May 26, 2026, em redditinc.com/policies/user-agreement.
A proibição cobre a coleta "by any means (automated or otherwise)", então um navegador headless e um loop de curl caem na mesma cláusula. O Reddit lista a seção 7 entre as seções que sobrevivem à rescisão, então apagar a conta com que você fez scraping não encerra a obrigação.

O robots.txt do Reddit permite rastreamento?
O robots.txt do Reddit hoje bloqueia todo rastreador em todo caminho. O arquivo em reddit.com/robots.txt contém um único grupo de regras, "User-agent: *" seguido de "Disallow: /", sob um comentário de cabeçalho que diz "Reddit believes in an open internet, but not the misuse of public content" e aponta para a Public Content Policy do Reddit. A permissão condicional de rastreamento da seção 7 se resolve, portanto, como nenhuma permissão para um rastreador geral hoje.
Um arquivo robots.txt não tem força própria, como o explicativo sobre robots.txt estabelece. O Reddit User Agreement o converte em uma fronteira contratual ao conceder permissão de rastreamento por referência ao que o arquivo disser no momento em que você o ler.
O que conta como uso comercial dos dados do Reddit?
O Reddit define uso comercial como qualquer uso por uma empresa, em nome de uma empresa, ou como parte de um produto ou serviço monetizado. O artigo de ajuda "Developer Platform and Accessing Reddit Data" lista aplicativos móveis com anúncios ou paywalls, serviços por assinatura, serviços ou acesso a dados mediante pagamento, publicação de conteúdo do Reddit em sites monetizados, e venda de acesso a modelos treinados com dados do Reddit. O mesmo artigo afirma que você não pode exibir conteúdo do Reddit e rodar anúncios no seu aplicativo, site ou serviço.
Os dois contratos direcionam o uso comercial para um acordo assinado. O Data API Terms 3.1 diz que, para "commercial purposes, research in excess of rate limits, or for any use that is not expressly permitted", você "will need to enter into a separate agreement with Reddit". O Developer Terms 4.1 repete isso e barra o acesso "by or on behalf of a business or as part of a service or product that is monetized" sem aprovação por escrito.
| Caminho até os dados do Reddit | O que a política do Reddit diz | Fonte primária |
|---|---|---|
| Scraping de páginas públicas | Proibido sem o consentimento prévio por escrito do Reddit | User Agreement, seção 7 |
| Rastreamento sob o robots.txt | Permitido condicionalmente, e o arquivo ao vivo envia Disallow: / para todo user agent | User Agreement seção 7, reddit.com/robots.txt |
| Data API, não comercial | Liberado depois que você solicita acesso e o Reddit aprova o caso de uso | Responsible Builder Policy |
| Data API, comercial | Exige um acordo por escrito separado com o Reddit | Data API Terms 3.1, Developer Terms 4.1 |
| Pesquisa acadêmica | Somente pelo programa Reddit for Researchers | Developer Platform and Accessing Reddit Data |
| Treinar um modelo de IA | Proibido sem a permissão do Reddit e a permissão dos titulares de direitos | Data API Terms 2.4, Developer Terms 4.2 |
O que mudou no acesso aos dados do Reddit em 2023?
O Reddit publicou novos Data API Terms em vigor desde June 19, 2023, e esse documento continua valendo, revisado pela última vez em July 20, 2026. Ele dá ao Reddit o direito de "set and enforce limits on your use of the Data APIs" a seu exclusivo critério na seção 2.9, proíbe você de contornar esses limites na seção 3.2, e exige a exclusão do User Content em cache na rescisão na seção 6. A análise dos preços da API do Reddit cobre as tarifas que vieram depois, e os limites de taxa da API do Reddit cobrem a mecânica de cota que o seu cliente precisa respeitar.
O Pushshift, o arquivo em que rodava a maior parte da pesquisa sobre o Reddit, parou de atender o público geral no mesmo período. Sua série de dumps termina em March 2023, que é onde o arquivo Arctic Shift a retoma. O Pushshift agora condiciona o acesso a uma verificação de moderador: seus termos de cadastro exigem que a pessoa certifique ser um moderador registrado do Reddit e limitam o acesso a "community moderation, enforcing Reddit community guidelines, and ensuring community member safety".
Como o Reddit faz valer seus termos?
O Reddit atua por controles de acesso, auditorias e licenciamento, e não por representação criminal. A Responsible Builder Policy lista as medidas de forma direta: revogar seus tokens de acesso, suspender seu aplicativo ou conta, e suspender contas, bots, domínios ou subreddits associados. O Developer Terms 2.2 acrescenta um direito de auditoria: o Reddit monitora seu uso, exige comprovação de conformidade, e pode "use any technical measures to prevent, block, or otherwise overcome the interference".
O lado do licenciamento vem da Public Content Policy. O Reddit diz que firma acordos de licenciamento para poder saber quem está acessando conteúdo público e por quê, impor restrições contratuais de uso, e garantir que os licenciados honrem as exclusões feitas pelos Redditors. Essa política nomeia o acesso não autorizado "by scraping or using data brokers" como o comportamento que o programa de licenciamento existe para substituir.

Qual é a forma de coletar dados do Reddit em conformidade?
Registre um aplicativo, solicite acesso ao Data API para um caso de uso declarado, e assine um acordo separado com o Reddit antes de qualquer dinheiro tocar o resultado. A Responsible Builder Policy impõe três condições a todo acesso a dados do Reddit: aprovação antes de você acessar qualquer coisa, nenhum mascaramento de como e por que você está acessando os dados, e nenhum contorno ou excesso sobre os limites de acesso. O Data API Terms 2.8 torna a segunda concreta, ao exigir o token OAuth que o Reddit emitiu e nenhum mascaramento do user agent ou da identidade OAuth.
RedReplier
Começar
Reddit, X, Bluesky e HN
Alertas de intenção em tempo real
Respostas IA ilimitadas
Classificado por intenção de compra
Três obrigações vêm em seguida. O Data API Terms 3.2 exige que você apague qualquer dado que não seja necessário ao caso de uso aprovado. O Developer Terms 3.3 exige que você remova o User Content assim que o Reddit ou seu autor o apagar. O Data API Terms 2.4 não concede direito de treinamento, então um modelo precisa da própria permissão. Se essa engenharia não vale a construção, compre o acesso: a comparação entre a RedReplier e construir sobre a API do Reddit apresenta o tradeoff, e o monitoramento de palavras-chave no Reddit entrega as mesmas conversas como alertas.
Perguntas frequentes
Fazer scraping do Reddit é legal se as páginas são públicas?
A visibilidade pública resolve a questão criminal e não a questão contratual. Os tribunais dos EUA pararam de tratar o acesso a páginas públicas como violação do Computer Fraud and Abuse Act, o que a página geral sobre web scraping cobre, mas o Reddit User Agreement proíbe scraping sem consentimento prévio por escrito, exija ou não a página um login. A Public Content Policy do Reddit diz o mesmo: terceiros não têm direito de fazer mau uso de conteúdo público só porque ele é público.
O robots.txt do Reddit bloqueia todos os rastreadores?
Sim. O arquivo ao vivo em reddit.com/robots.txt contém um único grupo, "User-agent: *" com "Disallow: /", então não nomeia exceção para nenhum rastreador. O Reddit User Agreement concede permissão de rastreamento apenas "in accordance with the parameters set forth in our robots.txt file", então o arquivo atual deixa essa concessão vazia.
Posso usar o Reddit Data API dentro de um produto pago?
Não sem um acordo separado. O Data API Terms 3.1 direciona finalidades comerciais para um acordo separado com o Reddit, e o Developer Terms 4.1 barra o acesso por uma empresa ou em nome dela, ou como parte de um produto monetizado, sem aprovação por escrito. A documentação de ajuda do Reddit conta serviços por assinatura, aplicativos com paywall e acesso a dados mediante pagamento como uso comercial.
Posso treinar um modelo de IA com posts do Reddit?
Não sem permissão do Reddit e dos titulares de direitos. O Data API Terms 2.4 não concede direito de usar User Content "for training a machine learning or AI model, without the express permission of rightsholders", e o Developer Terms 4.2 barra o acesso a dados do Reddit por API, indexação, cache ou rastreamento para treinar modelos sem a permissão do Reddit. A documentação de ajuda do Reddit acrescenta que o uso comercial de um modelo treinado com dados do Reddit precisa de aprovação explícita.
O Pushshift ainda está disponível?
O Pushshift hoje atende apenas moderadores do Reddit. Seus termos de cadastro exigem que a pessoa certifique ser um moderador registrado do Reddit e limitam o uso a moderação de comunidade, aplicação das diretrizes e segurança dos membros. Sua série pública de dumps termina em March 2023, e o Arctic Shift continua a série a partir dali.
O que acontece se o Reddit pegar você fazendo scraping?
O Reddit revoga tokens de acesso, suspende o aplicativo ou a conta, e suspende contas, bots, domínios ou subreddits associados, medidas que a Responsible Builder Policy lista como suas ações de enforcement. O Data API Terms 3.2 acrescenta um bloqueio permanente ao Data API quando o Reddit entende que você violou a cláusula de limites. Como a violação é contratual, o Reddit age por autoridade própria e não espera um tribunal.
O que acontece com meu acesso se eu fechar a conta do Reddit depois de fazer scraping?
Fechar a conta não cancela a obrigação. O Reddit lista a Section 7, a cláusula que proíbe scraping, entre as seções que sobrevivem ao encerramento do contrato. A reivindicação contratual se apoia no próprio ato de scraping, não no fato de a conta continuar existindo.
Como o Reddit decide quem recebe um acordo de licenciamento de dados?
A Public Content Policy do Reddit trata o licenciamento como uma forma de controlar o acesso, não como um mercado aberto a qualquer um. O Reddit firma esses acordos para saber quem acessa o conteúdo público e por quê, impor restrições contratuais de uso e obrigar os licenciados a respeitar as exclusões de conteúdo feitas pelos usuários. A política aponta o scraping não autorizado e os data brokers como o comportamento que o licenciamento busca substituir.
Pesquisadores universitários podem ter acesso especial aos dados do Reddit?
A pesquisa acadêmica passa por um canal separado da Data API padrão. O Reddit direciona esse acesso para o programa Reddit for Researchers, em vez da aprovação geral da API ou do scraping. Scraping e uso não aprovado da API continuam fora dos limites para pesquisa, assim como para qualquer outro caso de uso.
O Reddit pode mudar os limites da Data API quando quiser?
Essa decisão fica nas mãos do Reddit. A Data API Terms 2.9 dá ao Reddit o direito de definir e aplicar limites de uso das Data API a seu exclusivo critério, e a seção 3.2 proíbe desenvolvedores de contornar o limite vigente. Um cliente construído para os limites de hoje pode ser limitado ou bloqueado amanhã, sem negociação.
Veja-nos mais no Google
Um clique marca a RedReplier como fonte preferida e nossos artigos passam a aparecer mais acima nas suas Principais notícias, no modo IA e nas visões gerais com IA.
Antes de você ir...
RedReplier
Alcance cada comprador que procura o que você vende
O RedReplier monitora Reddit, X, Bluesky e Hacker News em tempo real, classifica cada tópico por intenção de compra e redige a sua resposta, para que você chegue primeiro.
Reddit, X, Bluesky e HN
Alertas de intenção em tempo real
Respostas IA ilimitadas
Classificado por intenção de compra
Artigos relacionados


Quando o web scraping é legal? Quatro perguntas, quatro respostas separadas
Nenhuma lei torna o web scraping legal: CFAA, contrato, direitos autorais e GDPR respondem à parte, e hiQ Labs v. LinkedIn separou as duas primeiras.


Limites de taxa da API do Reddit: 100 consultas por minuto, com média de dez
Como funcionam os limites de taxa da API do Reddit: 100 consultas por minuto por client id do OAuth, média móvel de dez minutos e respostas 429.


Toda taxa de engajamento do Reddit que você vê foi montada por outra pessoa
A taxa de engajamento do Reddit não existe em nenhum produto do Reddit. O que a API devolve, o que os insights mostram e as três taxas montadas com elas.

