TL;DR
10 lecture min.Scraper des pages Reddit publiquement visibles n'est pas un délit fédéral aux États-Unis depuis Van Buren et hiQ, mais cela viole le Reddit User Agreement, qui interdit le scraping des Services sans accord écrit préalable de Reddit et n'accorde de permission de crawl que dans les limites de robots.txt, où reddit.com envoie aujourd'hui Disallow slash à tous les user agents. Reddit fait respecter ce contrat par la révocation de jetons, la suspension de comptes et d'applications, un droit d'audit et des accords de licence de données. La voie conforme est la Data API officielle après approbation, avec un accord écrit distinct pour tout usage commercial.
Le scraping de Reddit est-il légal ?
Aucune loi des États-Unis ne répond à la question "le scraping de Reddit est-il légal", alors Reddit y répond par contrat : le Reddit User Agreement interdit le scraping des Services sans accord écrit préalable de Reddit et n'accorde la permission de crawler que dans les paramètres fixés par son fichier robots.txt. Le droit pénal de l'accès informatique et le droit des contrats tranchent séparément, et Reddit agit du côté contractuel, où il n'a besoin d'aucun procureur. Lisez les conditions de Reddit qui couvrent votre cas d'usage avant d'écrire un client, car ces conditions engagent votre compte quelle que soit la réponse pénale.
Le droit général sur ce terrain, y compris ce que Van Buren v. United States a jugé sur "exceeds authorized access" (l'excès d'accès autorisé) et ce que hiQ Labs v. LinkedIn a jugé sur le scraping de pages publiques au titre du Computer Fraud and Abuse Act, se trouve sur la page consacrée à la légalité du web scraping. Cette page traite de ce qu'exige Reddit, Inc. Ni l'une ni l'autre n'est un conseil juridique.
Que dit le Reddit User Agreement à propos du scraping ?
Le Reddit User Agreement interdit le scraping sans réserve et n'autorise le crawl que sous condition. La section 7, "Things You Cannot Do", énonce que vous ne pouvez pas "Access, search, or collect data from the Services by any means (automated or otherwise) except as permitted in these Terms or in a separate agreement with Reddit (we conditionally grant permission to crawl the Services in accordance with the parameters set forth in our robots.txt file, but scraping the Services without Reddit's prior written consent is prohibited)." (accéder aux Services, y effectuer des recherches ou y collecter des données par quelque moyen que ce soit, automatisé ou non, sauf autorisation prévue par ces conditions ou par un accord distinct avec Reddit ; la permission de crawler les Services est accordée sous condition, dans les paramètres fixés par le fichier robots.txt, mais le scraping des Services sans accord écrit préalable de Reddit est interdit). Ce texte provient du User Agreement en vigueur au 1er juillet 2026, dernière révision le 26 mai 2026, sur redditinc.com/policies/user-agreement.
L'interdiction couvre la collecte "by any means (automated or otherwise)", par tout moyen, automatisé ou non, si bien qu'un navigateur headless et une boucle curl tombent sous la même clause. Reddit range la section 7 parmi les sections qui survivent à la résiliation, donc supprimer le compte depuis lequel vous avez scrapé n'éteint pas l'obligation.

Le fichier robots.txt de Reddit autorise-t-il le crawl ?
Le robots.txt de Reddit interdit aujourd'hui à tous les crawlers l'ensemble des chemins. Le fichier situé à reddit.com/robots.txt contient un seul groupe de règles, "User-agent: *" suivi de "Disallow: /", sous un commentaire d'en-tête qui indique "Reddit believes in an open internet, but not the misuse of public content" (Reddit croit en un internet ouvert, mais pas au détournement du contenu public) et renvoie vers la Public Content Policy de Reddit. La permission conditionnelle de crawl de la section 7 se résout donc aujourd'hui en une absence de permission pour un crawler généraliste.
Un fichier robots.txt n'a aucune force propre, comme l'expose l'explication de robots.txt. Le Reddit User Agreement le convertit en frontière contractuelle en accordant la permission de crawl par renvoi à ce que le fichier indique au moment où vous le lisez.
Qu'est-ce qui compte comme usage commercial des données Reddit ?
Reddit définit l'usage commercial comme tout usage par une entreprise, pour le compte d'une entreprise, ou dans le cadre d'un produit ou service monétisé. L'article d'aide "Developer Platform and Accessing Reddit Data" cite les applications mobiles avec publicité ou paywall, les services par abonnement, les services ou accès aux données payants, la publication de contenu Reddit sur des sites monétisés, et la vente d'accès à des modèles entraînés sur des données Reddit. Le même article précise que vous ne pouvez pas afficher du contenu Reddit et diffuser de la publicité dans votre application, votre site ou votre service.
Les deux contrats orientent l'usage commercial vers un accord signé. Les Data API Terms 3.1 indiquent que pour des "commercial purposes, research in excess of rate limits, or for any use that is not expressly permitted" (des fins commerciales, une recherche au-delà des limites de débit ou tout usage non expressément autorisé), vous "will need to enter into a separate agreement with Reddit" (devrez conclure un accord distinct avec Reddit). Les Developer Terms 4.1 répètent la règle et interdisent l'accès "by or on behalf of a business or as part of a service or product that is monetized" (par une entreprise ou pour son compte, ou dans le cadre d'un service ou produit monétisé) sans approbation écrite.
| Voie d'accès aux données Reddit | Ce que dit la politique de Reddit | Source principale |
|---|---|---|
| Scraping de pages publiques | Interdit sans accord écrit préalable de Reddit | User Agreement, section 7 |
| Crawl dans les limites de robots.txt | Autorisé sous condition, et le fichier en ligne envoie Disallow: / à tous les user agents | User Agreement section 7, reddit.com/robots.txt |
| Data API, usage non commercial | Autorisé après demande d'accès et approbation du cas d'usage par Reddit | Responsible Builder Policy |
| Data API, usage commercial | Exige un accord écrit distinct avec Reddit | Data API Terms 3.1, Developer Terms 4.1 |
| Recherche académique | Uniquement via le programme Reddit for Researchers | Developer Platform and Accessing Reddit Data |
| Entraînement d'un modèle d'IA | Interdit sans la permission de Reddit et celle des ayants droit | Data API Terms 2.4, Developer Terms 4.2 |
Qu'est-ce qui a changé pour l'accès aux données Reddit en 2023 ?
Reddit a publié de nouveaux Data API Terms en vigueur au 19 juin 2023, et ce document reste applicable, dernière révision le 20 juillet 2026. Il donne à Reddit le droit de "set and enforce limits on your use of the Data APIs" (fixer et faire respecter des limites à votre usage des Data APIs) à sa seule discrétion au titre de la section 2.9, vous interdit de contourner ces limites au titre de la section 3.2, et impose la suppression du User Content mis en cache à la résiliation au titre de la section 6. Le détail des tarifs de l'API Reddit couvre les prix qui ont suivi, et les limites de débit de l'API Reddit couvrent la mécanique de quotas que votre client doit respecter.
Pushshift, l'archive sur laquelle tournait l'essentiel de la recherche Reddit, a cessé de servir le grand public sur la même période. Sa série de dumps s'arrête en mars 2023, point où l'archive Arctic Shift prend le relais. Pushshift filtre désormais l'accès par une vérification de modération : ses conditions d'inscription exigent que l'utilisateur certifie être modérateur Reddit enregistré et limitent l'accès à "community moderation, enforcing Reddit community guidelines, and ensuring community member safety" (la modération de communauté, l'application des règles communautaires de Reddit et la sécurité des membres).
Comment Reddit fait-il respecter ses conditions ?
Reddit fait respecter ses conditions par le contrôle d'accès, l'audit et la licence, et non par le renvoi au pénal. La Responsible Builder Policy énumère clairement les mesures : révocation de vos jetons d'accès, suspension de votre application ou de votre compte, et suspension des comptes, bots, domaines ou subreddits associés. Les Developer Terms 2.2 ajoutent un droit d'audit : Reddit surveille votre usage, exige des preuves de conformité et peut "use any technical measures to prevent, block, or otherwise overcome the interference" (employer toute mesure technique pour prévenir, bloquer ou surmonter l'interférence).
Le volet licence vient de la Public Content Policy. Reddit indique qu'il conclut des accords de licence pour savoir qui accède au contenu public et pourquoi, poser des restrictions contractuelles d'usage, et s'assurer que les licenciés honorent les suppressions faites par les Redditors. Cette politique désigne l'accès non autorisé "by scraping or using data brokers" (par scraping ou via des courtiers en données) comme le comportement que le programme de licence existe pour remplacer.

Quelle est la façon conforme de collecter des données Reddit ?
Enregistrez une application, demandez l'accès à la Data API pour un cas d'usage déclaré, et signez un accord distinct avec Reddit avant que le moindre euro ne touche le résultat. La Responsible Builder Policy pose trois conditions à tout accès aux données Reddit : une approbation avant tout accès, aucune dissimulation de la façon dont vous accédez aux données et des raisons de cet accès, et aucun contournement ni dépassement des limites d'accès. Les Data API Terms 2.8 rendent la deuxième concrète, en exigeant le jeton OAuth émis par Reddit et l'absence de dissimulation du user agent ou de l'identité OAuth.
RedReplier
Commencer
Reddit, X, Bluesky et HN
Alertes d'intention en temps réel
Réponses IA illimitées
Classé par intention d'achat
Trois obligations en découlent. Les Data API Terms 3.2 vous imposent de supprimer toute donnée non nécessaire au cas d'usage approuvé. Les Developer Terms 3.3 vous imposent de retirer un User Content dès que Reddit ou son auteur le supprime. Les Data API Terms 2.4 n'accordent aucun droit d'entraînement, un modèle a donc besoin de sa propre permission. Si cette ingénierie ne vaut pas la peine d'être construite, achetez l'accès : RedReplier comparé au développement sur l'API Reddit expose l'arbitrage, et la surveillance de mots-clés Reddit livre les mêmes conversations sous forme d'alertes.
Questions fréquentes
Le scraping de Reddit est-il légal si les pages sont publiques ?
La visibilité publique tranche la question pénale et pas la question contractuelle. Les tribunaux américains ont cessé de traiter l'accès à des pages publiques comme une violation du Computer Fraud and Abuse Act, ce que couvre la page générale sur le web scraping, mais le User Agreement de Reddit interdit le scraping sans accord écrit préalable, qu'une page exige ou non une connexion. La Public Content Policy de Reddit dit la même chose : les tiers n'ont aucun droit de détourner du contenu public au seul motif qu'il est public.
Le robots.txt de Reddit bloque-t-il tous les crawlers ?
Oui. Le fichier en ligne à reddit.com/robots.txt contient un groupe unique, "User-agent: *" avec "Disallow: /", et ne nomme donc aucune exception pour aucun crawler. Le User Agreement de Reddit n'accorde la permission de crawl que "in accordance with the parameters set forth in our robots.txt file" (conformément aux paramètres fixés par notre fichier robots.txt), si bien que le fichier actuel laisse cette autorisation vide.
Puis-je utiliser la Reddit Data API dans un produit payant ?
Pas sans accord distinct. Les Data API Terms 3.1 renvoient les fins commerciales vers un accord distinct avec Reddit, et les Developer Terms 4.1 interdisent l'accès par une entreprise ou pour son compte, ou dans le cadre d'un produit monétisé, sans approbation écrite. La documentation d'aide de Reddit range les services par abonnement, les applications sous paywall et l'accès payant aux données parmi les usages commerciaux.
Puis-je entraîner un modèle d'IA sur des posts Reddit ?
Pas sans la permission de Reddit et celle des ayants droit. Les Data API Terms 2.4 n'accordent aucun droit d'utiliser le User Content "for training a machine learning or AI model, without the express permission of rightsholders" (pour entraîner un modèle d'apprentissage automatique ou d'IA, sans la permission expresse des ayants droit), et les Developer Terms 4.2 interdisent d'accéder aux données Reddit par API, indexation, mise en cache ou crawl pour entraîner des modèles sans la permission de Reddit. La documentation d'aide de Reddit ajoute que l'usage commercial d'un modèle entraîné sur des données Reddit demande une approbation explicite.
Pushshift est-il toujours disponible ?
Pushshift ne sert plus que les modérateurs Reddit. Ses conditions d'inscription exigent que l'utilisateur certifie être modérateur Reddit enregistré et limitent l'usage à la modération de communauté, à l'application des règles et à la sécurité des membres. Sa série publique de dumps s'arrête en mars 2023, et Arctic Shift poursuit la série à partir de là.
Que se passe-t-il si Reddit vous surprend en train de scraper ?
Reddit révoque les jetons d'accès, suspend l'application ou le compte, et suspend les comptes, bots, domaines ou subreddits associés, mesures que la Responsible Builder Policy énumère comme ses actions d'application. Les Data API Terms 3.2 ajoutent un blocage permanent de l'accès à la Data API lorsque Reddit estime que vous avez enfreint la clause de limites. Comme le manquement est contractuel, Reddit agit de sa propre autorité et n'attend aucun tribunal.
Que devient mon accès si je ferme mon compte Reddit après avoir scrapé ?
Fermer le compte n'annule pas l'obligation. Reddit range la Section 7, la clause qui interdit le scraping, parmi les sections qui survivent à la résiliation. La réclamation contractuelle porte sur l'acte de scraping lui-même, pas sur le fait que le compte existe encore.
Comment Reddit choisit-il qui obtient un accord de licence sur ses données ?
La Public Content Policy de Reddit présente la licence comme un moyen de contrôler l'accès, pas comme un marché ouvert à tous. Reddit conclut ces accords pour savoir qui accède au contenu public et pourquoi, imposer des restrictions contractuelles d'usage et obliger les licenciés à respecter les suppressions de contenu faites par les utilisateurs. La politique désigne le scraping non autorisé et les data brokers comme le comportement que la licence est censée remplacer.
Les chercheurs universitaires ont-ils un accès particulier aux données Reddit ?
La recherche académique passe par un canal distinct de la Data API classique. Reddit l'oriente vers le programme Reddit for Researchers plutôt que vers l'approbation générale de l'API ou le scraping. Le scraping et l'usage non approuvé de l'API restent hors limites pour la recherche, comme pour tout autre usage.
Reddit peut-il changer les limites de la Data API quand il le veut ?
Cette décision reste entre les mains de Reddit. Data API Terms 2.9 donne à Reddit le droit de fixer et faire respecter des limites d'usage des Data API à sa seule discrétion, et la section 3.2 interdit aux développeurs de contourner la limite en vigueur. Un client conçu pour les limites d'aujourd'hui peut se retrouver bridé ou bloqué demain, sans négociation.
Nous voir plus souvent sur Google
Un clic définit RedReplier comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.
Avant de partir...
RedReplier
Repérez chaque acheteur qui cherche ce que vous vendez
RedReplier surveille Reddit, X, Bluesky et Hacker News en temps réel, classe chaque sujet selon l'intention d'achat et rédige votre réponse, pour que vous arriviez en premier.
Reddit, X, Bluesky et HN
Alertes d'intention en temps réel
Réponses IA illimitées
Classé par intention d'achat
Articles connexes


Quand le web scraping est-il légal ? Quatre questions, quatre réponses distinctes
Aucune loi ne rend le web scraping légal : CFAA, contrat, droit d'auteur et GDPR répondent à part, et hiQ Labs v. LinkedIn a séparé les deux premiers.


Limites de débit de l'API Reddit : 100 requêtes par minute, moyennées sur dix
Les limites de débit de l'API Reddit en pratique : 100 requêtes par minute par client id OAuth, moyenne glissante de dix minutes et réponses 429.


Chaque taux d'engagement Reddit que vous voyez a été fabriqué par quelqu'un d'autre
Aucun produit Reddit ne contient de taux d'engagement. Ce que renvoie l'API, ce qu'affichent les insights de publication, et les trois taux qu'on en bricole.

