glossary

Comment Arctic Shift a reconstruit l'accès public aux données Reddit

Taras Shynkarenko
Taras Shynkarenko
Updated: 7 lecture min.
Comment Arctic Shift a reconstruit l'accès public aux données RedditComment Arctic Shift a reconstruit l'accès public aux données Reddit

TL;DR

7 lecture min.

Le projet de données Reddit Arctic Shift publie des dumps mensuels gratuits de posts et commentaires remontant à 2005, ainsi qu'une API et un outil de recherche web sur les mêmes données. Ses dumps prolongent la série publiée par Pushshift, qui s'arrête en mars 2023. L'accès ne coûte rien et ne nécessite aucune clé, et l'API hébergée ne garantit aucune disponibilité.

Qu'est-ce qu'Arctic Shift ?

Le projet de données Reddit Arctic Shift publie des dumps mensuels gratuits de posts et commentaires Reddit, une API publique sur les mêmes enregistrements et un outil de recherche basé sur le navigateur, le tout maintenu par l'utilisateur GitHub ArthurHeitmann. Le README du projet indique que son objectif est de rendre les données Reddit accessibles aux chercheurs, aux modérateurs et à tous les autres. Choisissez le mode d'accès selon le volume: l'outil web pour un seul fil, l'API pour quelques milliers d'enregistrements, les dumps pour tout le corpus.

Mode d'accèsOù il se trouveIdéal pourCe que ça coûte
Dumps mensuelsLiens de téléchargement publiés dans le dépôt GitHubHistoriques complets de subreddits, constitution de corpusGratuit, plus votre propre stockage et calcul
API publiquearctic-shift.photon-reddit.comRequêtes scriptées de milliers d'enregistrementsGratuit, sans clé, sans garantie de disponibilité
Outil de recherche webarctic-shift.photon-reddit.comRetrouver à la main un post supprimé ou l'historique d'un utilisateurGratuit, rien à installer

Les trois modes lisent les mêmes données sous-jacentes, donc une requête que vous testez dans l'outil web répond de la même façon via l'API.

Rangées de baies de stockage serveur, illustrant l'ampleur des dumps mensuels de données Reddit.

Quelles données Arctic Shift couvre-t-il ?

Arctic Shift couvre les posts et commentaires Reddit collectés via l'API officielle de Reddit, à l'exclusion des subreddits privés et mis en quarantaine. L'index des dumps s'étend de juin 2005, proche des débuts de Reddit lui-même, jusqu'aux publications des mois les plus récents, si bien que l'archive est à la fois historique et continue. Vérifiez le fichier de liens de téléchargement du dépôt avant de planifier une étude, car ce fichier est la référence officielle des mois disponibles.

Le format de fichier est un objet JSON par post ou commentaire, ce qui fait d'un dump un flux délimité par des sauts de ligne que vous pouvez traiter sans le charger en entier. Depuis novembre 2023, le projet récupère chaque élément deux fois, à environ 36 heures d'intervalle, si bien qu'un enregistrement porte les modifications, suppressions et changements de score survenus dans cette fenêtre. Depuis avril 2024, le projet distribue les fichiers exclusivement au format .zst, ce qui nécessite Python 3.10 ou supérieur et la bibliothèque zstandard pour les lire.

Comment le format d'Arctic Shift a évolué
1
Juin 2005. L'index des dumps commence ici, proche des débuts de Reddit lui-même.
2
Novembre 2023. Chaque élément est récupéré deux fois, à environ 36 heures d'intervalle, ce qui capture les modifications et les suppressions.
3
Avril 2024. Les dumps passent exclusivement au format .zst, ce qui exige Python 3.10 ou plus récent et la bibliothèque zstandard.
Les détails de collecte des dumps plus récents ne s'appliquent pas aux fichiers de l'ère Pushshift, de mars 2023 et avant.

Quel est le lien entre Arctic Shift et Pushshift ?

Les dumps d'Arctic Shift prolongent la série publiée par Pushshift, qui s'arrête en mars 2023. La documentation propre du projet trace la ligne explicitement: ses changements de collecte s'appliquent aux dumps ultérieurs et ne s'appliquent pas aux dumps Pushshift antérieurs de 2023-03 et avant. Les chercheurs qui ont bâti leurs pipelines sur les chemins de fichiers de Pushshift pointent donc ce même pipeline vers Arctic Shift pour tout ce qui suit cette date.

Les deux archives coexistent plutôt que l'une ne remplace l'autre. Le README d'Arctic Shift liste Pushshift et PullPush à ses côtés, chacun avec sa propre procédure de demande de suppression, ce qui constitue la carte pratique de l'endroit où vivent aujourd'hui les données d'archives Reddit. Pour le volet plateforme de cette histoire, tarification de l'API Reddit couvre ce qui a changé pour quiconque lit Reddit en volume, et comment RedReplier se compare à Pushshift couvre le volet surveillance.

Quelles sont les limites de débit de l'API Arctic Shift ?

Arctic Shift ne publie aucune limite de débit chiffrée, et sa documentation d'API indique plutôt qu'un utilisateur normal effectuant quelques requêtes par seconde n'a rien à craindre. La limitation est dynamique et liée à la charge du serveur, si bien que le plafond évolue selon ce que tout le monde demande à ce moment précis. Écrivez votre client pour qu'il ralentisse plutôt que de viser un budget fixe.

Quand vous atteignez effectivement la limite, l'API répond 429 et renvoie les en-têtes X-RateLimit-Reset et X-RateLimit-Reset-At qui indiquent quand la limite se libère. Lisez ces deux en-têtes et attendez la réinitialisation au lieu de réessayer à l'aveugle. Les quotas fixes fonctionnent différemment sur la plateforme officielle, et limites de débit de l'API Reddit détaille ces chiffres.

Choisir un mode d'accès Arctic Shift
Partez du nombre d'enregistrements dont vous avez besoin
Un post ou un historique d'utilisateur: l'outil de recherche web
Des milliers d'enregistrements, en script: l'API publique
Un subreddit entier ou une année: les dumps mensuels
Les dumps nécessitent Python 3.10+ et la bibliothèque zstandard
Traitez le 429 avec les en-têtes de réinitialisation, pas avec une boucle de nouvelles tentatives
L'API ne garantit aucune disponibilité, donc une étude qui doit aboutir devrait s'exécuter sur des dumps téléchargés.

Une personne tapant du code sur un ordinateur portable tard le soir, évoquant les chercheurs et modérateurs qui interrogent les archives Reddit.

À quoi les gens utilisent-ils Arctic Shift ?

Trois groupes utilisent Arctic Shift: les universitaires qui construisent des jeux de données, les modérateurs qui reconstituent ce qui s'est passé dans leurs propres communautés, et quiconque récupère un post depuis supprimé. L'archive répond à des questions que l'API Reddit en direct ne peut pas résoudre, car l'API en direct renvoie ce qui existe maintenant et l'archive renvoie ce qui existait alors. Cet écart est toute la raison d'être du projet.

Le travail sur les jeux de données s'exécute sur les dumps, car une étude nécessitant une année d'un subreddit est une opération de fichier plutôt que des milliers de requêtes. Le travail de modération s'exécute sur l'API et l'outil web, où vous récupérez l'historique de commentaires d'un utilisateur ou l'arborescence d'un fil supprimé. Les deux relèvent de la pratique plus large couverte dans collecte de données sur les réseaux sociaux, et le cadre juridique pour réutiliser ces données fait l'objet de le web scraping est-il légal.

Quand Arctic Shift n'est-il pas le bon outil ?

Arctic Shift est le mauvais outil quand vous devez savoir ce qui se passe dans une conversation pendant qu'elle est encore ouverte. L'archive est rétrospective par conception, publiée à un rythme mensuel, sans alerte ni engagement de disponibilité sur l'API hébergée. Un jeu de données publié le mois prochain ne peut pas vous dire que quelqu'un a demandé ce matin un produit comme le vôtre.

Cette tâche revient à un produit de surveillance. RedReplier surveille Reddit, X, Bluesky, Facebook et Hacker News ensemble, classe les mentions selon l'intention d'achat et explique avec l'IA pourquoi chacune a été signalée, puis vous envoie un e-mail selon l'intervalle de votre forfait. Voir surveillance de mots-clés Reddit pour cette configuration, et comment fonctionne la recherche Reddit pour ce que renvoie la recherche du site lui-même avant même de recourir à une archive.

Questions fréquentes

Arctic Shift est-il gratuit ?

Oui. Les dumps, l'API et l'outil de recherche web sont tous gratuits, et l'API ne nécessite aucune clé. Les coûts restants sont les vôtres: l'espace disque pour les dumps et le calcul pour les décompresser et les traiter.

RedReplier
RedReplier

Commencer

Reddit, X, Bluesky et HN

Alertes d'intention en temps réel

Réponses IA illimitées

Classé par intention d'achat

Arctic Shift inclut-il les posts et commentaires supprimés ?

Les enregistrements sont capturés deux fois, à environ 36 heures d'intervalle, donc un post supprimé après ce second passage reste dans l'archive tel qu'il a été capturé. Un post supprimé quelques minutes après sa création n'a peut-être jamais été collecté. Le projet gère aussi une procédure de demande de suppression pour les personnes qui veulent faire retirer leur propre contenu.

Quel format de fichier utilisent les dumps d'Arctic Shift ?

Les fichiers sont livrés sous forme de flux compressés .zst contenant un objet JSON par post ou commentaire. Les lire nécessite Python 3.10 ou supérieur avec la bibliothèque zstandard installée. Le dépôt inclut des scripts pour parcourir un dump sans décompresser le fichier entier sur le disque.

Jusqu'à quand remontent les données d'Arctic Shift ?

L'index des dumps commence en juin 2005 et va jusqu'à la publication mensuelle la plus récente. La partie antérieure de cette plage provient des dumps Pushshift de mars 2023 et avant, qu'Arctic Shift republie sans modification.

Arctic Shift couvre-t-il les subreddits privés ?

Non. La collecte passe par l'API officielle de Reddit, qui exclut les subreddits privés et mis en quarantaine, donc aucun des deux n'apparaît dans les dumps. Tout ce que vous trouvez dans l'archive était public sur Reddit au moment où cela a été capturé.

Arctic Shift peut-il remplacer un outil de surveillance Reddit en direct ?

Non. Les dumps mensuels et une API d'archive répondent à des questions sur le passé, tandis que la surveillance répond à des questions sur la dernière heure. Utilisez Arctic Shift pour la recherche et un outil de surveillance pour tout ce à quoi vous comptez répondre.

Qui maintient Arctic Shift ?

L'utilisateur GitHub ArthurHeitmann maintient Arctic Shift et publie les dumps, l'API et l'outil de recherche web depuis le même dépôt. Le README du projet présente son objectif comme rendre les données Reddit accessibles aux chercheurs, aux modérateurs et à tout le monde. Un seul mainteneur fait donc tourner les trois modes d'accès sur les mêmes données.

Où télécharger les dumps d'Arctic Shift ?

Les dumps mensuels sont des liens de téléchargement publiés directement dans le dépôt GitHub, séparés de l'API et de l'outil web. Vérifie le fichier de liens de téléchargement du dépôt avant de préparer une étude, car ce fichier fait foi sur les mois réellement disponibles. Chaque fichier lié arrive sous forme de flux .zst, prêt pour les scripts que le dépôt fournit afin de le parcourir sans le décompresser entièrement sur le disque.

Que doit faire mon code quand Arctic Shift renvoie un 429 ?

Une réponse 429 arrive avec les en-têtes X-RateLimit-Reset et X-RateLimit-Reset-At, qui indiquent précisément quand la limite se lève. Lis ces en-têtes et attends la réinitialisation, plutôt que de réessayer à l'aveugle selon un calendrier fixe ou un budget de requêtes fixe. Arctic Shift ne publie de toute façon aucune limite numérique, puisque le plafond bouge avec la charge du serveur à cet instant.

Puis-je utiliser Arctic Shift et Pushshift dans le même pipeline ?

Les deux archives se raccordent directement, puisque les dumps d'Arctic Shift reprennent exactement là où la série Pushshift s'arrête en mars 2023. La documentation des fichiers d'Arctic Shift précise que ses changements de collecte, comme la double capture de chaque élément, s'appliquent seulement aux dumps postérieurs à cette date et pas aux fichiers Pushshift antérieurs. Un pipeline construit sur les chemins de fichiers Pushshift peut pointer vers Arctic Shift pour tout ce qui suit mars 2023.

Nous voir plus souvent sur Google

Un clic définit RedReplier comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.

Avant de partir...

RedReplier

RedReplier

Repérez chaque acheteur qui cherche ce que vous vendez

RedReplier surveille Reddit, X, Bluesky et Hacker News en temps réel, classe chaque sujet selon l'intention d'achat et rédige votre réponse, pour que vous arriviez en premier.

Reddit, X, Bluesky et HN

Alertes d'intention en temps réel

Réponses IA illimitées

Classé par intention d'achat

Articles connexes