Reddit engage une procédure judiciaire contre quatre entreprises technologiques. Parmi elles figure Perplexity AI, l’un des nouveaux visages de l’intelligence artificielle générative. La plateforme accuse ces sociétés d’avoir aspiré massivement ses contenus sans autorisation. Ce conflit s’ajoute à une série de tensions croissantes entre les détenteurs de contenus en ligne et les développeurs d’IA.
Une plainte qui cible des pratiques de collecte automatisée
Le 22 octobre, Reddit a déposé une plainte auprès d’un tribunal fédéral de New York. Elle vise quatre entités : Perplexity AI (États-Unis), Oxylabs UAB (Lituanie), SerpApi (Texas) et AWMProxy (Russie). Selon la plateforme, ces entreprises ont contourné ses systèmes de protection pour extraire à grande échelle les messages postés par les utilisateurs.
La méthode décrite consiste à passer par les résultats de recherche Google. Reddit évoque une stratégie détournée. Ces sociétés n’ont pas directement violé ses serveurs, mais ont utilisé des portes d’entrée accessibles publiquement pour collecter ses données. Reddit compare ces pratiques à un vol indirect, où l’on ne force pas un coffre mais où l’on intercepte le véhicule qui le transporte.
Reddit affirme aussi que Perplexity a volontairement évité toute négociation commerciale. L’entreprise aurait pu signer un accord de licence, mais aurait préféré acheter les données extraites illégalement via des intermédiaires.
Les entreprises accusées rejettent en bloc les faits
Perplexity nie toute infraction. Elle affirme qu’elle n’a pas utilisé Reddit pour entraîner ses modèles d’IA. Elle insiste sur le respect des droits d’accès aux données publiques. De son côté, Oxylabs remet en cause la position de Reddit. Elle estime qu’aucune entreprise ne peut revendiquer la propriété de contenus considérés comme publics sur Internet.
Ces positions révèlent un désaccord plus profond. Reddit souhaite garder la main sur les contenus créés par sa communauté. Les sociétés de scraping, elles, revendiquent une libre utilisation des données accessibles via les moteurs de recherche.
Un affrontement qui reflète un débat plus large
Cette affaire s’inscrit dans un contexte plus large de confrontation. Les entreprises d’IA ont besoin d’énormes volumes de textes pour améliorer leurs outils. Les plateformes de contenus, de leur côté, cherchent à protéger leurs bases de données et à en tirer une valeur économique.
Reddit avait déjà poursuivi Anthropic pour des raisons similaires. Ces actions traduisent une volonté de reprendre le contrôle. Elles annoncent aussi un possible durcissement des règles autour de l’usage des contenus publics. Si la justice donne raison à Reddit, d’autres plateformes pourraient emboîter le pas.



