Reddit a attrapé Perplexity en train de voler du contenu
J’ai raconté plus tôt que Reddit a déposé une plainte contre le moteur de recherche IA Perplexity. Reddit accuse Perplexity de collecte de contenu «industrielle». Mais maintenant il y a des faits et Reddit a montré comment ils ont piégé le défendeur.
Pour étayer les accusations, Reddit a mené une expérience. L’entreprise a créé un post test qui était accessible uniquement au crawler de Google et n’était pas visible pour les utilisateurs réguliers et les collecteurs de données externes. Selon Reddit, le contenu de ce post est apparu dans les réponses de Perplexity en quelques heures seulement. Pour Reddit c’est une preuve directe que Perplexity via des analyseurs tiers de résultats de recherche Google obtient des données fermées pour elle. Dans le texte de la plainte, cette technique est comparée aux billets marqués que les enquêteurs utilisent.
Reddit affirme avoir envoyé à Perplexity une lettre exigeant d’arrêter l’accès au contenu dès mai 2024. Mais depuis, le nombre de liens Perplexity vers des matériaux Reddit «a augmenté de 40 fois». Selon la version de Reddit, Perplexity et les sous-traitants ont délibérément contourné les barrières techniques pour extraire des textes de la plateforme.
Perplexity rejette publiquement les accusations. L’entreprise dit qu’elle n’entraîne pas ses modèles de base directement sur des données Reddit. Mais seulement «résume les discussions publiquement disponibles».