Reddit erwischte Perplexity beim Inhaltsdiebstahl

Ich erzählte früher, dass Reddit Klage gegen die KI-Suchmaschine Perplexity eingereicht hat. Reddit beschuldigt Perplexity des «industriellen» Content-Sammelns. Aber jetzt gibt es Fakten und Reddit zeigte, wie sie den Beklagten in eine Falle lockten.

Um die Anschuldigungen zu untermauern, führte Reddit ein Experiment durch. Das Unternehmen erstellte einen Testbeitrag, der nur für Googles Crawler zugänglich war und für normale Nutzer und externe Datensammler nicht sichtbar war. Laut Reddit erschien der Inhalt dieses Beitrags bereits nach wenigen Stunden in Perplexity-Antworten. Für Reddit ist dies ein direkter Beweis, dass Perplexity über Drittanbieter-Parser von Google-Suchergebnissen für sie geschlossene Daten erhält. Im Klagtext wird dieser Trick mit markierten Banknoten verglichen, die Ermittler verwenden.

Reddit behauptet, dass sie im Mai 2024 ein Schreiben an Perplexity mit der Forderung geschickt haben, den Zugang zu Inhalten einzustellen. Aber seitdem ist die Anzahl der Perplexity-Links zu Reddit-Materialien «um das 40-fache gestiegen». Nach Reddits Version umgingen Perplexity und Auftragnehmer bewusst technische Barrieren, um Texte von der Plattform zu ziehen.

Perplexity weist die Anschuldigungen öffentlich zurück. Das Unternehmen sagt, dass es seine Grundmodelle nicht direkt auf Reddit-Daten trainiert. Sondern lediglich «öffentlich zugängliche Diskussionen zusammenfasst».