OpenAI testet Modelle gegen Spezialisten aus 44 Berufen
OpenAI stellte neuen Benchmark GDPval vor, der ihre KI-Modelle im Vergleich mit Profis aus verschiedenen Branchen testet. Und ist Versuch zu verstehen, wie nahe OpenAI-Systeme der Überlegenheit über Menschen in ökonomisch bedeutsamer Arbeit sind.
Der Benchmark basiert auf 9 Branchen, die größten Beitrag zum US-Bruttoinlandsprodukt leisten. GDPval testet KI-Modellleistung über 44 Berufe in diesen Branchen, von Programmierern bis Krankenschwestern und Journalisten. Erfahrene Profis verglichen KI-generierte Berichte mit Arbeiten anderer Spezialisten.
GPT-5 high wurde in 46,6% der Fälle als besser oder gleichwertig mit Branchenexperten eingestuft. Claude Opus 4.1 von Anthropic wurde in 49% der Aufgaben als besser oder gleichwertig mit Branchenexperten eingestuft. Obwohl OpenAI behauptet, Claude zeigte solch hohe Ergebnisse wegen Neigung, attraktive Grafiken zu erstellen.
Ich denke, solch hohe Modellwerte könnten wegen Testbeschränkungen überhöht sein. Und spiegeln nicht reale Leistung wider. Der neue Benchmark selbst könnte falsche Erwartungen an KI-Fähigkeiten unter realen Arbeitsbedingungen schaffen.