LIVEBSI-Grundschutz 2025: LLM-Sicherheit für Kritische Infrastrukturen·DeepSeek-V3: Open-Source-KI mit Multimodal-Reasoning für Unternehmen·KI-ROI in der Chemieindustrie 2025: Prozesse, Synthese, HaftungMittwoch, 30. September 2026

MMLU, MMLU-Pro und GPQA: Wie zuverlässig sind KI-Benchmarks 2025?

MMLU, MMLU-Pro und GPQA messen KI-Wissen unterschiedlich streng. Dieser Vergleich zeigt, wo Benchmarks 2025 an Grenzen stoßen.

ER
ecompanion Redaktion14.9.2026 · 3 Min. Lesezeit
↗ Teilen🔖 Merken🎧 Anhören
MMLU, MMLU-Pro und GPQA: Wie zuverlässig sind KI-Benchmarks 2025?

Gemini 2.5 Pro Preview erzielt laut Artificial Analysis auf MMLU-Pro 89,8 Prozent – doch Forscher zeigen 2025, dass schon kleine Aufgabenänderungen die Leistung selbst führender Modelle messbar senken. MMLU gilt vielen als gesättigt, MMLU-Pro mit 12.000 Fragen auf Hochschulniveau und zehn Antwortoptionen sollte die Latte höher legen. Eine 2025 veröffentlichte Studie (arXiv 2502.06738) zeigt jedoch: Schon das Hinzufügen weiterer Antwortmöglichkeiten oder das Paaren von Fragen senkt die Modellleistung vorhersagbar. Das deutet auf Mustererkennung statt echtem Schlussfolgern hin. Für Entscheider bedeutet das: Benchmark-Spitzenwerte allein sind kein verlässlicher Maßstab für den produktiven KI-Einsatz.

MMLU, MMLU-Pro und GPQA: Was Knowledge-Benchmarks 2025 wirklich messen

Gemini 2.5 Pro Preview erreicht auf dem MMLU-Pro-Benchmark laut Artificial Analysis einen Spitzenwert von 89,8 Prozent. Damit ist ein Datenpunkt benannt, der auf den ersten Blick beeindruckend wirkt. Was er tatsächlich aussagt, hängt jedoch davon ab, wie robust der Benchmark selbst konstruiert ist. Genau das stellt die Forschung von 2025 zunehmend in Frage.

Was die drei Benchmarks unterscheidet

MMLU (Massive Multitask Language Understanding) war lange der Standard zur Messung von Faktenwissen und Verständnis über Fachgebiete hinweg. Das Problem: Führende Modelle haben die Obergrenze des Tests weitgehend erreicht. Die Ergebnisse spreizen sich kaum noch aus, die Aussagekraft sinkt.

MMLU-Pro setzt an diesem Sättigungsproblem an. Der Benchmark umfasst 12.000 Fragen auf Postgraduierteniveau in 14 Fachbereichen. Statt vier Antwortoptionen stehen zehn zur Auswahl, und die Aufgaben verlangen tieferes Schlussfolgern. Das Leaderboard von Artificial Analysis zeigt: Gemini 2.5 Pro Preview (hohe Rechenkapazität) führt mit 89,8 Prozent, knapp gefolgt von Gemini 2.5 Pro Preview (niedrige Kapazität) und Claude Opus 4.5 mit Reasoning-Modus, beide bei 89,5 Prozent.

GPQA (Graduate-Level Google-Proof Q&A) zielt auf Fragen ab, die selbst für Experten schwer zu beantworten sind, ohne Fachliteratur hinzuzuziehen. Zusammen mit WMDP-bio wurde GPQA in einer 2025 veröffentlichten Studie untersucht, die auf der Plattform Hugging Face dokumentiert ist.

Adversariale Kodierung als Gegenmaßnahme

Eine 2025 auf arXiv und Hugging Face veröffentlichte Arbeit zur Ressurrektion gesättigter Benchmarks zeigt: Bereits kleine Veränderungen an Testfragen senken die Leistung großer Sprachmodelle messbar. Die Autoren untersuchten zwei Methoden: das Paaren von Fragen und das Erweitern der Antwortoptionen auf WMDP-bio, GPQA und MMLU-Varianten.

Das Ergebnis: Vor allem leistungsstärkere Modelle reagieren auf diese Modifikationen mit vorhersehbaren Leistungseinbußen. Die Autoren interpretieren das als Hinweis darauf, dass Modelle teils auf Mustererkennung setzen statt auf formales Schlussfolgern. Ähnliche Befunde lieferte bereits die GSM-Symbolic-Studie für mathematische Aufgaben.

Der Ansatz wird als Möglichkeit beschrieben, ältere, erschöpfte Benchmarks durch adversariale Kodierung wieder differenzierungsfähig zu machen, ohne neue Datensätze von Grund auf entwickeln zu müssen.

Praktische Implikationen für Entscheider

1. Benchmark-Werte nicht isoliert bewerten. Ein hoher MMLU-Pro-Score bedeutet zunächst, dass ein Modell strukturierte Multiple-Choice-Fragen auf Graduiertenniveau löst. Ob dieselbe Leistung auf internen Unternehmensprozessen, regulierten Dokumenten oder domänenspezifischen Anfragen replizierbar ist, lässt sich aus dem Benchmark-Wert allein nicht ableiten. Unabhängige Messungen, wie sie etwa Artificial Analysis publiziert, ergänzen Herstellerangaben, ersetzen aber keine eigene Evaluation. Mehr dazu unter LLM-Benchmarks und Evaluierungsmethoden.

2. Sättigungseffekte kennen. Wenn mehrere Spitzenmodelle denselben Benchmark innerhalb eines Prozentpunkts belegen, differenziert das Instrument nicht mehr zuverlässig. Entscheider, die Modelle für anspruchsvolle Aufgaben wie rechtliche Analyse oder wissenschaftliche Recherche auswählen, sollten auf Benchmarks setzen, die nachweislich noch Spielraum nach oben haben. GPQA und MMLU-Pro erfüllen dieses Kriterium derzeit besser als das ursprüngliche MMLU. Vergleiche zur Benchmark-Validität finden Sie unter MMLU-Pro vs. ARC Challenge.

3. Robustheit systematisch testen. Die beschriebene Forschung zeigt, dass Modelle unter veränderten Aufgabenformaten teils deutlich schlechter abschneiden. Wer Modelle in produktive Systeme integriert, sollte Robustheitstests in variierenden Formulierungen und mit erweiterten Antworträumen einplanen. Das betrifft besonders Anwendungen mit sicherheitsrelevanten Entscheidungen. Hintergründe zur Benchmark-Manipulation finden Sie unter LLM-Leaderboard Benchmark Manipulation.

4. Unabhängige Quellen einbeziehen. Benchmark-Leaderboards der Modellhersteller und unabhängige Auswertungsplattformen kommen nicht immer zu denselben Schlüssen. Artificial Analysis, Papers with Code und Lmarena verwenden unterschiedliche Methoden. Ein Abgleich mehrerer Quellen reduziert das Risiko, Beschaffungsentscheidungen auf selektiv präsentierte Metriken zu stützen. Methodische Unterschiede werden unter Hersteller-Benchmarks vs. Artificial Analysis erläutert.


Quellen

Häufige Fragen

Was unterscheidet MMLU-Pro vom ursprünglichen MMLU?

MMLU-Pro ist eine erweiterte Variante des klassischen MMLU-Benchmarks. Er umfasst 12.000 Fragen auf Hochschulniveau aus 14 Fachbereichen. Gegenüber dem Original wurden die Antwortoptionen von vier auf zehn erhöht, und die Aufgaben erfordern tieferes Schlussfolgern. Damit soll das Benchmark robuster gegen einfaches Raten und Mustererkennung sein.

Welche Modelle erzielen derzeit die höchsten Werte auf MMLU-Pro?

Laut dem Leaderboard von Artificial Analysis führt Gemini 3 Pro Preview (high) mit einem Score von 89,8 Prozent. Auf den Plätzen zwei und drei folgen Gemini 3 Pro Preview (low) sowie Claude Opus 4.5 (Reasoning), beide mit einem Score von 89,5 Prozent.

Warum gelten viele klassische Benchmarks wie MMLU inzwischen als gesättigt?

Führende Sprachmodelle erzielen auf älteren Benchmarks wie MMLU Werte, die menschliche Referenzleistungen übertreffen. Das schränkt die Aussagekraft dieser Tests stark ein, da Leistungsunterschiede zwischen Modellen kaum noch messbar sind. Forscher sprechen in diesem Zusammenhang von Sättigung.

Wie lassen sich gesättigte Benchmarks ohne vollständige Neuentwicklung reaktivieren?

Eine Forschungsarbeit aus dem Jahr 2025 zeigt, dass zwei vergleichsweise kleine Eingriffe ausreichen: das Koppeln von Fragen sowie das Hinzufügen weiterer Antwortoptionen. Beide Maßnahmen senken die Leistung leistungsstärkerer Modelle vorhersagbar und erhöhen so die effektive Leistungsobergrenze des Benchmarks. Die Methode wurde unter anderem an MMLU-Varianten, WMDP-bio und GPQA erprobt.

Was sagen veränderte Benchmarkfragen über die tatsächliche Reasoning-Fähigkeit von Sprachmodellen aus?

Aktuelle Forschungsergebnisse legen nahe, dass Sprachmodelle in Teilen auf Mustererkennung statt auf formalem Schlussfolgern basieren. Bereits kleinere Änderungen an Aufgabenformulierungen können die Modellleistung spürbar verschlechtern. Auch die faktische Erinnerungsleistung schwankt je nach Fragenformat. Das deutet darauf hin, dass hohe Benchmark-Scores nicht zwingend mit robuster, formatunabhängiger Reasoning-Kompetenz gleichzusetzen sind.


Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.

Quellen

  1. MMLU-Pro Benchmark Leaderboard | Artificial AnalysisArtificial AnalysisPrimärquelleabgerufen 14. Sept. 2026
  2. Resurrecting saturated LLM benchmarks with adversarial encoding (arXiv)arXivPrimärquelleabgerufen 14. Sept. 2026

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.