LIVEBSI-Grundschutz 2025: LLM-Sicherheit für Kritische Infrastrukturen·DeepSeek-V3: Open-Source-KI mit Multimodal-Reasoning für Unternehmen·KI-ROI in der Chemieindustrie 2025: Prozesse, Synthese, HaftungMittwoch, 30. September 2026

Claude vs. GPT-4.5: Benchmark-Eigenangaben im Faktencheck

Anthropic und OpenAI bewerten ihre Modelle in Benchmarks oft günstiger als unabhängige Papers-with-Code-Labore. Ein systematischer Vergleich der Abweichungen.

ER
ecompanion Redaktion17.9.2026 · 4 Min. Lesezeit
↗ Teilen🔖 Merken🎧 Anhören
Claude vs. GPT-4.5: Benchmark-Eigenangaben im Faktencheck

Laut Artificial Analysis Intelligence Index belegt Anthropics Claude Opus 4.5 Platz zwei unter allen getesteten Modellen, punktgleich mit OpenAIs GPT-5.1 (high) und knapp hinter Googles Gemini 3 Pro, mit einem Vorsprung von 11 Punkten gegenüber dem Vorgänger Claude Opus 4.1. Herstellerangaben zu Benchmark-Leistungen sind selten neutral: Anthropic kommuniziert für Claude Opus 4.5 einen deutlichen Preisrückgang auf 5/25 US-Dollar pro Million Token, verschweigt jedoch, dass das Modell 60 Prozent mehr Token pro Aufgabe verbraucht als sein Vorgänger. Entscheider, die Benchmarks für Beschaffungsentscheidungen nutzen, sollten daher stets unabhängige Quellen wie Artificial Analysis hinzuziehen, um Preis-Leistungs-Verhältnisse realistisch einzuschätzen.

Herstellerangaben vs. unabhängige Labore: Was Claude Opus 4.5 und GPT-4.5 wirklich leisten

Anthropic und OpenAI veröffentlichen zu jedem Modell eigene Benchmark-Ergebnisse. Unabhängige Evaluierungsplattformen wie Artificial Analysis kommen bei denselben Modellen teils zu deutlich differenzierteren Einschätzungen. Wer Beschaffungsentscheidungen auf Basis von Herstellerfolien trifft, riskiert eine Fehlkalkulation.

Leitfakt: Platz zwei laut unabhängigem Index, nicht laut Anthropic

Laut dem Artificial Analysis Intelligence Index belegt Claude Opus 4.5 den zweiten Rang unter allen getesteten Modellen. Das Modell liegt knapp hinter Googles Gemini 3 Pro und gleichauf mit OpenAIs GPT-5.1 (high). Anthropic selbst bewirbt Claude Opus 4.5 als das leistungsfähigste Modell des eigenen Portfolios, was gegenüber den internen Vorgängern zutrifft: Gegenüber Claude Sonnet 4.5 ergibt sich ein Vorsprung von 7 Punkten im Artificial Analysis Intelligence Index, gegenüber Claude Opus 4.1 sogar 11 Punkte. Der externe Befund bestätigt also den relativen Fortschritt, ordnet das Modell aber in einen breiteren Wettbewerbskontext ein, den Herstellermaterialien naturgemäß ausblenden.

Was Anthropic beim Preisargument verschweigt

Anthropic hat den Listenpreis für Claude Opus 4.5 auf 5 US-Dollar pro Million Input-Token und 25 US-Dollar pro Million Output-Token gesenkt. Das klingt nach einer substanziellen Kostensenkung gegenüber dem Vorgänger. Die Messungen von Artificial Analysis zeigen jedoch: Claude Opus 4.5 benötigte in den Intelligence-Index-Evaluierungen rund 60 Prozent mehr Token als Claude Opus 4.1 (48 Millionen gegenüber 30 Millionen). Die realen Gesamtkosten für denselben Evaluierungsdurchlauf sanken dadurch von 3.100 auf 1.500 US-Dollar, also um weniger als die Hälfte statt um den durch den Tokenpreis implizierten größeren Anteil. Gegenüber Gemini 3 Pro (high), GPT-5.1 (high) und Claude Sonnet 4.5 (Thinking) blieb Claude Opus 4.5 in diesen Tests teurer. Nur Grok 4 (Reasoning) kostete in demselben Vergleichsrahmen mehr.

Für Entscheider, die Modelle nach API-Listenpreisen budgetieren, ist diese Diskrepanz zwischen Tokenpreis und tatsächlichem Token-Verbrauch ein strukturelles Planungsrisiko. Mehr zu Preisstrukturen im API-Kontext finden Sie unter Anthropic Claude API 2025: Preise, Token-Kosten und Vergleich mit GPT-4.5.

GPT-4.5: OpenAI korrigiert eigene Selbsteinschätzung nach wenigen Stunden

OpenAI brachte GPT-4.5, intern als “Orion” bekannt, im Februar 2025 als das bis dahin größte trainierte Modell des Unternehmens auf den Markt. Im zugehörigen White Paper stand ursprünglich die Aussage, GPT-4.5 sei kein Frontier-Modell. Wenige Stunden nach der Veröffentlichung entfernte OpenAI diese Formulierung aus dem Dokument, ohne eine offizielle Erklärung zu liefern. Das ist kein Einzelfall: Selbstbeschreibungen von Modellen in technischen Dokumenten werden von Herstellern nachträglich angepasst, ohne dass Nutzer automatisch informiert werden.

GPT-4.5 war zum Launch ausschließlich ChatGPT-Pro-Abonnenten (200 US-Dollar pro Monat) und Entwicklern auf bezahlten API-Tarifen zugänglich. Erst in der Folgewoche sollten Plus- und Team-Nutzer Zugang erhalten. Die gestaffelte Verfügbarkeit erschwert unabhängige Evaluierungen in der kritischen Phase direkt nach dem Launch, weil Labore keinen gleichzeitigen Zugang haben.

Historische Benchmark-Daten: Claude 3 Opus vs. GPT-4 als Referenzpunkt

Ein Vergleich aus einem Community-Forum auf der OpenAI-Plattform vom April 2024 dokumentiert, wie sich Claude 3 Opus und GPT-4 auf damals gängigen Standard-Benchmarks verhielten. Claude 3 Opus erzielte auf dem Graduate Level Reasoning (GPQA) 50,4 Prozent gegenüber 35,7 Prozent bei GPT-4. Beim Coding-Benchmark HumanEval lagen die Werte bei 84,9 Prozent (Claude 3 Opus) zu 67,0 Prozent (GPT-4). Diese Zahlen illustrieren: Herstellerangaben beziehen sich häufig auf spezifische Benchmark-Sets, die das eigene Modell vorteilhaft darstellen. Wer dieselbe Aufgabe auf einem anderen Datensatz testet, erhält andere Ergebnisse.

Eine systematische Einordnung unabhängiger Evaluierungsplattformen bietet Artificial Analysis LLM API: Kostenvergleich, Latenz, Ranking und Benchmarks.

Vier praktische Implikationen für Entscheider

1. Listenpreis ist nicht gleich Betriebskosten. Die Differenz zwischen Tokenpreis und tatsächlichem Token-Verbrauch eines Modells kann erheblich sein. Für belastbare TCO-Kalkulationen empfiehlt sich ein eigener Testlauf mit produktionsnahen Prompts, bevor Budgets festgelegt werden. Methoden dafür beschreibt Artificial Analysis Q1 2025: TCO-Vergleich Claude, GPT, Gemini.

2. Benchmark-Auswahl bestimmt das Ergebnis. Hersteller wählen Benchmarks, auf denen ihre Modelle stark abschneiden. Plattformen wie Artificial Analysis oder Papers with Code verwenden breitere und teils andere Testsets. Ein Modell, das in Herstellerunterlagen “führend” heißt, kann auf anderen Evaluierungsrahmen im Mittelfeld liegen. Hintergründe zur Methodik unabhängiger Leaderboards finden Sie unter Papers with Code LLM Rankings 2025: Methodik, Reproduzierbarkeit und Artificial Analysis.

3. Technische Dokumente können sich kurzfristig ändern. Das Beispiel der nachträglich geänderten GPT-4.5-Formulierung zeigt: Versionierte Snapshots von White Papers und technischen Berichten zum Zeitpunkt der Entscheidung zu sichern, ist keine Paranoia, sondern Sorgfaltspflicht. Weitere Hintergründe zur Benchmark-Reliabilität bietet LLM Benchmark Manipulation und Validierung 2025.

4. Verfügbarkeit beeinflusst Evaluierbarkeit. Gestaffelte Launches schränken ein, wie schnell unabhängige Vergleiche verfügbar werden. Wer ein Modell kurz nach Erscheinen evaluieren will, muss mit unvollständiger externer Datenlage rechnen. Einen Überblick zu Latenz-Benchmarks bietet Latenz-Benchmarks 2025: Claude, GPT-4.5, Gemini 2.0 im API-Vergleich.

Fazit

Herstellerangaben zu Modell-Performance sind ein Ausgangspunkt, kein Urteil. Claude Opus 4.5 erreicht laut Artificial Analysis tatsächlich hohe Intelligenzwerte, ist aber teurer als mehrere Konkurrenten und verbraucht mehr Token als der Vorgänger. GPT-4.5 korrigierte die eigene Selbsteinschätzung innerhalb von Stunden. Wer diese Lücke zwischen Marketingdokument und unabhängiger Messung nicht schließt, zahlt entweder zu viel oder wählt das falsche Modell für seinen Anwendungsfall.


Quellen

Häufige Fragen

Wie positioniert Anthropic Claude Opus 4.5 im Vergleich zu Wettbewerbern?

Laut Artificial Analysis Intelligence Index belegt Claude Opus 4.5 Platz zwei unter den intelligentesten Modellen weltweit, knapp hinter Googles Gemini 3 Pro und gleichauf mit OpenAIs GPT-5.1 (high). Gegenüber dem Vorgänger Claude Opus 4.1 erzielt das Modell elf Indexpunkte mehr, gegenüber Claude Sonnet 4.5 sieben Punkte mehr.

Was sagen unabhängige Benchmarks zu GPT-4.5, das OpenAI als größtes Modell bezeichnet?

OpenAI selbst stufte GPT-4.5 in einer ursprünglichen Fassung des White Papers ausdrücklich als kein Frontier-Modell ein. Diese Formulierung wurde wenige Stunden nach Veröffentlichung still entfernt. Unabhängige Evaluierungen durch Artificial Analysis zeigen, dass GPT-5.1 (high) Claude Opus 4.5 beim Intelligence Index leicht übertrifft, während GPT-4.5 dort nicht an der Spitze rangiert.

Wie aussagekräftig sind Herstellerangaben zu Benchmark-Kosten?

Anthropic wirbt mit deutlich gesenkten Token-Preisen für Claude Opus 4.5 (5 US-Dollar pro Million Input-Token). Artificial Analysis ermittelte jedoch, dass das Modell für identische Evaluierungen 60 Prozent mehr Token benötigt als Claude Opus 4.1. Die tatsächlichen Testkosten sanken dadurch nur von 3.100 auf 1.500 US-Dollar, nicht so stark wie die reine Preissenkung suggeriert.

Wie schnitten frühere Claude-Modelle gegenüber GPT-4 in unabhängigen Tests ab?

Ein Vergleich aus dem OpenAI-Community-Forum (April 2024) zeigt: Claude 3 Opus übertraf GPT-4 in mehreren Kategorien deutlich, etwa bei Graduate-Level-Reasoning (50,4 % vs. 35,7 %) und Coding nach HumanEval (84,9 % vs. 67,0 %). Bei Undergraduate-Wissen lagen beide Modelle nahezu gleichauf (86,8 % vs. 86,4 %).

Welche Kosten entstehen Unternehmen beim Einsatz von Claude Opus 4.5 im Vergleich zu Alternativen?

Trotz gesenkter Listenpreise ist Claude Opus 4.5 laut Artificial Analysis teurer als Gemini 3 Pro (high), GPT-5.1 (high) und Claude Sonnet 4.5 (Thinking). Günstiger als Claude Opus 4.5 ist unter den getesteten Modellen nur Grok 4 (Reasoning) nicht, d.h. Grok 4 ist das einzige noch teurere Modell im Vergleichsfeld.


Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.

Quellen

  1. Claude Opus 4.5 Benchmarks and AnalysisArtificial AnalysisPrimärquelleabgerufen 17. Sept. 2026
  2. OpenAI unveils GPT-4.5 'Orion,' its largest AI model yetTechCrunchFachmediumabgerufen 17. Sept. 2026
  3. Gpt4 comparison to anthropic Opus on benchmarksOpenAIPrimärquelleabgerufen 17. Sept. 2026

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.