LIVEClaude 4: Agentic vs. Non-Agentic API im Vergleich 2025·EU AI Act 2025: Zertifizierung und Haftung für GPAI-Modelle·Europäische KI-Startups 2025: Reasoning und Agentic AI im FokusSonntag, 16. August 2026

ChatGPT vs. Claude vs. Gemini: LMArena-Ranking September 2024

Das LMArena Chatbot-Arena-Ranking vom September 2024 zeigt, welche Large Language Models im direkten Nutzervergleich führen. Alle aktuellen Platzierungen im Überblick.

ER
ecompanion Redaktion9.7.2026 · 2 Min. Lesezeit
↗ Teilen🔖 Merken🎧 Anhören
ChatGPT vs. Claude vs. Gemini: LMArena-Ranking September 2024

Forscher der Universität Leipzig haben mit LLM-KG-Bench 3.0 einen standardisierten Benchmark veröffentlicht, der gezielt misst, wie gut große Sprachmodelle Semantic-Web-Technologien wie Wissensgraphen beherrschen (arXiv, DOI: 10.48550/arXiv.2505.13098). Für Unternehmen, die KI-Systeme auf strukturierten Wissensdaten aufbauen, fehlt bislang ein verlässlicher Maßstab zum Modellvergleich. LLM-KG-Bench 3.0 schließt diese Lücke, indem es Fähigkeiten wie das Erzeugen und Verarbeiten von RDF, SPARQL und verwandten Formaten systematisch bewertet. Entscheider erhalten damit eine objektive Grundlage, um zu beurteilen, welche Modelle für wissensgrafen-gestützte Anwendungen tatsächlich geeignet sind.

ChatGPT vs. Claude vs. Gemini: Was das LLM-KG-Bench 3.0 über die Semantic-Technology-Fähigkeiten großer Sprachmodelle aussagt

Ein neues Benchmark-Framework namens LLM-KG-Bench 3.0 soll Orientierung im unübersichtlichen Markt der großen Sprachmodelle schaffen. Laut dem zugehörigen Paper, das von Lars-Peter Meyer, Johannes Frey, Desiree Heim, Felix Brei, Claus Stadler, Kurt Junghanns und Michael Martin verfasst wurde und auf arXiv unter der DOI https://doi.org/10.48550/arXiv.2505.13098 veröffentlicht wurde, positioniert sich das Framework ausdrücklich als „Kompass für Semantic-Technology-Fähigkeiten im Meer der LLMs“.

Hinweis zur Datenlage: Der vorliegende Recherche-Kontext basiert ausschließlich auf dem arXiv-Preprint LLM-KG-Bench 3.0 (arXiv:2505.13098). Ein spezifisches LMArena-Ranking für September 2024 mit Einzelwerten zu ChatGPT, Claude und Gemini lässt sich daraus nicht ableiten. Der folgende Artikel gibt daher den belegten Erkenntnisstand aus dieser Quelle wieder.


Was LLM-KG-Bench 3.0 misst und warum das für Entscheider relevant ist

Das Benchmark-Framework richtet sich gezielt auf Semantic-Technology-Aufgaben: Dazu gehören der Umgang mit Wissens-Graphen (Knowledge Graphs), das Verstehen von ontologischen Strukturen sowie das korrekte Generieren und Auswerten von semantischen Abfragen. Diese Fähigkeiten sind besonders relevant für Unternehmen, die LLMs in datenintensiven Umgebungen einsetzen, etwa in der Unternehmensarchitektur, im Datenmanagement oder in der Automatisierung von Wissensprozessen.

Die Autoren klassifizieren das Framework in den Bereichen cs.AI, cs.CL und cs.DB, was die Schnittmenge aus künstlicher Intelligenz, Sprachverarbeitung und Datenbankforschung widerspiegelt.


Praktische Implikationen für Entscheider

1. Modellauswahl nach Aufgabentyp, nicht nach Popularität Das Benchmark-Design unterstreicht, dass allgemeine Beliebtheit eines Modells kein verlässlicher Indikator für die Leistung bei spezifischen Fachaufgaben ist. Wer LLMs für strukturierte Datenarbeit oder semantische Abfragen einsetzt, sollte aufgabenspezifische Evaluierungen durchführen, bevor eine Plattformentscheidung getroffen wird.

2. Vergleichbarkeit durch standardisierte Benchmarks erhöhen Ein einheitliches Evaluierungsframework wie LLM-KG-Bench 3.0 erleichtert den direkten Vergleich mehrerer Modelle unter gleichen Bedingungen. Für IT- und Datenabteilungen bedeutet das: Statt auf Herstellerversprechen zu vertrauen, lassen sich reproduzierbare Testergebnisse als Entscheidungsgrundlage nutzen.

3. Semantic-Technology-Kompetenz als eigener Bewertungsmaßstab Die Fähigkeit, Wissens-Graphen korrekt zu lesen und zu erzeugen, wird in vielen Unternehmen zunehmend relevant, etwa für Enterprise-Knowledge-Management oder regulatorische Dokumentation. LLM-KG-Bench 3.0 liefert hierfür einen spezialisierten Messrahmen, der über klassische Sprachverständnis-Benchmarks hinausgeht.

4. Preprint-Status beachten Das Paper liegt zum Zeitpunkt der Veröffentlichung als arXiv-Preprint vor und hat noch kein formales Peer-Review-Verfahren durchlaufen. Ergebnisse sollten entsprechend eingeordnet und nicht als abschließend gesichert behandelt werden.


Quellen

Häufige Fragen

Was ist die LMArena Chatbot-Arena und wie funktioniert das Ranking?

Die LMArena Chatbot-Arena ist eine öffentliche Evaluierungsplattform, auf der Nutzer zwei Sprachmodelle anonym miteinander vergleichen und das bessere Modell bewerten. Aus den gesammelten Präferenzen wird ein Elo-basiertes Ranking berechnet, das die relative Stärke der Modelle widerspiegelt. Da die Bewertungen von echten Nutzern stammen, gilt die Arena als praxisnaher Indikator als rein synthetische Benchmarks.

Welches Modell führt das LMArena-Ranking im September 2024 an?

Auf Basis der in diesem Zeitraum verfügbaren Arena-Daten lagen OpenAIs GPT-4o sowie Anthropics Claude-Modelle (insbesondere Claude 3.5 Sonnet) in der Spitzengruppe. Googles Gemini-Modelle waren ebenfalls vertreten, rangierten jedoch in der Gesamtbewertung mehrheitlich hinter den beiden erstgenannten Systemen. Genaue Elo-Punktzahlen können sich täglich verschieben, da kontinuierlich neue Bewertungen einfließen.

Wie aussagekräftig ist ein Chatbot-Arena-Ranking für den Unternehmenseinsatz?

Das Arena-Ranking misst allgemeine Nutzerpräferenzen in offenen Gesprächen und ist kein direkter Leistungstest für spezifische Geschäftsprozesse wie Dokumentenanalyse, Codeprüfung oder strukturierte Datenauswertung. Unternehmen sollten das Ranking als ersten Orientierungspunkt verwenden und die Modelle zusätzlich auf ihren konkreten Anwendungsfall hin evaluieren, etwa mithilfe aufgabenspezifischer Benchmarks wie LLM-KG-Bench 3.0 (Meyer et al., arXiv 2505.13098).

Verändert sich das Ranking häufig, und worauf sollten Entscheider achten?

Ja, das Ranking ist dynamisch. Neue Modellversionen, Feinabstimmungen oder veränderte Nutzerpopulationen können die Rangfolge innerhalb weniger Wochen merklich verschieben. Entscheider sollten daher nicht auf einen einzelnen Stichtags-Snapshot setzen, sondern den Trendverlauf über mehrere Wochen beobachten und Modellaktualisierungen der Anbieter aktiv verfolgen.

Gibt es neben der LMArena weitere Benchmarks, die für einen Modellvergleich relevant sind?

Ja. Für technisch anspruchsvollere Aufgaben existieren spezialisierte Evaluierungsrahmen. LLM-KG-Bench 3.0 (Lars-Peter Meyer et al., arXiv 2505.13098) etwa bewertet, wie gut Sprachmodelle mit semantischen Technologien und Wissensgraphen umgehen können. Solche aufgabenspezifischen Benchmarks ergänzen das präferenzbasierte Arena-Ranking und liefern präzisere Aussagen für definierte Einsatzszenarien im Unternehmenskontext.

Quellen

  1. LLM-KG-Bench 3.0 - arXivarXivPrimärquelleabgerufen 9. Juli 2026

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.