LIVEBSI-Grundschutz 2025: LLM-Sicherheit für Kritische Infrastrukturen·DeepSeek-V3: Open-Source-KI mit Multimodal-Reasoning für Unternehmen·KI-ROI in der Chemieindustrie 2025: Prozesse, Synthese, HaftungMittwoch, 30. September 2026

MTEB vs. ChromaDB: Embedding-Modelle im RAG-Praxistest 2025

Wie gut sagen MTEB-Benchmarks die RAG-Retrieval-Qualität in ChromaDB voraus? Eine sachliche Analyse für Entscheider, die Embedding-Modelle 2025 fundiert auswählen wollen.

ER
ecompanion Redaktion21.9.2026 · 3 Min. Lesezeit
↗ Teilen🔖 Merken🎧 Anhören
MTEB vs. ChromaDB: Embedding-Modelle im RAG-Praxistest 2025

Embedding-Modelle performen auf domänenspezifischen Benchmarks deutlich abweichend vom MTEB-Leaderboard: OpenAIs text-embedding-3-large erzielte in einem unabhängigen Retrieval-Test mit 532 Bibelvers-Abfragen eine Trefferquote von 89,3 Prozent, während das auf dem MTEB gut platzierte Open-Source-Modell GTE Large nur Für Unternehmen, die RAG-Systeme produktiv einsetzen, hat diese Diskrepanz direkte Konsequenzen: Ein Modell, das auf dem MTEB-Leaderboard stark abschneidet, muss in der eigenen Fachdomäne nicht führen. Parallel dazu adressiert der neue Massive Legal Embedding Benchmark (MLEB) genau diese Lücke für die Rechtsbranche mit zehn expertennotierten Datensätzen über sechs Jurisdiktionen. Entscheider sollten Embedding-Modelle stets anhand eigener, aufgabenspezifischer Evaluierungen auswählen.

MTEB-Leaderboard vs. Praxis-Retrieval: Was Embedding-Benchmarks 2025 wirklich aussagen

Wer ein Retrieval-augmented-Generation-System (RAG) baut und dabei blind auf das Massive Text Embedding Benchmark (MTEB)-Leaderboard vertraut, riskiert in der Produktion schlechtere Ergebnisse als erwartet. Das zeigt eine wachsende Zahl unabhängiger Evaluierungen und domänenspezifischer Benchmarks, die im Sommer 2025 auf Hugging Face veröffentlicht wurden.

Leitfakt: Benchmark-Position und Praxis-Performance klaffen systematisch auseinander

Ein Nutzertest auf Hugging Face mit 532 Abfragen gegen einen Bibelvers-Datensatz illustriert das Problem konkret: OpenAIs text-embedding-3-large erzielte eine Trefferquote von 89,3 Prozent (1.348 von 1.596 möglichen Punkten), während text-embedding-3-small auf 81,0 Prozent kam. Googles text-embedding-004 folgte mit 80,3 Prozent, das ältere text-embedding-ada-002 mit 78,3 Prozent. Open-Source-Modelle wie thenlper/gte-large und thenlper/gte-base lagen bei 73,1 bzw. 72,5 Prozent. Auffällig: Diese Reihenfolge weicht teils erheblich von den MTEB-Ranglisten ab, die auf anderen Datensätzen und Aufgabentypen basieren. Der Nutzer hielt explizit fest, dass seine Ergebnisse sich deutlich vom MTEB-Leaderboard unterschieden.

Parallel dazu präsentierte die Forschungsgemeinschaft das Massive Legal Embedding Benchmark (MLEB), das laut Hugging Face Daily Papers der bisher größte, vielfältigste und umfassendste Open-Source-Benchmark für juristische Informationsrecherche ist. MLEB umfasst zehn von Fachleuten annotierte Datensätze aus mehreren Rechtsordnungen (USA, Großbritannien, EU, Australien, Irland, Singapur), deckt verschiedene Dokumenttypen ab (Gerichtsurteile, Gesetzgebung, regulatorische Leitlinien, Verträge, Fachliteratur) und enthält drei Aufgabentypen: Suche, Zero-Shot-Klassifikation und Fragen-Antworten. Sieben der zehn Datensätze wurden neu erstellt, um Lücken im bestehenden Open-Source-Ökosystem zu schließen. Code, Ergebnisse und Daten sind offen verfügbar.

Ebenfalls neu ist der CoreB C2T Retrieval-Datensatz im MTEB-Ökosystem, der Code-zu-Text-Retrieval-Aufgaben abdeckt und als Teil der wachsenden MTEB-Datenbasis gelistet ist.

Vier praktische Implikationen für Entscheider

1. Kein universeller Benchmark ersetzt den domänenspezifischen Test

MTEB ist ein aggregierter Benchmark über Dutzende von Aufgaben und Domänen. Ein Modell, das im Gesamtranking führt, kann in einer spezifischen Anwendung wie juristischem Retrieval, medizinischer Dokumentensuche oder technischer Code-Suche deutlich schlechter abschneiden als ein spezialisiertes Modell. Das MLEB-Projekt ist ein direkter Beleg dafür: Bestehende Benchmarks deckten juristische Domänen und Jurisdiktionen unzureichend ab. Unternehmen sollten eigene Evaluierungsdatensätze aus ihrem tatsächlichen Anwendungsfall aufbauen, bevor sie ein Embedding-Modell für die Produktion auswählen. Weitere Hintergründe zu Evaluierungsmethoden finden Sie in unserem Beitrag zum MTEB-Leaderboard 2025.

2. Proprietäre Modelle dominieren, aber der Abstand zu Open Source schrumpft

Die Praxis-Tests zeigen, dass OpenAIs Embedding-Modelle in domänenspezifischen Tests vorne liegen. Allerdings schneidet gte-large mit 73,1 Prozent noch vergleichsweise stark ab, wenn man berücksichtigt, dass es kostenlos und lokal betreibbar ist. Für datenschutzsensible Anwendungen, etwa in der Rechts- oder Finanzbranche, kann ein On-Premise-Betrieb mit einem Open-Source-Modell sinnvoller sein, auch wenn die Retrieval-Qualität geringfügig niedriger ausfällt. Zur Abwägung zwischen proprietären APIs und eigenen Infrastrukturen lesen Sie unseren Beitrag zu kleinen Modellen on-premise.

3. RAG-Evaluierung muss end-to-end gemessen werden

Das MLEB-Pendant für vollständige RAG-Systeme, der Legal RAG Bench, bewertet nicht nur den Retrieval-Schritt isoliert, sondern die End-to-End-Performance eines juristischen RAG-Systems. Das ist methodisch entscheidend: Ein Embedding-Modell kann hohe Recall-Werte im Retrieval erzielen, aber wenn das nachgelagerte Sprachmodell die abgerufenen Texte nicht korrekt verarbeitet, leidet die Gesamtqualität. Entscheider sollten Retrieval-Qualität und Generierungsqualität getrennt messen und beide Metriken in ihre Modellauswahl einfließen lassen. Unser Artikel zu MTEB vs. ChromaDB vertieft diesen Aspekt.

4. Benchmark-Kontamination und Reproduzierbarkeit bleiben offene Risiken

Dass Modelle auf Benchmarks trainiert werden oder deren Testdaten in den Trainingsdaten enthalten sind, ist ein bekanntes Problem. Neu erstellte Datensätze wie die sieben neuen MLEB-Komponenten reduzieren dieses Risiko für den juristischen Bereich, lösen es aber nicht vollständig. Wer Embedding-Modelle evaluiert, sollte auf frisch erstellte, nicht öffentlich zugängliche Testdaten setzen und regelmäßig re-evaluieren, wenn Modelle aktualisiert werden. Zu den methodischen Schwächen von Leaderboards insgesamt lesen Sie unseren Überblick zur Benchmark-Reproduzierbarkeit sowie zur Leaderboard-Manipulation.

Quellen

Häufige Fragen

Das MLEB ist aktuell das umfangreichste Open-Source-Benchmark für rechtliche Informationssuche. Es umfasst zehn von Experten annotierte Datensätze aus mehreren Rechtssystemen, darunter USA, UK, EU, Australien, Irland und Singapur. Abgedeckt werden Dokumenttypen wie Urteile, Gesetze, Verträge und Fachliteratur sowie Aufgabentypen wie Suche, Zero-Shot-Klassifikation und Frage-Antwort. Sieben der enthaltenen Datensätze wurden neu erstellt, um bestehende Lücken zu schließen.

Warum weichen eigene Retrieval-Benchmark-Ergebnisse oft stark vom MTEB-Leaderboard ab?

MTEB-Ergebnisse basieren auf standardisierten, domänenübergreifenden Testsets. Eigene Benchmarks auf spezifischem Datenmaterial, etwa Bibelversen mit 532 Anfragen, können deutlich abweichende Rankings ergeben. In einem solchen praxisnahen Test erzielte OpenAIs text-embedding-3-large mit 89,3 % Trefferquote den Spitzenwert, gefolgt von text-embedding-3-small mit 81 % und Googles text-embedding-004 mit 80,3 %. Allgemeine Leaderboards spiegeln domänenspezifische Retrieval-Qualität daher nur eingeschränkt wider.

Welche Embedding-Modelle schneiden in domänenspezifischen Retrieval-Tests am besten ab?

In einem praxisnahen Test zur Bibelvers-Suche (532 Anfragen, max. 1596 Punkte) rangierte text-embedding-3-large von OpenAI mit 1348 Punkten an erster Stelle. Dahinter folgten text-embedding-3-small (1228 Punkte), Geminis text-embedding-004 (1214 Punkte) sowie das ältere text-embedding-ada-002 (1186 Punkte). Open-Source-Modelle wie GTE Large erzielten 1105 Punkte. Die Reihenfolge kann je nach Fachdomäne abweichen.

Was ist der Unterschied zwischen MTEB und einem aufgabenspezifischen Retrieval-Benchmark?

MTEB ist ein breites, mehrsprachiges Benchmark-Framework, das viele Aufgabentypen und Domänen abdeckt und damit den Vergleich von Modellen über unterschiedliche Szenarien ermöglicht. Aufgabenspezifische Benchmarks, wie das MLEB für Rechtstexte oder eigene RAG-Tests, messen dagegen gezielt die Leistung in einer definierten Domäne. Für produktive RAG-Systeme empfiehlt sich die Validierung am eigenen Datenmaterial, da generische Leaderboard-Platzierungen die tatsächliche Retrieval-Qualität im Einsatz nicht zuverlässig vorhersagen.

Wie unterstützt das MTEB-Ökosystem auf Hugging Face die Evaluierung von RAG-Systemen?

Hugging Face stellt über MTEB standardisierte Datensätze und Evaluierungspipelines bereit, darunter etwa den Datensatz coreb-c2t-retrieval für Code-zu-Text-Retrieval-Aufgaben. Diese ermöglichen reproduzierbare Vergleiche verschiedener Embedding-Modelle unter einheitlichen Bedingungen. Ergänzend dazu entstehen spezialisierte Benchmarks wie Legal RAG Bench, der die End-to-End-Leistung juristischer RAG-Systeme messbar macht. Code, Ergebnisse und Daten werden offen veröffentlicht.


Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.

Quellen

  1. Why are my benchmark results so different from the MTEB leaderboard?Hugging FacePrimärquelleabgerufen 21. Sept. 2026
  2. mteb/coreb-c2t-retrieval · Datasets at Hugging FaceHugging FacePrimärquelleabgerufen 21. Sept. 2026

Dieser Artikel wurde mit KI-Unterstützung erstellt und redaktionell geprüft.