Auf Hugging Face ist ein multimodales Sprachmodell mit 35 Milliarden Gesamtparametern verfügbar, das per Reasoning-Destillation aus Claude 4.7 Opus trainiert wurde und im INT4-Format (W4A16, Groupsize 128) nur noch 3 Milliarden Parameter aktiv nutzt. Für Unternehmen, die leistungsfähige KI-Modelle selbst betreiben möchten, zeigt dieses Modell exemplarisch, wie sich Reasoning-Fähigkeiten eines großen proprietären Modells wie Claude 4.7 Opus in ein ressourcenschonendes Open-Weight-Modell übertragen lassen. Durch die Kombination aus Mixture-of-Experts-Architektur (Qwen3.5-MoE) und INT4-Quantisierung sinkt der Speicherbedarf erheblich, ohne die multimodale Verarbeitungsfähigkeit vollständig aufzugeben. Das ist für Entscheider relevant, die On-Premise-Deployments planen und dabei Rechenkosten sowie Hardware-Anforderungen niedrig halten müssen.
Qwen3.5-MoE mit Claude-4.7-Opus-Reasoning: Open-Source-Community veröffentlicht quantisiertes Multimodal-Modell
Ein auf Hugging Face veröffentlichtes Modell kombiniert die Architektur des Qwen3.5-MoE mit Reasoning-Fähigkeiten, die durch Knowledge Distillation aus Claude 4.7 Opus gewonnen wurden. Das Ergebnis ist ein INT4-quantisiertes, multimodales Sprachmodell, das auf handelsüblicher Hardware lauffähig sein soll.
Technische Grundlage
Das Modell trägt die Bezeichnung Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-AWQ-INT4 und basiert auf einer Mixture-of-Experts-Architektur (MoE) mit 35 Milliarden Gesamtparametern, von denen pro Inferenzschritt jeweils rund 3 Milliarden aktiv sind. Die Quantisierung erfolgt im INT4-Format (W4A16, Gruppenbreite 128, asymmetrisch) gemäß dem AutoAWQ-GEMM-Layout.
Technisch relevant ist dabei eine bewusste Entscheidung der Entwickler: Die Quantisierung betrifft ausschließlich die gerouteten Expert-MLPs (konkret: gate_proj, up_proj und down_proj je Expert, verteilt über 256 Experten und rund 39 MoE-Layer). Der multimodale Stack inklusive Vision Tower, lineare Attention-Schichten, Shared Experts, Layer 0, MTP-Head und Router-Gates bleibt in fp16/bf16 erhalten. Damit sollen Bildverarbeitungsfähigkeiten vollständig erhalten bleiben.
Das Modell lässt sich über vLLM mit dem moe_wna16/AWQ-Kernel-Pfad betreiben, da das On-Disk-Layout dem etablierten QuantTrio/Qwen3.6-35B-A3B-AWQ-Format entspricht.
Wichtiger Methodenhinweis zur Quantisierung
Die Modellkarte auf Hugging Face enthält einen expliziten Hinweis, der für Entscheider relevant ist: Die Quantisierung wurde als datenfreie RTN-Methode (Round-to-Nearest) durchgeführt und lediglich im AutoAWQ-GEMM-Format verpackt. Die namensgebende AWQ-Methode (Activation-aware Weight Quantization) setzt einen aktivierungsbasierten Salienz-Pass über ein Kalibrierungskorpus voraus, der bei diesem Build nicht durchgeführt wurde. Wer das Modell zitiert, sollte diese Unterscheidung berücksichtigen.
Praktische Implikationen für Unternehmen
1. Hardware-Anforderungen sinken deutlich Die Kombination aus MoE-Architektur (nur 3B aktive Parameter) und INT4-Quantisierung reduziert den VRAM-Bedarf gegenüber einem vollparametrischen 35B-Modell erheblich. Für Teams, die Reasoning-fähige Modelle on-premise betreiben wollen, ohne in High-End-GPU-Cluster zu investieren, bietet dieses Format einen praktikablen Einstiegspunkt. Lesen Sie dazu auch unsere Analyse zu kleinen Modellen im On-Premise-Betrieb.
2. Multimodalität bleibt vollständig erhalten
Da der Vision Tower nicht quantisiert wird, eignet sich das Modell für Workflows, die Text- und Bildverarbeitung kombinieren, etwa Dokumentenanalyse oder visuelle Qualitätskontrolle. Für Anwendungsfälle ohne Bildverarbeitung empfehlen die Entwickler explizit die Geschwistervariante im FP8-Format (feanorscode/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-FP8-Dynamic), die bei maximaler Qualität ohne multimodalen Stack auskommt.
3. Deployment über vLLM ohne Anpassungen Das kompatible On-Disk-Layout erlaubt den Einsatz mit bestehenden vLLM-Setups ohne zusätzliche Konfiguration. Unternehmen, die bereits vLLM-basierte Inference-Infrastruktur betreiben, können das Modell ohne Umbau einbinden. Relevante Latenz- und Durchsatzvergleiche für vLLM-Deployments finden Sie unter vLLM-Serving-Benchmarks.
4. Reasoning-Distillation als Qualitätsmerkmal mit Einschränkungen
Das Basismodell lordx64/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled wurde durch Destillation aus Claude 4.7 Opus auf mehrstufiges Schlussfolgern optimiert. Die nachgelagerte RTN-Quantisierung kann gegenüber vollständiger AWQ-Kalibrierung Qualitätseinbußen bei komplexen Reasoning-Aufgaben erzeugen. Zum Vergleich kommerzieller Reasoning-Modelle lesen Sie unsere Übersicht zu Claude 4 und agentischer KI sowie den Vergleich von Qwen-QWQ und OpenAI o3.
Einordnung
Das Modell ist ein Beitrag der Open-Source-Community auf Hugging Face und kein offizielles Release von Anthropic oder Alibaba/Qwen. Die Kombination aus Qwen3.5-MoE-Architektur, Claude-4.7-Opus-Reasoning-Distillation und INT4-Quantisierung ist technisch interessant, erfordert jedoch eine sorgfältige Evaluierung vor dem produktiven Einsatz. Unabhängige Benchmarking-Methoden und deren Aussagekraft diskutieren wir unter LLM-Benchmarks und Reproduzierbarkeit.
Quellen
Häufige Fragen
Was unterscheidet Claude 4.7 Opus von einem Standard-Sprachmodell?
Claude 4.7 Opus ist ein multimodales Modell, das neben Text auch visuelle Eingaben verarbeiten kann. Es verfügt über erweiterte Reasoning-Fähigkeiten, die durch Destillation in abgeleitete Modelle übertragen werden können. Dies zeigt sich etwa darin, dass das quelloffene Qwen3.5-MoE-Modell auf Hugging Face explizit als “reasoning-distilled from Claude 4.7 Opus” beschrieben wird.
Was bedeutet “Reasoning Distillation” im Kontext von Claude 4.7 Opus?
Bei der Reasoning Distillation wird das Schlussfolgerungsverhalten eines leistungsfähigen Lehrermodells wie Claude 4.7 Opus genutzt, um ein kleineres Schülermodell zu trainieren. Das Schülermodell übernimmt dabei strukturierte Denkmuster des Lehrermodells, ohne dessen vollständige Parameterzahl zu benötigen. Das auf Hugging Face verfügbare Modell “Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled” ist ein Beispiel für diesen Ansatz: Es basiert auf der Qwen3.5-MoE-Architektur und wurde mit Claude 4.7 Opus als Reasoning-Quelle distilliert.
Welche multimodalen Komponenten bleiben bei der INT4-Quantisierung des Claude-4.7-Opus-destillierten Modells erhalten?
Bei der INT4-Quantisierung des Modells “Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled” in der AWQ-INT4-Variante bleiben der Vision Tower, die Linear-Attention-Schichten, die Shared Experts, Layer 0, der MTP-Head sowie die Router-Gates vollständig in fp16 bzw. bf16 erhalten. Lediglich die gerouteten Expert-MLPs (gate_proj, up_proj, down_proj) über 256 Experten und rund 39 MoE-Schichten werden auf INT4 quantisiert. Die multimodale Verarbeitungsfähigkeit bleibt damit vollständig nutzbar.
Ist das AWQ-INT4-Format dieses Modells eine echte AWQ-Quantisierung?
Nicht im strengen Sinne. Der Modellautor weist auf Hugging Face ausdrücklich darauf hin, dass diese Variante zwar das AutoAWQ-GEMM-Format und den AWQ-kompatiblen vLLM-Kernel-Pfad verwendet, jedoch keinen aktivierungsgewichteten Salience-Pass über einen Kalibrierungsdatensatz durchläuft. Es handelt sich um eine datenfreie RTN-Quantisierung (Round-To-Nearest) im AWQ-Layout. Wer maximale Modellqualität ohne Multimodal-Bedarf benötigt, wird auf die FP8-Variante desselben Modells verwiesen.
Wie wird das destillierte Modell in bestehende Inferenz-Infrastruktur eingebunden?
Das On-Disk-Layout der AWQ-INT4-Variante spiegelt das Format von QuantTrio/Qwen3.6-35B-A3B-AWQ, sodass vLLM das Modell automatisch erkennt und über den moe_wna16/AWQ-Kernel-Pfad ausführt. Eine manuelle Anpassung der Inferenz-Pipeline ist damit in der Regel nicht erforderlich. Das Modell ist auf Hugging Face öffentlich verfügbar und kann über gängige Frameworks wie vLLM oder SGLang eingebunden werden.
Dieser Artikel wurde von einem KI-System automatisiert erstellt. Kennzeichnung gemäß Art. 50 der EU-KI-Verordnung.




