Ornith 1.0 35B · NVFP4
Einen 34,7B-Qwen3.5-MoE-Reasoning-Checkpoint auf eine einzelne Blackwell-Workstation bringen, ohne jedes Subsystem zu quantisieren.
Release-Notizen zu Ornith 1.0 35B · NVFP4: das Problem, die Entscheidung, die Artefakte auf Hugging Face und was die Evaluation gezeigt hat. Die Zahlen stammen aus dem gespeicherten Snapshot vom 01.09.2026.
Problem
Einen 34,7B-Qwen3.5-MoE-Reasoning-Checkpoint auf eine einzelne Blackwell-Workstation bringen, ohne jedes Subsystem zu quantisieren.
Entscheidung
Routed Experts mit NVIDIA ModelOpt auf NVFP4 quantisiert; Attention-QKV, Shared Experts und Vision Encoder blieben in höherer Präzision.
Artefakte
| Artefakt | Format | Veröffentlicht | Downloads · 30 Tage |
|---|---|---|---|
| Ornith-1.0-35B-NVFP4 (öffnet in einem neuen Tab) | NVFP4 | 29.06.2026 | 3'202 |
Resultat
Rund 23 GB statt 69 GB BF16; Laden und Generieren mit vLLM auf einer RTX PRO 6000 Blackwell validiert.
Serving-Check
Ein minimaler Single-Node-Start mit vLLM für das Serving-Build; Kontextlänge und Parallelität an die Hardware anpassen.
# vLLM, Single Node; --max-model-len und --tensor-parallel-size an die GPU anpassen
vllm serve ressl/Ornith-1.0-35B-NVFP4 \
--dtype auto \
--max-model-len 32768
Nachweise
- Model Card: Ornith-1.0-35B-NVFP4 (öffnet in einem neuen Tab)
- Fall auf ressl.ch: https://ressl.ch/de/#model-ornith-nvfp4
- Hugging-Face-Snapshot erfasst am 01.09.2026