BLOG

Ornith 1.0 35B · NVFP4

Veröffentlicht 1 Min. Lesezeit

Einen 34,7B-Qwen3.5-MoE-Reasoning-Checkpoint auf eine einzelne Blackwell-Workstation bringen, ohne jedes Subsystem zu quantisieren.

Release-Notizen zu Ornith 1.0 35B · NVFP4: das Problem, die Entscheidung, die Artefakte auf Hugging Face und was die Evaluation gezeigt hat. Die Zahlen stammen aus dem gespeicherten Snapshot vom 01.09.2026.

Problem

Einen 34,7B-Qwen3.5-MoE-Reasoning-Checkpoint auf eine einzelne Blackwell-Workstation bringen, ohne jedes Subsystem zu quantisieren.

Entscheidung

Routed Experts mit NVIDIA ModelOpt auf NVFP4 quantisiert; Attention-QKV, Shared Experts und Vision Encoder blieben in höherer Präzision.

Artefakte

Artefakt Format Veröffentlicht Downloads · 30 Tage
Ornith-1.0-35B-NVFP4 (öffnet in einem neuen Tab) NVFP4 29.06.2026 3'202

Resultat

Rund 23 GB statt 69 GB BF16; Laden und Generieren mit vLLM auf einer RTX PRO 6000 Blackwell validiert.

Serving-Check

Ein minimaler Single-Node-Start mit vLLM für das Serving-Build; Kontextlänge und Parallelität an die Hardware anpassen.

# vLLM, Single Node; --max-model-len und --tensor-parallel-size an die GPU anpassen
vllm serve ressl/Ornith-1.0-35B-NVFP4 \
  --dtype auto \
  --max-model-len 32768

Nachweise