Gemma 4 31B uncensored · Formatfamilie
59 GB → 20 GBNVFP4-Checkpoint · vLLM und SGLang validiert
- Resultat
BF16-Evaluation: 0/686 effektive Refusals über vier Datensätze. Der 20-GB-NVFP4-Build, reduziert von 59 GB, wurde in vLLM und SGLang validiert. GGUF: 12–31 GB mit 0–1/100 Hard Refusals über die Quantisierungsstufen.
Nachweis: BF16 (öffnet in einem neuen Tab)NVFP4 (öffnet in einem neuen Tab)GGUF (öffnet in einem neuen Tab)
Problem und Entscheidung
- Problem
Refusal-Verhalten aus einem multimodalen 30,7B-Modell entfernen, ohne ein deploybares Format-Set zu verlieren.
- Mein Beitrag & Entscheidung
Weight-Level-Abliteration angewendet und dieselbe Modelllinie als BF16, ModelOpt-NVFP4 und GGUF-K-Quant-Ladder veröffentlicht. Für multimodales NVFP4-Serving blieben Vision Tower, Embedder und lm_head in BF16.
