BLOG

Gemma 4 31B uncensored · Formatfamilie

Veröffentlicht 2 Min. Lesezeit

Refusal-Verhalten aus einem multimodalen 30,7B-Modell entfernen, ohne ein deploybares Format-Set zu verlieren.

Release-Notizen zu Gemma 4 31B uncensored · Formatfamilie: das Problem, die Entscheidung, die Artefakte auf Hugging Face und was die Evaluation gezeigt hat. Die Zahlen stammen aus dem gespeicherten Snapshot vom 01.09.2026.

Problem

Refusal-Verhalten aus einem multimodalen 30,7B-Modell entfernen, ohne ein deploybares Format-Set zu verlieren.

Entscheidung

Weight-Level-Abliteration angewendet und dieselbe Modelllinie als BF16, ModelOpt-NVFP4 und GGUF-K-Quant-Ladder veröffentlicht. Für multimodales NVFP4-Serving blieben Vision Tower, Embedder und lm_head in BF16.

Artefakte

Artefakt Format Veröffentlicht Downloads · 30 Tage
gemma-4-31B-it-uncensored (öffnet in einem neuen Tab) BF16 08.07.2026 135
gemma-4-31B-it-uncensored-NVFP4 (öffnet in einem neuen Tab) NVFP4 08.07.2026 285
gemma-4-31B-it-uncensored-GGUF (öffnet in einem neuen Tab) GGUF 08.07.2026 1'746

Resultat

BF16-Evaluation: 0/686 effektive Refusals über vier Datensätze. Der 20-GB-NVFP4-Build, reduziert von 59 GB, wurde in vLLM und SGLang validiert. GGUF: 12–31 GB mit 0–1/100 Hard Refusals über die Quantisierungsstufen.

Serving-Check

Ein minimaler Single-Node-Start mit vLLM für das Serving-Build; Kontextlänge und Parallelität an die Hardware anpassen.

# vLLM, Single Node; --max-model-len und --tensor-parallel-size an die GPU anpassen
vllm serve ressl/gemma-4-31B-it-uncensored-NVFP4 \
  --dtype auto \
  --max-model-len 32768

Nachweise