Gemma 4 31B uncensored · Formatfamilie
Refusal-Verhalten aus einem multimodalen 30,7B-Modell entfernen, ohne ein deploybares Format-Set zu verlieren.
Release-Notizen zu Gemma 4 31B uncensored · Formatfamilie: das Problem, die Entscheidung, die Artefakte auf Hugging Face und was die Evaluation gezeigt hat. Die Zahlen stammen aus dem gespeicherten Snapshot vom 01.09.2026.
Problem
Refusal-Verhalten aus einem multimodalen 30,7B-Modell entfernen, ohne ein deploybares Format-Set zu verlieren.
Entscheidung
Weight-Level-Abliteration angewendet und dieselbe Modelllinie als BF16, ModelOpt-NVFP4 und GGUF-K-Quant-Ladder veröffentlicht. Für multimodales NVFP4-Serving blieben Vision Tower, Embedder und lm_head in BF16.
Artefakte
| Artefakt | Format | Veröffentlicht | Downloads · 30 Tage |
|---|---|---|---|
| gemma-4-31B-it-uncensored (öffnet in einem neuen Tab) | BF16 | 08.07.2026 | 135 |
| gemma-4-31B-it-uncensored-NVFP4 (öffnet in einem neuen Tab) | NVFP4 | 08.07.2026 | 285 |
| gemma-4-31B-it-uncensored-GGUF (öffnet in einem neuen Tab) | GGUF | 08.07.2026 | 1'746 |
Resultat
BF16-Evaluation: 0/686 effektive Refusals über vier Datensätze. Der 20-GB-NVFP4-Build, reduziert von 59 GB, wurde in vLLM und SGLang validiert. GGUF: 12–31 GB mit 0–1/100 Hard Refusals über die Quantisierungsstufen.
Serving-Check
Ein minimaler Single-Node-Start mit vLLM für das Serving-Build; Kontextlänge und Parallelität an die Hardware anpassen.
# vLLM, Single Node; --max-model-len und --tensor-parallel-size an die GPU anpassen
vllm serve ressl/gemma-4-31B-it-uncensored-NVFP4 \
--dtype auto \
--max-model-len 32768
Nachweise
- Model Card: gemma-4-31B-it-uncensored (öffnet in einem neuen Tab)
- Model Card: gemma-4-31B-it-uncensored-NVFP4 (öffnet in einem neuen Tab)
- Model Card: gemma-4-31B-it-uncensored-GGUF (öffnet in einem neuen Tab)
- Fall auf ressl.ch: https://ressl.ch/de/#model-gemma-4-family
- Hugging-Face-Snapshot erfasst am 01.09.2026