STAFF / PRINCIPAL / FORWARD DEPLOYED AI SYSTEMS

Ich baue, breche und deploye AI-Systeme.

Hands-on Engineer für Model Tuning, Inference-Infrastruktur, Offensive Security und regulierte Produktion. Ich führe über Code, Architektur und direkte Arbeit mit Kunden.

HF-Snapshot

Modelle, die wirklich ausgeliefert werden

Ich transformiere Modellverhalten, quantisiere für reale Hardware, validiere Serving-Ziele und veröffentliche die Artefakte mit klaren Evaluationsgrenzen.

Gemma 4 31B uncensored · Formatfamilie

59 GB → 20 GBNVFP4-Checkpoint · vLLM und SGLang validiert

Resultat

BF16-Evaluation: 0/686 effektive Refusals über vier Datensätze. Der 20-GB-NVFP4-Build, reduziert von 59 GB, wurde in vLLM und SGLang validiert. GGUF: 12–31 GB mit 0–1/100 Hard Refusals über die Quantisierungsstufen.

Nachweis: BF16 (öffnet in einem neuen Tab)NVFP4 (öffnet in einem neuen Tab)GGUF (öffnet in einem neuen Tab)
Problem und Entscheidung
Problem

Refusal-Verhalten aus einem multimodalen 30,7B-Modell entfernen, ohne ein deploybares Format-Set zu verlieren.

Mein Beitrag & Entscheidung

Weight-Level-Abliteration angewendet und dieselbe Modelllinie als BF16, ModelOpt-NVFP4 und GGUF-K-Quant-Ladder veröffentlicht. Für multimodales NVFP4-Serving blieben Vision Tower, Embedder und lm_head in BF16.

Engineering-Details lesen →

Ornith 1.0 35B · NVFP4

~69 GB → ~23 GBExperts-only NVFP4 · eine Blackwell-GPU

Resultat

Rund 23 GB statt 69 GB BF16; Laden und Generieren mit vLLM auf einer RTX PRO 6000 Blackwell validiert.

Nachweis: Ornith-1.0-35B-NVFP4 (öffnet in einem neuen Tab)
Problem und Entscheidung
Problem

Einen 34,7B-Qwen3.5-MoE-Reasoning-Checkpoint auf eine einzelne Blackwell-Workstation bringen, ohne jedes Subsystem zu quantisieren.

Mein Beitrag & Entscheidung

Routed Experts mit NVIDIA ModelOpt auf NVFP4 quantisiert; Attention-QKV, Shared Experts und Vision Encoder blieben in höherer Präzision.

Engineering-Details lesen →

MiniMax-M3-uncensored · 428B MoE

428B · BF16Weight-Level-Verhaltensänderung · 796 GB veröffentlicht

Resultat

0/16 Hard Refusals im veröffentlichten Sample; multimodales Verhalten, Reasoning und MoE-Routing wurden smoke-getestet, nicht vollständig benchmarked.

Nachweis: MiniMax-M3-uncensored (öffnet in einem neuen Tab)
Problem und Entscheidung
Problem

Refusal-Verhalten in einem multimodalen 428B-MoE untersuchen und dabei Reasoning- und Routing-Struktur erhalten.

Mein Beitrag & Entscheidung

Attention-o_proj und alle residual-writing down_proj über sämtliche 60 Layer modifiziert; veröffentlicht als 796 GB BF16 in 59 Shards.

Engineering-Details lesen →
Alle Hugging-Face-Releases ansehen (öffnet in einem neuen Tab)
Alle Releases im Snapshot (28)
ModellFormatVeröffentlichtDownloads · 30 Tage
GLM-5.3-NVFP4 (öffnet in einem neuen Tab)NVFP4213
Ornith-1.5-35B-A3B-uncensored-MLX-8bit (öffnet in einem neuen Tab)MLX 8bit336
Ornith-1.5-35B-A3B-uncensored-MLX-6bit (öffnet in einem neuen Tab)MLX 6bit837
Ornith-1.5-35B-A3B-uncensored-MLX-4bit (öffnet in einem neuen Tab)MLX 4bit457
Ornith-1.5-35B-A3B-uncensored-MLX (öffnet in einem neuen Tab)MLX393
Ornith-1.5-9B-uncensored-MLX-8bit (öffnet in einem neuen Tab)MLX 8bit330
Ornith-1.5-9B-uncensored-MLX-6bit (öffnet in einem neuen Tab)MLX 6bit868
Ornith-1.5-9B-uncensored-MLX-4bit (öffnet in einem neuen Tab)MLX 4bit383
Ornith-1.5-9B-uncensored-MLX (öffnet in einem neuen Tab)MLX334
Ornith-1.5-35B-A3B-uncensored-GGUF (öffnet in einem neuen Tab)GGUF1'313
Ornith-1.5-35B-A3B-uncensored-NVFP4 (öffnet in einem neuen Tab)NVFP4631
Ornith-1.5-9B-uncensored-GGUF (öffnet in einem neuen Tab)GGUF1'055
Ornith-1.5-9B-uncensored-NVFP4 (öffnet in einem neuen Tab)NVFP4161
Ornith-1.5-397B-uncensored-NVFP4 (öffnet in einem neuen Tab)NVFP4403
Ornith-1.5-397B-uncensored-FP8 (öffnet in einem neuen Tab)FP848
Laguna-S-2.1-Uncensored (öffnet in einem neuen Tab)BF1641
MiniMax-M3-uncensored-NVFP4 (öffnet in einem neuen Tab)NVFP415'732
gemma-4-31B-it-uncensored-MLX-4bit (öffnet in einem neuen Tab)MLX 4bit182
gemma-4-31B-it-uncensored-MLX-5bit (öffnet in einem neuen Tab)MLX 5bit143
gemma-4-31B-it-uncensored-MLX-6bit (öffnet in einem neuen Tab)MLX 6bit139
gemma-4-31B-it-uncensored-MLX-8bit (öffnet in einem neuen Tab)MLX 8bit107
gemma-4-31B-it-uncensored-MLX-bf16 (öffnet in einem neuen Tab)MLX bf16146
MiniMax-M3-uncensored (öffnet in einem neuen Tab)BF16375
gemma-4-31B-it-uncensored-GGUF (öffnet in einem neuen Tab)GGUF1'407
gemma-4-31B-it-uncensored (öffnet in einem neuen Tab)BF1655
gemma-4-31B-it-uncensored-NVFP4 (öffnet in einem neuen Tab)NVFP4209
GRM-2.6-Plus-NVFP4 (öffnet in einem neuen Tab)NVFP49
Ornith-1.0-35B-NVFP4 (öffnet in einem neuen Tab)NVFP4839

Atom-FeedJSON

Agents angreifen. Systeme härten.

Ich verbinde Model-Behavior-Forschung mit den Kontrollen rund um Agents: Red Teaming, Prompt Injection, MCP-Angriffsflächen, Containment, Policy Enforcement und Auditierbarkeit.

Modellverhalten

Abliteration, Alignment-Analyse, Refusal-Messung und adversariale Evaluation über veröffentlichte Checkpoints.

Angriffsfläche Agent

LLM Red Teaming, Prompt Injection, MCP-Scanning, Tool Poisoning, Exfiltrationspfade und Missbrauch von Tool-Chains.

Containment & Audit

Runtime Policy Enforcement, Egress-Kontrollen, menschliche Freigaben, signierte Audit-Trails und Compliance-Evidenz.

Produktionssysteme, Ende zu Ende

Das Modell ist nur eine Komponente. Ich baue den Linux-, GPU-, Kubernetes-, Inference-, Netzwerk-, Observability- und Security-Pfad darum.

  1. WEIGHTSVeröffentlichte Checkpoints und Modellverhalten
  2. TUNELoRA · Behavior Work
  3. QUANTIZENVFP4 · GGUF
  4. SERVEvLLM · SGLang
  5. ATTACKMCP · Agents
  6. HARDENPolicy · Audit

AI-Inference-Plattform

Ich baue und betreibe eine GitOps-gesteuerte Talos/Kubernetes-Inference-Plattform auf NVIDIA- und AMD-GPUs: Modellvorbereitung, Backend-Readiness, Streaming und betriebliche Telemetrie. Die Fallstudie dokumentiert eine vLLM-Router-Implementierung und ihre Abwägungen aus einem konkreten Stand dieser Arbeit.

Private Plattform · öffentliche Architekturnotizen

Plattform-Fallstudie lesen →

Audit-fähige Delivery

Technische Delivery und Evidenz in FINMA-, DORA- und TLPT-Umgebungen.

FINMA · DORA · TLPT

Technische Führung aus der Umsetzung

Ich schaffe Klarheit, treffe die schwierigen technischen Entscheidungen und bleibe verantwortlich, bis das System ausgeliefert ist.

Ausgewählte Arbeiten

Open-Source-Tools für AI Security und Systeme, die ich baue, veröffentliche und betreibe.

Rust · React · PostgreSQL · AI workflows

paperless-archivist

Security-first AI-Automatisierung für Paperless-ngx: fortsetzbare OCR- und Tagging-Workflows, validierungsgebremster Autopilot, Human Review, Dokument-Chat mit Quellen, RBAC und auditierbare Aktionen.

Weitere ausgelieferte Produktarbeit

Zwanzig Jahre mit wachsender technischer Verantwortung

Von Linux und Hochverfügbarkeit über Cloud und Offensive Security bis Model Work und globale Customer Delivery.

Globale Offensive-Security-Delivery

Embedded mit C-Level bei Tier-1-Banken, Versicherern und Automotive, weiterhin hands-on.

Cloud-Architektur zur Security-Practice

Practice-Aufbau, APT-Simulation und Custom Tooling unter Engagement-Deadlines.

Infrastruktur zur Automatisierung

Konfigurationsautomatisierung im grossen Massstab, Engineer-Schulungen und Go-Backend-Automatisierung.

Linux Engineering zur Solution Architecture

Hochverfügbare Systeme im Rechenzentrum, danach ein globaler IT-Neuaufbau mit auditierter Security.

Vollständige Laufbahn anzeigen
  1. Associate Director, Offensive Security Global @ Kyndryl

    Embedded mit C-Level bei Tier-1-Banken, Versicherern und Automotive in 11 Ländern. 100+ On-site-Engagements. Custom Tooling unter Engagement-Deadlines geliefert. DORA / FINMA / TLPT.

  2. Senior Red Team Lead Engineer, Global @ Kyndryl

    Forward-deployed APT-Simulation für Fortune 500. Custom Tooling und Rapid Prototyping im Engagement — 40% Effizienzgewinn in der Delivery.

  3. Associate Partner Security @ Kyndryl

    Consulting-Practice und GTM-Strategie nach dem IBM-Spin-off aufgebaut. Pre-Sales-Scoping und Customer-embedded-Delivery-Modell.

  4. Security Consultant & Cloud Architect @ IBM

    Cloud-Transformationen — AWS, GCP, OpenShift, K8s. Security-Division im Consulting aufgebaut.

  5. DevOps Engineer Expert @ Avectris AG

    Linux-Abteilung aufgebaut. Backend-Automatisierung in Go (80% weniger manueller Aufwand). Scrum Master.

  6. DevOps Engineer @ Swisscom AG

    Automatisierung für Swisscom TV (300+ Kanäle). Sprachsteuerungs-System. 35+ Engineers geschult.

  7. Linux Architect @ EveryWare AG

    Enterprise-Infrastruktur für Allianz, JobCloud, UBS AG.

  8. Linux DevOps Engineer @ CTBTO (United Nations)

    600 Nodes von CFEngine zu Puppet migriert. Nahezu 100% Konfigurations-Automatisierung.

  9. Lead Solution Architect @ Schrack Seconet AG

    Globale IT neu aufgebaut (HQ + 16 Niederlassungen). 100% Security-Audits bestanden. ERP-RPO: 1 Tag → 15 Min.

  10. Linux Engineer @ Freelance

    HA-Systeme in Interxion-Rechenzentren. 99.99% Uptime.

Nachweise

39 Nachweise in Offensive Security, Linux, Automatisierung, Containern und Cloud.

Alle 39 anzeigen

Security & Offensive

CompTIA

Red Hat

Linux Foundation & LPI

LFCSLinux Foundation & LPI (öffnet in einem neuen Tab)LPI-3 (304)Linux Foundation & LPILPI-3 (303)Linux Foundation & LPI

Cloud & ITSM

Chef / DevOps

Extending ChefChef / DevOpsCertified Chef DeveloperChef / DevOpsDeploying CookbooksChef / DevOpsLocal Cookbook DevChef / DevOpsBasic Chef FluencyChef / DevOps

Interaktives Terminal

Nachweise in der Evidence CLI erkunden und optional eine fiktive lokale Delivery-Mission durchspielen. Befehls- und Dateiinhalte werden nie übertragen; schreibbare Dateien nutzen origin-privaten Browser-Speicher erst nach deiner Freigabe.

Terminal-Ausgabe

Befehle laufen nur in diesem Browser. Befehls- und Dateiinhalte werden nie an einen Server gesendet.

Befehle laufen nur in diesem Browser. Befehls- und Dateiinhalte werden nie an einen Server gesendet.

Schreibbare Dateien werden erst nach deiner Freigabe lokal gespeichert.

Einige Befehle sind versteckt. Beharrlichkeit zahlt sich aus.

Interaktive Funktionen sind nicht verfügbar. Alle Nachweise und Kontaktwege bleiben verfügbar; nur Terminal und Darstellungseinstellungen sind inaktiv.

Bauen wir das schwierige System gemeinsam.

Ich interessiere mich für hands-on Staff-, Principal- und Forward-Deployed-Rollen bei AI-Unternehmen sowie ausgewählte technische Zusammenarbeit.

Darstellungseinstellungen

Darstellungsoptionen bleiben nur für diese Tab-Sitzung gespeichert. Kein Tracking.

Matrix-Hintergrund
Theme