Red Hat: 200M-parameter DeBERTa classifier nearly matches 35B model in AI guardrails
Red Hat benchmarked nine guardrail configurations for prompt injection and content safety using NVIDIA's NeMo Guardrails. Its DeBERTa-based classifier (~200M parameters) scored 89.01% versus 89.31% for Qwen3.6-35B, while responding in 54.1 ms versus 312.5 ms. Both Red Hat classifiers will ship as default guardrail configurations in OpenShift AI 3.6.
- DeBERTa scored 89.01% on prompt injection vs 89.31% for Qwen3.6-35B
- Median latency was 54.1 ms for DeBERTa vs 312.5 ms for Qwen and 348.1 ms for Jev
- On content safety Jev led at 86.20%, while Granite Guardian placed sixth at 80.27%
- Policy tuning lifted Laya from 57.87% to 75.20% but cut Jev from 86.20% to 82.53%
Read next
Security