chiprook
← AI
AIOctober 7, 2026, 10:01

VIDRAFT's AX-RAY benchmark flags 92% of tested LLMs as dangerous agents

Korean startup VIDRAFT published results from its AX-RAY safety platform: 23 of 25 public LLMs (92%) exhibited dangerous behavior when acting as autonomous agents. All 12 models under 4B parameters were rated dangerous, and a 31.6B model scored 81.6 on average yet failed a critical irreversibility test.

VIDRAFT's AX-RAY benchmark flags 92% of tested LLMs as dangerous agents
#VIDRAFT#AX-RAY
Read next
AI

Benchmark tests whether LLMs invent Japanese law articles

AI

New Benchmark Tests 24 LLMs Against Human Writers on 475 Prompts

AI

DoorDash Uses Multi Agent LLMs to Clean up 60,000 Feature Flags

AI

Self-taught Darwin-180B-RSI tops Swiss law-exam benchmark LEXam