CareManage-Bench: LLMs Skip Safety Checks in Clinical Care Tasks
A developer benchmarked Gemini 3.7 Flash, Gemma 4 31B, and GPT-5.4 Mini on 24 synthetic clinical cases across three task families. All models aced medication safety and triage but failed 5 care-plan tasks, missing depression screening and bleeding-risk assessments.
- All three models scored 24/24 on medication safety and triage tasks
- Gemini 3.7 Flash and GPT-5.4 Mini scored 23/24, Gemma 4 31B scored 21/24
- All models missed depression screening in a post-MI cardiac care plan
- Gemma 4 31B prescribed anticoagulants without bleeding-risk assessment and bisphosphonates without dental review
Read next
AI