
Safe-Psych Benchmark Tests Whether AI Models Ask Before Diagnosing in Psychiatry
Researchers introduced Safe-Psych, a sequential benchmark that evaluates how well large language models handle evolving diagnostic uncertainty in clinical psychiatry. Unlike existing medical benchmarks that assume complete information upfront, Safe-Psych tests whether models request clarification or abstain when data is insufficient.






















