论文arxiv cs.CL · 2w ago重要
Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry
分类释义:学术论文 / 技术报告
TL;DR
Safe-Psych 基准测试揭示当前顶级 LLMs 在精神科诊断中普遍存在「过早承诺」问题:即使信息不足,仍有超过 60% 的情况未能正确弃权,且很少主动寻求澄清。
关键要点
- 01Safe-Psych 基准测试揭示当前顶级 LLMs 在精神科诊断中普遍存在「过早承诺」问题:即使信息不足。
- 02仍有超过 60% 的情况未能正确弃权。
- 03且很少主动寻求澄清。
为什么值得关注
医疗场景中模型应学会「主动说不知道」而非硬猜,工程师可借鉴 Safe-Psych 的三标签评测框架(DIAGNOSE/CLARIFY/ABSTAIN),为诊断类 Agent 设计不确定性感知的决策模块,避免在生产环境中因错误自信造成患者风险。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估在医疗诊断类 Agent 架构中引入 uncertainty-aware 决策模块,参考 ABSTAIN 机制设计 |
| 应用工程师 | 在诊断类功能代码中加入置信度阈值判断,低于阈值时强制触发 CLARIFY 而非返回结果 |
| 运维 / 平台 | 暂无直接影响,了解即可 |
| 产品 / 业务 | 审视现有诊断类功能的免责声明逻辑,确认是否需要在低置信度场景下向用户明确提示信息不足 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5