ClinLens 是一个包含 200 个可执行任务的临床多模态基准,覆盖 MIMIC 的 EHR、笔记、心电图、胸片和超声心动图,当前最强模型配置仅达到 56.3% 严格通过率,而专用编码 agent 解决 83/126 任务,5 个生物医学系统在 GPT-4o-mini 上仅 2.9%。 创意点:该基准揭示了「能跑通」与「临床正确」之间的巨大鸿倪——100% 执行成功却只有 56.3% 正确,说明当前 agent 在理解时序语义和跨模态因果推理上严重不足。工程师可借鉴其 program-first reverse synthesis 方法来设计更严格的医学 AI 评测管道,并以此作为临床 agent 红队测试集。 原文:https://arxiv.org/abs/2607.26155
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。