研究发现大多数 LLM「从众」行为其实不需要说话者存在——标准测试把「重复错误答案」和「有说话者」两个因素混在一起,导致误判conformity程度。实验中,仅移除说话者但保留重复错误答案,仍有66.5%的正确案例发生有害修改。 创意点:工程师在做LLM对齐或安全评估时,常依赖conformity类benchmarks,但这个研究发现现有benchmark有根本性 confound——可能被重复文本本身影响而非真正社会压力。可执行的创意:在自己的对齐测试中加入「无来源重复答案」control组,先剔除这个floor再测speaker effect。 原文:https://arxiv.org/abs/2607.05545
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。