论文arxiv cs.CL · 3d ago重要

Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement

分类释义:学术论文 / 技术报告

TL;DR

CKM(认知内核模型)通过强制 LLM 在决策前将输入分类为 Fact/Heuristic/Emotion 三种认知角色,在 26 个模型、37403 次观测中实现决策翻转率降低 82%,且效果不依赖模型权重修改。

关键要点

  • 01CKM(认知内核模型)通过强制 LLM 在决策前将输入分类为 Fact/Heuristic/Emotion 三种认知角色
  • 02在 26 个模型、37403 次观测中实现决策翻转率降低 82%
  • 03且效果不依赖模型权重修改
为什么值得关注

LLM 在生产环境中对同一问题给出不一致答案是真实痛点,CKM 证明了「结构化认知分类」比单纯 JSON 格式化更能约束行为;工程师可直接在 prompt 中增加「请先分别列出你使用的:事实、假设、情感倾向」步骤来提升 Agent 决策稳定性。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估 CKM 方法是否纳入团队的 prompt 规范和 code review checklist
应用工程师在现有 agent prompt 中加入「先列出事实/假设/情感倾向」步骤,验证一致性提升效果
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5