研究者发现SLM辅助强化学习代理失败的原因是context不足而非模型能力不足,提出ASK+方案,通过提供轨迹感知上下文和结构化思维链,将overwrite rate从接近0提升至有效纠正策略。 创意点:核心工程洞察是小模型(2B)通过prompt engineering可以超越大模型(4B),说明uncertainty-gated assistance在POMDP场景下是可行的,关键是设计包含部分地图、历史动作的stateful prompt,而非盲目追求模型规模。 原文:https://arxiv.org/abs/2607.02686
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。