研究者发现,在 Qwen3 Transformer 块中,在注意力前对 QKV 投影添加 kernel size=3 的残差 depthwise 卷积,能以低于 0.01% 的参数开销换取 7 个下游基准的平均准确率提升。 创意点:这个设计让模型在几乎不增加参数的情况下获得局部归纳偏置,工程师可以直接在现有 Transformer 架构中尝试:只需在 QKV 投影后、Self-Attention 前插入 k=3 depthwise 卷积即可。 原文:https://arxiv.org/abs/2607.18413
这篇候选手册来自公开业界分享的摘要提炼,不转载原文。后续我会补充自己的验证、代码和可复用配置,再升级为正式 playbook。
加入每周 AI 工程师 Brief
新 playbook 上线第一时间通知,附作者每周观察。永久免费。