模型arxiv cs.CL · 1w ago重要
Convolution for Large Language Models
分类释义:新模型发布或升级
TL;DR
研究者发现,在 Qwen3 Transformer 块中,在注意力前对 QKV 投影添加 kernel size=3 的残差 depthwise 卷积,能以低于 0.01% 的参数开销换取 7 个下游基准的平均准确率提升。
关键要点
- 01在 Qwen3 Transformer 块中。
- 02在注意力前对 QKV 投影添加 kernel size=3 的残差 depthwise 卷积。
- 03能以低于 0.01% 的参数开销换取 7 个下游基准的平均准确率提升。
为什么值得关注
这个设计让模型在几乎不增加参数的情况下获得局部归纳偏置,工程师可以直接在现有 Transformer 架构中尝试:只需在 QKV 投影后、Self-Attention 前插入 k=3 depthwise 卷积即可。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估将 Depthwise Convolution 添加到 Transformer 的方案是否纳入当前季度优化路线图 |
| 应用工程师 | 在 QKV 投影层后、Self-Attention 前插入 kernel_size=3 的残差 depthwise 卷积验证效果 |
| 运维 / 平台 | 测量加入卷积层后推理延迟和显存占用的增量,确认是否符合 SLA 要求 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5