模型arxiv cs.CL · 1w ago重要

Convolution for Large Language Models

分类释义:新模型发布或升级

TL;DR

研究者发现,在 Qwen3 Transformer 块中,在注意力前对 QKV 投影添加 kernel size=3 的残差 depthwise 卷积,能以低于 0.01% 的参数开销换取 7 个下游基准的平均准确率提升。

关键要点

  • 01在 Qwen3 Transformer 块中
  • 02在注意力前对 QKV 投影添加 kernel size=3 的残差 depthwise 卷积
  • 03能以低于 0.01% 的参数开销换取 7 个下游基准的平均准确率提升
为什么值得关注

这个设计让模型在几乎不增加参数的情况下获得局部归纳偏置,工程师可以直接在现有 Transformer 架构中尝试:只需在 QKV 投影后、Self-Attention 前插入 k=3 depthwise 卷积即可。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将 Depthwise Convolution 添加到 Transformer 的方案是否纳入当前季度优化路线图
应用工程师在 QKV 投影层后、Self-Attention 前插入 kernel_size=3 的残差 depthwise 卷积验证效果
运维 / 平台测量加入卷积层后推理延迟和显存占用的增量,确认是否符合 SLA 要求
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5