论文arxiv cs.CL · 4w ago必读
Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment
分类释义:学术论文 / 技术报告
TL;DR
BPE分词会将安全关键词拆分成子词片段,现有对齐数据集完全不包含这类碎片化输入。攻击者利用这一分布偏移,可使主流模型(Qwen、Gemma、Llama、Mistral)的安全对齐机制失效,成功率达80-100%。
关键要点
- 01BPE分词会将安全关键词拆分成子词片段。
- 02现有对齐数据集完全不包含这类碎片化输入。
- 03攻击者利用这一分布偏移。
- 04可使主流模型(Qwen、Gemma、Llama、Mistral)的安全对齐机制失效。
为什么值得关注
现有对齐训练(DPO/SFT)无法根本修复:SFT会导致模型对无害prompt也一律拒绝(全局坍缩),表明仅补充碎片化数据不足以解决漏洞。开发者需要重新审视tokenization层与安全机制的耦合关系——这是一个从tokenization→对齐→安全的系统性盲点,而非简单数据增强。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估是否切换到字符级或混合分词器以缓解token边界攻击 |
| 应用工程师 | 在模型输入层增加基于规则的恶意prompt检测作为纵深防御 |
| 运维 / 平台 | 暂无直接影响,了解即可 |
| 产品 / 业务 | 评估该漏洞对产品安全承诺的影响,必要时在用户协议中补充免责声明 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5