论文arxiv cs.CL · 4w ago必读

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

分类释义:学术论文 / 技术报告

TL;DR

BPE分词会将安全关键词拆分成子词片段,现有对齐数据集完全不包含这类碎片化输入。攻击者利用这一分布偏移,可使主流模型(Qwen、Gemma、Llama、Mistral)的安全对齐机制失效,成功率达80-100%。

关键要点

  • 01BPE分词会将安全关键词拆分成子词片段
  • 02现有对齐数据集完全不包含这类碎片化输入
  • 03攻击者利用这一分布偏移
  • 04可使主流模型(Qwen、Gemma、Llama、Mistral)的安全对齐机制失效
为什么值得关注

现有对齐训练(DPO/SFT)无法根本修复:SFT会导致模型对无害prompt也一律拒绝(全局坍缩),表明仅补充碎片化数据不足以解决漏洞。开发者需要重新审视tokenization层与安全机制的耦合关系——这是一个从tokenization→对齐→安全的系统性盲点,而非简单数据增强。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估是否切换到字符级或混合分词器以缓解token边界攻击
应用工程师在模型输入层增加基于规则的恶意prompt检测作为纵深防御
运维 / 平台暂无直接影响,了解即可
产品 / 业务评估该漏洞对产品安全承诺的影响,必要时在用户协议中补充免责声明
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5