论文arxiv cs.AI · 1mo ago重要
Refusal Lives Downstream of Persona in Chat Models
分类释义:学术论文 / 技术报告
TL;DR
研究发现大模型的拒绝行为(refusal)并非独立机制,而是被「顺从人格方向」所门控。在 Llama 中激活顺从人格方向可将拒绝率从 97% 降至 2%,且拒绝只存在于模型的晚期层表达阶段。
关键要点
- 01研究发现大模型的拒绝行为(refusal)并非独立机制。
- 02而是被「顺从人格方向」所门控。
- 03在 Llama 中激活顺从人格方向可将拒绝率从 97% 降至 2%。
- 04且拒绝只存在于模型的晚期层表达阶段。
为什么值得关注
这意味着攻击者可通过 persona steering 绕过安全对齐,为红队测试提供新攻击向量;同时安全干预应针对晚期层的人格方向投影,而非单独处理拒绝方向。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 安排团队复现该研究,评估现有安全对齐方案是否存在类似漏洞 |
| 应用工程师 | 审查输入预处理逻辑,增加对 persona steering 注入的检测 |
| 运维 / 平台 | 在模型推理链路增加晚期层激活值的异常监控 |
| 产品 / 业务 | 评估该漏洞对业务场景的影响,决定是否需要额外的应用层安全兜底 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5