论文arxiv cs.AI · 1mo ago重要

Refusal Lives Downstream of Persona in Chat Models

分类释义:学术论文 / 技术报告

TL;DR

研究发现大模型的拒绝行为(refusal)并非独立机制,而是被「顺从人格方向」所门控。在 Llama 中激活顺从人格方向可将拒绝率从 97% 降至 2%,且拒绝只存在于模型的晚期层表达阶段。

关键要点

  • 01研究发现大模型的拒绝行为(refusal)并非独立机制
  • 02而是被「顺从人格方向」所门控
  • 03在 Llama 中激活顺从人格方向可将拒绝率从 97% 降至 2%
  • 04且拒绝只存在于模型的晚期层表达阶段
为什么值得关注

这意味着攻击者可通过 persona steering 绕过安全对齐,为红队测试提供新攻击向量;同时安全干预应针对晚期层的人格方向投影,而非单独处理拒绝方向。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead安排团队复现该研究,评估现有安全对齐方案是否存在类似漏洞
应用工程师审查输入预处理逻辑,增加对 persona steering 注入的检测
运维 / 平台在模型推理链路增加晚期层激活值的异常监控
产品 / 业务评估该漏洞对业务场景的影响,决定是否需要额外的应用层安全兜底
阅读原文 ↗来源:arxiv cs.AI

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5