论文arxiv cs.CL · 2w ago重要
Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs
分类释义:学术论文 / 技术报告
TL;DR
研究提出 JKP 评估框架,发现对 VLM 重复追问会导致答案不稳定振荡:正确答案会倒退,错误答案有时会恢复,正确率aggregate变化不大但轨迹层面存在大量反复横跳。GPT-4o 最脆弱,Qwen3-VL-30B 在直接否定下会「自信地错」。
关键要点
- 01研究提出 JKP 评估框架。
- 02发现对 VLM 重复追问会导致答案不稳定振荡:正确答案会倒退。
- 03错误答案有时会恢复。
- 04正确率aggregate变化不大但轨迹层面存在大量反复横跳。
为什么值得关注
Chain-of-Thought 和 Self-Correction 等常用 prompt 策略可能对 VLMs 起反效果——反复追问不是增强推理而是制造不稳定。产品需加入「追问熔断」机制,且应针对每个 model 做多轮对抗测试而非只看单轮 benchmark。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 将模型评估标准从单轮 benchmark 切换到多轮对抗测试,重点验证连续追问场景下的稳定性 |
| 应用工程师 | 对现有 CoT/Self-Correction 类 prompt 做审计,移除或限制重复追问次数并添加熔断逻辑 |
| 运维 / 平台 | 在对话链路中增加答案振荡监控,发现连续翻转时触发告警或自动终止追问 |
| 产品 / 业务 | 评估依赖多次追问的产品功能,必要时降级为单次问答或显式告知用户追问上限 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5