论文arxiv cs.AI · 2w ago重要

Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking

分类释义:学术论文 / 技术报告

TL;DR

研究发现不同提示词格式包装器会导致模型得分产生超过30倍的差异,140次万次实验证明解析成功率是准确率的强预测因子,基准测试报告若不披露包装器方差和合规率则统计上不可靠。

关键要点

  • 01研究发现不同提示词格式包装器会导致模型得分产生超过30倍的差异
  • 02140次万次实验证明解析成功率是准确率的强预测因子
  • 03基准测试报告若不披露包装器方差和合规率则统计上不可靠
为什么值得关注

对基准测试:评估模型时应报告同一任务在不同包装器下的分数范围;工程落地:在生产环境部署结构化输出时,包装器格式的选择可能比模型切换影响更大,建议先用PSI低的格式做兜底方案。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead更新模型评估标准,要求报告中必须包含同一任务在不同包装器下的分数方差和解析成功率
应用工程师在选型时优先测试 PSI(格式敏感指数)低的格式作为兜底方案,再考虑升级模型
运维 / 平台评估平台增加包装器多样性测试模块,对比至少3种主流格式包装器的输出稳定性
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.AI

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5