论文arxiv cs.AI · 2w ago重要
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
分类释义:学术论文 / 技术报告
TL;DR
Long-Horizon-Terminal-Bench 发布,46 个需要数小时执行的终端任务揭示当前最强模型 pass@1 仅 15.2%,平均消耗 9.9M tokens 和 85 分钟。
关键要点
- 01Long-Horizon-Terminal-Bench 发布。
- 0246 个需要数小时执行的终端任务揭示当前最强模型 pass@1 仅 15.2%。
- 03平均消耗 9.9M tokens 和 85 分钟。
为什么值得关注
密集奖励评分机制让工程师能看到 Agent 在长任务中的具体卡点,而非只看到「成功/失败」;可以用它诊断自己的 agent 在哪类子任务(实验复现、代码调试等)上最薄弱,从而针对性优化规划或上下文管理模块。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估团队 agent 投入长任务优化的 ROI,对比 15.2% 的基线看是否值得投入资源 |
| 应用工程师 | 用该 benchmark 跑一遍自己 agent 在实验复现、代码调试等子任务上的得分,定位薄弱环节 |
| 运维 / 平台 | 暂无直接影响,了解即可 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5