论文arxiv cs.AI · 2d ago重要

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

分类释义:学术论文 / 技术报告

TL;DR

ClinLens 是一个包含 200 个可执行任务的临床多模态基准,覆盖 MIMIC 的 EHR、笔记、心电图、胸片和超声心动图,当前最强模型配置仅达到 56.3% 严格通过率,而专用编码 agent 解决 83/126 任务,5 个生物医学系统在 GPT-4o-mini 上仅 2.9%。

关键要点

  • 01ClinLens 是一个包含 200 个可执行任务的临床多模态基准
  • 02覆盖 MIMIC 的 EHR、笔记、心电图、胸片和超声心动图
  • 03当前最强模型配置仅达到 56.3% 严格通过率
  • 04而专用编码 agent 解决 83/126 任务
为什么值得关注

该基准揭示了「能跑通」与「临床正确」之间的巨大鸿倪——100% 执行成功却只有 56.3% 正确,说明当前 agent 在理解时序语义和跨模态因果推理上严重不足。工程师可借鉴其 program-first reverse synthesis 方法来设计更严格的医学 AI 评测管道,并以此作为临床 agent 红队测试集。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead将「执行成功率」与「临床正确率」的差异纳入团队AI质量评估标准
应用工程师参考ClinLens的program-first reverse synthesis方法重构医学AI任务的测试管道
运维 / 平台暂无直接影响,了解即可
产品 / 业务与工程师确认医学类功能需增加「结果正确性人工复核」环节而非仅验证执行成功
阅读原文 ↗来源:arxiv cs.AI

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5