论文arxiv cs.CL · 1mo ago重要
Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO
分类释义:学术论文 / 技术报告
TL;DR
Qwen3-14B 通过 GRPO + 方差感知评分奖励,在心脏病问答基准上将准确率从 36.2% 提升至 50.2%,接近 120B 参数的 GPT-OSS 水平。
关键要点
- 01Qwen3-14B 通过 GRPO + 方差感知评分奖励。
- 02在心脏病问答基准上将准确率从 36.2% 提升至 50.2%。
- 03接近 120B 参数的 GPT-OSS 水平。
为什么值得关注
对于需要多维评分、难以自动验证的任务(如医疗 QA、产品评审、代码审查),该研究证明用连续函数替代二值/整体评分的方差感知奖励能提供更丰富的优化信号;可借鉴这一思路设计 RLHF 奖励模型,通过细粒度 rubric 捕获专家评判逻辑而非依赖单一分数。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 评估将方差感知 rubric 奖励引入团队 RLHF 流程的可行性,重点关注多维评分任务场景 |
| 应用工程师 | 在医疗 QA、评审类应用开发中,采用细粒度 rubric 替代单一评分来设计评估标准 |
| 运维 / 平台 | 暂无直接影响,了解即可 |
| 产品 / 业务 | 暂无直接影响,了解即可 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5