论文arxiv cs.CL · 1mo ago重要
POLARIS: Guiding Small Models to Write Long Stories
分类释义:学术论文 / 技术报告
TL;DR
POLARIS 是一种针对小模型的训练方法,通过 LLM-as-judge 奖励信号和人类参考文本注入,让 Qwen3.5-9B 在长篇故事生成上达到接近 27B 参数模型的效果,且在训练长度 3 倍时仍保持质量。
关键要点
- 01POLARIS 是一种针对小模型的训练方法。
- 02通过 LLM-as-judge 奖励信号和人类参考文本注入。
- 03让 Qwen3.5-9B 在长篇故事生成上达到接近 27B 参数模型的效果。
- 04且在训练长度 3 倍时仍保持质量。
为什么值得关注
工程师可借鉴「长度泛化」作为长文本模型的评测维度,以及用小规模高质量数据和 GRPO + HRI 策略低成本微调小模型的方法。具体产品创意:构建一个能生成长达 3 万字连贯故事的轻量级写作助手。
对你的工程实践意味着什么
LLM 实时生成MiniMax-M2.7缓存命中
| 角色 | 你应该做什么 |
|---|---|
| Tech Lead | 将「长度泛化」纳入长文本模型的评测体系,制定对应的 benchmark 和验收标准 |
| 应用工程师 | 验证 GRPO + HRI 策略在自有数据集上的效果,用 9B 模型做 POC 降低试错成本 |
| 运维 / 平台 | 评估 9B 模型 vs 27B 模型的推理成本差异,按 3 倍训练长度估算显存和吞吐需求 |
| 产品 / 业务 | 调研用户对 3 万字连贯长篇的需求场景,评估是否值得单独包装为产品功能 |
同类资讯
本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5