论文arxiv cs.CL · 1mo ago重要

POLARIS: Guiding Small Models to Write Long Stories

分类释义:学术论文 / 技术报告

TL;DR

POLARIS 是一种针对小模型的训练方法,通过 LLM-as-judge 奖励信号和人类参考文本注入,让 Qwen3.5-9B 在长篇故事生成上达到接近 27B 参数模型的效果,且在训练长度 3 倍时仍保持质量。

关键要点

  • 01POLARIS 是一种针对小模型的训练方法
  • 02通过 LLM-as-judge 奖励信号和人类参考文本注入
  • 03让 Qwen3.5-9B 在长篇故事生成上达到接近 27B 参数模型的效果
  • 04且在训练长度 3 倍时仍保持质量
为什么值得关注

工程师可借鉴「长度泛化」作为长文本模型的评测维度,以及用小规模高质量数据和 GRPO + HRI 策略低成本微调小模型的方法。具体产品创意:构建一个能生成长达 3 万字连贯故事的轻量级写作助手。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead将「长度泛化」纳入长文本模型的评测体系,制定对应的 benchmark 和验收标准
应用工程师验证 GRPO + HRI 策略在自有数据集上的效果,用 9B 模型做 POC 降低试错成本
运维 / 平台评估 9B 模型 vs 27B 模型的推理成本差异,按 3 倍训练长度估算显存和吞吐需求
产品 / 业务调研用户对 3 万字连贯长篇的需求场景,评估是否值得单独包装为产品功能
阅读原文 ↗来源:arxiv cs.CL

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5