十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

POLARIS 是什么?开源后训练配方如何让4B小模型在AIME上超越Claude-4-Opus

POLARIS 是什么?开源后训练配方如何让4B小模型在AIME上超越Claude-4-Opus POLARIS 是什么开源后训练配方如何让4B小模型在AIME上超越Claude-4-Opus【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS2025年开源AI圈迎来一个令人震撼的结果一个仅有40亿参数4B的推理模型竟然在AIME 2025数学竞赛评测中拿下79.4分一举超越 Claude-4-Opus75.5、Grok-3-Beta77.3和 o3-mini-high73.0等顶级商业模型。创造这一成绩的正是POLARIS——一个完全开源的强化学习后训练配方由香港大学 NLP 实验室与字节跳动 Seed 团队联合推出。本文用最简单的方式带你读懂 POLARIS 是什么、它为什么能赢以及普通人如何复现这套神奇的后训练流程。一、POLARIS 是什么一个开源的 RL 后训练配方POLARISPOst-training recipe for scaling Reinforcement Learning on Advanced Reasoning modelS本质上是一套完整的强化学习RL后训练方法论它不训练全新的模型而是把已经具备推理能力的开源模型如 Qwen3-4B再炼一层通过强化学习让它们的推理水平再上一个台阶。它的核心价值在于完全开源、可复现训练数据、代码、脚本、评估流程全部公开。整个项目以 verl 训练框架为底座奖励函数设计参考了 DeepScaleR模型基座是 Qwen3 系列与 DeepSeek-R1-Distill 系列。上图可以直观看到红色条形代表的 Qwen3-4B 原生模型只有 65.6 分经过 POLARIS 后训练后飙升至79.4 分仅用 4B 参数就超越了众多数百亿乃至千亿参数级的商业闭源模型。二、核心亮点4B 小模型的逆袭之路惊人的性价比32块GPU、10天训练POLARIS-4B-Preview 的训练成本低得惊人在 32 块 H800 GPU 上训练约 10 天每步约 0.33 小时batch size 为 128、rollout size 为 8。相比动辄上千卡训练数周的商业闭源模型这个成本对学术团队和个人研究者都非常友好。效果提升有多夸张模型AIME24 avg32AIME25 avg32Qwen3-4B原始73.865.6POLARIS-4B-Preview81.279.4Claude-4-Opus—75.5Grok-3-Beta—77.3除了 AIMEPOLARIS 在 Minerva、Olympiad Bench、AMC23 等数学基准上也全面领先验证了这套配方的普适性。三、POLARIS 后训练配方的三个秘密武器1. 三阶段渐进式训练从宽到深POLARIS 没有使用一把梭式的单轮训练而是设计了stage1 → stage2 → stage3 三阶段配方每个阶段的训练数据、采样温度和最大响应长度都在动态演进Stage 1在 5.3 万条精选数学题上训练采样温度 1.4最大响应长度 39936 tokenStage 2温度提升至 1.45响应长度扩至 48128 tokenStage 3温度达 1.5响应长度增至 52224 token对应脚本都在 scripts/train/qwen3-4b/ 目录下如 stage1.sh、stage2.sh、stage3.sh每阶段还会用 verl/scripts/model_merger.py 把上一阶段的 checkpoint 转成 HF 格式继续训练。2. 难度自适应数据过滤丢掉送分题训练数据的质量直接决定 RL 效果。POLARIS 团队从 DeepScaleR 和 AReaL 等公开数据集过滤出5.3 万条高难度题目polaris-data-53K.parquet并且在每一阶段训练后通过 drop_easy_data.py 自动剔除模型平均得分超过 0.9 的已掌握题目让模型始终在跳一跳才够得着的难度区间中持续进步。3. 温度搜索与长思维链评估POLARIS 提出了两个容易被忽视的工程细节解码温度评估时建议使用比 Qwen3 默认更高的温度0.6 →1.4通过 search_optimal_temperature.py 可以自动搜索每个阶段 checkpoint 的最优温度超长响应推理响应长度建议超过64K token避免截断导致性能回退到原始模型水平。四、奖励函数如何给数学推理打分RL 后训练离不开一个可靠的裁判。POLARIS 的数学奖励函数实现在 deepscaler/rewards/math_reward.py 中它会从模型输出中提取最终答案先用 sympy 和字符串归一化做快速判定若规则判定失败再调用 LLM 作为 ORMOutcome Reward Model二次确认兼顾了速度与准确率。五、普通人如何复现 POLARIS项目把复现门槛降到了最低你只需几行命令cd POLARIS pip install -e ./verl pip install -e ./ pip install transformers4.51.0 pip install vllm0.8.4然后直接运行单机训练脚本即可启动 stage1./scripts/train/qwen3-4b/stage1.sh \ --model /path/to/qwen3-4b \ --data_path parquet/stage1/qwen3-4b-s1.parquet \ --experiment_name qwen3-4b-stage1评估也极其简单一条命令即可在 AIME 上打分再通过 evaluation/grade.py 完成判分python scripts/eval/eval_vllm_aime24.py \ --model /path/to/model --n 32 --max_length 90000 --k 20 --t 1.4六、总结小模型 好配方 大突破POLARIS 告诉我们一个朴素的道理在推理能力面前模型大小不是唯一的决定因素。通过精心设计的强化学习后训练配方——三阶段训练、难度自适应数据、温度搜索、长思维链评估——一个 4B 小模型也能在 AIME 上超越千亿参数级的商业闭源模型。对于研究者POLARIS 是一份可以逐行复现的炼金术手册对于普通开发者它证明了开源生态正在以极低成本逼近甚至超越闭源巨头的推理上限。如果你也想亲手训练一个能思考的数学推理模型从 clone 这个仓库、跑通第一个 stage 开始吧【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表