拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

UltraData-RL-2609数据构建流水线揭秘:从原始数据到RL-ready样本的6个阶段

UltraData-RL-2609数据构建流水线揭秘:从原始数据到RL-ready样本的6个阶段 UltraData-RL-2609数据构建流水线揭秘从原始数据到RL-ready样本的6个阶段【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609UltraData-RL-2609 是 OpenBMBMiniCPM 团队面向大模型强化学习RL后训练发布的 RL 数据集共 85,995 条可验证任务样本覆盖数学、代码、长上下文与科学推理四大领域。它的核心价值在于一条六阶段数据构建流水线从原始数据整合、标准化改写到可验证性过滤、奖励可信性校验、难度校准最终整理为统一的 RL-ready 样本。本文将完整拆解这条流水线的每个阶段帮助你理解高质量 RL 训练数据是如何炼成的。 数据全景4 大领域85,995 条样本领域样本数占比任务类型结果如何验证Math32,41237.7%竞赛 / 教材类数学题答案唯一可抽取与参考答案做答案匹配Code23,66527.5%按自然语言描述生成程序用测试用例执行提交代码Long-Context18,04621.0%长文档多跳问答答案匹配且上下文保证支撑答案Knowledge11,87213.8%科学 / 知识推理简答题与参考答案做答案匹配数据围绕三个目标构建结果可判定verifiable、奖励可信trustworthy、难度适配calibrated让策略模型获得稳定、可追溯的训练信号。各领域的原始数据文件可按目录浏览data/Math/、data/Code/、data/Long_Context/、data/Knowledge/。️ 六阶段构建流水线全拆解四个领域共用同一套六阶段流程只是在各环节使用领域专属的验证器与筛选规则。阶段 1 · 数据准备与来源整合按领域汇聚上游公开数据集与合成数据MathDAPO、DeepScaleR、DeepMath 三个公开可验证数学 RL 数据集取并集Knowledge / STEMOpenScienceReasoning-2 科学推理数据Long-ContextHotpotQA、Qasper、MuSiQue 多跳问答扩写至更长上下文并加入内部合成数据CodeOpenCodeReasoning、OpenCodeReasoning-2 与 HardTests 竞赛题配合合成测试用例。阶段 2 · 任务形式标准化与改写按训练器和验证器的要求统一任务格式、答案字段与元数据领域标准化做法Math / Knowledge改写为简答题形式Long-Context扩展上下文同时保持问题与参考答案的对应关系Code统一 query 表述、输入输出约定与提交格式阶段 3 · 可验证性过滤只保留答案唯一、可自动校验、抽取格式统一的样本。选择题、判断题、证明题、多问题以及依赖图片的题目都在这一阶段被移除。Long-Context 样本必须有明确的上下文—问题—答案关联Code 样本则必须能在沙箱中通过测试用例执行。阶段 4 · 奖励可信性校验这是奖励信号可靠的关键一环LLM Judge审核题目与答案的一致性Math / Knowledge 由多个独立模型重新求解按共识修正标签——无共识则直接丢弃不做猜测Long-Context 采用参考答案比对 多模型质量评估Code 对测试用例、参考实现与预期输出做三方交叉验证无效或无法执行的用例一律移除。阶段 5 · 难度校准在 RL 初始化 checkpoint 上对每条样本多次 rollout估算经验通过率并据此分层处理通过率 1已完全掌握、无梯度收益→ 移除处于可学习区间→ 保留通过率 0 但标签已确认合法→ 保留交由在线动态采样调控训练频率。注意本阶段只改变难度与采样权重绝不修改参考标签——难度筛选动分数、不动答案。阶段 6 · 格式整理与质量复核导出为统一 JSONL并做发布前最后一道体检检查可解析性、必需字段、唯一 ID、抽取规则与验证器配置清理精确 / 近似重复样本以及与公开评测集重叠的样本去污染复核各领域关键属性Math / Knowledge 答案唯一性、Long-Context 上下文关联、Code 测试用例可执行性记录数据来源、筛选版本与验证器版本保证全程可追溯。 最终成果统一的五字段 JSONL 格式每条样本一行五个字段即可驱动整个 RL 训练循环{ uuid: Math_00001, query: ……完整的题面……, ground_truth: ……参考答案……, source: 原始来源 | UltraData-RL-2609, domain: Math }字段说明uuid全局唯一 ID由领域前缀 序号组成query模型要回答的完整任务长文本任务的上下文和问题都在此字段ground_truth参考答案字符串Code 领域为测试用例对象source原始来源信息domainMath/Knowledge/Long_Context/CodeCode 领域的ground_truth特别值得一提它是一对等长数组inputs/outputs验证完全基于真实执行——把输入喂给候选程序比对标准化后的输出全部测例通过才计为正确。例如两组测例的形式{inputs: [3\n1 2 3\n, 1\n5\n], outputs: [6\n, 5\n]}这种以执行判对错的设计让代码任务的奖励信号几乎不存在歧义。 实战效果AIME 2025 从 61 到 86这套数据的成色有实打实的成绩单背书在 JustRL II 实验设置小模型 critic 的 128K 推理 RL中AIME 2025 在约 300 步 RL 内从 61 提升到 81最终消费该数据集完成后训练的 MiniCPM5-2B checkpoint 在 AIME 2025 上达到86。可验证、可追溯的训练信号正是稳定 RL 的基石。 快速上手指南数据集提供四个 config用 Hugging Facedatasets库即可加载from datasets import load_dataset ds load_dataset(openbmb/UltraData-RL-2609, Math, splittrain) # 也可用 Knowledge / Long-Context / Code仓库内同样提供完整的本地分片文件例如 Math_part-1-of-4.jsonl、Code_part-01-of-12.jsonl、Knowledge_part-1-of-2.jsonl、Long_Context_part-1-of-2.jsonl可结合 README_ZH.md 中的说明直接使用。⚠️ 使用注意事项Code 需自备验证器发布内容包含测试用例但不含沙箱需自行执行提交代码计算奖励静态标签构建时的难度过滤与采样权重不作为字段发布只保留最终入选样本去污染范围有限仅覆盖构建时已知的评测集引入新基准前建议另行检测。✅ 小结UltraData-RL-2609 用一条可判定 → 可信 → 难度适配 → 规范化发布的六阶段流水线把多源原始数据打磨成 85,995 条 RL-ready 样本。它的流水线设计——尤其是多模型共识校验与只调权重不改标签的难度校准原则——对任何想做 LLM RL 后训练的团队都有直接参考价值。项目按 Apache 2.0 许可发布更多细节可参阅 README.md。【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表