拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

UltraX-Preview五大数据集怎么选?UltraX-FineWeb vs AICC vs RedPajama完整选型清单

UltraX-Preview五大数据集怎么选?UltraX-FineWeb vs AICC vs RedPajama完整选型清单 UltraX-Preview五大数据集怎么选UltraX-FineWeb vs AICC vs RedPajama完整选型清单【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview 预训练数据不知道选哪个OpenBMB 开源社区的UltraX-Preview给出了答案这是一个基于**自适应程序化编辑函数调用式精炼**的大规模预训练数据集合集包含5 个英文精炼语料UltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc每个约20B tokens。本文提供一份完整的 UltraX-Preview 五大数据集选型清单帮新手 3 分钟选对预训练语料。一、先认识 UltraX-Preview它精炼了什么东西传统的数据清洗靠规则过滤端到端 LLM 改写则成本高且不稳定。UltraX 走了一条新路训练一个轻量精炼模型为每条样本预测结构化编辑操作keep_all保留、remove_all丢弃、remove_lines删行、replace_str替换、add_line插入编辑操作确定性执行在原始文本上逐条instance-wise精炼而非整段重写配合 LAM行级对齐映射 DCR动态上下文替换流水线保证大规模执行可靠每个数据集的 parquet 文件都同时保留了精炼前raw_content和精炼后cleaned_content的文本方便你做对比实验。二、五大数据集一览表来源、规模、特点数据集源语料数据目录分片数特点UltraX-FineWebFineWebdata/UltraX-FineWeb/104大规模 Common Crawl 网页语料通用首选UltraX-RedPajama-V2RedPajama-v2data/UltraX-RedPajama-V2/110多源混合网页语料覆盖面广UltraX-AICCAICCdata/UltraX-AICC/61HTML 解析的高保真网页语料UltraX-Ultra-FineWebUltra-FineWebdata/UltraX-Ultra-FineWeb/104质量过滤后的 FineWeb底子更干净UltraX-FineWeb-ProX-DocFineWeb-ProX-Docdata/UltraX-FineWeb-ProX-Doc/100文档级精炼语料长文档友好 分片数不同是因为各源语料的单文件大小和总量不同例如 AICC 单片约 1.1GB不代表质量差异五个数据集规模都在 20B tokens 量级。三、快速选型清单按需求直接抄作业 需求 A通用网页预训练图省事→ 选UltraX-FineWeb。FineWeb 是当前最主流的大规模 Common Crawl 网页基准语料官方 1B 模型预训练实验中 UltraX 版本在 FineWeb 上数据效率最高仅用 16B tokens 就超过了原始语料Raw和 ProX-C 用满 20B tokens 的成绩。 需求 B追求更高数据质量上限→ 选UltraX-Ultra-FineWeb。它在已做质量过滤的 Ultra-FineWeb 基础上再叠加 UltraX 精炼属于精上加精适合预算有限、想用小数据量博取更好效果的场景。 需求 C多源混合、内容多样性优先→ 选UltraX-RedPajama-V2。RedPajama-v2 本身融合多个来源语料分布更杂适合训练目标场景不明确、希望模型见多识广的通用底座。 需求 D高保真网页解析、结构化内容多→ 选UltraX-AICC。AICC 以 HTML 解析出的高保真文本著称页面噪声少适合对文本结构如列表、表格类内容敏感的任务。 需求 E长文档、文档级任务→ 选UltraX-FineWeb-ProX-Doc。源自 ProX 的文档级精炼语料在文档粒度的质量把控上更有优势。四、数据格式5 列 parquet怎么读每个分片文件如 UltraX-AICC-en-part-0001-of-0061.parquet都是标准 parquet 格式包含 5 列列名类型说明uidstring唯一标识raw_content的 MD5 哈希raw_contentstring精炼前的原始文本cleaned_contentstring经 UltraX 精炼后的文本processed_functionsstring实际执行的编辑操作记录sourcestring源语料名称这种原始 精炼 操作日志的三元组设计是 UltraX 的一大亮点你不仅拿到干净数据还能审计每条数据被怎么改过复现性和可控性远超黑盒改写。五、快速上手一行代码加载指定数据集本地克隆仓库后数据文件走 LFS加载只需替换 config 名称from datasets import load_dataset # 五个数据集只改中间的 config 名 ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain)五个可选 configUltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc。更多用法细节可参考仓库内的 README.md 与 README_ZH.md。六、效果速览官方 1B 模型预训练评估官方用 1B 参数 MiniCPM 模型在每个语料的 20B tokens上从零预训练并在 10 个基准MMLU、HellaSwag、ARC、PIQA 等零样本评估✅ UltraX 精炼版在全部五个语料上平均性能第一50 个任务 × 语料组合中拿下 34 个最佳✅ 相比原始语料Raw平均相对提升约2.00%相比 ProX-C 提升约1.53%✅ FineWeb 上 16B tokens 即超越 Raw / ProX-C 跑满 20B tokens 的最终成绩数据效率显著更高简单说同样的算力预算换用 UltraX 精炼语料 少训 20% 数据还更强。⚡七、常见疑问 FAQQ1五个数据集能混着一起用吗可以。它们的列结构完全一致同为 5 列按需混合多源语料做课程学习或配比实验是常见做法source列可帮你按来源采样。Q2只想拿精炼后的干净文本训练用哪一列直接取cleaned_content即可做消融实验时再对比raw_content。Q3许可证要注意什么本项目按 Apache 2.0 发布见 LICENSE但各语料源FineWeb、RedPajama-v2、AICC 等有各自的许可条款商用前请逐一核查源数据集的 License。同时项目禁止未经授权的原样二次分发与镜像托管。Q4分片文件很多61/100/104/110 个下载太慢怎么办按需只拉取需要的分片即可例如只做小规模验证时取几个 part 就能跑通全流程。一句话总结通用选 FineWeb求质选 Ultra-FineWeb求多源选 RedPajama-V2求高保真选 AICC求长文档选 ProX-Doc —— 五选一复制上面的加载代码即可开训。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表