十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

pypto-gym 开源仓测试报告解读:CANN 9.1.0 下 82 算子与 10 模型的全量质量验证

pypto-gym 开源仓测试报告解读:CANN 9.1.0 下 82 算子与 10 模型的全量质量验证 pypto-gym 开源仓测试报告解读CANN 9.1.0 下 82 算子与 10 模型的全量质量验证【免费下载链接】community本项目是CANN开源社区的核心管理仓库包含社区的治理章程、治理组织、通用操作指引及流程规范等基础信息项目地址: https://gitcode.com/cann/community本文基于 CANN 社区 pypto-gym仓开源测试报告 展开对 pypto-gym 开源仓在 CANN 9.1.0 版本下的开源演练测试进行完整解读。报告以快速搭建开发环境、执行算子与模型测试为目标通过 UT/ST 全量算子验证、全量模型验证、泛化精度验证与性能验证四类测试任务覆盖 82 个算子与 10 个模型场景全部通过并达到出口质量标准。读完本文你可以完整掌握 pypto-gym 仓的测试范围、测试方法、关键算子与模型清单以及泳道图与 profiling 双口径性能评估的实操口径。1. 被测对象pypto-gym 与 PTO SIGpypto-gym 是 CANN PTO SIG 负责维护的开源仓库之一。PTOParallel Tensor/Tile Operation是 CANN 推出的面向 AI 加速器的高性能编程系统包含PyPTO 编程框架与PTO 虚拟指令集两部分其定位是以基于 Tile 的编程模型为核心通过多层次计算图表达将 AI 模型应用从高层计算图逐步编译为 PTO 虚拟指令最终生成目标平台上高效执行的代码详见 pto SIG 介绍。从 pto SIG 仓库清单 可以看到该 SIG 维护三个仓库cann/pyptoPyPTO 编程框架提供基于 Python 的高性能算子开发框架与 Tile 编程模型cann/pypto-gym本次测试报告的被测对象负责算子与模型的验证/演练能力cann/pto-isaPTO 虚拟指令集规范提供硬件无关的指令抽象。cann/pypto-gym在 sig-info.yaml 中配置了独立的 committer 列表foundea、jason_yuan_ye、DCGDDD、tsungl4、gaoxingwang 等表明其作为独立开源仓进行治理与演进。本测试报告即该仓开源演练阶段的出口质量验证测试结果将作为 QA-SIG 评审归档的依据。2. 测试概述与版本环境2.1 测试目标报告第 1 章明确了本次演练测试的核心目标基于 pypto-gym 开源仓提供的能力验证快速搭建开发环境、执行算子与模型测试。即该仓对外承诺的能力链路是开箱搭建环境 → 运行算子测试 → 运行模型测试测试报告围绕这条链路验证其可用性与正确性。2.2 版本测试信息项内容产品型号A2/A3操作系统x86 / arm64CANN 版本9.1.0Python 版本Python 3.13从该表可以看出测试覆盖了 A2 与 A3 两代硬件产品以及 x86 与 arm64 两种主流通用计算架构组合Python 3.13 为当前主流新版本运行时环境。这四项信息共同构成被测环境基线后续所有测试结论均在该环境下得出也是用户复现测试时的前提条件。3. 测试总体结论报告第 3 章给出的总体结论为基于 9.1.0 版本共计执行 4 项测试任务覆盖 82 个算子和 10 个模型场景遗留问题均已闭环。整体质量良好满足出口质量标准。4 项测试任务即报告第 4 章的四个特性质量评估项全量算子 UT/ST 测试、全量模型测试、主要算子泛化精度测试、主要算子性能测试。这一结论表明 pypto-gym 仓在当前版本达到了社区开源仓的出口质量要求可以对外发布。4. 特性质量评估4.1 全量算子 UT/ST 测试UT/ST 即单元测试Unit Test与系统测试System Test是算子验证的两层基础手段。报告对代码仓全量算子逐一执行 UT/ST 验证模型/场景算子数量通过率qwen3_next1100%minimax_m271100%chunked_gdr1100%glm_v4_57100%deepseek_v47100%llada2_moe2100%deepseek_v32_exp6100%spatial_ssrl_3b2100%qat1100%deepseek_v2_lite_chat1100%qwen3_6_27b1100%qwen3_5_9b1100%arctic1100%phi_3_mini_4k_instruct1100%qwen3_1_7b1100%gutenocr_3b2100%gemma4_31b2100%experimental44100%总计82100%可以看到82 个算子按其所服务的模型/场景进行分组覆盖了 Qwen、GLM、DeepSeek、MiniMax、Arctic、Phi、Gemma 等主流大模型衍生场景以及 44 个 experimental实验性算子。experimental 类算子数量占比超过一半反映该仓承担了大量新算子探索与验证的职责且这些实验性算子在本次版本中同样达到 100% 通过率。4.2 全量模型测试模型级验证用于确认算子在真实模型样例中可端到端运行报告选取 10 个模型样例验证其典型融合组件组合模型融合组件验证结果qwen3_1_7brms norm rope通过phi_3_mini_4k_instructmla通过qwen3_vl_8b_instruct_unredacted_maxGQA通过spatial_ssrl_3brope rms norm通过gutenocr_3brope rms norm通过qwen3_5_9bGDR通过gemma4_31b_itSoftmax, GQA通过llada2_moeGrouped GEMM通过qwen3_6_27bGDR通过deepseek_v2_lite_chatmla通过10 个模型样例全部通过通过率 100%。模型清单与 4.1 节中的算子分组高度对应体现了算子分组 → 模型样例的自洽验证体系。从融合组件角度看这些组件覆盖了当前大模型推理/训练的核心计算热点rms norm rope / rope rms normRMSNorm 归一化与 RoPE 旋转位置编码的组合是 Qwen 系模型的标准组件搭配mlaMulti-head Latent AttentionDeepSeek 系列采用的 MLA 注意力结构deepseek_v2_lite_chat、phi_3_mini_4k_instruct 场景GQAGrouped Query Attention 分组查询注意力在 qwen3_vl 与 gemma4 系列中验证GDR 与 chunked_gdr报告中以代号形式出现的融合组件在 qwen3_5_9b、qwen3_6_27b 中验证其精确语义以 pypto-gym 仓内实现为准Grouped GEMM分组矩阵乘对应 MoE 类模型llada2_moe的分组专家计算SoftmaxAttention 归一化在 gemma4_31b_it 中与 GQA 组合验证。4.3 主要算子泛化精度测试在 UT/ST 基础上报告进一步选取 34 个高优先级算子开展泛化精度验证通过大规模 case 矩阵检验算子在不同 shape、不同输入分布下的精度稳定性场景算子数量case 数量通过率DeepSeek65863100%GLM84163100%Operator7582100%GreenLight131315100%总计3411923100%34 个算子共构造 11923 个泛化 case全部通过。其中 DeepSeek 与 GLM 场景的 case 数量占比最高合计超过一万个说明这两个模型系列算子是泛化验证的重点GreenLight 场景承载 13 个算子的验证是 case 密度最高的分组。泛化测试的通过率为 100%为算子精度质量提供了大数据量支撑。4.4 主要算子性能测试性能验证选取 12 个 Top 算子构造低时延、高吞吐、预训练、后训练等不同场景 case从**泳道图swimlane**与profiling两种采集口径给出性能结果算子名场景数量ASC/AICoreASC/Profinplace_add_rmsnorm40.540.46mla_prolog_v320.750.68mla_prolog_v3_quant20.660.59interleave_rope40.690.5sparse_flash_attn_antiquant40.690.63sparse_flash_attn40.820.73glm_attention40.580.52flash_attention_mha20.60.26flash_attention_mha_grad20.420.27mhc_post20.60.32apply_adam20.770.73incre_flash_attention_mla40.530.51平均-0.640.52表中的 ASC 即 AscendC 基线实现对比基准。从表格结构与报告结论可以推断数值表示被测 PyPTO 算子与 AscendC 算子的耗时比值PyPTO/AscendC其中ASC/AICore为基于泳道图工具采集的 AICore 核侧耗时口径ASC/Prof为基于 profiling 工具采集的整体耗时口径。12 个算子平均耗时比为 0.64泳道图口径与 0.52profiling 口径即被测场景下 PyPTO 算子整体耗时低于 AscendC 基线实现报告结论为符合预期。需要说明的是性能比值与算子类型、场景构造强相关例如 flash_attention_mha_grad 在 profiling 口径下达到 0.27而 sparse_flash_attn 为 0.73不同算子存在明显差异对比时应以同场景、同口径为前提。PyPTO 框架本身提供了泳道图swimlane与 profiling 相关的工具链支撑——在 pto SIG 仓库清单 中可以看到tools/gen_swimlane.sh泳道图生成脚本与tools/profiling目录被划入 machine 组件进行治理说明该性能评估口径在框架层面有配套工具落地。5. DFX 专项质量评估报告第 5 章对四项 DFX 专项给出了明确结论专项结论安全测试本次演练不涉及可靠性测试该仓不涉及性能测试该仓不涉及兼容性测试本次演练不涉及DFX 各项标注不涉及与 pypto-gym 仓的开源演练定位一致本次演练聚焦功能正确性与性能基线建立性能验证已在 4.4 节作为特性质量评估项完成安全、可靠性、兼容性等专项待后续版本按需纳入。报告对每项均给出不涉及的具体理由避免空泛结论保持了测试结论的可追溯性。6. 测试执行评估与测试覆盖报告第 6 章给出了测试覆盖总表测试活动测试结论用例数用例通过率特性测试pass82100%资料测试pass1100%可靠性测试NANANA继承特性测试NANANA兼容性测试NANANA安全测试NANANA测试覆盖情况与第 5 章 DFX 结论保持一致本次演练实际执行的测试活动为特性测试82 个用例对应 82 个算子的 UT/ST与资料测试1 个用例对应开源仓文档/资料的准确性验证其余专项活动标记为 NA。特性测试与资料测试通过率均为 100%。7. 遗留问题与关键风险报告第 7 章结论为不涉及第 9 章附件同样为不涉及。这对应第 3 章总体结论中的遗留问题均已闭环——本次演练过程中发现的问题已在测试期间全部关闭无阻塞性遗留问题与关键风险为满足出口质量标准的结论提供了直接依据。8. 总结一份可复现、可追溯的开源仓测试报告结合本报告可以归纳出 pypto-gym 仓开源演练测试的完整方法链环境基线先行明确 A2/A3、x86/arm64、CANN 9.1.0、Python 3.13 的版本组合保证测试可复现算子与模型双线验证82 个算子 UT/ST 10 个模型样例验证从算子到模型端到端链路精度用规模说话34 个高优先级算子、11923 个泛化 case以大数据量支撑精度结论性能双口径评估泳道图AICore 核侧与 profiling整体两种采集口径交叉验证 12 个 Top 算子并对标 AscendC 基线结论分级透明DFX 专项明确标注不涉及范围遗留问题与附件如实说明无模糊表述。从报告治理角度看该文档遵循了社区统一的测试报告模板结构概述、版本信息、测试结论、特性质量评估、DFX 专项、测试执行评估、遗留问题、附件模板定义可参考 测试报告模板。同时测试报告归档说明 规定仓开源测试报告需经 QA-SIG 会议评审由 Maintainer 与 Committer 在 PR 上检视并完成问题闭环后归档。因此本文解读的这份报告不仅是 pypto-gym 仓的质量凭证也是 CANN 社区谁开发谁测试、评审归档闭环机制的落地样例。对于希望了解或贡献 PyPTO 生态的开发者可将本报告作为评估 pypto-gym 仓当前能力基线算子清单、模型支持面、性能水平的第一手资料再结合 pto SIG 介绍 中的仓库清单与贡献指南深入实践。【免费下载链接】community本项目是CANN开源社区的核心管理仓库包含社区的治理章程、治理组织、通用操作指引及流程规范等基础信息项目地址: https://gitcode.com/cann/community创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表