十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

实测报告:Maka Agent在Terminal-Bench 2.1上表现如何?AI Agent评测深度解读

实测报告:Maka Agent在Terminal-Bench 2.1上表现如何?AI Agent评测深度解读 实测报告Maka Agent在Terminal-Bench 2.1上表现如何AI Agent评测深度解读【免费下载链接】makaApache Maka (Incubating) is a local-first AI agent workspace. Model messages, tool calls, tool results, permission decisions, and termination events are recorded as an append-only log.项目地址: https://gitcode.com/GitHub_Trending/mak/makaApache Maka 是一个本地优先local-first的 AI Agent 工作空间它把模型消息、工具调用、权限决策和终止事件都记录为只追加的运行日志。最近项目团队用统一的 DeepSeek V4 Flash 模型在业界权威的Terminal-Bench 2.1基准89 个真实终端任务上对 Maka 与 Codex、Claude Code、Reasonix、OpenCode 等主流 Agent 框架做了严格的同模型横评。结果显示Maka 拿下 73.03% 的端到端通过率成本效率全场第一——这份报告值得每个关心 AI Agent 的人读一读。一、Terminal-Bench 2.1 是什么为什么 AI Agent 评测要看它Terminal-Bench 2.1 是目前衡量 AI Agent 真实干活能力的主流基准之一。它不像跑分那样喂模型选择题而是给 Agent 一个完整的容器环境让它独立完成89 个真实任务编译 Cython 扩展、修复 Git 仓库、做 DNA 序列组装、写 MIPS 解释器、破解 7z 哈希……每个任务都有官方的验证器verifier做最终判定通过与否不由模型自己说了算。这正是它的价值所在在聊天界面里说得漂亮和在终端里真能把活干完是两回事。对普通用户来说选 AI Agent 工具时最关心的三个问题这个基准恰好都能回答能不能做成→ 端到端 pass1 通过率做得快不快→ 每个任务的耗时与时间预算消耗贵不贵→ 每个成功任务的 API 成本二、实验设计同一模型、同一环境只换框架理解这份报告关键在它的实验方法。团队在报告中反复强调四个手臂arm用的是同一个 DeepSeek V4 Flash 模型、同一份任务容器、同一个包镜像、同一套截止时间策略唯一的变量就是 Agent 框架本身。这套设计由项目自带的评测框架maka/eval驱动源码位于 packages/eval/ 目录它保证了实验维度统一配置模型DeepSeek V4 Flash四臂相同推理强度max四臂相同基准Terminal-Bench 2.1 全部 89 个任务截止时间任务原生的 agent 超时 ×1计分官方验证器的配对 pass1网络出口统一 egress 代理屏蔽基准答案类 URL 防止作弊换句话说这不是一场模型大战而是一场Agent 框架的底盘对比同样的发动机模型不同的底盘上下文管理、工具循环、执行策略谁把性能发挥得更好。三、核心结果Maka 73.03%与第一名差距不显著四臂对比的完整数据运行 IDdeepseek-v4-flash-4arm-tbench-2.1-full-v1Agent 框架端到端通过率通过/总任务预算耗尽Codex78.65%70 / 899Maka73.03%65 / 8911Claude Code64.04%57 / 8924Reasonix61.80%55 / 8913初看 Codex 领先但报告紧接着给出了两个更重要的解读1️⃣ 差距没有统计学意义。用精确 McNemar 检验配对比较Codex 对 Maka 的 p 值为0.359——远未达到 0.05 的显著性门槛。19 个胜负分歧任务里 Codex 赢了 12 个、Maka 赢了 7 个这个 5 个任务的差距完全在基准的运行噪声范围内。2️⃣ 噪声有多大团队用一次独立的前次运行做了对照配置完全相同的 Codex 臂两次运行之间有19% 的任务结果发生了翻转而净分只移动了 3 个。也就是说这套基准里约五分之一的结果是由运气决定的。在这个噪声地板上任何5 个任务以内的差距都不该被当成定论——包括 Maka 与 Codex 之间的差距。四、成本效率Maka 是全场最便宜的成功如果说通过率是面子成本就是里子。报告统计了每个成功任务的 API 等效成本Agent 框架每通过一个任务的成本Maka$0.03215全场最低Codex$0.03339Reasonix$0.04051Claude Code$0.04800Maka 仅用Codex 61% 的输入 token1.81 亿对 2.95 亿就拿下了其 93% 的得分总花费 $2.09 对 $2.34。Maka 比 Claude Code 每个任务便宜 49%——对于要跑批量任务的重度用户这笔账相当可观。五、速度拆解中位数最快但长尾是短板耗时数据呈现出一个有趣的双面画像Agent 框架中位数耗时平均耗时中位数时间预算消耗Maka332.8 s最快693.1 s0.309Codex411.7 s582.8 s0.303Reasonix428.7 s658.2 s0.363Claude Code544.7 s840.2 s0.416典型任务上 Maka 干得最快但它每次请求的思考量更大每请求 778 个推理 tokenCodex 只有 543 个步数更少更重。这种形态在硬截止时间下有风险比如write-compressor任务Maka 花了 900 秒预算里的 890 秒在模型推理上最终时间耗尽而 Codex 用更细碎的 66 步在 540 秒内完成。报告给出的失败归因非常坦诚Maka 输给 Codex 的 12 个独占任务中8 个是答案不对被验证器打回verification failure只有 4 个是时间耗尽。也就是说差距的三分之二是正确性问题而不是速度问题——这是速度统计单看不出来的结论。另一个有意思的细节在所有任务都没耗尽预算的 60 个子集上前三名顺序反转了——Claude Code 90.00%、Codex 88.33%、Maka 86.67%。Claude Code 总榜垫底的原因是它在 26.97% 的任务上烧光了时间预算超过其他任何手臂的两倍。决定排名的往往不是能不能解出来而是能不能在截止时间前收工。六、与 OpenCode 对打Maka 13.48 个百分点的显著优势除了四臂对比团队还做了一组 Maka vs OpenCode 的双臂评测89 个任务全量结果MakaOpenCode端到端通过率61/8968.54%49/8955.06%预算耗尽率15/8916.85%24/8926.97%每通过任务成本$0.03172$0.03171这一次 Maka 的领先通过了显著性检验McNemar 检验 p 0.0118 0.0516 个Maka 独有通过对 4 个OpenCode 独有通过。成本上两者几乎完全持平说明 Maka 的优势来自更低的预算耗尽率16.85% 对 26.97%而非更低的单价。七、普通用户该如何看这份 AI Agent 评测报告结合两组数据可以提炼出四条实用结论Maka 属于第一梯队。73.03% 的通过率与头名 Codex 在统计上不可区分领先 Claude Code 约 9 个百分点且执行干净89 个任务零基础设施失败、零未计分单元。成本敏感型用户选 Maka 很划算。全场最低的每成功任务成本意味着同样的预算能跑更多任务。警惕小分差相信显著性检验。19% 的任务结果翻转率提醒我们任何单次评测里几个任务的差距都不足为据。看 p 值别只看名次。截止时间是隐形裁判。同一个框架会做和在限时内做完是两码事。评估 Agent 工具时多关注它在长耗时任务上的预算消耗行为。报告同样诚实地列出了局限单次运行、Maka 臂携带额外的系统提示词和工具结果裁剪策略其他臂没有、McNemar 检验未做多重比较校正。作者明确写道这些结论是对一次冻结运行的描述不是普遍排序的证明。这种克制本身就是这份评测可信度的一部分。八、资料索引与延伸阅读想核对原始数据或复现实验项目内提供了完整的可追溯资料路径相对于仓库根目录四臂评测报告docs/eval/terminal-bench-2.1-deepseek-v4-flash-four-arm.md四臂逐任务结果docs/eval/terminal-bench-2.1-deepseek-v4-flash-four-arm.csvMaka vs OpenCode 报告docs/eval/terminal-bench-2.1-deepseek-v4-flash-maka-vs-opencode.md双任务逐任务结果docs/eval/terminal-bench-2.1-deepseek-v4-flash-maka-vs-opencode.csv评测框架说明与实验配置packages/eval/README.md及packages/eval/experiments/架构总览ARCHITECTURE.md四臂报告还附上了完整的 SHA-256 证据链实验清单、运行归档、提交结果 CSV 全部可哈希校验——对一份评测来说可复现性本身就是结论的一部分。一句话总结在 Terminal-Bench 2.1 的 89 道真实终端考题上Maka Agent 以 73.03% 的通过率跻身第一梯队用全场最低的单任务成本跑出了与第一名统计上无法区分的成绩——AI Agent 的评测看的不该只是分数还有分数背后的方法与诚意。【免费下载链接】makaApache Maka (Incubating) is a local-first AI agent workspace. Model messages, tool calls, tool results, permission decisions, and termination events are recorded as an append-only log.项目地址: https://gitcode.com/GitHub_Trending/mak/maka创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表