拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

19个模型修同一个BUG:Awesome Coding Plan非严谨能力测试复盘,通过率与成本全揭秘

19个模型修同一个BUG:Awesome Coding Plan非严谨能力测试复盘,通过率与成本全揭秘

19个模型修同一个BUG:Awesome Coding Plan非严谨能力测试复盘,通过率与成本全揭秘

【免费下载链接】awesome-coding-plan各厂家 Coding Plan 实际价值对比项目地址: https://gitcode.com/gh_mirrors/aw/awesome-coding-plan

Awesome Coding Plan 是一个各大模型与云厂商 Coding Plan 实际价值对比的开源项目,覆盖额度倍率、TPS、模型参数与真实编码能力测试。本文复盘项目中最接地气的"非严谨能力测试":同一个网络代理协议不匹配 BUG,先后 19 个 AI 编程模型接手修复,各模型的通过率、单次成本与耗时如何,一文揭秘,帮你判断哪款 Coding Plan 更值得入手。

🧪 测试背景:一个"烂摊子"怎么变成能力试金石

这次测试场景相当刁钻:作者先让 gemini-3.5-flash 去解决一个网络代理协议不匹配的 BUG,结果它没修好,还留下了一个"烂摊子"。随后 18 个主流编码模型(来自 Claude Code、Codex、OpenCode、Grok Build 等 Agent Harness)被依次拉来"救火",每个模型跑 3 轮,记录Token 消耗、单次成本、耗时与修复通过率。

加上最初留下烂摊子的 gemini-3.5-flash,前后共有 19 个模型与这个 BUG 交手——这就是标题里"19 个模型"的由来。

原始数据与结论可在项目的 README.md#L126-L151 中查看。

📊 19 个模型修 BUG 的通过率与成本全对比

✅ 3/3 全通过:4 款模型一战成名

模型Agent Harness成本耗时通过率
deepseek-v4-flash-0731opencode$0.0412min✅ 3/3
grok-4.5grok build~$0.52min✅ 3/3
gpt-5.6-solcodex$1.0911min✅ 3/3
claude-opus-4.8claude code$2.609min✅ 3/3

全通过组亮点明显:deepseek-v4-flash 以 $0.04 的"白菜价"完成 3/3,grok-4.5 用 2 分钟跑完全场最快;而 claude-opus-4.8 虽然稳定,单次成本却是前者的 65 倍。

⚠️ 2/3 半通过:能力强,但不够稳

模型Agent Harness成本耗时通过率
deepseek-v4-pro-0813opencode$0.1118min⚠️ 2/3
claude-opus-5claude code$3.0810min⚠️ 2/3
gpt-5.6-terracodex$0.505min⚠️ 2/3
gpt-5.5codex$1.296min⚠️ 2/3
claude-fabel-5claude code$8.2518min⚠️ 2/3

这一组最"扎心":claude-fabel-5 花了全场最高的 $8.25,却只拿到 2/3;而 deepseek-v4-pro-0813 只花 $0.11 就完成 2 次修复,成本效率差距一目了然。

❌ 翻车组:1/3 与 0/3 都栽在哪

模型Agent Harness成本耗时通过率
gpt-5.6-lunacodex$0.407min❌ 1/3
kimi-k3opencode$1.4728min❌ 1/3
kimi-k2.7-codeopencode$0.9415min❌ 1/3
deepseek-v4-pro maxopencode$0.055min❌ 0/3
claude-sonnet-5claude code$0.565min❌ 0/3
gpt-5.4codex$1.6012min❌ 0/3
glm-5.2 maxopencode$2.6242min❌ 0/3
qwen-3.7-maxopencode$0.493min❌ 0/3

几个值得注意的信号:

  • glm-5.2 max 耗时 42 分钟仍 0/3,时间花得最多、结果最差;
  • 同为 DeepSeek V4 Pro,0813版本拿到 2/3,max配置却是 0/3,说明模型版本与推理档位都会影响结果;
  • 多数 0/3 模型耗时很短(3~5 分钟),属于"快速失败",成本损失可控。

🕵️ 特例:qwen-3.8-max 为什么只测了一轮?

qwen-3.8-max 消耗了20,869,362 Token,跑了 1 小时 24 分钟,一轮成本 $8.42,Token 效率远低于同组其他模型,作者因此没有继续测试(原始记录见 README.md#L141)。如果你在意按量计费账单,这类 Token 效率问题往往比通过率更致命。

🔍 如何正确看待这份"非严谨"能力测试数据

"非严谨"不是自我贬低,而是作者刻意标注的数据边界,阅读时请抓住三点:

  1. 单场景测试:只测了一个网络代理协议 BUG 修复场景,只能在一定程度上侧面反映模型解决问题的能力,不能直接外推到所有编码任务;
  2. 轮次有限:项目明确提示"测试轮次不够多,部分模型效果评估可能存在偏差",0/3 也可能是手气问题;
  3. Harness 变量:同一模型在不同 Agent Harness(opencode / codex / claude code / grok build)下表现可能不同,对比时要把两列放在一起看。

它的正确用法是:把通过率当作"日常编码能力"的参考信号,把成本列当作预算护栏,而不是唯一决策依据。

🛠 结合测试结果,新手如何挑选 Coding Plan

测试结论与项目给出的核心选购建议可以互相印证,新手可以直接照着这四条走:

  1. 算力优先于额度:项目核心建议是"尽量考虑算力相对充裕的厂商,额度再差也比天天 429 报错强"——模型再强,频繁限流也修不了你的 BUG;
  2. 按量计费看性价比:全通过组里成本最低($0.04)的 deepseek-v4-flash,正是项目推荐的"按用量计费首选",同等 Token 用量下比大部分 Coding Plan 都便宜,1M 上下文、50 TPS 以上;
  3. 免费档适合体验:NVIDIA NIM 免费不限量提供 deepseek-v4-pro、glm-5.1 等开源模型,适合零成本上手,但没有稳定性保证、速度不固定;
  4. 团队套餐量力而行:团队综合推荐 Kimi Code Allegretto(¥199/月,支持多模态图像输入);团队开发推荐 GLM Coding Plan Pro(¥149/月,模型代码能力国内最强)。注意两者近期都有 429 频繁、算力紧张的情况,下单前先看实时口碑。

数据安全提示:如果你有数据安全性要求、不允许数据被用于训练,不建议购买 Coding Plan(项目原话)。

📁 项目资料索引:从哪入手读原始数据

  • 完整对比表(额度价值 / 倍率 / TPS):README.md#L42-L60
  • 模型参数与 Tokenizer 压缩率数据:README.md#L63-L107
  • 非严谨能力测试原始数据:README.md#L126-L151
  • 授权说明(CC BY 4.0,可自由分享与改编):LICENCE

想追踪最新一轮数据,把仓库拉到本地即可:

git clone https://gitcode.com/gh_mirrors/aw/awesome-coding-plan

本文数据均整理自 Awesome Coding Plan 项目公开记录,测试轮次有限,结论仅供参考,购买前请以厂商最新政策为准。

【免费下载链接】awesome-coding-plan各厂家 Coding Plan 实际价值对比项目地址: https://gitcode.com/gh_mirrors/aw/awesome-coding-plan

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表