19个模型修同一个BUG:Awesome Coding Plan非严谨能力测试复盘,通过率与成本全揭秘
【免费下载链接】awesome-coding-plan各厂家 Coding Plan 实际价值对比项目地址: https://gitcode.com/gh_mirrors/aw/awesome-coding-plan
Awesome Coding Plan 是一个各大模型与云厂商 Coding Plan 实际价值对比的开源项目,覆盖额度倍率、TPS、模型参数与真实编码能力测试。本文复盘项目中最接地气的"非严谨能力测试":同一个网络代理协议不匹配 BUG,先后 19 个 AI 编程模型接手修复,各模型的通过率、单次成本与耗时如何,一文揭秘,帮你判断哪款 Coding Plan 更值得入手。
🧪 测试背景:一个"烂摊子"怎么变成能力试金石
这次测试场景相当刁钻:作者先让 gemini-3.5-flash 去解决一个网络代理协议不匹配的 BUG,结果它没修好,还留下了一个"烂摊子"。随后 18 个主流编码模型(来自 Claude Code、Codex、OpenCode、Grok Build 等 Agent Harness)被依次拉来"救火",每个模型跑 3 轮,记录Token 消耗、单次成本、耗时与修复通过率。
加上最初留下烂摊子的 gemini-3.5-flash,前后共有 19 个模型与这个 BUG 交手——这就是标题里"19 个模型"的由来。
原始数据与结论可在项目的 README.md#L126-L151 中查看。
📊 19 个模型修 BUG 的通过率与成本全对比
✅ 3/3 全通过:4 款模型一战成名
| 模型 | Agent Harness | 成本 | 耗时 | 通过率 |
|---|---|---|---|---|
| deepseek-v4-flash-0731 | opencode | $0.04 | 12min | ✅ 3/3 |
| grok-4.5 | grok build | ~$0.5 | 2min | ✅ 3/3 |
| gpt-5.6-sol | codex | $1.09 | 11min | ✅ 3/3 |
| claude-opus-4.8 | claude code | $2.60 | 9min | ✅ 3/3 |
全通过组亮点明显:deepseek-v4-flash 以 $0.04 的"白菜价"完成 3/3,grok-4.5 用 2 分钟跑完全场最快;而 claude-opus-4.8 虽然稳定,单次成本却是前者的 65 倍。
⚠️ 2/3 半通过:能力强,但不够稳
| 模型 | Agent Harness | 成本 | 耗时 | 通过率 |
|---|---|---|---|---|
| deepseek-v4-pro-0813 | opencode | $0.11 | 18min | ⚠️ 2/3 |
| claude-opus-5 | claude code | $3.08 | 10min | ⚠️ 2/3 |
| gpt-5.6-terra | codex | $0.50 | 5min | ⚠️ 2/3 |
| gpt-5.5 | codex | $1.29 | 6min | ⚠️ 2/3 |
| claude-fabel-5 | claude code | $8.25 | 18min | ⚠️ 2/3 |
这一组最"扎心":claude-fabel-5 花了全场最高的 $8.25,却只拿到 2/3;而 deepseek-v4-pro-0813 只花 $0.11 就完成 2 次修复,成本效率差距一目了然。
❌ 翻车组:1/3 与 0/3 都栽在哪
| 模型 | Agent Harness | 成本 | 耗时 | 通过率 |
|---|---|---|---|---|
| gpt-5.6-luna | codex | $0.40 | 7min | ❌ 1/3 |
| kimi-k3 | opencode | $1.47 | 28min | ❌ 1/3 |
| kimi-k2.7-code | opencode | $0.94 | 15min | ❌ 1/3 |
| deepseek-v4-pro max | opencode | $0.05 | 5min | ❌ 0/3 |
| claude-sonnet-5 | claude code | $0.56 | 5min | ❌ 0/3 |
| gpt-5.4 | codex | $1.60 | 12min | ❌ 0/3 |
| glm-5.2 max | opencode | $2.62 | 42min | ❌ 0/3 |
| qwen-3.7-max | opencode | $0.49 | 3min | ❌ 0/3 |
几个值得注意的信号:
- glm-5.2 max 耗时 42 分钟仍 0/3,时间花得最多、结果最差;
- 同为 DeepSeek V4 Pro,
0813版本拿到 2/3,max配置却是 0/3,说明模型版本与推理档位都会影响结果; - 多数 0/3 模型耗时很短(3~5 分钟),属于"快速失败",成本损失可控。
🕵️ 特例:qwen-3.8-max 为什么只测了一轮?
qwen-3.8-max 消耗了20,869,362 Token,跑了 1 小时 24 分钟,一轮成本 $8.42,Token 效率远低于同组其他模型,作者因此没有继续测试(原始记录见 README.md#L141)。如果你在意按量计费账单,这类 Token 效率问题往往比通过率更致命。
🔍 如何正确看待这份"非严谨"能力测试数据
"非严谨"不是自我贬低,而是作者刻意标注的数据边界,阅读时请抓住三点:
- 单场景测试:只测了一个网络代理协议 BUG 修复场景,只能在一定程度上侧面反映模型解决问题的能力,不能直接外推到所有编码任务;
- 轮次有限:项目明确提示"测试轮次不够多,部分模型效果评估可能存在偏差",0/3 也可能是手气问题;
- Harness 变量:同一模型在不同 Agent Harness(opencode / codex / claude code / grok build)下表现可能不同,对比时要把两列放在一起看。
它的正确用法是:把通过率当作"日常编码能力"的参考信号,把成本列当作预算护栏,而不是唯一决策依据。
🛠 结合测试结果,新手如何挑选 Coding Plan
测试结论与项目给出的核心选购建议可以互相印证,新手可以直接照着这四条走:
- 算力优先于额度:项目核心建议是"尽量考虑算力相对充裕的厂商,额度再差也比天天 429 报错强"——模型再强,频繁限流也修不了你的 BUG;
- 按量计费看性价比:全通过组里成本最低($0.04)的 deepseek-v4-flash,正是项目推荐的"按用量计费首选",同等 Token 用量下比大部分 Coding Plan 都便宜,1M 上下文、50 TPS 以上;
- 免费档适合体验:NVIDIA NIM 免费不限量提供 deepseek-v4-pro、glm-5.1 等开源模型,适合零成本上手,但没有稳定性保证、速度不固定;
- 团队套餐量力而行:团队综合推荐 Kimi Code Allegretto(¥199/月,支持多模态图像输入);团队开发推荐 GLM Coding Plan Pro(¥149/月,模型代码能力国内最强)。注意两者近期都有 429 频繁、算力紧张的情况,下单前先看实时口碑。
数据安全提示:如果你有数据安全性要求、不允许数据被用于训练,不建议购买 Coding Plan(项目原话)。
📁 项目资料索引:从哪入手读原始数据
- 完整对比表(额度价值 / 倍率 / TPS):README.md#L42-L60
- 模型参数与 Tokenizer 压缩率数据:README.md#L63-L107
- 非严谨能力测试原始数据:README.md#L126-L151
- 授权说明(CC BY 4.0,可自由分享与改编):LICENCE
想追踪最新一轮数据,把仓库拉到本地即可:
git clone https://gitcode.com/gh_mirrors/aw/awesome-coding-plan
本文数据均整理自 Awesome Coding Plan 项目公开记录,测试轮次有限,结论仅供参考,购买前请以厂商最新政策为准。
【免费下载链接】awesome-coding-plan各厂家 Coding Plan 实际价值对比项目地址: https://gitcode.com/gh_mirrors/aw/awesome-coding-plan
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考