GPT、Claude还是Gemini谁更会算命?MingLi-Bench跨模型八字能力横评
【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench
大语言模型真的会算命吗?MingLi-Bench 正是为回答这个问题而生的命理评测基准:它用来自"全球算命师大赛"的 160 道真实八字/紫微斗数选择题,对 GPT、Claude、Gemini、DeepSeek 等主流大模型进行公平横评。本文将带你快速看懂横评结果、数据集构成,以及如何三步跑出自己的对比分数。
🏆 横评结果:谁最会"看盘"?
测试集取自 2025 年第十六届全球算命师大赛官方题库,共8 个命例、40 道选择题,覆盖性格、事业、婚姻、健康等维度。每个模型独立测试5 轮,采用多数投票(至少 3 轮答对才算通过),并注入预排好的八字与紫微命盘,温度设为 0.0,最大限度排除"背题"与计算错误干扰。
| 参与者 | 截尾均值准确率 | 整体准确率 |
|---|---|---|
| 🧑🤝🧑 人类 Top-20 选手平均 | 53.5% | 51.9% |
| 🤖 Tianfu Agent(多智能体系统) | 50.0% | 45.0% |
| Claude Opus 4.6 | 40.0% | 37.5% |
| Doubao Seed 2.0 Pro | 36.7% | 37.5% |
| Gemini 3.1 Pro Preview | 36.7% | 37.5% |
| Grok-4.2 | 36.7% | 35.0% |
| GPT-5.4 | 30.0% | 32.5% |
| MiniMax M2.7 | 30.0% | 30.0% |
| DeepSeek V3.2 | 26.7% | 30.0% |
| Kimi K2.5 | 26.7% | 27.5% |
| Qwen3.6 Plus | 23.3% | 27.5% |
截尾均值准确率是比赛官方排名采用的积分方法:去掉每个模型表现最好和最差的案例后再计算平均,以排除极端情况的影响。
几个值得注意的现象:
- Claude 系列是通用大模型中的最强基线(40%),比第二名高出一档;
- GPT 与 Gemini 表现接近,但都明显落后于 Claude;
- 即便最好的通用模型也只有人类 Top-20 平均水平的75%左右——"会写诗"并不等于"会看盘";
- 项目团队自研的Tianfu Agent(多智能体 + 200+ 命理专用工具)把分数拉到 50%,几乎追平人类选手,验证了"领域工具环境"路线的可行性。
📚 数据集解剖:160 道命理选择题从哪来
MingLi-Bench 的题库全部来自全球算命师大赛 2022–2025 年度的赛题(原始卷面位于 data/raw/2022.txt 至 data/raw/2025.txt),整理为标准化选择题,以与标准答案完全一致作为评分标准:
- 题目数据:data/data.json — 160 道题目,划分入事业、健康、婚姻、子女、财运、灾劫等十二大类人生事件,每道题包含生辰信息、四选项与客观可验证的标准答案;
- 命盘数据:data/fortune_api_results.json — 借助 iztro 预先排定的八字与紫微斗数命盘,通过
case_id与题目关联。
为什么要把命盘"预排"好?这是本基准最关键的设计:将"排盘"与"推理"两个环节解耦。开启--astro参数后,排好的四柱、五行局、十二宫星曜会直接注入提示词,让分数真正反映模型的推理能力,而不是干支换算的准确度——毕竟没有人希望输给一张万年历。
一道典型题目长这样:
命主信息:男命,1974年4月28日下午4:40分,出生地点 usa 问题:此命 1996 年发生何事? A. 患上严重抑郁症 B. 回港认识现任妻子 C. 交通意外,撞车,人平安 D. 得到一笔意外之财
评分逻辑与提示词构造可在核心模块 mingli_bench/benchmark.py 中查看,所有模型共享的统一系统提示词定义在 mingli_bench/models/base.py。
🚀 三步上手:跑你自己的八字能力评测
一键安装步骤
git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt最快配置方法:只需填一个密钥
CLI 从.env文件读取 API 密钥与默认参数,只需填写你实际要用的服务商,空值会被自动跳过。想省事的路线是配一个 OpenRouter 密钥,即可路由调用绝大多数模型:
OPENROUTER_API_KEY=sk-or-...也可以直连原生接口,README_zh.md 中列出了OPENAI_API_KEY、ANTHROPIC_API_KEY、GOOGLE_API_KEY、DEEPSEEK_API_KEY、DOUBAO_API_KEY等完整模板。配置完成后先做连通性自检:
python -m mingli_bench.cli --list-models # 查看受支持的模型列表 python -m mingli_bench.cli --stats # 查看数据集统计信息第一条横评命令:GPT、Claude、Gemini 一次跑完
推荐始终带上--cot(思维链推理)与--astro(注入预排命盘):
python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro --max-workers 8 python -m mingli_bench.cli --model anthropic/claude-sonnet-4-6 --year 2025 --cot --astro python -m mingli_bench.cli --model google/gemini-2.5-pro --year 2025 --cot --astro模型名中含/时会自动路由到 OpenRouter;否则框架按前缀(gpt-*、claude-*、gemini-*等)推断服务商,路由逻辑见 mingli_bench/models/factory.py。常用参数速查:
| 参数 | 用途 |
|---|---|
--year 2025 | 只评测某一年赛题 |
--categories 事业 婚姻 | 按人生类别筛选题目 |
--sample 10 | 只跑前 10 题,快速冒烟测试 |
--shuffle-options | 打乱选项顺序,防位置偏差 |
--no-save | 只打印结果,不写文件 |
每次运行会在logs/下生成results.json(逐题明细)、summary.txt(核心指标)和responses/(每题原始回复),方便你做失败案例分析。完整参数说明见 mingli_bench/cli.py。
🧠 进阶:Tianfu Agent 如何逼近人类水平
单纯"预排命盘 + 通用模型推理"存在结构性瓶颈:大限、流年、飞宫等衍生数据会组合爆炸,无法穷举注入提示词;"三方四正""能量流通"等规则依赖空间关系,序列化后拓扑信息丢失;长推理链的误差还会逐步累积。
针对这些问题,Tianfu Agent 把 LLM 放进命理专用工具环境:200 多个原子性推算工具负责排盘、时间推演等确定性计算,复杂推理规则被封装为可调用的"推理工具",并引入不确定性量化贯穿工具输出、子智能体结论与多流派合参三个阶段——模拟人类专家的隐式直觉,让高层推理知道"该信谁"。
正是这条"确定性计算 + 规则封装 + 信心度量"的路线,让 Agent 以 50% 的截尾准确率超越了最强通用模型(40%),逼近人类 Top-20 选手的 53.5%。
📌 写在最后
- 想快速验证某个模型的八字水平?
--sample 10五分钟内出分; - 想做严肃横评?记得固定
--cot --astro,并开启--shuffle-options排除选项位置偏差; - 结果解读请保持清醒:这是技术探索性原型,命理咨询是开放式对话而非选择题,基准分数不代表实际咨询效果;
- 数据集样本量(160 题 / 8 命例)仍有限,跨年份、跨地域的泛化结论有待更大规模验证。
一个有趣的结论已经浮现:通用大模型"懂很多",但"算命"是一门需要领域工具与规则工程的手艺——MingLi-Bench 恰好为这种手艺提供了第一把可以量化的尺子。
【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考