拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT、Claude还是Gemini谁更会算命?MingLi-Bench跨模型八字能力横评

GPT、Claude还是Gemini谁更会算命?MingLi-Bench跨模型八字能力横评

GPT、Claude还是Gemini谁更会算命?MingLi-Bench跨模型八字能力横评

【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench

大语言模型真的会算命吗?MingLi-Bench 正是为回答这个问题而生的命理评测基准:它用来自"全球算命师大赛"的 160 道真实八字/紫微斗数选择题,对 GPT、Claude、Gemini、DeepSeek 等主流大模型进行公平横评。本文将带你快速看懂横评结果、数据集构成,以及如何三步跑出自己的对比分数。


🏆 横评结果:谁最会"看盘"?

测试集取自 2025 年第十六届全球算命师大赛官方题库,共8 个命例、40 道选择题,覆盖性格、事业、婚姻、健康等维度。每个模型独立测试5 轮,采用多数投票(至少 3 轮答对才算通过),并注入预排好的八字与紫微命盘,温度设为 0.0,最大限度排除"背题"与计算错误干扰。

参与者截尾均值准确率整体准确率
🧑‍🤝‍🧑 人类 Top-20 选手平均53.5%51.9%
🤖 Tianfu Agent(多智能体系统)50.0%45.0%
Claude Opus 4.640.0%37.5%
Doubao Seed 2.0 Pro36.7%37.5%
Gemini 3.1 Pro Preview36.7%37.5%
Grok-4.236.7%35.0%
GPT-5.430.0%32.5%
MiniMax M2.730.0%30.0%
DeepSeek V3.226.7%30.0%
Kimi K2.526.7%27.5%
Qwen3.6 Plus23.3%27.5%

截尾均值准确率是比赛官方排名采用的积分方法:去掉每个模型表现最好和最差的案例后再计算平均,以排除极端情况的影响。

几个值得注意的现象:

  • Claude 系列是通用大模型中的最强基线(40%),比第二名高出一档;
  • GPT 与 Gemini 表现接近,但都明显落后于 Claude;
  • 即便最好的通用模型也只有人类 Top-20 平均水平的75%左右——"会写诗"并不等于"会看盘";
  • 项目团队自研的Tianfu Agent(多智能体 + 200+ 命理专用工具)把分数拉到 50%,几乎追平人类选手,验证了"领域工具环境"路线的可行性。

📚 数据集解剖:160 道命理选择题从哪来

MingLi-Bench 的题库全部来自全球算命师大赛 2022–2025 年度的赛题(原始卷面位于 data/raw/2022.txt 至 data/raw/2025.txt),整理为标准化选择题,以与标准答案完全一致作为评分标准:

  • 题目数据:data/data.json — 160 道题目,划分入事业、健康、婚姻、子女、财运、灾劫等十二大类人生事件,每道题包含生辰信息、四选项与客观可验证的标准答案;
  • 命盘数据:data/fortune_api_results.json — 借助 iztro 预先排定的八字与紫微斗数命盘,通过case_id与题目关联。

为什么要把命盘"预排"好?这是本基准最关键的设计:将"排盘"与"推理"两个环节解耦。开启--astro参数后,排好的四柱、五行局、十二宫星曜会直接注入提示词,让分数真正反映模型的推理能力,而不是干支换算的准确度——毕竟没有人希望输给一张万年历。

一道典型题目长这样:

命主信息:男命,1974年4月28日下午4:40分,出生地点 usa 问题:此命 1996 年发生何事? A. 患上严重抑郁症 B. 回港认识现任妻子 C. 交通意外,撞车,人平安 D. 得到一笔意外之财

评分逻辑与提示词构造可在核心模块 mingli_bench/benchmark.py 中查看,所有模型共享的统一系统提示词定义在 mingli_bench/models/base.py。


🚀 三步上手:跑你自己的八字能力评测

一键安装步骤

git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt

最快配置方法:只需填一个密钥

CLI 从.env文件读取 API 密钥与默认参数,只需填写你实际要用的服务商,空值会被自动跳过。想省事的路线是配一个 OpenRouter 密钥,即可路由调用绝大多数模型:

OPENROUTER_API_KEY=sk-or-...

也可以直连原生接口,README_zh.md 中列出了OPENAI_API_KEY、ANTHROPIC_API_KEY、GOOGLE_API_KEY、DEEPSEEK_API_KEY、DOUBAO_API_KEY等完整模板。配置完成后先做连通性自检:

python -m mingli_bench.cli --list-models # 查看受支持的模型列表 python -m mingli_bench.cli --stats # 查看数据集统计信息

第一条横评命令:GPT、Claude、Gemini 一次跑完

推荐始终带上--cot(思维链推理)与--astro(注入预排命盘):

python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro --max-workers 8 python -m mingli_bench.cli --model anthropic/claude-sonnet-4-6 --year 2025 --cot --astro python -m mingli_bench.cli --model google/gemini-2.5-pro --year 2025 --cot --astro

模型名中含/时会自动路由到 OpenRouter;否则框架按前缀(gpt-*、claude-*、gemini-*等)推断服务商,路由逻辑见 mingli_bench/models/factory.py。常用参数速查:

参数用途
--year 2025只评测某一年赛题
--categories 事业 婚姻按人生类别筛选题目
--sample 10只跑前 10 题,快速冒烟测试
--shuffle-options打乱选项顺序,防位置偏差
--no-save只打印结果,不写文件

每次运行会在logs/下生成results.json(逐题明细)、summary.txt(核心指标)和responses/(每题原始回复),方便你做失败案例分析。完整参数说明见 mingli_bench/cli.py。


🧠 进阶:Tianfu Agent 如何逼近人类水平

单纯"预排命盘 + 通用模型推理"存在结构性瓶颈:大限、流年、飞宫等衍生数据会组合爆炸,无法穷举注入提示词;"三方四正""能量流通"等规则依赖空间关系,序列化后拓扑信息丢失;长推理链的误差还会逐步累积。

针对这些问题,Tianfu Agent 把 LLM 放进命理专用工具环境:200 多个原子性推算工具负责排盘、时间推演等确定性计算,复杂推理规则被封装为可调用的"推理工具",并引入不确定性量化贯穿工具输出、子智能体结论与多流派合参三个阶段——模拟人类专家的隐式直觉,让高层推理知道"该信谁"。

正是这条"确定性计算 + 规则封装 + 信心度量"的路线,让 Agent 以 50% 的截尾准确率超越了最强通用模型(40%),逼近人类 Top-20 选手的 53.5%。


📌 写在最后

  • 想快速验证某个模型的八字水平?--sample 10五分钟内出分;
  • 想做严肃横评?记得固定--cot --astro,并开启--shuffle-options排除选项位置偏差;
  • 结果解读请保持清醒:这是技术探索性原型,命理咨询是开放式对话而非选择题,基准分数不代表实际咨询效果;
  • 数据集样本量(160 题 / 8 命例)仍有限,跨年份、跨地域的泛化结论有待更大规模验证。

一个有趣的结论已经浮现:通用大模型"懂很多",但"算命"是一门需要领域工具与规则工程的手艺——MingLi-Bench 恰好为这种手艺提供了第一把可以量化的尺子。

【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

返回列表