ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT、Claude还是Gemini谁更会算命?MingLi-Bench跨模型八字能力横评

GPT、Claude还是Gemini谁更会算命?MingLi-Bench跨模型八字能力横评 GPT、Claude还是Gemini谁更会算命MingLi-Bench跨模型八字能力横评【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench大语言模型真的会算命吗MingLi-Bench 正是为回答这个问题而生的命理评测基准它用来自全球算命师大赛的 160 道真实八字/紫微斗数选择题对 GPT、Claude、Gemini、DeepSeek 等主流大模型进行公平横评。本文将带你快速看懂横评结果、数据集构成以及如何三步跑出自己的对比分数。 横评结果谁最会看盘测试集取自 2025 年第十六届全球算命师大赛官方题库共8 个命例、40 道选择题覆盖性格、事业、婚姻、健康等维度。每个模型独立测试5 轮采用多数投票至少 3 轮答对才算通过并注入预排好的八字与紫微命盘温度设为 0.0最大限度排除背题与计算错误干扰。参与者截尾均值准确率整体准确率‍‍ 人类 Top-20 选手平均53.5%51.9% Tianfu Agent多智能体系统50.0%45.0%Claude Opus 4.640.0%37.5%Doubao Seed 2.0 Pro36.7%37.5%Gemini 3.1 Pro Preview36.7%37.5%Grok-4.236.7%35.0%GPT-5.430.0%32.5%MiniMax M2.730.0%30.0%DeepSeek V3.226.7%30.0%Kimi K2.526.7%27.5%Qwen3.6 Plus23.3%27.5%截尾均值准确率是比赛官方排名采用的积分方法去掉每个模型表现最好和最差的案例后再计算平均以排除极端情况的影响。几个值得注意的现象Claude 系列是通用大模型中的最强基线40%比第二名高出一档GPT 与 Gemini 表现接近但都明显落后于 Claude即便最好的通用模型也只有人类 Top-20 平均水平的75%左右——会写诗并不等于会看盘项目团队自研的Tianfu Agent多智能体 200 命理专用工具把分数拉到 50%几乎追平人类选手验证了领域工具环境路线的可行性。 数据集解剖160 道命理选择题从哪来MingLi-Bench 的题库全部来自全球算命师大赛 2022–2025 年度的赛题原始卷面位于 data/raw/2022.txt 至 data/raw/2025.txt整理为标准化选择题以与标准答案完全一致作为评分标准题目数据data/data.json — 160 道题目划分入事业、健康、婚姻、子女、财运、灾劫等十二大类人生事件每道题包含生辰信息、四选项与客观可验证的标准答案命盘数据data/fortune_api_results.json — 借助 iztro 预先排定的八字与紫微斗数命盘通过case_id与题目关联。为什么要把命盘预排好这是本基准最关键的设计将排盘与推理两个环节解耦。开启--astro参数后排好的四柱、五行局、十二宫星曜会直接注入提示词让分数真正反映模型的推理能力而不是干支换算的准确度——毕竟没有人希望输给一张万年历。一道典型题目长这样命主信息男命1974年4月28日下午4:40分出生地点 usa 问题此命 1996 年发生何事 A. 患上严重抑郁症 B. 回港认识现任妻子 C. 交通意外撞车人平安 D. 得到一笔意外之财评分逻辑与提示词构造可在核心模块 mingli_bench/benchmark.py 中查看所有模型共享的统一系统提示词定义在 mingli_bench/models/base.py。 三步上手跑你自己的八字能力评测一键安装步骤git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt最快配置方法只需填一个密钥CLI 从.env文件读取 API 密钥与默认参数只需填写你实际要用的服务商空值会被自动跳过。想省事的路线是配一个 OpenRouter 密钥即可路由调用绝大多数模型OPENROUTER_API_KEYsk-or-...也可以直连原生接口README_zh.md 中列出了OPENAI_API_KEY、ANTHROPIC_API_KEY、GOOGLE_API_KEY、DEEPSEEK_API_KEY、DOUBAO_API_KEY等完整模板。配置完成后先做连通性自检python -m mingli_bench.cli --list-models # 查看受支持的模型列表 python -m mingli_bench.cli --stats # 查看数据集统计信息第一条横评命令GPT、Claude、Gemini 一次跑完推荐始终带上--cot思维链推理与--astro注入预排命盘python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro --max-workers 8 python -m mingli_bench.cli --model anthropic/claude-sonnet-4-6 --year 2025 --cot --astro python -m mingli_bench.cli --model google/gemini-2.5-pro --year 2025 --cot --astro模型名中含/时会自动路由到 OpenRouter否则框架按前缀gpt-*、claude-*、gemini-*等推断服务商路由逻辑见 mingli_bench/models/factory.py。常用参数速查参数用途--year 2025只评测某一年赛题--categories 事业 婚姻按人生类别筛选题目--sample 10只跑前 10 题快速冒烟测试--shuffle-options打乱选项顺序防位置偏差--no-save只打印结果不写文件每次运行会在logs/下生成results.json逐题明细、summary.txt核心指标和responses/每题原始回复方便你做失败案例分析。完整参数说明见 mingli_bench/cli.py。 进阶Tianfu Agent 如何逼近人类水平单纯预排命盘 通用模型推理存在结构性瓶颈大限、流年、飞宫等衍生数据会组合爆炸无法穷举注入提示词三方四正能量流通等规则依赖空间关系序列化后拓扑信息丢失长推理链的误差还会逐步累积。针对这些问题Tianfu Agent 把 LLM 放进命理专用工具环境200 多个原子性推算工具负责排盘、时间推演等确定性计算复杂推理规则被封装为可调用的推理工具并引入不确定性量化贯穿工具输出、子智能体结论与多流派合参三个阶段——模拟人类专家的隐式直觉让高层推理知道该信谁。正是这条确定性计算 规则封装 信心度量的路线让 Agent 以 50% 的截尾准确率超越了最强通用模型40%逼近人类 Top-20 选手的 53.5%。 写在最后想快速验证某个模型的八字水平--sample 10五分钟内出分想做严肃横评记得固定--cot --astro并开启--shuffle-options排除选项位置偏差结果解读请保持清醒这是技术探索性原型命理咨询是开放式对话而非选择题基准分数不代表实际咨询效果数据集样本量160 题 / 8 命例仍有限跨年份、跨地域的泛化结论有待更大规模验证。一个有趣的结论已经浮现通用大模型懂很多但算命是一门需要领域工具与规则工程的手艺——MingLi-Bench 恰好为这种手艺提供了第一把可以量化的尺子。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表