
MingLi-Bench参数完全清单从--cot、--astro到--shuffle-options逐项拆解【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench 是一个面向大语言模型LLM的中国传统命理评测基准涵盖八字与紫微斗数内置 160 道选择题。它通过--cot、--astro、--shuffle-options等命令行参数精细控制评测变量帮你看清一个模型到底是在排盘上出错还是在推理上翻车。本文逐项拆解这些参数让你第一次运行也能用对配置。为什么需要这些参数一次命理评测到底在测什么 MingLi-Bench 的题目来源于全球算命师大赛 2022–2025 年度赛题全部整理为选择题按与标准答案完全一致来评分并划分进事业、健康、婚姻、财运等十二大类。原始数据见 data/raw/整理后的数据集为 data/data.json。命理问答包含两个环节排盘根据生辰推出八字 / 紫微斗数命盘与推理基于命盘推算事件。如果让模型全程自己来分数高低就无法区分是排盘排错了还是推理推错了。这正是各参数存在的意义--cot控制是否要求模型先分析推理、再给答案--astro控制是否注入预先排好的命盘把排盘环节从模型手里拿走--shuffle-options控制是否打乱选项顺序消除位置偏差。理解了这个控制变量的思路下面每个参数的作用就一目了然了。快速上手一条命令跑通 MingLi-Bench 评测 ⚡克隆仓库后安装依赖配置好.env中的 API 密钥详见 README_zh.md 的配置章节pip install -r requirements.txt python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro官方推荐的默认配置是始终开启--cot与--astro这样评测分数反映的是模型的推理能力而不是它的排盘准确度。仅当你想做消融实验时才关闭它们。核心参数逐项拆解 参数定义集中在 cli.py运行逻辑在 benchmark.py。以下按影响结果的深度从高到低逐个讲解。1.--model/-m指定要评测的大模型必填模型名有两套写法路由规则见 factory.py含/的写法视为 OpenRouter 的provider/model形式如openai/gpt-4o、anthropic/claude-sonnet-4-6一个 OpenRouter 密钥即可调用大多数模型无/的写法按前缀自动推断服务商——gpt-*、o1-*、o3-*→ OpenAIclaude-*→ Anthropicgemini-*→ Googledeepseek-*→ DeepSeekdoubao-*→ 豆包。不确定自己配了哪些密钥时先用--list-models查看支持的模型列表。2.--platform强制指定调用平台默认按模型名自动推断路由但遇到自动识别不了的情况比如带版本号的豆包 endpoint id可以显式指定python -m mingli_bench.cli --platform doubao --model doubao-seed-2-0-pro-260215 --cot --astro可选值openai、openrouter、anthropic、google、deepseek、doubao定义于 cli.py。3.--cot开启思维链CoT推理开关参数默认关闭。开启后发给模型的指令从请直接给出答案变为请先分析推理过程然后给出答案。两种提示词的差异可以在 benchmark.py 中直接看到。命理题目往往需要逐柱、逐宫位推演思维链给模型留出了足够的思考空间因此官方建议默认开启关闭--cot只适合测直答能力的消融实验。4.--astro注入预先排好的八字 / 紫微斗数命盘开关参数默认关闭。开启后程序会从 data/fortune_api_results.json 中按case_id取出预先排定的命盘注入到提示词的命主信息与问题之间包括八字四柱、时辰、五行局、生肖紫微斗数十二宫位命宫、夫妻、财帛、官禄……的主星与辅星分布。注入逻辑见 loader.py 与 benchmark.py。这一步把排盘与推理两个环节解耦模型拿到的是标准答案级的命盘考卷上只剩推理题评测结果对不同排盘能力的模型才公平。5.--shuffle-options随机打乱选项杜绝位置偏差部分模型存在偏爱选 A之类的答题倾向若选项顺序固定分数可能被高估。开启此参数后每道选择题的 A–D 顺序会被打乱实现见 loader.py且有两个贴心设计确定性打乱以题目 ID 的哈希作为随机种子同一道题每次运行打乱结果一致便于复现对比无不动点约束保证打乱后没有任何一个选项留在原位位置偏差被真正消除。每道题的原始答案、新答案及选项映射如A→C, B→A都会记录在结果文件的【选项打乱信息】中方便人工核对。6.--year/--categories/--sample筛选题目范围 参数作用--year, -y只评测某一赛年的题目2022–2025每年 40 题年份按题号自动推断--categories, -c按类别筛选可选事业、健康、外貌、婚姻、子女、学业、官非、家庭、性格、灾劫、财运、运势--sample, -s N只评测前 N 题适合快速冒烟自测三者可以叠加使用例如--year 2025 --categories 财运 运势。运行--stats可先查看数据集的年份与类别分布再决定筛选条件。7.--max-workers/--output-dir/--no-save并发与结果输出--max-workers并发调用 API 的线程数默认5速率限制允许时可提高到 8–16触发限流则调低--output-dir, -o结果输出目录默认logs/。每次运行生成model_时间戳/内含results.json逐题预测与打分、summary.txt核心指标摘要和responses/每题完整提示词与模型原始回复逐题存为独立文件--no-save只在终端打印摘要不写文件。8.--data-path/--env-file数据与密钥切换--data-path指定自定义题库文件默认自动定位 data/data.json--env-file指定另一套.env文件方便切换不同的密钥组合。所有可配置的环境变量TIMEOUT、MAX_TOKENS、TEMPERATURE等见 config.py。参数速查表 ✅参数默认值一句话说明--model, -m必填模型名含/走 OpenRouter否则按前缀推断服务商--platform自动推断强制指定调用平台覆盖前缀推断--cot关闭提示词中加入思维链指令建议常开--astro关闭注入预排八字/紫微命盘解耦排盘与推理建议常开--shuffle-options关闭每题确定性打乱选项顺序消除位置偏差--year, -y全部仅评测指定年份2022–2025的题目--categories, -c全部按十二大类筛选如事业 婚姻--sample, -s N全部仅评测前 N 题快速自测--max-workers5并发 API 请求数--output-dir, -ologs结果文件输出目录--no-save关闭仅输出到终端不写文件--data-path自动自定义题库文件路径--env-file.env指定其他 env 文件--list-models—列出受支持模型后退出--stats—打印数据集统计信息后退出可搭配--year完整帮助python -m mingli_bench.cli --help。3 种常见场景的推荐组合 ① 冒烟自测第一次跑通流程python -m mingli_bench.cli --model openai/gpt-4o --sample 10 --no-save用 10 道题快速验证密钥、路由、打分链路是否正常。② 标准评测官方推荐配置python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro --shuffle-options开启思维链 预排命盘 选项打乱分数最能反映模型的真实命理推理水平。③ 消融实验定位短板分别关闭--cot或--astro各跑一遍对比分数变化掉分多说明模型缺推理空间或排盘能力从而精准定位短板。小结MingLi-Bench 的参数设计围绕控制变量展开--cot管推理深度--astro管排盘解耦--shuffle-options管选项公平--year/--categories/--sample管题目范围其余参数管并发、输出与密钥配置。按标准评测组合起步再针对自己的研究问题做消融就能充分发挥这套八字 / 紫微斗数 LLM 评测基准的价值。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考