ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

10. 能力边界——什么时候不该用决策模型(收官)

10. 能力边界——什么时候不该用决策模型(收官) 文章目录写在前面一、能力边界实测清单六条条条带数字二、三栏选型法什么时候轮到谁三、军规点兵十条全点四、十篇实验账本自测十题结业拼图写在最后收官附术语速查表第 10 版·终版系列完结写在前面十篇的最后一篇回答最值钱的问题它什么时候不该用。推荐工具的人满街都是告诉你什么时候别用的才是自己人。这一篇前半是边界的实测清单——每一条都有数字或复现后半是全系列合龙十篇的军规点兵、类比地图、实验账本一次点清。今天立最后一条军规被一个 0.362 逼出来的军规十一次成功不算能力边界要拿最坏情况量。demo 里答对十次不如边界测试里诚实地说这里我会错。选型看的是下限不是高光。一、能力边界实测清单六条条条带数字① 零样本≈随机——它是快速特化的底座不是即插即用的神。官方基准上的诚实声明typed-decisions checkpoint 零样本 0.362/0.352随机基线 0.318多数类基线 0.461——没微调过连多数类都打不过。那个 0.766 的漂亮数字是在自己基准的训练集上微调过的。翻译拿原版 LAYA 直接 judge 你的业务题不如让模型先见 100 条你的数据第 9 篇。② 否定句错误是概率性的——比全错更危险。官方 issue #377 报告过四连错。我实测no_action / cancel_account 两键Please cancel my account → cancel_account 0.990 √对照 Please do NOT cancel my account... → cancel_account 0.660 × 忽略了 NOT Do not cancel anything... → no_action 0.974 √ dont cancel my subscription... → no_action 0.829 √三句否定句错一句。注意这比全错更麻烦你没法用一条规则兜底因为不知道哪句会漏。官方的处理也是诚实的“check on your own data”——语义标签不保证否定安全上线前拿你的真实语料测。③ 布尔词标签模型跟着标签走。第 5 篇的 0.000↔0.935 还记得吗——noul 默认 false/true 标签词的引力可以盖过语义。choice 里用 yes/no 当标签同样中招。解法在第 5 篇语义化 criteria 或中性标签。④ 高基数的墙77 选项是苦战50 选项换 Jev。第 5 篇实测过完整链条默认预算 0.2515 选错 → head_max_len512 救回 0.756 → 双调配置才稳。官方对照 Jev 在 Banking77 上 0.870 对 LAYA 的 0.425且明说 “Jev is currently better suited for 50 options”。三解法调预算、predict_shortlistembedding 先筛 top-k、粗细两级问题。⑤ score 是最弱原语。SST-5 情感五级 0.372held-outmultilingual 还有位置偏置#131几乎不选第一个等级。结论score 的相对排序可用绝对等级要校准验证——正好是第 7 篇的活。⑥ act_head 目前无可用信号。第 5 篇埋的最后一个钩子。官方明说act_probability 几乎恒 1.0我三次抽查全是 1.0原始 AUROC 0.30——比瞎猜还差。要门控用 answer_confidenceAUROC 0.77且经第 7 篇温度校准。第 4 篇说的第四个小出口第 10 篇再回来——现在兑现这个出口目前焊死别接门。⑦ 但它知道自己不知道弃权机制实测。77 选项 min_confidence0.9 → conf0.627 0.9 → low_confidenceTrue ✓低于阈值主动标记decide 接口直接返回 None。校准弃权生产环境的退路说不准的时候举手比硬答一个 0.6 的答案强。边界清单里唯一的加分项也是最该接进你系统的一个。二、三栏选型法什么时候轮到谁场景特征规则引擎决策模型LAYA/JevLLM输入结构化、可枚举自然语言文本自然语言输出确定值固定选项校准概率自由文本可解释完全可追溯概率元数据弱延迟成本微秒级毫秒级秒级起变更成本改规则改选项微调第 9 篇改提示词/微调典型例子越限报警、阈值联动意图路由、优先级、是否判断起草、总结、多步推理一句话选型有明确阈值用规则开放文本固定出口要概率要快用决策模型要写东西或想不通才用 LLM。三者是接力关系不是替代关系——LLM 起草、决策模型把关、规则执行各干各的。拿一个真实场景练手第 1 篇埋的台架故事正式收线凝给水系统的泵出口压力越限判断——阈值明确、测点可枚举规则引擎别用模型军规一的精神能算的不猜“这段告警文本说的是泵的问题还是阀的问题”——自然语言进、固定类别出、毫秒级批量决策模型甜点区“根据历史工况写一份异常处置建议书”——要生成LLM但要接受它的延迟和幻觉概率。同一套系统三种工具三个岗位。三、军规点兵十条全点#军规立于1数字标出处实测才作数12随机权重看结构不问学问23谈快先数串行步数34模型的参数量亲手数45标签和选项怎么写先跑一遍再信56缩写和术语引官方原文67出厂概率先当没校准的看78延迟数字不带硬件等于没说89上新硬件前先跑最小版910一次成功不算能力边界拿最坏情况量10十条合起来其实就一句话对数字较真对流程敬畏。四、十篇实验账本篇实验核心数字2numpy 手算注意力20 行全流程 8 步3同一骨架两种跑法计时生成 50 token ≈ 90× 判断耗时4打印结构参数对账394.8M 26.5M 421.3M ✓5真模型三原语77 选项#156换标签词 0.000↔0.9356Brier/log 手算proper_reward 真跑赌对赏 0.0001 赌错罚 0.98017ECE 手算温度拟合0.267 → 0.006T2.728六语言路由延迟账HTTP 协议路由 0.28ms/次output_tokens: 09mini-RLCD 真训练奖励 0.675→0.75090 秒 CPU10否定句弃权act 抽查1/3 概率性错low_confidenceTrue每一行都是跑出来的不是抄来的——这是这个系列能站住的唯一理由。自测十题结业拼图最后十题横跨全系列答对八题以上你就不是读者了是同行。点开对答案排序一次判断的六步—— encoder → 盖题型章 → 头两层 → 按名牌取人 → scorer 打分 → softmax。4421.3M ___ ___—— encoder 394.8M 决策头 26.5M。4三原语连线choice↔标签概率分布score↔等级期望值noul↔P(true)。5proper_reward 三合一 log score 0.5×spherical − RPS仅 score 题。6温度缩放公式 p softmax(logits / T)T1 软化、T1 锐化。7RLHF 的病根一句话—— “We’ve been optimizing for humans”为取悦人类优化。6延迟排序小→大 T4 33ms CPU multilingual 181ms CPU english 637ms——差在哪硬件哪尺寸。8判断act_probability 适合做门控—— ×目前无信号恒 1.0AUROC 0.30用 answer_confidence。10军规五是什么—— 标签和选项怎么写先跑一遍再信——0.000↔0.935 的教训。5收官一句话什么时候不该用决策模型—— 有明确阈值用规则、要写东西用 LLM决策模型管开放文本进、固定选项出、要概率、要快的那一段且零样本不算数先微调再上岗。本篇写在最后收官第 1 篇我说这个系列要回答一个问题不写文章的 AI 模型到底凭什么存在十篇之后的答案它把判断这件事从大模型的闲聊里切了出来用 encoder 的速度给判断提速用 RLCD 的罚分给概率立规矩用温度缩放给置信度验真用 open 的源码让你把每一步都亲手摸过一遍。它不写诗它签字。生成模型的尊严在写出的文章里决策模型的尊严在报出的概率里。愿你从此既会用大模型写诗也会用小模型签字——并且永远记得看一眼账本。十篇完结。感谢同行。附术语速查表第 10 版·终版术语一句话解释详解在哪篇零样本zero-shot不微调直接用——本系列主角的弱项0.362≈随机本篇否定句不安全NOT 可能被忽略且错误概率性出现须用自有数据验证本篇predict_shortlistembedding 先筛 top-k 再前向高基数解法本篇5min_confidence弃权阈值低于则标 low_confidence/返回 None本篇三栏选型规则阈值/决策模型文本→选项/LLM生成接力本篇甜点区开放文本固定选项要概率要快的交集本篇全系列 10 版累计 95 条各篇术语表即完整索引。系列完结《Jev 与 LAYA 决策模型十日谈》全十篇完。回顾入口1 介绍 Jev · 2 预备知识 · 3 自回归与非自回归 · 4 LAYA 架构 · 5 三种问题 · 6 训练方法 · 7 概率校准 · 8 部署与接口 · 9 实战微调 · 10 能力边界本篇。全系列终。读完有收获的话点赞、收藏、关注三连走起——下一个系列见。
返回列表