ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【AI黑话日日新】Day 045|Reward Model(奖励模型)

【AI黑话日日新】Day 045|Reward Model(奖励模型) 一句话说清:奖励模型是替人类给 AI 回答打分的中间人,决定训练里哪条回答更“好”。1. 它到底在说什么Reward Model 是英文“奖励模型”的直译。它的工作说白了:你给它一个提示和一条回答,它吐回一个数字,表示“一个普通人有多可能喜欢这条回答”。它存在的唯一理由,是你不可能把真人塞进一个跑几百万步的训练循环里,所以先拿人类的偏好比较数据,训出一个便宜的替代品,之后每次都用它代班打分。用一个生活化的类比理解:像公司评优,先让若干老员工对一堆候选方案两两比较、排出高下,再从这些比较里“悟”出一把打分尺子;以后所有新方案不用再打扰老员工,直接上尺子量一下即可。尺子量得快、量得便宜,但它只是老员工偏好的近似,不是标准答案本身。2. 为什么现在这个词很热奖励模型一路从“幕后组件”变成“对齐工程的核心”,时间线很清楚。2017 年,Christiano 等人发表《Deep RL from Human Preferences》(arXiv:1706.03741,NeurIPS 2017),首次用成对的偏好比较训练奖励模型:机器人学会后空翻,只用了约 900 次人类比较。这奠定了“收集人类判断 → 拟合奖励模型 → 优化策略”的基本循环。
返回列表