ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DeBERTa-v3-large 奖励模型:给 AI 生成内容打分,评估准确率 99.5%

DeBERTa-v3-large 奖励模型:给 AI 生成内容打分,评估准确率 99.5% DeBERTa-v3-large 奖励模型给 AI 生成内容打分评估准确率 99.5%【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformersDeBERTa-v3-large 奖励模型是基于 Microsoft DeBERTa-v3-large 微调出来的文本奖励评分模型。它给 AI 生成的文本打分判断质量与相关性评估集准确率 99.5%适合做 RLHF强化学习人类反馈里的自动评分器。它到底在解决什么问题先讲个类比。老师批改作文靠经验一天批几十篇就到极限如果有一台打分器每篇作文交上去立刻出分老师只需要抽检效率就完全不一样。奖励模型给 AI 输出打分、判断好坏的模型扮演的就是这台打分器。大模型生成回答时同一个问题往往有好几种说法哪种更好人工逐条标注太贵也太慢。训练好一个奖励模型后你直接把候选文本喂进去它输出一个分数分数高的优先保留。这个项目做的小事就是拿预训练好的 DeBERTa-v3-large用一批好文本/坏文本的对比数据微调它让它变成一个专门打分的分类器。你不需要从零训练下载权重直接推理即可。性能速览训练过程中的关键指标如下训练损失轮次步数验证损失准确率0.02132.01000.02050.9950.0024.02000.01280.9950.00056.03000.01070.9950.00018.04000.01100.9950.000110.05000.01060.995两个信号值得注意一是第 2 轮准确率就稳定在 0.995说明模型收敛得快二是训练损失从 0.0213 一路降到 0.0001而验证损失停在 0.0106 左右不再下降两者有明显差距——典型的过拟合前兆。如果你的数据规模类似训练到 6 轮左右就够了后面几轮收益不大。三步跑起来准备环境。项目依赖 Transformers 4.41.2、PyTorch 2.3.0、Datasets 2.19.1、Tokenizers 0.19.1。先克隆仓库git clone https://gitcode.com/GitHub_Trending/tra/transformers再按依赖清单安装pip install -r examples/requirements.txt。本仓库的 examples/requirements.txt 可参考 PyTorch 示例的标准依赖写法按需调整版本。加载模型。用AutoTokenizer和AutoModel加载奖励模型权重模型架构解耦注意力 掩码预测是 DeBERTa-v3 的两个核心设计在 src/transformers/models/deberta_v2/ 里可以找到对应实现。推理打分。最小可运行示例如下from transformers import AutoTokenizer, AutoModel import torch model_path zhouhui/deberta-v3-large-reward-model tokenizer AutoTokenizer.from_pretrained(model_path) model AutoModel.from_pretrained(model_path).eval() sentences [Good answer, Bad answer] inputs tokenizer(sentences, paddingTrue, truncationTrue, return_tensorspt) with torch.no_grad(): outputs model(**inputs) print(reward logits:, outputs.logits)outputs.logits里每个数就是模型对该句子的偏好分分数高的句子质量更好。如果你要做句向量而不是分类分把池化换成 mean_pooling 再 L2 归一化即可。训练配置与复现原始超参数记录在仓库根目录的training_args.bin序列化后的训练参数文件里直接读取不方便列出关键值供复现参考学习率1.41e-05训练批大小16评估批大小8梯度累积步数2等效总批大小 32随机种子42优化器AdamWbetas(0.9, 0.999)epsilon1e-08学习率调度线性衰减训练轮次10.0这套参数可以直接写进TrainingArguments复现训练。结合上表看第 6 轮后验证损失不再下降复现时把轮次从 10 调到 6能省一半时间。能用在哪些场景对话系统回复筛选。让模型对同一个问题生成多个候选回答奖励模型打分后只保留高分回答用于训练或展示。好处是把人工筛选成本降到抽检级别回答相关性、有用性都有量化依据。内容质量评估。摘要、改写类任务输出不稳定时用它当自动质检器分数低于阈值就重新生成。比人肉读得快且标准一致不会今天严明天松。RLHF 训练打分器。在强化学习人类反馈流程里它替代人工标注给策略模型提供持续反馈信号。对新手来说这是接触 RLHF 最省事的入口——不用自己攒偏好数据先用现成奖励模型跑通流程。文件速查文件用途config.json模型结构参数层数、隐藏维度、注意力头等model.safetensors权重文件加载模型的主体tokenizer.json / tokenizer_config.json分词器本体与配置special_tokens_map.json / added_tokens.json特殊 token 定义spm.modelSentencePiece 词表文件training_args.bin训练超参数复现训练的起点结语 / 下一步如果你要给 AI 生成内容自动打分先用上面的推理脚本验证一下拿 20 条已知好坏的文本跑一遍看分数排序是否符合预期。符合预期再接进你的评估流程不符合就检查输入长度是否被截断、任务是否和原微调数据差距过大。想复现或二次微调从training_args.bin里的参数出发把轮次降到 6 轮再跑。本仓库的 examples/ 目录和 src/transformers/models/deberta_v2/ 可作为训练脚本与模型实现的两份参考。【免费下载链接】transformers Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.项目地址: https://gitcode.com/GitHub_Trending/tra/transformers创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表