ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

go_emotions数据集深度解析:roberta-base-go_emotions背后28种情感标签的Reddit数据来源

go_emotions数据集深度解析:roberta-base-go_emotions背后28种情感标签的Reddit数据来源 go_emotions数据集深度解析roberta-base-go_emotions背后28种情感标签的Reddit数据来源【免费下载链接】roberta-base-go_emotions项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/roberta-base-go_emotionsroberta-base-go_emotions 是一个基于 HuggingFace 镜像的多标签情感分类模型由 RoBERTa-base 在 go_emotions 数据集源自 Reddit 真实评论、4 万 条样本上训练而来。它能对任意英文句子一次性输出 28 种情感如 joy、anger、gratitude各自的概率值是情感分析Sentiment Analysis与 NLP 多标签分类任务的开箱即用模型。go_emotions 数据集数据从哪来go_emotions 是 Google Research 发布的经典情感数据集其数据来源是Reddit 上的真实用户评论如 r/entitledpeople 等板块。它有三个关键特点多标签Multi-Label一条文本可以同时命中多个情感标签因此模型对每个输入输出 28 个 0~1 的概率值通常以 0.5 为阈值二值化28 种细粒度情感远不止正面/负面覆盖了从感激、尴尬到解脱的完整情绪光谱标签严重不均衡如 neutral 在测试集中有 1787 条而 grief 只有 6 条——这也是模型性能天花板的根本原因之一。 数据集本身存在少量标注噪声与歧义。官方 README 指出对数据做清洗去重、消除冲突标注后再训练性能还能进一步提升。28 种情感标签完整清单模型在 [config.json] 的id2label中定义了全部 28 个标签编号 0~27按语义可分为四类类别标签 积极情绪admiration钦佩、amusement逗乐、approval认可、caring关心、desire渴望、excitement兴奋、gratitude感激、joy愉悦、love喜爱、optimism乐观、pride自豪、relief如释重负 消极情绪anger愤怒、annoyance烦躁、disappointment失望、disapproval不赞同、disgust厌恶、embarrassment尴尬、fear恐惧、grief悲痛、nervousness紧张、sadness悲伤 认知/惊讶类confusion困惑、curiosity好奇、realization顿悟、surprise惊讶、remorse懊悔⚪ 中性neutral无特定情感模型架构与训练配置速览项目配置基座模型roberta-base12 层 Transformer隐藏维度 768词表 50265任务类型multi_label_classification多标签分类见 [config.json] 的problem_type字段训练轮数3 个 epoch共 16281 步学习率2e-5weight decay 0.01输出维度28每个情感一个 sigmoid 概率训练过程记录在 [trainer_state.json] 中验证集 F1 从第 1 轮的 0.535 稳步提升到第 3 轮的0.586最佳检查点为 checkpoint-16281ROC-AUC 达到 0.751验证吞吐约459 样本/秒说明该规模的模型在单卡 GPU 上迭代非常高效。模型效果如何各标签表现差异巨大在测试集上阈值 0.5整体指标为AccuracyPrecisionRecallF10.4740.5750.3960.450由于多标签任务中每个标签本质上是独立的二分类逐标签指标更有参考价值表现最佳gratitudeF1 高达 0.919、amusement0.829、love0.802——这些情感词义边界清晰⚠️表现最差grief、pride、relief样本过少、annoyancerecall 仅 0.159逐标签调阈值后将每个标签的判定阈值单独优化到 F1 最优例如 anger 降到 0.15整体 F1 可提升至0.541按样本量加权后更是0.611。 工程建议如果你的业务只需要感激/愤怒/中性等少数标签直接使用效果就很好若要全量 28 标签建议为每个标签单独设置阈值。如何在项目中快速接入情感分析最简单的方式是使用 HuggingFace Transformers 的 pipeline只需几行代码模型名即本镜像项目名 roberta-base-go_emotionsfrom transformers import pipeline classifier pipeline( tasktext-classification, modelSamLowe/roberta-base-go_emotions, top_kNone ) outputs classifier(I am not having a great day) print(outputs) # 每个标签一个 {label, score} 字典另外README 中提到该项目还提供ONNX 版本含 INT8 量化推理更快、依赖更小量化版模型体积缩小 75% 且几乎不损失精度非常适合边缘设备与低延迟服务。仓库文件结构说明本镜像仓库包含完整的模型与分词器文件模型权重约 499MB通过 Git LFS 管理文件作用README.md模型说明、训练方式与完整评估指标表config.json模型架构参数与 28 个标签映射id2label / label2idmodel.safetensors / pytorch_model.bin训练后的模型权重两种格式内容等价vocab.json / merges.txtRoBERTa 的 BPE 词表50265 个 token与合并规则tokenizer.json / tokenizer_config.json / special_tokens_map.json分词器配置与特殊 tokens、/s、pad、mask、unktrainer_state.json训练日志各轮 loss、验证 F1/AUC、最佳检查点信息常见问题FAQQ它和普通的二分类情感分析模型有什么区别A普通模型只输出正面/负面roberta-base-go_emotions 基于 go_emotions 数据集输出 28 种细粒度情感的概率可以精确区分愤怒与烦躁、喜悦与兴奋。Q为什么某些标签如 grief几乎检测不出来A标签在训练数据中样本极少grief 仅几十条属于典型的长尾标签问题可通过逐标签调阈值或数据清洗缓解。Q能用在中文文本上吗A该模型基于英文 RoBERTa-base 在英文 Reddit 数据上训练建议仅用于英文文本。【免费下载链接】roberta-base-go_emotions项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/roberta-base-go_emotions创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表