ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

XTREME 九大任务深度解读:从词性标注、NER 到跨语言问答一网打尽

XTREME 九大任务深度解读:从词性标注、NER 到跨语言问答一网打尽 XTREME 九大任务深度解读从词性标注、NER 到跨语言问答一网打尽【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme想测试多语言预训练模型的外语能力到底有多强XTREME 基准是目前最权威的跨语言评测体系之一。XTREMECross-lingual TRansfer Evaluation of Multilingual Encoders由 Google Research 与 DeepMind 联合推出覆盖 40 种类型学差异巨大的语言横跨 12 个语系通过九大 NLP 任务全面评估模型的跨语言泛化能力。无论你是刚接触多语言 NLP 的新手还是想跑排行榜的进阶玩家这篇九大任务深度解读都能帮你理清头绪。XTREME 的九大任务可归为四大家族结构化预测词性标注、命名实体识别、句子分类自然语言推理、句对判别、句子检索平行句挖掘与跨语言问答抽取式问答。所有任务统一采用英文训练、多语言零样本测试的评估范式下面逐一拆解。一、结构化预测词性标注与命名实体识别UD-POS跨语言词性标注的试金石词性标注Part-of-Speech Tagging是理解句子结构的基础任务XTREME 选用Universal Dependencies v2.5数据集覆盖 33 种语言。模型需要为每个词打上名词、动词、形容词等词性标签评测指标为F1 分数。想跑通这个任务可以参考 scripts/train.sh 中的预处理与训练流程。Wikiann NER覆盖全部 40 种语言的命名实体识别命名实体识别NER要找出人名、地名、机构名等实体。XTREME 使用的Wikiannpanx数据集是九大任务中语言覆盖最广的40 种语言全部包含其中不乏泰米尔语、斯瓦希里语等低资源语言。该任务同样以 F1 作为核心指标是检验模型跨语言实体抽取能力的硬核关卡。二、句子分类XNLI 与 PAWS-XXNLI跨语言自然语言推理Cross-lingual Natural Language Inference要求模型判断句子对之间的蕴含entailment、矛盾contradiction或中立neutral关系覆盖 15 种语言。模型先用英文 MNLI 数据微调再零样本迁移到其他语言测试集。数据处理逻辑可查看 third_party/processors/xnli.py。PAWS-X句对判别中的找茬高手PAWS-X 是Paraphrase Adversaries from Word Scrambling的跨语言版本覆盖 7 种语言。它的特点是样本极具迷惑性两个句子词完全一样、只是顺序不同模型要判断它们是否语义相同。覆盖 de、en、es、fr、ja、ko、zh 七种语言用准确率Accuracy评估。三、句子检索BUCC 2018 与 Tatoeba这两个任务不需要训练直接用预训练模型的句子表征做相似度计算是检验跨语言句子嵌入质量的最快方式。BUCC 2018可比语料中的平行句挖掘BUCC 任务需要在可比语料中找出互为翻译的平行句对覆盖德语、法语、俄语、中文 4 种语言用专门设计的F1 分数同时考虑精确率与召回率评估。Tatoeba覆盖 35 种语言的检索基准Tatoeba 数据集的覆盖语言多达 35 种模型要为每个句子在目标语言中检索出正确的翻译。bash scripts/train.sh [MODEL] tatoeba一行命令即可直接评测。四、跨语言问答三件套XQuAD、MLQA、TyDiQA问答是九大任务中最考验综合能力的部分XTREME 一口气集成了三个抽取式问答数据集均以EM精确匹配 F1双指标评估。数据集覆盖语言训练数据特点XQuAD11 种SQuAD v1.1跨语言迁移问答经典基准MLQA7 种SQuAD v1.1多语言问答含阿拉伯语、印地语等TyDiQA-GoldP9 种TyDiQA-GoldP 英文集信息寻求型问答覆盖孟加拉语、斯瓦希里语等低资源语言XQuAD跨语言问答的入门必修课XQuAD 由英文 SQuAD 人工翻译而来覆盖 en、es、de、el、ru、tr、ar、vi、th、zh、hi 共 11 种语言是评测零样本跨语言问答迁移的标准数据集。MLQA更真实的低资源语言考验MLQA 的独特之处在于测试数据是原文而非翻译覆盖 7 种语言包含阿拉伯语、印地语、越南语等高难度语种。由于模型只能用英文 SQuAD 训练MLQA 对跨语言泛化能力的要求更为苛刻。TyDiQA-GoldP信息寻求型问答的终极挑战TyDiQA 基于维基百科真实提问构建覆盖 9 种类型学多样的语言包括孟加拉语bn、芬兰语fi、斯瓦希里语sw等。它的抽取式问答实现可参考 third_party/processors/squad.py 中的答案跨度处理逻辑。五、九大任务的语言覆盖与评估体系一览XTREME 的 40 种语言按 ISO 639-1 双字母代码标识任务与语言的组合矩阵非常讲究每个任务覆盖不同语言子集低资源语言如泰米尔语 ta、约鲁巴语 yo在 NER、词性标注任务中被重点考察。评估方式统一而透明所有预测文件按test-{语言代码}.{扩展名}命名问答任务用 json其余用 tsv放在对应任务子目录中然后用一条命令完成全部评测python evaluate.py --prediction_folder [预测目录] --label_folder [标签目录]评测脚本 evaluate.py 会根据任务自动选择指标准确率、F1 或 EMF1并汇总出综合得分。提交前可以先对照 mock_test_data/predictions 检查目录结构是否符合规范。六、快速上手从下载数据到跑通基线想亲手体验九大任务只需两步克隆仓库并安装依赖git clone https://gitcode.com/gh_mirrors/xt/xtreme然后执行bash install_tools.sh下载数据后用一条命令微调任一任务bash scripts/train.sh [模型名] [任务名]支持的模型包括bert-base-multilingual-cased、xlm-mlm-100-1280和xlm-roberta-large任务名支持udpos、panx、xnli、pawsx、xquad、mlqa、tydiqa、bucc2018、tatoeba九种与九大任务一一对应。总结为什么九大任务缺一不可XTREME 的高明之处在于用任务多样性逼出模型的真实跨语言能力词性标注考句法、NER 考实体、XNLI 考语义推理、问答考深度理解、检索考表征对齐。单一任务的高分可能是侥幸而九大任务的全方位覆盖才能让不同语言、不同任务上的表现差异无所遁形。无论你是研究者还是工程师把 XTREME 作为多语言模型的体检报告都是最省心也最靠谱的选择。【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表