ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MATA (m\=ata): Mindful Assessment of the Telugu Abilities of Large Language Models

MATA (m\=ata): Mindful Assessment of the Telugu Abilities of Large Language Models 文章《MATA (మాట): Mindful Assessment of the Telugu Abilities of Large Language Models》总结与翻译一、文章主要内容本文聚焦低资源语言泰卢固语(Telugu),针对现有大语言模型(LLMs)泰卢固语能力评估的不足,开展了三方面核心工作:构建MATA评估数据集:数据集含729道精心设计的题目,涵盖选择题(约25%)和开放式问题(约75%),分语法、事实知识、词汇、语言推理、谜语、习语谚语、其他推理7个大类及15个亚类。题目来源为印度安得拉邦和特伦甘纳邦1-10年级泰卢固语教材及公开竞争性考试试题,确保涵盖泰卢固语独特语法结构(如复合词)、文化嵌入内容(如韵律诗、谜语),填补现有数据集仅侧重事实知识选择题的空白。评估11个LLMs的泰卢固语能力:涵盖5个开源模型(如Gemma3-12B、LLama3.3-70B)和6个闭源模型(如GPT-4o、Gemini2.5-Pro),采用英语和泰卢固语两种提示词,结合“LLM作为评判者”(LLM-as-a-judge,用LLama3.3-70B和Gemma3-27B)与人工评估两种方式。结果显示,闭源模型Gemini2.5-Pro表现最优,选择题英语提示词准确率0.942、泰卢固语提示词0.974;开放式问题难度显著更高,多数模型准确率仅0.22-0.45,且事实知识、语言推理等需文化或深层语
返回列表