
大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载本文基于开源仓库examples/q8_13b-p7b-p13b/QA.md中的完整知识问答QA评测记录系统解读 Chinese-LLaMA-Alpaca 项目在 8-bit 量化部署下基础版 Alpaca-13B、Alpaca-Plus-7B、Alpaca-Plus-13B 三款模型在中文常识问答任务上的实测表现、打分方法、解码参数与逐题输出。读完本文你将掌握这套评测的复现方法、三款模型的选型差异以及如何从逐题输出中定位模型的知识短板与拒答边界。一、评测背景为什么做这份知识问答对比Chinese-LLaMA-Alpaca 项目在 examples 目录 下提供了一系列效果对比文档采用相同 Prompt、多模型同场竞技的方式快速评估不同模型的实际表现。examples/q8_13b-p7b-p13b/这一组专门对比8-bit 量化版的三款指令模型Alpaca-13B基础版基于原版 LLaMA-13B 中文指令数据精调Alpaca-Plus-7BPlus 版基于中文 LLaMA-Plus-7B 与多轮指令数据精调Alpaca-Plus-13BPlus 版基于中文 LLaMA-Plus-13B 精调根据同目录 README.md 的说明这些测试结果均基于8-bit 量化模型llama.cpp 的q8_0格式效果接近 FP16。量化部署正是本项目的核心卖点之一——通过 llama.cpp 将模型压缩到可以在个人 PC 上本地 CPU 运行详见根目录 README.md。知识问答Knowledge QA是该组评测中10 个任务组之一20 个样例其余任务还包括开放式问答、数值计算推理、文学、娱乐、写作、翻译、多轮交互、代码、伦理拒答等。整组评测共 200 个样例三款模型的总平均分为模型总平均分200 题知识问答单项20 题规整到 100 分Alpaca-13B74.370Alpaca-Plus-7B78.274Alpaca-Plus-13B 80.8 79需要特别强调的是README.md 原文说明以上分数应视为 paired score配对相对分数即多个系统两两比较得到的结果分数的大小关系有参考价值但绝对值本身没有太大参考意义。二、评测方法与打分机制2.1 测试流程每组任务满分 100 分由 20 个样例构成每个样例满分 10 分除多轮任务外所有任务均基于单轮回复打分不包含任何对话历史每个样例运行 2–3 次人工选取最好的一组交给机器评分以降低解码随机性带来的偏差样例得分之和规整到 100 分区间作为该模型在该任务上的得分。2.2 机器评分模板打分由 GPT-4 与 ChatGPTgpt-3.5-turbo以 10 分制完成优先使用 GPT-4由于 GPT-4 交互次数限制部分打分由 ChatGPT 进行。打分模板英文如下The followings are ChatGPT-like systems outputs based on a single prompt. Please rate an overall score on a ten point scale for each system and give a short explanation to justify your scores. Please try not to give the same scores for different system unless they are indistinguishable. Prompt: prompt-input System1: system1-output System2: system2-output2.3 统一解码参数全部测试使用同一组 llama.cpp 解码参数来自 README.md./main -m zh-alpaca-models/{7B,13B,7B-Plus}/ggml-model-q8_0.bin --color -f ./prompts/alpaca.txt -ins \ -b 16 -c 2048 -n 512 -t 6 \ --temp 0.2 --top_k 40 --top_p 0.9 \ --repeat_penalty 1.1各参数含义与取值说明可结合 llama.cpp 官方参数约定理解-m指定 8-bit 量化模型文件ggml-model-q8_0.bin--color终端输出着色便于区分用户输入与模型回复-f读取 alpaca 指令模板文件prompts/alpaca.txt-ins以指令理解 聊天模式启动对应 Alpaca 指令模型的正确用法与基座 LLaMA 的-p续写模式不同详见 README.md-b 16batch size 为 16-c 2048上下文长度 2048-n 512生成最多 512 个 token-t 6使用 6 个 CPU 线程--temp 0.2较低的温度使生成更稳定、更利于复现--top_k 40top-k 采样候选数为 40--top_p 0.9核采样累积概率阈值 0.9--repeat_penalty 1.1重复惩罚系数 1.1。README 同时提醒这组参数可能并不适合所有任务实际使用中对话、写作等自由生成类任务可适当调高--temp。三、知识问答分数总览QA.md 首先给出了三款模型在 20 个 QA 样例上的逐题得分与平均分模型平均分#1#2#3#4#5#6#7#8#9#10#11#12#13#14#15#16#17#18#19#2013B6.953882107108928778892986Plus-7B7.4310910108106628777785889Plus-13B7.85310108109107929888988777三个关键观察Plus-13B 整体最优平均分 7.85且在 #5、#7、#13 等基础事实题上拿到满分 10 分换算到 100 分制即 README 中的 79 分Plus-7B 是性价比之选7B 参数规模却以 7.4 的平均分紧追 13B 基础版6.95在 #2、#3、#4、#5 等题上甚至反超与其在整组评测中 78.2 的总分一致难点题三模型集体失分#1Lightning 线充电、#10机场代码 KIX、#17李约瑟难题等题三款模型得分普遍偏低暴露了中文常识问答中的典型知识盲区详见下文逐题解析。四、20 个测试样例逐题解析本节完整继承 QA.md 的 20 个测试样例Prompt 与三模型原始输出并补充逐题点评帮助读者理解得分差异背后的原因。样例按主题归类如下。4.1 生活与常识类#1–#3、#8、#10、#13、#14、#15、#19#1 我能用 lightning 数据线给安卓手机充电吗三模型均仅得 3 分模型输出13B是的您可以使用 lightning 数据线给安卓手机充电。Plus-7B是的您可以使用苹果的 lightning 数据线来连接到安卓手机并进行充电。Plus-13B是的您可以使用 Lightning 数据线来给安卓手机充电。点评三款模型都自信地给出了错误回答。Apple Lightning 与安卓常用的 USB-C / Micro-USB 接口互不兼容不经转接头无法直接充电。这是消费电子常识三模型全部踩坑说明该领域训练语料覆盖不足且模型缺乏常识纠错能力——即使知道 Lightning 是苹果接口Plus-7B 甚至说出口了也没有推导出不兼容的结论。#2 为什么天空是蓝色的13B: 8 分Plus-7B/Plus-13B: 10 分模型输出13B天空是蓝色的原因是因为大气中的气体分子会散射太阳光中的短波长如蓝色而吸收长波长的光线。Plus-7B天空是蓝色的是因为大气中的气体分子如氮气和氧气散射了太阳光中的短波长蓝光使得我们看到的天空呈现出蓝色。Plus-13B天空是蓝色的是因为大气中的气体分子散射了太阳光中的短波长蓝光使得我们看到的天空呈现出蓝色。点评三款模型都掌握了瑞利散射的核心解释短波长蓝光被大气分子散射Plus 版本表述更准确、得分更高。#3 如何做披萨13B: 8 分Plus-7B: 9 分Plus-13B: 10 分模型输出13B制作披萨的步骤1. 准备材料面团、番茄酱、奶酪、蔬菜、肉类等。2. 将面团擀成圆形涂上番茄酱。3. 撒上适量的奶酪和蔬菜或肉类。4. 放入预热好的烤箱中以200度左右烤10-15分钟。5. 取出披萨切成均匀的小块即可享用。Plus-7B1. 准备材料面团、番茄酱、奶酪、配料例如蔬菜、肉类等。2. 将面团揉成球状放在案板上用手掌压扁成圆形。3. 在面团上涂上适量的番茄酱。4. 撒上一层奶酪。5. 根据个人口味添加各种配料如蔬菜、肉类等。6. 把披萨放入预热至200℃的烤箱中烘烤10-15分钟直到奶酪融化和面饼变脆即可。Plus-13B制作披萨的步骤如下1. 准备面团将面粉、酵母、盐和水混合在一起。揉成光滑的面团放在温暖的地方发酵。2. 准备酱料可以使用番茄酱或自制酱料。3. 准备配料可以选择各种蔬菜、肉类、奶酪等。4. 把面团擀成薄饼状涂上酱料和配料。5. 将披萨放入预热好的烤箱中以200度左右的温度烤10-15分钟直到金黄色即可。点评均为合理的流程性回答。Plus-13B 增加了面团发酵环节步骤更完整得分最高Plus-7B 的细节手掌压扁、奶酪融化变脆也更贴近真实操作。#8 经常吃烫的东西会罹患什么病13B: 8 分Plus-7B: 6 分Plus-13B: 7 分模型输出13B经常吃烫的东西可能会罹患口腔癌、食管癌和胃癌等消化系统疾病。Plus-7B经常吃烫食物可能会导致口腔溃疡、胃炎和消化不良等疾病。Plus-13B经常食用过热的食物可能会导致口腔癌、食道癌等疾病。点评基础版 13B 答出口腔癌、食管癌与主流医学共识更接近世界卫生组织已将 65°C 以上热饮列为 2A 类致癌物得分最高Plus-7B 的回答偏保守、覆盖不足。医学类问答中回答完整度是评分关键。#10 机场代码 KIX 代表的是哪个机场三模型均仅得 2 分模型输出13B机场代码 KIX 代表韩国首尔国际机场。Plus-7B机场代码 KIX 代表的是日本东京羽田国际机场。Plus-13B机场代码 KIX 代表韩国首尔国际机场Incheon International Airport。点评三模型全部答错。KIX 实际是日本关西国际机场Kansai International Airport的 IATA 代码。三个模型分别幻觉出首尔金浦/仁川仁川代码应为 ICN与东京羽田应为 HND属于典型的机场代码类事实记忆缺失 编造。此题为全卷最低分题均 2 分是知识问答局限性的最直观证据。#13 水在什么情况下沸点小于 100 摄氏度13B: 7 分Plus-7B: 7 分Plus-13B: 8 分模型输出13B水在压力低于标准大气压1013千帕时其沸点会降低。Plus-7B水在以下情况下沸点小于100摄氏度1. 压力低于标准大气压101325帕2. 温度低于标准水温0°C3. 物质中存在其他物质如盐类或有机物。Plus-13B水的沸点会受到压力的影响当压力降低时沸点也会相应下降。例如在海拔较高的地方由于大气压较低水的沸点就会比在海平面上低。此外水中溶解其他物质也会影响沸点如盐分、糖类等。点评三模型均抓住了核心低压下沸点降低如高原。Plus-7B 第 2 条温度低于 0°C属于凑数错误Plus-13B 的溶质影响沸点描述盐/糖提高沸点表述为影响尚可接受得分最高。#14 飞机为什么能飞起来详细介绍其科学原理13B: 8 分Plus-7B: 8 分Plus-13B: 9 分模型输出13B飞机的飞行原理是利用空气动力学原理通过发动机产生的推力和机身的形状和结构来产生升力。当飞机在空气中飞行时空气会与机身表面形成一个压力差从而产生向上的推力使飞机上升并飞行。Plus-7B飞机之所以能够飞行是因为它利用了空气动力学的原理。当飞机在空气中运动时会受到空气的阻力和升力的作用。其中升力是由于飞机表面的气流产生的而阻力则是由于空气分子与飞机表面的摩擦所产生的。为了克服这些阻力飞机需要使用引擎来提供足够的推力使飞机能够克服重力并保持飞行状态。Plus-13B飞机能够飞行是因为它利用了牛顿第三定律的原理即每个作用都有一个相等大小且相反的方向的反作用。在飞机起飞和降落时发动机产生的推力是通过机翼产生升力使飞机向上运动。当飞机上升到一定高度后空气阻力逐渐增大使得飞机需要不断增加推力才能保持飞行状态。而当飞机下降时由于重力的作用飞机会向下坠落此时发动机的推力必须大于重力以抵消下坠的速度并保持飞行状态。点评三模型都提到了升力、推力和空气动力学但均未严谨展开机翼上下表面流速差 → 压力差 → 升力的伯努利原理解释。Plus-13B 侧重牛顿第三定律视角且存在轻微混淆推力与升力的因果关系但整体较完整得 9 分。#15 详细描述海市蜃楼的形成原因13B: 8 分Plus-7B: 7 分Plus-13B: 8 分模型输出13B海市蜃楼是由于大气层中温度和密度不均匀造成的。当光线通过温度和密度不均匀的空气层时会发生折射和反射导致光线在不同高度和方向上出现不同的现象。当光线从较冷的空气层进入较热的空气层时会发生折射使光线弯曲从而形成海市蜃楼。Plus-7B海市蜃楼是由于大气折射和折射率变化引起的。当光线从高空通过低空气层时由于空气密度不同光线会发生折射从而使远处物体看起来变小或变形。这种现象在沙漠、湖泊等开阔的区域更容易出现。Plus-13B海市蜃楼是一种光学现象通常在沙漠、海洋或湖泊中出现。它的形成是由于空气温度差异导致光线折射的结果。当太阳光照射到地面时地面会将部分热量传递给周围的空气中使空气变得比周围环境更暖。由于空气的密度随温度而变化因此较热的空气上升并形成一个类似云层的薄层称为海市蜃楼。当光线从地平线反射到海市蜃楼上升时它们会穿过这个薄层并在其上方再次被折射。由于海市蜃楼的厚度非常小光线在经过多次反射和折射后最终会被散射并形成一个倒映的图像。这种图像通常是扭曲、模糊或扭曲的并且可能与真实物体的位置不符。点评三模型都抓住了空气密度/温度不均 → 光线折射这一核心机制Plus-13B 叙述最详尽含具体场景与折射过程但物理细节如热空气上升形成薄层仍有瑕疵。#19 为什么会有春夏秋冬四季变化三模型均 7–8 分模型输出13B春夏秋冬四季变化是由于地球绕太阳公转的轨道和自转轴的倾斜角度引起的。这些因素导致了不同季节的气候和天气条件的变化包括温度、湿度、日照时间、风向等。Plus-7B地球绕着太阳公转受到太阳的辐射和引力影响导致地球的气候发生变化。在不同的季节里地球的倾斜角度不同使得太阳照射到地球上的角度和强度也不同从而导致气温、降水等气象要素的变化。Plus-13B这是由于地球的自转和公转所导致的不同季节太阳直射点在地球上的位置不同从而影响气温、降水等气象条件。点评核心原因黄赤交角导致太阳直射点南北移动三模型均基本答对Plus 版本表述更规范。4.2 科学知识与医学类#4、#6、#9、#12、#17、#18#4 为什么冥王星被踢出太阳系13B: 2 分Plus-7B: 10 分Plus-13B: 8 分模型输出13B冥王星被踢出太阳系的原因是它与木星的引力相互作用导致它的轨道变得不稳定最终被太阳系中的其他天体所吸引而脱离了太阳系。Plus-7B冥王星在2006年被重新定义为矮行星而不是行星。因此它不再被视为太阳系中的一个行星。Plus-13B冥王星被踢出太阳系是因为它的轨道太远不符合行星的定义。根据国际天文学联合会的定义一个行星必须绕其恒星公转的轨道是稳定的、近乎圆形的并且没有其他天体对其产生显著影响。因此冥王星被认为是一个矮行星而不是一个真正的行星。点评本题是全卷差异最悬殊的题目之一。基础版 13B 完全答错把降级为矮行星编造成与木星引力相互作用脱离太阳系仅得 2 分Plus-7B 准确点出 2006 年、矮行星、不再是行星得满分 10 分Plus-13B 补充了 IAU 行星定义但轨道太远/近乎圆形表述欠准确得 8 分。Plus 系列在知识更新2006 年后的天文分类上明显优于基础版。#5 列举太阳系的全部行星三模型均 10 分模型输出13B水星、金星、地球、火星、木星、土星、天王星、海王星。Plus-7B太阳系的行星包括水星、金星、地球、火星、木星、土星、天王星和海王星。Plus-13B水星、金星、地球、火星、木星、土星、天王星、海王星。点评三模型全部准确列出八大行星且没有把冥王星混入满分。#6 详细说明 DNA 和 RNA 的区别13B: 7 分Plus-7B: 8 分Plus-13B: 9 分模型输出13BDNA脱氧核糖核酸是存储遗传信息的分子由四种碱基腺嘌呤、鸟嘌呤、胸腺嘧啶和鳞氨酸组成。而RNA核糖核酸是一种可以转录DNA信息并参与蛋白质合成的分子由四种碱基腺嘌呤、鸟嘌呤、胸腺嘧啶和尿嘧啶组成。Plus-7BDNA脱氧核糖核酸和RNA核糖核酸是两种不同的核酸分子。它们的主要区别在于1. 化学结构DNA由脱氧核苷酸组成而RNA则由核苷酸组成。其中脱氧核苷酸包括脱氧腺嘌呤、脱氧鸟嘌呤、脱氧胞嘧啶和脱氧尿嘧啶四种碱基而核苷酸则包括核糖、磷酸和四种碱基腺嘌呤、鸟嘌呤、胞嘧啶和尿嘧啶。2. 功能DNA是遗传物质负责存储和传递生物体的遗传信息RNA则是基因表达过程中的重要分子参与蛋白质合成和翻译等过程。3. 化学性质DNA具有较强的稳定性不易被水解和氧化反应而RNA则容易受到酸碱环境的影响易于被水解和氧化反应。4. 结构特点DNA呈双螺旋结构由两条互补的链组成而RNA则呈单链结构由一条单链组成。Plus-13BDNA脱氧核糖核酸和RNA核糖核酸是两种不同的核酸分子它们在生物体内发挥着不同的功能。以下是它们的主要区别1. 化学结构不同DNA是由四种碱基腺嘌呤、胸腺嘧啶、鸟嘌呤和胞嘧啶组成的双螺旋结构而RNA则是由三种碱基腺嘌呤、尿嘧啶和胞嘧啶组成的单链结构。2. 功能不同DNA是生物体内的遗传物质负责存储和传递遗传信息。而RNA则在蛋白质合成过程中起着重要的作用它通过转录将DNA中的基因信息转化为RNA分子然后被翻译成氨基酸序列形成蛋白质。3. 长度不同DNA通常比RNA长因为它们包含更多的碱基对。例如人类的DNA长约30亿个碱基对而RNA则只有数百万个碱基对。4. 化学修饰不同在RNA分子中腺嘌呤和尿嘧啶的5-磷酸基团可以被脱去形成一种称为核糖核酸mRNA的前体。这种前体可以在翻译过程中被酶水解成氨基酸序列从而形成蛋白质。5. 生物学应用不同DNA在基因工程、生物技术和医学诊断等领域具有广泛的应用而RNA则在病毒学、药物研发和基因治疗等方面发挥着重要作用。点评三模型都从结构、功能等角度展开。需要注意的是即便得分最高的 Plus-13B 也存在事实错误如RNA 由三种碱基组成DNA 长约 30 亿个碱基对等表述不严谨胸腺嘧啶误与 RNA 关联等Plus-7B 也把脱氧尿嘧啶混入 DNA 碱基。得分差距主要来自展开篇幅与条理性而非完全的事实正确——这提示机器评分对结构完整、条理清晰有较高权重。#9 盐酸莫西沙星能否用于治疗肺炎13B: 9 分Plus-7B: 6 分Plus-13B: 9 分模型输出13B是的盐酸莫西沙星是一种抗生素可以用于治疗肺炎和其他细菌感染。Plus-7B盐酸莫西沙星是一种抗生素主要用于治疗革兰阳性菌引起的感染。肺炎是细菌感染的一种类型但大多数情况下是病毒感染导致的。因此盐酸莫西沙星不能用于治疗肺炎。Plus-13B是的盐酸莫西沙星是一种广谱抗生素可以用于治疗多种细菌感染包括肺炎。点评莫西沙星第四代氟喹诺酮类广谱抗菌药确实可用于细菌性肺炎治疗。13B 与 Plus-13B 的可用于治疗肺炎基本正确未限定细菌性Plus-7B 虽然补充了多数肺炎由病毒引起的合理提醒但直接断言不能用于治疗肺炎反而被判低分——体现了医学问答中严谨限定 vs 过度否定的权衡。#12 治疗糖尿病的常见药物有什么有哪些禁忌症13B: 7 分Plus-7B: 7 分Plus-13B: 8 分模型输出13B治疗糖尿病的常见药物包括1. 磺脲类药物如格列酮、格列韦2. 双胍类药物如格列米松、奥美拉唑3. 胰岛素类药物如注射胰岛素、胰岛素泵4. α-葡萄糖苷酶抑制剂如格列米脲5. 胰岛素释放素再摄取抑制剂如格列米脲。禁忌症包括1. 过敏史 2. 肾功能不全 3. 高血压 4. 心血管疾病 5. 孕妇和哺乳期妇女。Plus-7B常见的糖尿病药物包括胰岛素、二甲双胍、格列本脲等。这些药物有不同的作用机制和副作用需要根据患者的具体情况进行选择和使用。禁忌症包括过敏史、肝肾功能不全、高血压等。Plus-13B治疗糖尿病的常见药物包括磺脲类、双胍类、胰岛素增敏剂等。其中磺脲类药物如格列吡嗪和二甲双胍是常用的口服降糖药双胍类药物如二甲双胍和罗格列酮可以促进胰岛素分泌降低血糖水平胰岛素增敏剂如格列美脲、格列喹酮等则可以直接刺激胰岛素的分泌。禁忌症包括肝肾功能不全、妊娠期、哺乳期、严重心肺疾病等。此外糖尿病患者在使用药物治疗时应注意饮食和运动避免过度饮酒和吸烟等不良习惯。点评三模型均给出了药物大类与禁忌症但细节均有问题如 13B 把奥美拉唑质子泵抑制剂误归为双胍类、药物名张冠李戴Plus-13B 药物作用机制描述混乱。Plus-13B 因内容更丰富得分最高。#17 什么是李约瑟难题13B: 2 分Plus-7B: 5 分Plus-13B: 8 分模型输出13B李约瑟难题是指一个著名的哲学问题即人类是否可以从一个已知的前提出发推导出任何结论。这个问题最初由美国哲学家李约瑟提出并被认为是逻辑学和哲学中的一个重要问题。Plus-7B李约瑟难题是指在科学发展中如何平衡探索和应用之间的关系。Plus-13B李约瑟难题是指在中世纪欧洲由于技术和文化的限制为什么中国没有出现工业革命的现象。这个问题被称为李约瑟难题因为英国历史学家李约瑟J. Needham在他的著作《中国科技史》中提出了这个问题。备注此为模型原始输出个别内容存在明显史实偏差如李约瑟难题实际指近代科学为何未在中国产生之问Plus-13B 的表述也有偏差原文档仅记录输出未作事实订正。点评本题再次呈现显著代差13B 完全答错把李约瑟当成美国哲学家、杜撰哲学问题仅 2 分Plus-7B 部分相关科学探索与应用的平衡5 分Plus-13B 提到了英国历史学家、《中国科技史》与中国为何未出现工业革命的关联得 8 分。Plus 系列对中国历史文化类知识的掌握明显强于基础版。#18 为什么三极管可以用于放大信号13B: 9 分Plus-7B: 8 分Plus-13B: 7 分模型输出13B三极管可以用于放大信号因为它具有一个控制极和两个发射极可以通过控制极的电压来控制发射极的电流。当电流通过发射极时它会产生电场从而将输入信号放大成输出信号。Plus-7B三极管可以放大信号是因为当输入信号与基极电压相等时它将处于截止状态从而阻止电流通过。当输入信号大于基极电压时三极管将进入导通状态允许电流通过。因此当输入信号较大时三极管会放大其大小输出信号也会相应增大。Plus-13B三极管是一种半导体器件具有三个电极发射极、基极和集电极。正确命名了三个电极发射极、基极、集电极。当电流通过发射极时电子会在基极上被吸引并释放出来形成一个正向电压差。这个电压差可以放大信号从而实现放大功能。点评三模型都未能准确解释基极小电流控制集电极大电流的放大本质术语也有混淆13B 说一个控制极和两个发射极。分数差异主要来自对三极管结构描述的完整度。4.3 中国人文与历史类#7、#11、#16、#17#7 中国的东北三省指的是哪里三模型均 10/8/10 分模型输出13B中国东北三省指的是黑龙江、吉林和辽宁三个省份。Plus-7B中国的东北三省是指黑龙江、吉林和辽宁这三个省份。Plus-13B中国东北三省是指辽宁、吉林和黑龙江这三个省份。点评全部正确仅列举顺序不同Plus-13B 从辽宁起列均满分。#11 介绍一下导演张艺谋。13B: 8 分Plus-7B: 8 分Plus-13B: 9 分模型输出13B张艺谋是中国著名的电影导演代表作品包括《红高粱》、《活着》、《英雄》等。他的作品风格独特注重情感表达和视觉效果被誉为中国电影的代表人物之一。Plus-7B张艺谋是中国著名的电影导演出生于1965年毕业于中央戏剧学院导演系。他的代表作品包括《红高粱》、《大红灯笼高高挂》、《英雄》等。他被誉为中国电影的代表人物之一曾多次获得国际电影节大奖。Plus-13B张艺谋是中国著名的电影导演出生于1949年毕业于北京电影学院。他的代表作品包括《红高粱》、《大红灯笼高高挂》、《活着》等。他以独特的视觉风格和深刻的主题探讨中国传统文化与现代社会现实之间的矛盾和冲突被誉为中国电影界的重要代表人物之一。点评三模型都答出主要代表作。注意细节事实Plus-7B 称其1965 年生、中央戏剧学院、Plus-13B 称1949 年生、北京电影学院均与实际1950 年生、北京电影学院摄影系存在偏差但机器评分主要基于整体表述给分。原文档保留的是模型原始输出未作事实核验。#16 第一次世界大战的导火索是什么13B: 9 分Plus-7B: 8 分Plus-13B: 9 分模型输出13B第一次世界大战的导火索是奥匈帝国的王储弗朗茨·斐迪南在1914年6月28日被塞尔维亚民族主义者刺杀事件。Plus-7B第一次世界大战的导火索是奥匈帝国皇储弗朗茨·费迪南大公被塞尔维亚民族主义者刺杀事件。Plus-13B第一次世界大战的导火索是奥匈帝国皇储弗朗茨·费迪南德在萨拉热窝被塞尔维亚民族主义者刺杀事件。点评三模型均准确答出萨拉热窝刺杀事件仅人名译法略有差异得分接近满分。4.4 物理极端条件类#20#20 如何能够达到零下 1000 摄氏度请列举具体方法。13B: 6 分Plus-7B: 9 分Plus-13B: 7 分模型输出13B要达到零下1000摄氏度需要使用以下方法1. 使用超低温技术通过使用超低温技术例如在液氮中冷却物体可以达到零下1000摄氏度的温度。2. 使用超低温设备使用超低温设备如超低温冰箱或超低温实验室可以达到零下1000摄氏度的温度。3. 利用宇宙空间通过利用宇宙空间中的低温环境例如在太阳系外的行星上可以达到零下1000摄氏度的温度。Plus-7B目前没有实际的方法可以将温度降至负100摄氏度以下因为在绝对零度-273.15℃以上物质会失去所有热运动并变成固态。Plus-13B要达到零下1000摄氏度可以使用以下方法1. 超导体在低温下某些物质会失去电阻并进入超导状态。例如液氮的温度为-273.15°C因此将液氮储存在容器中使其保持低温状态可以达到零下1000摄氏度。2. 激光冷却通过使用激光来冷却原子或分子可以使它们达到非常低的温度。例如使用激光冷却技术可以将气体冷却到接近绝对零度-273.15°C。3. 超冷分子束通过在低温下将气体压缩成极小的空间并使其与超导体接触可以实现零下1000摄氏度的温度。例如使用超冷分子束技术可以在实验室中创造出接近绝对零度的环境。点评本题考察模型对物理常识边界的判断力。零下 1000°C 低于绝对零度−273.15°C在物理上不可能实现。基础版 13B 与 Plus-13B 都顺着提问编造了实现方法液氮、激光冷却等且存在温度数值自相矛盾而Plus-7B 正确指出没有实际方法并给出绝对零度依据获 9 分。这是模型是否敢于质疑不合理提问的典型案例——Plus-7B 的拒答/纠错倾向反而得分更高。五、逐题得分差异的三个规律综合 20 题得分见第三节表格可以提炼出 QA 能力差异的三个规律Plus 系列在知识更新类题目上碾压基础版冥王星#42 vs 10/8、李约瑟难题#172 vs 5/8两道题中基础版 13B 不仅不会还会自信地编造错误答案Plus 系列基于更大的中文指令数据知识覆盖更广、更时新。模型规模≠事实正确率Plus-7B 在 #410 分、#209 分上胜过 Plus-13B8 分、7 分说明 7B 的 Plus 精调质量在常识问答上已具备与 13B 竞争的实力而基础版 13B 仅凭参数更大在 #6、#9、#12 等题上靠输出完整性得分更高。全员知识盲区集中在代码/专名类事实#1Lightning 接口、#10机场代码 KIX三道题三模型集体失分说明当前训练数据对接口兼容性、机场代码这类高密度专名事实覆盖不足——这类题目对任何 LLM 都是硬骨头。六、如何在本地复现这份评测复现评测需要合并好的中文 Alpaca 模型 → llama.cpp 量化 → 统一解码参数。项目相关资源如下6.1 模型准备本项目发布的为 LoRA 权重需与原版 LLaMA 合并后才能使用。可参考 scripts/merge_llama_with_chinese_lora.py标准版或推荐的低资源版 scripts/merge_llama_with_chinese_lora_low_mem.py合并后再用 llama.cpp 量化到q8_0对应本文使用的 8-bit 模型。合并前请确认本机内存与磁盘满足 README.md 给出的最低要求13B FP16 约 24 GB8-bit 量化后约 14.9 GB。6.2 运行命令按第二节的命令运行即可。若希望换用其他量化格式或解码参数可参考同仓库其他评测组的对比4-bit 版评测见 examples/q4_7b-13b/README.mdq4_0--repeat_penalty 1.3FP16 33B 版评测见 examples/f16-p7b-p13b-33b/README.md。6.3 其他推理方式Transformers 推理使用 scripts/inference/inference_hf.pyAlpaca 模型需加--with_prompt参数详见 README.mdGradio Web 演示使用 scripts/inference/gradio_demo.py 提供多轮对话界面LangChain 集成检索式问答示例见 scripts/langchain/。6.4 注意事项生成具有随机性受解码超参、随机种子影响文档明确评测并非绝对严谨测试结果仅供参考欢迎自行体验若复现时发现回答质量骤降请检查模型与启动参数是否匹配如 LLaMA 与 Alpaca 词表不可混用、Alpaca 需-ins模式等见 README.md 的已知问题。七、知识问答评测的局限与选型建议7.1 评测本身的局限配对分数paired score分数是相对比较结果绝对值无太大参考意义单轮打分除多轮任务外均不含对话历史不能反映多轮追问能力机器评分偏差从逐题输出可见分数与展开完整度、条理性强相关个别事实错误未必被严格惩罚如 #6 DNA/RNA 的碱基错误、#11 张艺谋生平偏差因此高分的信息完整度与事实正确率应分别看待。7.2 选型建议基于本组 20 题结果场景建议中文常识问答为主、追求最佳效果Alpaca-Plus-13BQA 单项 79 分本组最高资源有限CPU/低内存但要求常识能力Alpaca-Plus-7BQA 74 分总评 78.27B 规模性价比突出需要完整长回复写作、翻译类参考 README.md 其他任务组Plus-13B 在写作87、翻译90等自由生成任务上优势更大涉及危险/非法内容的安全边界参考同组 ETHICS.mdPlus 系列伦理拒答得分Plus-7B 99、Plus-13B 100远超基础版82Plus 系列更可靠7.3 使用前提与边界本文所有结论基于8-bit 量化q8_0模型 统一解码参数 GPT-4/ChatGPT 机器打分这一特定评测配置结论不可外推至其他量化位宽、解码参数或评测方式模型输出存在幻觉风险如 #1、#10、#20不可直接用于医疗、法律等专业决策本项目模型存在 README.md 中列出的固有局限可能产生有害内容、中文理解能力仍有提升空间等学术研究之外请谨慎使用。八、小结examples/q8_13b-p7b-p13b/QA.md是一份含 20 个中文常识问答样例、三模型逐题打分与原始输出的高密度评测记录。通过对分数表与逐题输出的解析可以看出在 8-bit 量化部署条件下Alpaca-Plus-13B 的常识问答综合表现最好79/100Alpaca-Plus-7B 以 7B 规模获得 74 分的高性价比而基础版 Alpaca-13B 在知识更新类与纠错类题目上明显落后。同时评测也清楚暴露了模型在接口兼容、机场代码等专名事实上的共同短板以及低温度、高 top-k 采样 重复惩罚解码参数对复现评测结果的重要性。如需深入研究其他能力维度可继续阅读同目录下的 OQA.md、REASONING.md、ETHICS.md 等系列评测文档。赞分享大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载相关推荐PrismLauncher-Cracked如何突破Minecraft离线启动的技术壁垒PrismLauncher Cracked如何突破Minecraft离线启动的技术壁垒 在Minecraft生态系统中启动器是连接玩家与游戏世界的关键桥梁大模型人工智能预训练微调LoRA本地部署NLP模型评测Chinese-LLaMA-Alpaca 知识问答评测Alpaca-Plus-7B / Plus-13B / 33B 中文常识能力对比Chinese LLaMA Alpaca 知识问答评测Alpaca Plus 7B / Plus 13B / 33B 中文常识能力对比 本文基于开源仓库 Ch大模型人工智能预训练微调LoRA本地部署NLP模型评测Chinese-LLaMA-Alpaca 音乐、体育、娱乐能力实测8-bit 量化下 Alpaca-13B / Plus-7B / Plus-13B 效果对比与评测方法详解Chinese LLaMA Alpaca 音乐、体育、娱乐能力实测8 bit 量化下 Alpaca 13B / Plus 7B / Plus 13B 效果对比大模型人工智能预训练微调LoRA本地部署NLP模型评测上一篇抖音批量下载工具完全指南5分钟上手无水印批量下载全攻略下一篇TegraRcmGUI使用指南3分钟为旧版Switch注入Payload打开自制的第一扇门创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考