ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

lm-evaluation-harness 安装与配置实战指南:十分钟跑通第一个语言模型评测

lm-evaluation-harness 安装与配置实战指南:十分钟跑通第一个语言模型评测 lm-evaluation-harness 安装与配置实战指南十分钟跑通第一个语言模型评测【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness如果你手里有一个训练好或刚下载的语言模型想知道它到底行不行那么逐个人工写评测脚本会非常折磨人。lm-evaluation-harness 安装与配置就是解决这个问题的最快路径——它是 EleutherAI 开源的语言模型评测框架一条lm-eval run命令就能把同一个模型在 60 多个学术基准hellaswag、MMLU、GSM8K、ARC 等上跑完并输出标准化的、可横向对比的分数。能力速览这个评测框架能替你做什么能力对你意味着什么60 内置学术基准mmlu、arc、gsm8k、hellaswag 等数百个任务与变体开箱即用模型后端广覆盖本地 transformers 模型、vLLM 快速推理、NeMo、ONNX、GGUF以及 OpenAI 风格的商业 API 都能接标准化 few-shot 评测少样本示例和题干按上图结构拼进同一份提示词提示词公开可复现跨论文可比任务检索与预检lm-eval ls一览全部任务lm-eval validate在正式跑之前先校验配置结果落盘与缓存--output_path保存分数--use_cache中断续跑时跳过已算过的样本多卡支持数据并行、模型切分、张量并行均可按需开启任务在框架里按组 → 子任务分层组织比如mmlu是一个包含几十个学科子任务的组可以整组一次跑完。下图以挪威语基准 NorEval 为例展示一个基准内部按类别划分的任务结构内置任务的组织方式与此类似环境速查动手前核对这 4 项项目要求说明Python3.10 及以上框架声明requires-python3.10旧版本装不上Git常见版本即可仅用于拉取源码GPU可选CUDA 卡体验最好Apple 芯片 Mac 可走 MPS纯 CPU 能跑但慢pip常见版本即可核心包很轻模型后端按需另装注意新版不再把 torch、transformers 打进基础包装什么后端补什么依赖如lm_eval[hf]、lm_eval[vllm]首次安装比早年轻快不少。上手路径从克隆仓库到看到第一份结果拉取源码git clone --depth 1 https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness--depth 1只取最新快照不带历史省时间也省磁盘。安装核心框架pip install -e .-e是可编辑安装之后在仓库里改任务定义即时生效不用重装。装上你要用的模型后端pip install lm_eval[hf]hf对应 Hugging Face transformers 本地模型用 vLLM 或 API 的话换成lm_eval[vllm]或lm_eval[api]也可以合并写成lm_eval[hf,vllm,api]。确认命令可用lm-eval -h预期看到run跑评测、ls列任务、validate校验配置三个子命令的帮助列表 ✅ 看到它们就说明装好了。逛逛能跑哪些任务lm-eval ls tasks预期输出一长串任务名后面选任务时拿不准就回这里查。实战配置用 Hub 上的模型跑通第一个评测任务场景模型放在 Hugging Face Hub 上以 EleutherAI/gpt-j-6B 为例你想看它在 hellaswag 上的常识分数机器有一张 CUDA 卡。lm-eval run \ --model hf \ --model_args pretrainedEleutherAI/gpt-j-6B \ --tasks hellaswag \ --device cuda:0 \ --batch_size 8每个参数在干什么参数作用--model hf声明模型后端是本地 transformers 加载--model_args pretrained...指定模型可继续追加dtypefloat16、revisionstep100000等设置--tasks hellaswag任务名多个用逗号分隔写mmlu就是整组一起跑--device cuda:0模型放哪张卡Mac 写mps无显卡写cpu--batch_size 8一次算 8 个样本卡越大可越激进写auto会自动探上限运行中会看到进度条结束后打印指标分数表hellaswag 为 acc / acc_norm。想让结果落盘追加--output_path results/ --log_samples想先小规模验证流程加--limit 10只抽 10 条样本。少样本任务则用--num_fewshot 5指定放进上下文的示例数。进阶选读多卡与性能调优单卡可跳过模型放得下、想跑得更快数据并行K 张卡各放一份模型约快 K 倍accelerate launch -m lm_eval --model hf --tasks arc_easy --batch_size 16单卡装不下模型切分在 model_args 里加parallelizeTrue权重自动摊到多张卡lm-eval run --model hf --tasks arc_easy --model_args pretrained模型名,parallelizeTruevLLM 快速推理pip install lm_eval[vllm]后--model vllm --batch_size auto利用其连续批处理榨干吞吐批量大小自调--batch_size auto:4会自动重估最大批量 4 次样本长短不一时更稳避坑与 FAQQ跑着跑着爆显存OOM把--batch_size调小或在 model_args 里加load_in_4bitTrue用 4bit 量化加载。QGGUF 模型加载卡住几个小时没给独立 tokenizer 时框架会尝试从 GGUF 文件重建分词器耗时可能以小时计。在 model_args 里显式传tokenizer/path/to/tokenizer加载能从小时级缩回秒级。QAPI 模型上我传了--device反而报错--device只适用于本地模型openai-completions 这类外部服务调用不要传这个参数。Q装完跑不了模型说缺 transformers / torch新版模型后端是分离安装的先pip install lm_eval[hf]再运行。QApple 芯片 Mac 能验吗把--device cuda:0换成--device mps即可若分数出现异常先对比--device cpu的结果确认。Q任务名记不住 / 不确定配置对不对lm-eval ls tasks查列表lm-eval validate --tasks 任务名可在正式跑之前预检配置。结语与下一步导航第一条评测跑通之后可以沿这些入口继续深入接下来想做什么去哪里看查全部 CLI 参数与子命令CLI 参考把评测参数写进 YAML 配置文件配置指南以 Python 代码方式调用框架Python API 文档定义自己的评测任务任务定义目录、新任务指南了解各模型后端实现模型后端源码结果对比、提示词导出等工具脚本scripts/按先--limit 10小样验证流程 → 去掉 limit 跑全量 → 用保存的结果文件对比多个模型的节奏推进你的第一套模型评测报告很快就能成形。【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表