ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

whichllm 完整指南:按硬件和基准测试筛选本地 LLM 模型

whichllm 完整指南:按硬件和基准测试筛选本地 LLM 模型 whichllm 完整指南按硬件和基准测试筛选本地 LLM 模型【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm想在本机跑本地 LLM却不知道哪个模型既装得下、又跑得最快whichllm 自动检测 GPU、CPU 和内存按真实基准测试而非参数数量排名一条命令给出推荐还能直接拉起聊天。适合刚接触本地部署的新手。8GB 显卡到底能跑什么本地模型假设你有一张 8GB 显存的 RTX 4060。在 HuggingFace 上你能搜到 7B、14B 甚至 27B 的 GGUF 文件但装得下不等于跑得好有的模型量化后刚好塞进显存却只能跑到 3 tok/s有的 27B 模型因为架构新、基准分高反而比能塞下的大模型更值得跑。手动逐个对比参数量、下载量和评测表很容易选错。whichllm 把这件事压缩成一条命令检测硬件、估算显存占用权重 KV 缓存 激活开销、预估生成速度再按 0–100 的基准分排序输出。三步完成首次上手第一步安装需要 Python 3.11pip install whichllm或者不安装、直接运行最新版uvx whichllmlatest第二步执行默认命令自动检测本机硬件并打印推荐表whichllm第三步把排名第一的模型跑起来需 PATH 中有 uv首次会下载模型whichllm run到这里就完成了从不知道能跑什么到正在与本机最佳模型对话的全过程。按目标使用从确认硬件到规划升级检查硬件与显存确认本机能否跑本地 LLM如果你怀疑检测不准核显、统一内存或双显卡机器尤其如此单独查看硬件报告whichllm hardware核对输出中的 GPU 型号、显存、CPU 和内存是否符合预期。不一致时用参数手动覆盖例如模拟指定显卡whichllm --gpu RTX 4090 --vram 8 --ram-bandwidth 68多显卡机器可用--gpu-index指定用哪张卡参与计算。按硬件筛选最值得跑的 GGUF 模型默认排名会包含部分显存卸载和纯 CPU候选方便看全貌。只关心能完整装进显存、且速度可用的模型时whichllm --gpu-only --speed usable--speed usable要求预估不低于 10 tok/sfast则是 30 tok/s 起步。输出表中速度按实用度着色低于 4 tok/s 红色4–10 黄色10–30 绿色30 以上亮绿色。针对具体需求继续加条件--quant Q4_K_M锁定量化格式--context-length 64k按长上下文重新估算 KV 缓存--profile coding或 vision、math按用途筛选。模拟目标显卡买前验证显存够不够更换硬件前先模拟whichllm --gpu RTX 4090多卡写法可用--gpu 2x RTX 4090。反过来已看中某个模型、想知道需要什么样的显卡whichllm plan llama 3 70b它会给出不同量化等级下的显存需求。想对比几张候选卡与当前机器的差距whichllm upgrade RTX 4090 RTX 5090 H100一条命令运行模型或导出可复制的代码whichllm run也可以指定模型名支持模糊匹配whichllm run qwen 2.5 1.5b gguf它会通过 uv 创建隔离环境、安装推理依赖、下载模型并进入聊天。若只想拿代码贴进自己的项目whichllm snippet qwen 7bGGUF 模型生成基于 llama-cpp-python 的代码非 GGUF 模型则用 transformers。读懂排名结果避开误判分数由基准质量LiveBench、Artificial Analysis、Aider、Arena ELO 等来源合并加参数规模构成再按证据置信度与运行适配度打折低比特量化会被额外扣减。留意分数旁的标记~表示同族推断!sr表示仅有上传者自报数据?表示无基准数据。只信任独立基准精确匹配的结果时加--evidence strict。默认推荐偏进取会包含临界显存占用。想要更保守的推荐whichllm --gpu-only --speed usable --vram-headroom 1GB模型数据来自 HuggingFace 实时接口并带本地缓存结果会随时间变化用--refresh强制重新拉取。更多细节可查 CLI 参考、评分机制、硬件检测与模拟 和 排错指南。下一步先在终端跑一次whichllm记下本机第一推荐的型号与分数再用whichllm --markdown --top 5生成可粘贴的表格存档。如果近期打算升级硬件用whichllm upgrade把预算内的显卡列出来对比一轮比直接下单踏实得多。【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表