
人工智能大模型模型优化模型量化模型压缩【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载本文是 Model-Optimizer 仓库中 tools/launcher/docs/claude_code.md 的深度实战指南。围绕 Launcher 工具链介绍如何让 Claude Code 成为模型量化、训练与评测作业的自动化操作员从 YAML 配置提交、实验状态轮询、失败日志诊断、配置迭代到跨集群复现对比形成一个配置 → 提交 → 监控 → 诊断 → 修复 → 重提交的紧密反馈闭环。读完本文你将掌握 Claude Code 与 Launcher 的完整协作模式、每个工作流对应的精确命令以及底层launch.py、工厂系统与打包机制的工作原理。前置准备搭建 Claude Code 与 Launcher 环境Claude Code 负责理解自然语言指令并翻译成 Launcher 命令因此先要完成两件事安装 Claude Code 本体、初始化 Launcher 及其依赖子模块。npm install -g anthropic-ai/claude-code cd Model-Optimizer/tools/launcher git submodule update --init --recursivenpm install -g anthropic-ai/claude-code全局安装 Claude Code CLI使其可以作为交互式终端代理接收你的任务描述。git submodule update --init --recursive拉取 Launcher 依赖的Megatron-LM子模块。Model-Optimizer依赖则不是子模块——tools/launcher/modules/Model-Optimizer是指向仓库根目录的符号链接launch.py首次运行时会自动创建见 launch.py避免递归嵌套。运行远程 Slurm 作业前还需通过环境变量完成集群接入配置这些变量在 launch.py 的 docstring 中有明确说明变量用途是否必需远程SLURM_HOSTSlurm 登录节点主机名是SLURM_ACCOUNT计费账户是SLURM_JOB_DIR作业产物远端目录是SLURM_HF_LOCAL集群上 HuggingFace 模型缓存路径决定容器挂载路径是HF_TOKENHuggingFace API Token否NEMORUN_HOMENeMo Run 家目录默认取当前工作目录否这些环境变量会被 slurm_factory 读取为SlurmConfig的默认值也就是说 YAML 里不写host、account作业也能通过环境变量拿到集群信息。核心工作流总览Claude Code 将模型优化工作组织为一个可迭代的闭环configure → submit → monitor → diagnose → fix → resubmitconfigure用 YAML 描述任务量化、评测、部署脚本、Slurm 资源submituv run launch.py --yaml config --yes提交到本地 Docker 或远端 Slurmmonitor通过nemo experiment status/logs轮询实验状态、抓取日志diagnose分析错误栈输出根因与修复建议fix修改 YAML 或环境变量后重新提交resubmit进入下一轮闭环。下面五个小节逐一拆解文档给出的五类典型工作流。工作流一提交任务并监控这是最基础的场景。对 Claude Code 说 Run Qwen3-8B quantization on OCI-HSG and wait for it to finishClaude 将依次执行提交uv run launch.py --yaml examples/Qwen/Qwen3-8B/megatron_lm_ptq.yaml --yes监控NEMORUN_HOME$(pwd) uv run nemo experiment status id抓日志NEMORUN_HOME$(pwd) uv run nemo experiment logs id 0汇报给出 MMLU 分数与通过/失败状态被提交的配置长什么样文档引用的examples/Qwen/Qwen3-8B/megatron_lm_ptq.yaml仓库中的真实文件是一个三阶段流水线task_0common/megatron_lm/quantize/quantize.sh量化配置QUANT_CFGNVFP4_DEFAULT_CFG校准数据集/hf-local/abisee/cnn_dailymailcalib-size 32MMLU 下限 0.68task_1同一个 quantize 脚本QUANT_CFGFP8_DEFAULT_CFGMMLU 下限 0.75task_2common/tensorrt_llm/eval.sh对所有导出 checkpoint 跑 TRT-LLM MMLU 评测。任务之间按task_0 → task_1 → task_2顺序串行执行。quantize.sh源码内部依次完成 PTQ 量化、可选 MMLU 评测RUN_MMLUtrue时与 HF 格式导出RUN_EXPORTtrue时并将产物持久化到/cicd供后续实验复用。如果你的机器只有单卡改用同目录的megatron_lm_ptq_local.yaml文件并在命令行追加hf_local/mnt/hf-localLauncher 会转为本地 Docker 执行。底层原理命令是怎么被解析的launch.py的launch()入口源码接收--yaml文件把顶层job_name、pipeline映射为函数参数随后调用core.run_jobs()。slurm_config中的_factory_: slurm_factory会经由 core.py 的工厂注册表 解析为具体的SlurmConfig。而NEMORUN_HOME由 launch.py 显式写入run.config.set_nemorun_home()所以文档中监控命令需要保持NEMORUN_HOME$(pwd)与提交时一致Claude 才能定位到实验目录。工作流二诊断失败作业失败后对 Claude Code 说 /review-logsClaude 会扫描experiments/目录找出全部实验通过nemo experiment logs抓取各实验日志分析错误 traceback定位根因产出结构化报告根因 修复建议写出 JUnit XML供 CI 集成。这一步依赖 Launcher 的实验即目录约定每个实验会在experiments/标题/exp_id/下写入metadata.json含experiment_id、job_name、allow_to_fail等字段见 architecture.md日志目录结构固定Agent 可以机械式地遍历。仓库内配套的 monitor skill 进一步规范了诊断行为它要求按nel status id各自的状态词表轮询只报告状态变化失败时先看日志再给根因——这与/review-logs的分工一致monitor 负责发现失败了review-logs 负责回答为什么失败、怎么修。工作流三新增一个模型配置对 Claude Code 说 Add Llama-3.1-70B quantization config. It needs 2 nodes with 4 GPUs each.Claude 将创建examples/Meta/Llama-3.1-70B/megatron_lm_ptq.yaml按模型规模设置合适的 TP/EP张量并行/专家并行引用正确的 service 脚本如common/megatron_lm/quantize/quantize.sh用--dryrun验证配置确认解析无误后再提交。YAML 的两种形态新增配置前需要理解 configuration.md 定义的两种任务写法原始 SandboxTask 形态megatron_lm_ptq.yaml实际采用的形式job_name: Qwen3-8B_NVFP4_DEFAULT_CFG pipeline: task_0: script: common/megatron_lm/quantize/quantize.sh args: - --calib-dataset-path-or-name /hf-local/abisee/cnn_dailymail - --calib-size 32 environment: - MLM_MODEL_CFG: Qwen/Qwen3-8B - QUANT_CFG: NVFP4_DEFAULT_CFG - TP: 4 slurm_config: _factory_: slurm_factory nodes: 1 ntasks_per_node: 4 gpus_per_node: 4注意环境变量是单键字典列表- KEY: value写法TP/EP 等以字符串形式给出。类型化任务Typed Task形态通过_target_引用common/workflow/task.py中的 dataclass如MegatronLMQuantizeTask把model、quant_cfg、tp、calib_size等字段直接结构化配置。类型化任务在__post_init__中把 config 转换为script/args/environment见 architecture.md 的 Typed Task Classes 一节。按模型规模调整 TP/EP 时直接改config.tp或slurm_config下的并行度即可。多任务共享变量若多个 task 复用同一路径可用pipeline.global_vars配合global_vars.X插值在SandboxPipeline.__post_init__中通过正则替换解析见 architecture.md。用 --dryrun 做提交前验证新增配置后务必先干跑uv run launch.py --yaml examples/Meta/Llama-3.1-70B/megatron_lm_ptq.yaml --dryrun --yes -v--dryrun只打印解析后的完整配置而不真正执行-v输出更详细的过程信息。这是让 Agent 自主写配置时的安全阀。工作流四失败后迭代 The job failed with CUDA OOM. Try reducing the sequence length to 4096 and resubmit.Claude 将编辑 YAML 配置如把序列长度相关参数调小重新提交uv run launch.py --yaml config --yes继续监控并汇报结果。除了改文件Launcher 还支持命令行直接覆盖任意参数适合小步迭代而无需改文件# 改节点数 uv run launch.py --yaml config.yaml pipeline.task_0.slurm_config.nodes2 --yes # 换容器镜像 uv run launch.py --yaml config.yaml \ pipeline.task_0.slurm_config.containernvcr.io/nvidia/tensorrt-llm/release:1.2.0 --yes # 改类型化任务的并行度 uv run launch.py --yaml config.yaml pipeline.task_0.config.tp1 --yes常用标志汇总来自 configuration.md标志作用--yes/-y跳过确认提示-v详细输出--dryrun只打印解析后的配置不执行--to-yaml output.yaml把解析后的完整配置导出到文件detachtrue提交后立即返回分离模式工作流五复现与跨集群对比 Dump the resolved config for Qwen3-8B, then run it on both OCI-HSG and CW-DFWClaude 将导出解析后配置uv run launch.py --yaml config.yaml --to-yaml resolved.yaml把插值、默认值都落成一份自包含配置保证两集群复现一致在 OCI-HSG 运行SLURM_CLUSTERoci_hsg uv run slurm.py --yaml resolved.yaml --yes在 CW-DFW 运行SLURM_CLUSTERcw_dfw uv run slurm.py --yaml resolved.yaml --yes对比 MMLU 结果。SLURM_CLUSTER是集群选择机制与launch.py中环境变量驱动的通用slurm_factory不同slurm.py会根据SLURM_CLUSTER解析到集群专属的 factory见 architecture.md从而把同一份 resolved 配置原样投递到不同集群隔离环境差异、聚焦模型本身的精度对比。可用 Skills 一览文档列出的三个 Claude Code SkillSkill触发时机功能/review-logs作业完成/失败后分析日志、诊断失败、产出 JUnit XML/wait-for-jobs分离式提交detach之后轮询实验状态直到终态/speculative-decoding草稿模型流水线EAGLE3、DFlash 等新模型配置、日志审查、问题分级、验证三个 Skill 分工互补/wait-for-jobs解决提交后不阻塞、事后要追进度的异步场景/review-logs解决失败后归因/speculative-decoding覆盖投机解码这类跨配置、跨日志、需要反复验证的复杂流水线。仓库 plugins/modelopt/skills 目录还提供了monitor、debug、ptq、evaluation等更多技能其中 monitor/SKILL.md 描述了会话级任务注册表.claude/agents/session_id/active_jobs.json与状态变化上报约定可作为自定义轮询类 skill 的参照实现。CI 集成让 Claude Code 自动值守实验在 CI 中Claude Code 无需人工提示即可自动执行抓取并分析实验日志生成claude_analysis.md结论文档写出claude_review_rspec.xml供 GitLab 测试报告使用把失败摘要作为 MR 评论发布对allow_to_fail允许失败的作业创建/更新 GitLab issue 跟踪。这里的allow_to_fail正是 metadata.json 中记录的实验属性标记为允许失败的作业即使失败也不阻塞流水线但 Claude 会为其创建 issue 持续跟踪把已知失败纳入缺陷管理而非简单忽略。claude_analysis.md与claude_review_rspec.xml的命名约定使 CI 脚本可以稳定地按路径消费 Agent 产物。结合源码理解Launcher 的关键机制Claude Code 之所以能安全、可复现地驱动这些作业依赖 Launcher 的四个设计入口统一launch.py 是唯一公共入口同时支持--yaml与pipelinebare.yaml两种提交方式core.py持有共享数据类SandboxTask、SandboxPipeline、GlobalVariables与run_jobs()运行循环Docker/Slurm 由build_docker_executor()/build_slurm_executor()分别构造。工厂解析register_factory()注册名称到工厂函数的映射YAML 中的_factory_: slurm_factory因此可被解析为具体集群配置配置内容与集群细节解耦。代码打包与挂载PatternPackager把common/、examples/、modules/下的源码打成 tar.gz 并 rsync 到集群同时通过modelopt_install_path把本地modelopt/目录 bind-mount 到容器内预装路径本地改动无需重建镜像即可生效见 architecture.md。环境默认值注入get_default_env()为每个作业注入TRITON_CACHE_DIR、HF_HOME、HF_TOKEN等默认环境确保本地与集群行为一致见 core.py。了解这四层机制后你就能更准确地预估 Claude 提交的每条命令在远端实际发生了什么从而更好地评估它给出的诊断结论与修复建议。小结Claude Code Launcher 的协作模式本质上是把模型优化实验运营变成可由 Agent 反复执行的结构化流程--yaml统一了提交入口nemo experiment status/logs统一了观测接口experiments/目录约定统一了产物寻址--dryrun/--to-yaml/SLURM_CLUSTER保证了变更可控与跨集群可复现。对研究者而言这意味着从手工盯日志、手工改配置中解放出来对工程团队而言claude_analysis.md、JUnit XML 与 GitLab issue 的自动产出让 Agent 的每一次实验都有迹可查、有据可审。若要进一步深入建议继续阅读 configuration.mdYAML 全格式与覆盖规则、architecture.md设计细节与 testing.md本地与 CI 测试方式。赞分享人工智能大模型模型优化模型量化模型压缩【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载相关推荐Model-Optimizer MCP Server用 typed tools 让 Claude Code / Codex Agent 直接提交 PTQ、QAT 与训练任务Model Optimizer MCP Server用 typed tools 让 Claude Code / Codex Agent 直接提交 PTQ、QA人工智能大模型模型优化模型量化模型压缩Model-Optimizer 集群实战基于 SLURM 的容器化作业提交、监控与镜像认证完整指南Model Optimizer 集群实战基于 SLURM 的容器化作业提交、监控与镜像认证完整指南 导读 本文是 NVIDIA Model Optimizer人工智能大模型模型优化模型量化模型压缩Model-Optimizer 量化模型评估实战NEL 0.2.6 Launcher 端到端工作流指南Model Optimizer 量化模型评估实战NEL 0.2.6 Launcher 端到端工作流指南 本指南完整梳理 Model Optimizer 仓库中人工智能大模型模型优化模型量化模型压缩创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考