ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI Research SKILLs Demo Gallery 全览:从 NeMo 评测、量化实验到全自主科研 Agent 的实战案例库

AI Research SKILLs Demo Gallery 全览:从 NeMo 评测、量化实验到全自主科研 Agent 的实战案例库 AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载本文系统梳理 AI-Research-SKILLs 开源仓库demos/目录下的演示案例集合。该集合是「技能库如何驱动真实 AI 科研任务」的活教材既有 NeMo Evaluator 的 GPQA 基准评测、llama.cpp/GGUF 分层量化、FAISS 跨语言对齐分析等单技能实战也有以 autoresearch 双循环架构为核心的端到端自主科研 Demo负结果翻盘、RL 算法「脑部扫描」以及把 academic-plotting 双工作流落地成论文级图表的完整示例。读完本文你将理解每个 Demo 的仓库结构、核心技术链路、关键数据结论以及如何把现有技能库组合出可复现、可发表的 AI 科研流水线。一、Demo Gallery 是什么技能库的「实战样板间」demos/README.md 是 AI-Research-SKILLs 仓库的Demo Gallery 索引页。它的定位很明确——每个 demo 都是一个独立仓库用来展示「如何用本技能库中的某个或某组技能完成真实 AI 科研任务」并且每个 demo 都包含完整代码、结果、分析与文档而非玩具示例。demo-name/ ├── README.md # 概览、结果摘要、如何运行 ├── configs/ # 配置文件 ├── results/ # 原始输出与数据 ├── analysis/ # 脚本与可视化 ├── .env.example # 必需的环境变量 └── requirements.txt # Python 依赖如适用这个统一结构背后是四条设计原则原文明确列出Self-contained自包含克隆即可运行除 API Key 外不依赖外部资源Reproducible可复现提供清晰的复现步骤Educational教育性解释「为什么」而不只是「怎么做」Real results真实结果展示的是实际输出不是 mock 数据。在仓库中有三个 demo 是直接内嵌于本仓库的而非外部链接它们是本文的讲解重点Demo仓库内路径涉及技能Embedding Norm Heterogeneity 论文demos/autoresearch-norm-heterogeneity/autoresearch、ML Paper Writing、Research IdeationRL Algorithm Brain Scan 论文demos/autoresearch-rl-brain-scan/autoresearch、GRPO、TRL、SAELens、TransformerLens、ML Paper WritingScientific Plotting 演示demos/scientific-plotting-demo/academic-plotting其余 demoNeMo Evaluator、LoRA Without Regret、分层量化、跨语言对齐以外部仓库 摘要的形式索引在 Gallery 中同样值得逐一拆解。二、Demo 1NeMo Evaluator 跑 GPQA Diamond 基准技能NeMo Evaluator仓库内对应 11-evaluation/nemo-evaluator/任务用 NVIDIA NeMo Evaluator 在GPQA Diamond基准198 道研究生级别科学题上横向对比 Llama 三个规模档次的模型验证「端到端评测工作流」。关键结果原文表格完整保留ModelAccuracyNotesLlama-3.1-8B-Instruct27.3%20.7% extraction failuresLlama-3.3-70B-Instruct48.0%Clean extractionLlama-3.1-405B-Instruct53.0%Best performance这组数据本身就很有信息量8B 模型的 27.3% 准确率里有20.7% 是答案提取失败——即模型答对了但输出格式无法被解析这说明在评测小模型时「答案抽取/解析」环节的稳定性会显著影响最终分数而 70B 与 405B 模型则能干净输出。这是一个评测工程层面的重要洞察。你将学会用 NVIDIA Build API 配置 NeMo Evaluator为不同模型编写评测 YAML 配置跨模型规模分析评测结果制作准确率对比图、Venn 图与失败分类failure taxonomy可视化。仓库结构原文列出configs/每个模型的 YAML 配置、results/原始评测输出、analysis/分析脚本与model_accuracy.png、failure_taxonomy_plot.png、venn_diagrams.png可视化、README.md。三、Demo 2用 AI Agent 复现「LoRA Without Regret」技能GRPO RL Training、TRL Fine-Tuning任务完全通过提示词驱动一个 AI Agent复现 Thinking Machines Lab 论文《LoRA Without Regret》的核心发现。Agent 自主完成了编写 SFT 与 GRPO 强化学习的训练代码申请 H100 GPU 并通宵运行实验执行 LoRA rank 消融实验rank 1 到 256 全范围扫描生成可直接投稿的分析与可视化。看点研究者只需向 Agent 描述「想复现哪篇论文」Agent 就全权接管——从理解方法论、执行多天 GPU 实验到分析结果全程无需手工写码。你将学会如何为 AI Agent 撰写自主科研复现的提示词端到端 SFT GRPO 训练流水线LoRA 与全参数微调的实验设计对比自动化分析与报告生成。仓库中与该 Demo 强相关的技能实现GRPO RL Training 的说明明确指出GRPO 适用于「需要多种输出格式约束、可验证任务数学/代码/事实核查、无偏好数据但有多目标奖励」的场景其核心机制是对每个 prompt 生成一组4–16 条补全在组内按奖励函数相互比较来更新策略与 PPO 的关键差异是不需要独立奖励模型、更省样本、更易调试——这正是 Agent 能在夜间自主跑通 LoRA rank 消融的算法基础。四、Demo 3逐层量化实验Layer-Wise Quantization技能llama.cpp、GGUF任务研究量化 LLM 时各层精度的最优分配。核心发现是早期层用 Q8 精度即可实现 1.9× 压缩且困惑度perplexity只损失 1.3%——这证明「并非所有层在量化面前都生而平等」。你将学会LLM 的逐层layer-wise量化策略测量每层不同精度对困惑度的影响用 llama.cpp 与 GGUF 执行量化实验识别哪些层对精度降低最敏感。这个 Demo 的启发意义在于它把「量化」从「对整模型做统一精度取舍」升级为「按层敏感度差异化分配精度」是典型的科研式探索路径——先建立测量per-layer perplexity再做消融不同精度组合最后得出可操作的结论。五、Demo 4跨语言语义对齐分析技能FAISS任务用 FAISS 相似度检索定量衡量多语言 embedding 在 8 种语言之间对齐语义概念的能力揭示跨语言表示的结构以及对齐在何处失效。你将学会构建并查询多语言 embedding 的 FAISS 索引测量跨语言语义对齐质量分析不同语言间的 embedding 空间结构用相似度检索评估多语言模型。该 Demo 展示了 RAG/检索链路中 FAISS 索引类型选择的实际研究用途它不只是服务于「向量数据库」生产场景也能作为分析工具探测表示空间的几何结构。六、Demo 5Autoresearch 实战——负结果翻盘为更强的论文仓库内位置demos/autoresearch-norm-heterogeneity/论文 PDFnorm-heterogeneity-lora-brittleness.pdf技能Autoresearch、ML Paper Writing、Research Ideation6.1 完整剧情从假设、负结果到翻盘这是「AI Agent 跑完整 autoresearch 工作流」的标杆案例。起始假设是「ETF 结晶化ETF crystallization驱动了过训练模型的 LoRA 微调脆弱性」Agent 的完整行动链是文献调研连接两篇近期工作——NeurIPS 2025 Best Paper Runner-Up关于 superposition/ETF 结构与 ICML 2025关于灾难性过训练内循环实验在 Pythia-410M 与 Pythia-1.4B 多个 checkpoint 上计算 ETF overlap 指标与范数统计量随后应用 LoRA 微调发现负结果ETF overlap 几何不能预测微调难度r0.14起始假设被证伪翻盘Pivot识别出** embedding 范数异质性norm heterogeneity即变异系数 CV**才是真正的因果预测因子410M 上 r-0.841.4B 上 r-0.99因果深化在 LoRA 之前先均衡范数可将微调可塑性提升最多79%写论文调用 ml-paper-writing 技能完成论文写作。6.2 关键发现原文完整保留ETF overlap 指标与 LoRA 微调难度无相关性——一个清晰的负结果LM head 行的范数 CV 与去混淆后的微调可塑性强相关r-0.99 1.4BLoRA 前均衡范数可将相对微调可塑性提升最多 79%该效应与 rank 无关——增大 LoRA rank 无法缓解机理解释范数编码了语义特异性与 LoRA 统一低秩更新的「阻抗不匹配」impedance mismatch是脆弱性根源。6.3 为什么这个 Demo 重要它直接印证了 0-autoresearch-skill/SKILL.md 中定义的两循环架构设计意图内循环Inner Loop运行受约束的实验checkpoint 分析、LoRA 微调、指标计算目标是快速、可量化外循环Outer Loop把「负结果」综合成一次翻盘决策产出比原假设更有价值的发现Agent 自主完成了从「ETF 预测脆弱性」到「不是范数异质性」的真实科研转向最终论文的发现比最初的计划更强。正如 SKILL.md 中所强调的「一致的负结果是有效贡献」X does NOT work because Y只要推理严谨就可发表以及外循环中findings.md是项目的记忆中枢——本 Demo 正是这一理念的实装验证。七、Demo 6Autoresearch 实战——RL 算法的「脑部扫描」仓库内位置demos/autoresearch-rl-brain-scan/论文 PDFrl_algorithm_brain_scan.pdf技能Autoresearch、GRPO RL Training、TRL、SAELens、TransformerLens、ML Paper Writing7.1 任务与执行链Agent 自主研究了「RL 对齐算法到底对模型内部做了什么」——此前没有工作在同一基座模型上系统性对比 RLOO、GRPO、DPO 在权重与特征层面的差异文献调研梳理 RLOO/GRPO/DPO识别研究空白——无人对比过三种算法在同一基座模型上的权重/特征级影响内循环实验用 RLOO、GRPO、DPO 在 GPT-2 Small 上分别做情感sentiment与毒性toxicity任务训练随后用SVD 分析权重增量、用SAELens 分析特征变化外循环综合出三大发现见下因果验证用 SVD 消融实验提供因果而非仅相关证据写论文按 ICML 格式用 ml-paper-writing 技能成稿。7.2 三大关键发现原文完整保留DPO 是 rank-1 对齐rank-1 alignment每个权重矩阵的单个 SVD 方向即可恢复 DPO 行为效应的95.6%而 GRPO 需要 50 个方向才能达到等效恢复。在线 RL 保留结构RLOO/GRPO 维持更高的有效秩200 vs 119并更好地保留基座模型的 SAE 特征结构Jaccard0.83 vs 0.69。DPO 的「集中扰动级联」尽管秩更低DPO 在深层扰动了2 倍多的 SAE 特征1619 vs 527–870扰动在网络中逐层放大。结论在情感与毒性两个任务上都成立且具备统计显著性n3 个种子置信区间不重叠。7.3 为什么这个 Demo 重要它展示了 autoresearch同时编排多个领域技能的能力后训练技能TRL、GRPO负责训练 RL 模型可解释性技能SAELens、TransformerLens负责分析「改变发生在哪里」论文写作技能负责产出 ICML 投稿。更关键的是外循环的综合价值「DPO 是 rank-1 扰动」是一个概念性洞见而不只是某个指标的最优值——这正是两循环架构中「外循环产生新颖性」的设计初衷见 0-autoresearch-skill/SKILL.md 中「OUTER LOOP: …this is where novelty comes from」。八、Demo 7Scientific Plotting——论文级图表生产流水线仓库内位置demos/scientific-plotting-demo/子文档README.md技能Academic Plotting8.1 目标与结果该 Demo 用 academic-plotting 技能的两条工作流为 Andes 论文Andes: Defining and Enhancing Quality-of-Experience in LLM-Based Text Streaming Services, Liu et al., 2024生成了全部关键图表。论文核心结论原文保留MetricResultQoE improvement over vLLM4.7xGPU resource savings61%Peak queue length reduction85%Gemini text accuracy100%所有标签拼写正确Figures generated61 张 AI 架构图 5 张数据图表8.2 Workflow 1Gemini 生成架构图系统架构图Figure 1用gemini-3-pro-image-preview生成遵循 academic-plotting 技能的6 段式提示词结构Framing / Visual Style / Colors / Layout / Connections / Constraints、Style B Modern Minimal与Nord 色板Framing定位——设定整体基调「ultra-clean, modern, authoritative, like Apple docs meets Nature paper」Visual Style视觉风格——完整的 Modern Minimal 样式块浮动盒子 阴影、无边框、细灰色箭头Color Palette配色——Nord 色板为每个元素指定精确 hex 值如 Andes 组件用 Aurora Yellow#EBCB8B执行引擎用 Frost Blue#5E81ACLayout布局——每个盒子都有名称与空间位置含嵌套子组件如 Token-Level Scheduler 内含 Priority Scheduler 与 Overhead Refiner 两个子盒Connections连接——每条箭头单独指定源、目标、样式、颜色、标签与布线8 条编号箭头 红色虚线 preempt 路径 绿色 token 交付流Constraints约束——明确「不要什么」零装饰、无图标、无渐变、CRITICAL TEXT ACCURACY每个标签必须精确拼写。关键做法生成 3 次非确定性尝试人工/自动评估后选优best-of-3。仓库中保留了全部 3 次尝试attempt1、attempt2、attempt3且 3 次尝试的文字准确率均为 100%Token Pacer、Overhead Refiner、KV Cache 等全部拼写正确——相比上一代生成器「所有尝试都有拼写错误」是重大改进。完整的生成脚本可直接复现gen_fig_andes_architecture_gemini.py它演示了从.env加载GEMINI_API_KEY、循环 3 次调用client.models.generate_content(modelgemini-3-pro-image-preview, response_modalities[IMAGE,TEXT])并落盘fig_andes_architecture_attempt{n}.png的完整流程。8.3 Workflow 2matplotlib 数据图表实验图表用 matplotlib 生成采用出版级默认参数serif 字体、色盲安全色板、300 DPI 导出、符合投稿 venue 的尺寸同时导出 PDF矢量供 LaTeX与 PNG栅格。仓库内生成脚本 gen_fig_experiment_results.py 展示了 4 类图表的具体实现图表内容实现要点fig_qoe_definition.pngQoE 定义四案例图示理想体验 / 首 token 延迟 / 慢速流式 / 中途停顿4 子图线图红色阴影标出 S_delay 退化面积fig_cdf_comparison.pngQoE / TTFT / TDS 三面板 CDF 对比三面板共享样式QoE0.95 参考线Andes橙97% 请求 QoE≥0.95 vs vLLM蓝75%TTFT 从 10.5s 降到 1.8sfig_burst_intensity.png突发强度下 4 模型 × 3 数据集平均 QoE4×3 多面板网格共享坐标轴与统一图例Andes 在最高突发强度下达到 4.7x 提升fig_summary_improvements.png关键改进汇总三面板柱状图平均 QoE 0.99 vs 0.88、各架构 3.2x–4.7x 提升、61% GPU 节省 / 85% 队列降低 / 2.6x 并发8.4 与技能库的对应关系该 Demo 完整落实了 academic-plotting/SKILL.md 的两条核心规则「有数值坐标轴的图用 matplotlib有盒子和箭头的图用 Gemini」以及 Workflow 1 的「永远 3 次尝试」「样式块必填」「绝不硬编码 API Key」「保存生成脚本以保证可复现」。同时对应技能中「Nord 色板用于 Modern Minimal 风格」与「Okabe-Ito 色盲安全色板数据图必选」的选色规范。九、Coming Soon 与参与方式9.1 规划中的 DemoML Paper Writing: From Repo to Publication技能ML Paper Writing计划将「一个带实验结果的科研仓库」转化为可投稿 NeurIPS/ICML/ICLR 的论文。状态开发中。这与 ml-paper-writing/SKILL.md 中「从科研仓库出发主动交付完整初稿」的核心理念一脉相承。9.2 如何贡献一个 DemoGallery 欢迎社区贡献要求如下原文完整保留使用本技能库中的一个或多个技能产出有意义且可复现的结果包含清晰的文档有可视化输出图表、表格、报告。贡献流程创建自己的 demo 仓库 → 遵循上述统一目录结构 → 开 issue 或 PR 将其加入本索引。十、总结从「索引页」到「可执行技能组合」demos/ 目录虽然以「索引」形式呈现但它承载了三种不同粒度的价值单技能实战模板Demo 1–4NeMo Evaluator 的评测配置、llama.cpp/GGUF 的逐层量化方法、FAISS 的检索分析方法论都可直接迁移到自己的评测或分析任务多技能编排示范Demo 5–6autoresearch 两循环架构让 Agent 能自主完成「文献调研 → 内循环实验 → 外循环综合 → 翻盘 → 论文写作」的完整闭环两个内嵌 Demo 分别展示了「负结果翻盘」与「跨领域技能编排」两种高级形态图表生产流水线Demo 7从 6 段式 Gemini 提示词到出版级 matplotlib 样式仓库内的生成脚本与结果图可直接作为 academic-plotting 技能的「参考答案」。如果你要复现或扩展其中任意 Demo可以直接从对应子目录的README.md与figures/gen_*.py脚本入手如果要贡献新 Demo则遵循 Gallery 的统一结构与四条设计原则即可。这套「技能库 Demo 样板间」的组合让 AI 科研 Agent 的每一次能力升级都有据可依、有例可循。赞分享AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载相关推荐AI-Research-SKILLs 的 Autoresearch 技能用双循环架构驱动全自主 AI 科研编排AI Research SKILLs 的 Autoresearch 技能用双循环架构驱动全自主 AI 科研编排 本篇技术指南围绕 AI Research SKAI 技能人工智能大模型深度学习AI-Research-SKILLs 研究日志模板实战用 research-log.md 记录自主研究的决策时间线AI Research SKILLs 研究日志模板实战用 research log.md 记录自主研究的决策时间线 导读 本指南以 AI Research SAI 技能人工智能大模型深度学习autoskill 实战在 scientific-agent-skills 中根据真实科研工作流自动生成与补全 Agent Skillsautoskill 实战在 scientific agent skills 中根据真实科研工作流自动生成与补全 Agent Skills autoskillAI 技能科研生物信息学数据科学创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表