
ML Papers of the Week 2025年6月第4周榜单速览7 篇论文从扩散 LM 提速到罕见病诊断【免费下载链接】AI-Papers-of-the-WeekHighlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week2025 年 6 月 23 日至 6 月 29 日这一期ML Papers of the Week 榜单收录了 10 篇论文其中 3 篇在干同一件事——把推理和训练的账算得更省。ML Papers of the Week 是 DAIR.AI 团队维护的每周机器学习论文精选仓库按年和周归档本期清单呈现出明显的分化一边是速度与内存Mercury 用扩散模型把代码生成做到每秒上千 tokenMEM1 让智能体内存保持恒定另一边是长期缺乏可解释性的应用场景罕见病诊断、基因调控预测。下面按 4 个主题把这 7 篇逐一讲清楚各自解决什么痛点、机制是什么、最关键的数字是多少。仓库怎么克隆、目录各放什么仓库的核心价值是一份可检索的周度索引README.md 按年份列出每一周的清单并支持锚点直达2025 年的完整描述存放在 years/2025.md本期对应其中「June 23 - June 29」一节。research/ 目录以 CSV 形式沉淀历史论文数据如 ml-potw-10232023.csv包含标题、描述、论文与讨论链接四个字段适合批量处理pics/ 则是各期引用的图表资源。本地浏览只需一条命令git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week⚡ 推理与训练效率更快的生成、更便宜的监督Mercury并行生成把代码补全提速一个数量级自回归大模型逐 token 生成在代码补全这类对延迟敏感的场景里吞吐是硬瓶颈。Mercury 改走扩散式生成路线dLLM不是逐个决定字符而是一组 token 并行输出再经「粗到精」的迭代细化底座仍是 Transformer现有 LLM 基础设施可以复用。在 NVIDIA H100 上Mercury Coder Mini 和 Small 分别达到 1109 和 737 tokens/sec较速度优化的前沿模型快至 10 倍HumanEval、MBPP 等代码基准上与 Claude 3.5 Haiku、Gemini 2.0 Flash Lite 相当或更好填充中间FIM补全任务则超过 Codestral 2501 和 GPT-4o MiniCopilot Arena 人类评估中 Mini 以 25ms 延迟取得并列第二的 Elo。如果你在选型代码补全后端可以把这类并行生成模型列为候选速度与质量不必二选一。RLT只负责讲解题、不解题的 7B「教师」蒸馏管道通常要调用 320 亿参数以上的大教师生成推理数据成本与审计都高。RLTReinforcement-Learned Teachers换个思路小模型拿到的既有题目也有参考解它的任务是「连点成线」——写出一段让学生模型能复现答案的解释用强化学习直接优化这个目标奖励来自学生能否复现解法以及解释的逻辑自洽。7B 的教师模型在 AIME、MATH、GPQA 上的下游表现超过 320 亿参数以上教师的蒸馏管道包括 DeepSeek R1、QwQ训练只需 125 步、1 个 epoch。想搭数据生产管线时这种小型可控的解释生成器是大教师模型之外的现实选项。 智能体压内存、把搜索任务结构化MEM1长多轮任务里内存保持恒定的 7B 智能体常规智能体把全部历史追加进上下文任务一长内存、延迟、成本同步上涨性能还会退化。MEM1 不累积历史每步推理只更新一个共享内部状态丢弃过时上下文再用 PPO 风格的强化学习让「该保留什么」直接被任务完成率优化全程不依赖外部记忆模块。7B 的 MEM1 在 16 目标多跳 QA 上超过 Qwen2.5-14B-Instruct同时内存占用减少 3.7 倍、推理快 1.78 倍。做长会话智能体产品时「紧凑内部状态」这套策略值得直接借鉴来控制成本。Towards AI Search Paradigm四个智能体把搜索任务拆成 DAG传统 RAG 只负责取文档遇到需要调用工具、多步推理的复杂查询就无法闭环。这套系统按角色分工Master 分析并调度Planner 把任务建成有向无环图DAG并支持动态重规划Executor 执行并调用外部工具工具子集通过 MCP 协议动态选择Writer 负责成文并用 ATM 对抗训练抵抗噪声检索配合 RankGPT 等策略优化排序。在复杂信息合成任务中它能完成传统检索流水线接不住的多步骤任务且结果可验证。对做搜索助手的团队DAG 化的任务分解加模块化智能体是当前比较清晰的工程范式。 垂直领域落地临床与基因组学DeepRare6401 个罕见病病例上的可追溯诊断罕见病诊断平均滞后多年而临床 AI 常常只给结论不给依据医生难以复核。DeepRare 采用三层 MCP 式架构中央 LLM 主机、表型提取与变异优先级排序等专用智能体服务器外加 40 多个医疗工具与大规模医学文献同时吃下文本、HPO 表型术语和 VCF 基因文件输出排名假设及可追溯到文献来源的推理链。在覆盖 8 个数据集、2919 种罕见病的 6401 个病例上它对 1013 种疾病达到 100% 准确率Recall1 为 57.18%较 Claude-3.7-Sonnet-thinking 高 23.79 个百分点HPO基因多模态输入下109 个全外显子测序病例的 Recall1 达 70.60%对照工具 Exomiser 为 53.20%180 条推理链的专家评审一致性 95.4%。医疗 AI 里「可回溯的推理链」可能比单点准确率更先决定落地。AlphaGenome单碱基分辨率预测基因调控效应约 98% 的基因组位于非编码区而既有工具很难同时兼顾长序列覆盖和单碱基分辨率非编码变异因此难以解释。谷歌 DeepMind 的 AlphaGenome 用卷积与 Transformer 混合结构在单碱基分辨率下建模最长 100 万碱基对预测基因起止点、RNA 表达、剪接、染色质可及性与蛋白结合还能对比野生型与突变序列来评估某个变异的具体调控效应是首个显式预测剪接位置及表达水平的序列模型。它在 26 个变异效应基准中的 24 个上领先计算成本约为 Enformer 的一半。做非编码变异解读或罕见病基因研究时这是第一个能给出百万碱基上下文、单碱基精度预测的模型。安全与用户观察450 万次对话里的边界Claude for Affective Use情感支持使用的大规模画像AI 陪伴话题热度高但用户到底拿助手做什么、安全边界该画在哪缺少大规模实证。Anthropic 分析了超过 450 万次 Claude 对话对情感支持类场景人际建议、辅导、咨询、陪伴做了系统归类。结果显示仅 2.9% 的对话属于情感支持类别浪漫/性角色扮演不足 0.1%约 10% 的情感对话中 Claude 需要拒绝请求主要针对伤害风险或专业边界情绪分析显示会话结尾的用户语气普遍比开头更积极。对做面向个人用户的 AI 产品的人这是目前最完整的一份「支持性与安全性如何平衡」的大规模数据集。之后怎么持续跟进一句话说清本期趋势让推理和训练更省并行生成、小教师、恒定内存与让输出可被复核诊断推理链、变异效应预测、大规模用户数据是两条并行主线另有 DSRL机器人策略的潜空间强化学习适配与 PEVA全身条件的第一视角视频预测两篇机器人方向工作同样值得留意。README.md按年份的周度索引最新一期总在最上方research/历史论文的 CSV 数据目录含标题、描述与链接字段适合做二次分析每周 newsletter 订阅https://nlpnews.substack.com/ 社区讨论可加入 Discordhttps://discord.gg/SKgkVT8BGJ 。如果这期解读帮你省下了翻论文的时间转给同样被论文淹没的同事也不错。【免费下载链接】AI-Papers-of-the-WeekHighlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考