
ML-Papers-of-the-Week 一周 7 篇 AI 论文速览3 条主线看懂 2025 年 6 月底的研究热点【免费下载链接】AI-Papers-of-the-WeekHighlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-WeekML-Papers-of-the-Week 是 DAIR.AI 维护的每周精选机器学习论文项目按年份与周次归档方便快速检索一周内的重点研究。本文覆盖 2025 年 6 月 23 日至 29 日这一周收录的 7 篇论文按 3 条主线分组推理效率、多智能体系统与搜索、垂直领域应用。论文一句话亮点关键数据Mercury扩散语言模型并行多 token 生成把代码模型推理做到超高速H100 上 1109 / 737 tokens/sec比速度优化型前沿模型快至 10 倍MEM1把记忆与推理压进单一内部状态内存恒定内存减 3.7 倍、推理快 1.78 倍7B 胜过 14B 基线Towards AI Search Paradigm四个智能体分工 DAG 规划 MCP 工具调用Master/Planner/Executor/Writer 协作支持动态重规划RLT测试时扩展的强化学习教师教师只负责“讲解”不负责“解题”学生学得更好7B 教师训练 125 步、1 个 epoch胜过 32B 蒸馏管道AlphaGenome单碱基分辨率预测最长 100 万碱基对的基因调控效应计算量仅为 Enformer 一半24/26 项变异效应基准领先DeepRare罕见病诊断的多智能体系统输出可追溯推理链6401 病例、2919 种罕见病Recall1 达 57.18%Claude for Affective Use450 万次对话里量化用户的情感支持需求2.9% 对话属情感支持类拒绝率不足 10%图1本周收录论文相关图表拼贴数据来源pics/Week-2.png 推理效率扩散语言模型与恒定内存智能体这组工作的共同目标只有一个同样质量的输出更低的延迟与内存。️ 扩散语言模型 Mercury 的推理速度看点Mercury 是首批把扩散生成作为主线、且面向代码生产场景的大规模 dLLM并行出词让它以高吞吐跑在现有 LLM 基础设施上。要解决的问题是传统自回归语言模型逐 token 串行解码带来的吞吐瓶颈每次只能生成一个 token生成速度天然受限。关键做法用 Transformer 架构改造出的扩散式生成流程通过粗到精的迭代同时生成多个 tokendiffusion language modeldLLM架构保持与现有 LLM 基础设施兼容无需改造部署栈。代表性数据Mercury Coder Mini 与 Small 在 NVIDIA H100 上分别达到 1109 和 737 tokens/sec比速度优化型前沿模型快至 10 倍质量同时持平或更好HumanEval、MBPP、MultiPL-E 等基准上可对标 Claude 3.5 Haiku 与 Gemini 2.0 Flash Lite填充中间FIMfill-in-the-middle代码补全上超过 Codestral 2501 和 GPT-4o MiniCopilot Arena 人类评估中 Coder Mini 以 25ms 延迟取得第二高 Elo 评分。 MEM1 恒定内存推理框架为什么值得读这是少见的用强化学习RL训练“记忆整合”能力的框架直接命中长任务智能体的内存爆炸痛点。要解决的问题传统智能体把每轮思考、动作、观察全部追加进上下文多轮任务中内存持续增长、性能随之衰减。关键做法每轮只维护一个共享内部状态 新旧信息合并后丢弃过期上下文用 PPO 风格 RL 端到端训练配合掩码轨迹masked trajectory技巧处理动态上下文更新无需任何外部记忆模块。代表性数据MEM1-7B 在 16 目标多跳问答上超过 Qwen2.5-14B-Instruct内存占用少 3.7 倍、推理速度快 1.78 倍且能泛化到超过训练时长的任务内部状态分析还观察到结构化记忆管理、选择性注意、查询重构等类人策略。 多智能体系统与搜索从 DAG 任务规划到“解释式”教学智能体研究这周出现两条不同路线一条把复杂搜索拆给多个专职智能体另一条反过来教小模型怎么当老师。 DAG 任务规划与多智能体搜索工具调用一句话亮点用 Master、Planner、Executor、Writer 四个 LLM 智能体分工协作把搜索任务变成一张可重规划的任务图。要解决的问题传统文档检索或 RAG检索增强生成管道处理不了多步推理、需要调外部工具的复杂搜索任务也缺乏执行失败后的恢复机制。关键做法Planner 把查询拆成有向无环图DAG子任务Master 负责监控并支持局部重规划工具选型通过 MCPModel Context Protocol模型上下文协议服务器抽象 动态能力边界完成按查询语义挑选工具子集再用 DRAFT 方法迭代优化工具文档Executor 用 RankGPT 与 TourRank 让结果排序对齐 LLM 偏好而非仅相关度Writer 经对抗性调优ATM抵抗噪声检索。代表性数据在复杂信息合成任务上系统展现出类似人类的分解—调用工具—综合作答流程最终答案可追溯到中间步骤执行失败时可触发局部 DAG 重规划而不是整体重来。 RLT测试时扩展的强化学习教师模型一句话亮点不教模型解题而是教模型“写讲解”——7B 教师产出的解释比 32B 模型蒸馏管道更管用。要解决的问题推理模型的 RL 训练长期受稀疏奖励与探索难题拖累蒸馏大模型又成本高、管线重。关键做法RLTReinforcement-Learned Teachers把问题和答案同时给教师模型训练目标变成生成能让学生模型复现解法的高质量解释奖励由两项构成学生能否据此复现正确解法以及解释本身逻辑是否自洽。代表性数据仅 7B 参数的 RLT 训练只需 125 步、1 个 epoch无需后处理或验证器其原始解释在 AIME、MATH、GPQA 上超过 DeepSeek R1、QwQ 等 32B 蒸馏管道还能零样本迁移到新领域如 countdown 算术游戏产出的蒸馏数据训练出的学生强于直接 RL。 医疗与基因组垂直领域的 AI 应用应用侧两篇工作一个指向基因一个指向罕见病诊断共同点是都把“可解释、可追溯”当成硬指标。 基因调控预测模型 AlphaGenome看点在单碱基分辨率下建模最长 100 万个碱基对的 DNA计算量只要 Enformer 的一半。要解决的问题此前基因调控预测模型在序列覆盖长度与预测分辨率之间只能二选一且非编码区占基因组 98%基本无法解释。关键做法卷积层与 Transformer 层组合同时输出基因起止、RNA 表达、剪接、染色质可及性、蛋白结合等多种调控模态通过对比野生型与突变序列的预测差异来评估单个变异的调控效应。代表性数据22/24 项单序列基准、24/26 项变异效应基准领先现有模型还是首个显式预测 RNA 剪接位点及其表达水平的序列模型对脊髓性肌萎缩症、囊性纤维化这类剪接相关疾病有直接意义。 罕见病诊断多智能体系统 DeepRare一句话亮点给罕见病诊断生成排序假设之外还给出每一步都挂得上医学来源的推理链。要解决的问题临床 AI 只输出排序结果不够用医生需要知道每个结论是从哪些表型、哪些变异、哪些文献推出来的。关键做法三层 MCP 风格架构——中央 LLM 主机带记忆、专职智能体服务器表型提取、变异优先级排序等、40 多个工具与网络级医学数据源多模态输入覆盖文本、HPO 术语与 VCF 文件。代表性数据6401 个病例、2919 种罕见病、8 个数据集上对 1013 种疾病达到 100% 准确率Recall1 为 57.18%HPO 单项评估比 Claude-3.7-Sonnet-thinking 高 23.79 个百分点109 个全外显子测序病例上 Recall1 达 70.60%Exomiser 为 53.20%180 条诊断推理链的专家评审一致性 95.4%。 Claude 情感支持使用模式研究为什么值得读450 万次对话级别的统计是目前少有的关于 AI 助手情感使用的大规模实证对 AI 伦理设计有直接参考价值。要解决的问题AI 陪伴类用法增长很快但用户到底在哪些场景寻求情感支持、助手应如何把握安全边界一直缺乏数据。关键做法Anthropic 用匿名化工具 Clio 分析 450 多万次对话筛出 131k 条有意义的情感类会话剔除短对话与纯任务型交互再分类统计使用模式与拒绝行为。代表性数据仅 2.9% 的对话属于情感支持类人际建议、辅导、咨询、陪伴浪漫/性角色扮演不足 0.1%Claude 在不足 10% 的情感对话中拒绝请求主要针对自伤风险、极端节食或专业边界情感分析显示用户在会话结尾表达的情绪普遍更积极。 横向趋势这 7 篇放在一起说明了什么一周内同时出现 10 倍推理提速、恒定内存智能体、多智能体搜索与两篇垂直领域落地工作说明工程侧的焦点正从“模型能不能做”转向“做得多快、多省、多可追溯”。RLT 与 MEM1 共同指向7B 级别的模型只要训练目标设计得当就能逼近更大的模型垂直领域则把可解释性从加分项变成了准入门槛。 持续跟踪仓库git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week周度索引见 README.md各年论文列表在 years/ 目录如 years/2025.md历史论文数据见 research/ml-potw-10232023.csv社区入口DAIR.AI 官方 Discord下期将解读 2025 年 6 月 30 日至 7 月 6 日这一周的论文如果某篇论文你希望展开更细的拆解欢迎在评论区点名。【免费下载链接】AI-Papers-of-the-WeekHighlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考