ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

MAGI:面向真实药物发现的模块化智能体协调系统

MAGI:面向真实药物发现的模块化智能体协调系统 MAGI面向真实药物发现的模块化智能体协调系统原文网页https://arxiv.org/html/2610.06411v1PDF链接https://arxiv.org/pdf/2610.06411v1arXiv编号arXiv:2610.06411v1 [cs.AI]摘要智能体系统越来越多地被用于协调分子设计工具但目前尚不明确整个技术栈中究竟哪一层会制约真实药物研发项目的最终效果。本文开发MAGI开源模块化智能体能够自主制定项目目标、发起并监控分子优化任务、解析构效关系SAR并据此修订研发策略。MAGI支持两条分子生成路径由大模型LLM直接生成分子或者调度REINVENT 4完成生成评分服务基于统一契约接口实现可插拔替换。本文基于三家制药企业的9项回顾性先导化合物优化项目开展评测全部在固定时间约束下复现实验。两条生成路径均可产出有效分子结构LLM生成方案更贴近已有化学骨架在更少操作步数下达到相当甚至更优的主要靶点活性REINVENT则可以探索更加广阔的化学空间。项目能否达成预设目标并不取决于生成路径而是由预测评分模型的能力域所决定当分子化学结构超出模型适用域时目标达成率就会下降。另外开展盲测评估判断化学家能否区分MAGI输出与真实实验得到的化合物化学家无法分辨智能体产出分子与留存真实化合物并且认为智能体给出的构效关系推理大体合理但完整性尚有不足。综合实验结果表明MAGI可以作为可插拔协调层接入现有计算化学工作流但真实药物项目的性能天花板来自评分预测服务的适用域而非智能体的工具编排能力。关键词药物发现分子智能体先导化合物优化构效关系SARREINVENT 4MCP模型上下文协议计算化学目录引言相关工作MAGI方法体系3.1 系统整体架构3.2 目标与配置空间TTP治疗目标配置文件实验设置4.1 数据集4.2 实验协议4.3 评测指标实验结果5.1 分子质量与化学空间探索能力5.2 主要靶点活性与项目目标达成情况5.3 操作开销与化学家盲评实验讨论局限性结论参考文献附录简要说明1 引言先导化合物优化Lead optimization是药物研发关键环节需要在多轮「设计‑合成‑测试‑分析」循环中平衡分子活性、安全性、可开发性该环节占据药物研发的大量成本。REINVENT 4等生成式AI方法可以基于专家定义目标优化分子但随着项目证据积累与构效关系SAR发生变化评分配置需要人工反复修订。智能体系统有望自主规划、调用工具、闭环适配研发流程。目前已有大量化学智能体相关文献但多数评测仅验证工具调用执行或是通用分子基准缺少真实工业项目约束下的科学效果验证。基准上的优秀表现经常伴随基础推理错误与不可靠置信度单纯大模型分子生成也无法保证分子有效性更难以实现多参数可控优化。智能体每一步决策都高度依赖评分预测服务评分模型相当于整个系统的预言机评分模型的适用域直接限定智能体的性能上限。系统偏差、数值尺度偏移、范围压缩、排序相关性差都会导致候选分子排序不可信。MAGI核心定位开源模块化智能体可版本化维护项目目标调度、监控优化任务解读构效关系并据此重定向设计方向。支持两种分子生成模式①LLM直接生成分子②调度REINVENT 4生成。两条路径复用同一套预测与分子评估堆栈。本文对来自3家药企的9项工业先导优化项目做回顾性复现评测4个GSK项目、4个赛诺菲项目、1个阿斯利康未公开项目。本文主要贡献实现可审计的模块化智能体架构项目目标可执行、支持版本管理对LLM生成、REINVENT两套生成路径统一生效。在9项真实工业药物研发项目上完成评测汇报分子有效性、目标达成率、操作开销与系统短板。通过真实项目实证药物发现项目能否达成目标瓶颈来自预测评分模型可靠性而不是智能体的工具编排逻辑。2 相关工作REINVENT 4是工业界广泛使用的目标导向分子生成框架最大化专家定义的评分函数但不会自主撰写、修订优化目标适合作为智能体工作流内部生成组件。现有LLM化学设计系统各有侧重MT‑Mol使用多智能体完成SMILES生成、分析、验证CIDD结合大模型化学批判器与基于口袋的3D生成器DrugR实现显式药理学推理MolClaw整合REINVENT4、Boltz‑2与相互作用分析Mozi实现受控自治智能体ChatInvent把REINVENT集成到面向生产的交互界面。多数相关工作缺少时间分割的工业项目数据验证RetroDMTA提供4套时间隔离工业数据集但原有基准优先使用未来已知化合物。MAGI的评测范式生成阶段仅提供时间截断之前的上下文把未来真实化合物作为回顾性对比真值。3 MAGI方法体系3.1 系统整体架构MAGI将智能体编排、分子生成、分子评估三者解耦。推理后端采用Claude Sonnet 4.6基于MCP模型上下文协议访问REINVENT4、通用ADMET预测模型、时间受限项目专用模型、Boltz‑2、PoseBusters、相互作用分析器MCP服务一共对外暴露24个工具覆盖数据读取、TTP目标管理、评分、优化任务控制、结果获取。优化任务异步执行由网关层监控各组件运行在独立容器通过共享存储交换分子结构、配置与结果。外部REINVENT组件批量输出SMILES交给评分服务依赖感知封装层将Boltz‑2生成的复合物输入PoseBusters与相互作用分析。结构层面证据可以直接参与优化而不是仅用于事后排序。系统架构图见原文附图S1(a)。3.2 目标与配置空间TTP治疗目标配置文件每个研发项目由**可版本化、机器可读的治疗目标配置文件TTPTherapeutic Target Profile**驱动。每一条目标指定评分服务、优化方向、目标值/可接受区间、期望转换函数、权重固定防护约束作为独立的通过/失败条件评估。预测终点转换到KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲[0,1]\)期望值使用加权Derringer‑Suich几何均值做聚合打分D ( m ) ( ∏ i d i ( m ) w i ) 1 / ∑ i w i D(m)\left(\prod_{i} d_{i}(m)^{w_{i}}\right)^{1 / \sum_{i} w_{i}}D(m)(i∏​di​(m)wi​)1/∑i​wi​同一套TTP配置既用于评估LLM直接产出的分子也编译生成REINVENT的评分配置。智能体每一次修订目标都会记录版本缺失的指标值标记为不可评估不会代入计算。4 实验设置4.1 数据集评测使用9个先导化合物优化任务GSK公开BET‑BD2系列共4个项目赛诺菲RetroDMTA的4个项目FXA、MMP8、PPARδ、RENIN阿斯利康1个未公开项目。实验设定智能体仅能看到1个起始分子 4个已经测得活性的类似物其余化合物全部作为时间隔离的留存真值集智能体不可见。GSK‑S1主要指标动力学溶解度GSK‑S2膜通透性GSK‑S3、GSK‑S4logD 7.4 D_{7.4}D7.4​阿斯利康项目logD 7.4 D_{7.4}D7.4​赛诺菲FXA(p K i pK_ipKi​)、MMP8(p I C 50 pIC_{50}pIC50​)、RENIN(p I C 50 pIC_{50}pIC50​)、PPARδ(p E C 50 pEC_{50}pEC50​)FXA额外增加溶解度、logD 7.4 D_{7.4}D7.4​作为次级目标。赛诺菲项目的预测模型只能使用时间截断之前的化合物训练留存集完全隔离生成与评分阶段都不会泄露未来数据。4.2 实验协议每个项目执行5轮迭代优化。每一轮加载项目上下文与当前TTP目标生成并评估分子智能体筛选出约5个候选分子进入下一轮。LLM生成路径大模型直接输出候选分子短名单。REINVENT生成路径智能体创建/更新TTP配置启动并监控优化任务取回生成分子池从中筛选候选。完整实验流程见附图S1(b)。4.3 评测指标分子质量指标分子有效性、累计唯一性、相对于已展示分子的新颖度、与留存集分子相似度、轮内多样性、合成可及性多样性定义为1减去ECFP4 Tanimoto成对相似度均值。共折叠结构指标Boltz‑2配体iPTM、相互作用计数。操作开销统计生成、预测、共折叠、验证、监控、结果检索检查的工具调用次数。项目层面指标主要靶点活性、项目目标达成率。额外开展化学家盲评实验由4位药物化学家对分子、构效关系推理做人工评估。5 实验结果5.1 分子质量与化学空间探索能力GSK项目中LLM路径产出分子整体新颖度更高赛诺菲项目中REINVENT可以探索距离参考化学骨架更远的分子。REINVENT路径轮内分子多样性显著更高更适合需要大范围化学空间探索的场景。详见论文图1(a)。5.2 主要靶点活性与项目目标达成情况仅仅分子结构有效并不等价于满足项目研发目标。将两条路径生成分子分别和「智能体可见参考分子」、「不可见留存真实化合物」做活性对比。GSK 4个项目中的3个、阿斯利康项目达成预设目标GSK‑S1失败动力学溶解度目标落在预测模型训练范围之外智能体自主改用热力学溶解度作为代理指标分子得到部分改善但未达成原始目标。赛诺菲项目两条路径在预测的主要靶点活性上可以追平留存化合物仅FXA、PPARδ达到项目阈值。LLM路径达成目标的频次略高于REINVENT。项目失败案例几乎都对应评分模型外推失效GSK‑S1评分模型做外推预测RENIN配体模型对留存样本相关性弱。图1(b)©展示各项目主要靶点活性分布浅绿色区域为目标达成区间。5.3 操作开销与化学家盲评实验操作开销差异巨大REINVENT路径需要启动任务、监控、恢复、取回结果观测到的操作调用数量是LLM路径的4‑9倍。该统计还不包含强化学习循环内部调用REINVENT每轮会额外探索十万级别分子工具调用量级高出4个数量级。MAGI的自适应行为不只有语法修复还会基于收敛现象、评分模型矛盾、新出现的构效关系修订项目目标、搜索参数、分子设计策略。工具调用统计柱状图见原文图2。化学家盲评实验4位药物化学家28道评测问题化学家无法区分智能体生成分子与留存真实化合物对两种生成路径没有偏好认为MAGI输出的SAR构效关系推理大体合理但完整性存在欠缺。6 讨论两条生成路径体现典型的探索‑利用权衡LLM生成在已知化学骨架附近做聚焦局部优化工具操作开销低。REINVENT适合需要跳出起始化学骨架的场景可以提升分子多样性与新颖度但计算开销显著更高。两条路径均无法稳定保证项目目标达成分子生成器的探索能力无法弥补评分模型存在偏差、范围压缩、排序能力弱带来的缺陷。基于Boltz‑2的结构共折叠打分会显著改变top‑5候选短名单排序说明结构信息对候选分子筛选起到关键作用。MAGI的核心价值不在于分子生成本身而在于工具选择、根据证据迭代修订项目目标的协调编排层能力。7 局限性分子终点全部来自模型预测并非湿实验实测数据。每组实验仅使用一套后端模型、一套实验轨迹没有设置静态目标的对照组难以完全隔离智能体本身对结果的贡献。时间分割可以降低训练集测试集泄露风险但无法完全排除基座模型预训练阶段已经见过相关分子数据。8 结论本文提出MAGI一套模块化药物研发智能体推理协调层可以版本化管理项目目标TTP对接成熟的分子生成、预测工具监控任务运行根据实验证据自适应调整研发策略。在9项工业回顾性先导优化项目上实验LLM直接生成路径可以完成局部优化工具操作开销更低REINVENT可以实现更广的化学空间探索但计算代价更高。能否达成研发目标并不由生成路径决定而是受制于评分预测模型的适用域预测模型可靠时项目更容易成功一旦超出模型适用域就会失败。盲测实验表明化学家无法区分智能体产出与真实化合物但是构效关系推理完整性还有提升空间。综上智能体可以落地真实药物研发项目但现存两处关键天花板智能体本身的构效关系推理质量以及工业场景下评分预测服务的适用域边界。9 参考文献完整参考文献查阅原始arXiv网页https://arxiv.org/html/2610.06411v1附录简要说明附录S1拓展相关工作综述。附录S2系统完整架构、MCP工具清单、TTP配置定义、Derringer‑Suich聚合打分公式、系统提示词、错误恢复与自适应修订逻辑、硬件计算资源说明。附录S3数据集细节、项目目标定义、时间分割规则。附录S4‑S6全部补充图表、分子统计、各轮次轨迹、化学家盲评完整问卷与结果。如果你需要我可以继续解析下一篇arXiv论文或者把本篇加入智能体论文汇总速查表。
返回列表