
1. 从一条热搜说起AI Scientist到底在做什么第一次看到The AI Scientist这个词是在一个学术群里有人转了一条消息说有个系统能自己读文献、自己想idea、自己写代码跑实验、自己写论文最后还通过了同行评审。当时群里一半人觉得是标题党另一半人已经开始讨论我们是不是要失业了。我花了两天时间把相关的技术报告和开源代码翻了一遍又自己跑了一遍它的流程才慢慢理解这件事的分量在哪里。先说清楚它不是什么。它不是那种给个题目帮你扩写成八千字的写作工具也不是帮你润色摘要的辅助插件。The AI Scientist是一套完整的端到端科研自动化流程它把科研拆成了几个可以独立执行的阶段文献调研与创意生成、实验方案设计与编码、实验执行与结果分析、论文撰写、以及自动评审。每个阶段都由大模型驱动阶段之间通过结构化的中间产物传递信息最终产出一篇格式完整、有图表、有引用、有实验数据的论文。这件事之所以能上Nature级别的关注核心不在于AI会写论文——这个早就不新鲜了。真正让人坐不住的是两点第一它生成的论文在某次实验中通过了ICLR workshop的同行评审评审意见里甚至出现了这篇工作有新颖性这样的评价第二整套流程是开放的、可复现的任何人都能下载代码在自己的算力上跑一遍看看它到底能做出什么。我关心的不是AI能不能取代科学家这种宏大命题而是更实际的问题这套流程里每个环节是怎么设计的哪些地方真的能打哪些地方还是玩具如果我想在自己的研究领域里用类似的思路做点自动化应该从哪里下手这篇文章就把我这两天的拆解和实测记录下来给同样好奇的人一个参考。2. 拆解The AI Scientist的四个核心阶段2.1 创意生成从文献到idea的转化逻辑整个流程的起点是创意生成。这一步的输入是一个研究领域比如机器学习中的扩散模型或者图神经网络的可解释性输出是一批候选的研究想法。听起来简单但这里面的设计取舍很讲究。它没有让模型直接想一个idea而是先做文献检索。系统会从公开的论文库中拉取相关领域的近期论文把摘要和关键段落提取出来形成一个领域现状的上下文。然后模型在这个上下文的基础上被要求找出现有工作的空白或者可以改进的方向。这个设计的关键在于它把创意生成从凭空想象变成了基于已有工作的增量式创新。这其实和人类研究生的训练路径很像——先读够文献才知道哪里能挖。我实测下来它生成的idea质量参差不齐。有些确实有模有样比如把某种正则化方法应用到某个特定架构上验证在低资源场景下的效果有些则明显是拼凑把两个不相关的概念硬凑在一起。但值得注意的是它生成idea的数量很大一次能出几十个候选然后通过一个内部的打分机制筛选出前几个进入下一阶段。这个广撒网再筛选的策略比让模型一次就想出一个完美idea要靠谱得多。提示如果你自己想复现这个思路不要指望模型一次生成一个能用的idea。正确的做法是让它生成大量候选然后用一个独立的评估步骤去打分筛选。评估步骤可以是一个单独的模型调用也可以是一套基于规则的启发式打分。2.2 实验编码从想法到可运行代码的鸿沟创意筛选完之后进入实验编码阶段。这是整个流程里最容易出问题的地方也是我花时间最多去研究的部分。模型需要根据选定的idea写出能跑的代码包括数据加载、模型定义、训练循环、评估指标计算。这里的设计有一个很聪明的点它没有让模型从零开始写一个完整的项目而是提供了一个模板框架。模板里已经定义好了数据接口、训练流程的骨架、日志记录的格式模型只需要填充核心的模型定义和实验逻辑。这大大降低了出错的概率也让生成的代码更容易被自动化执行。但即便如此我实测时还是遇到了不少问题。最常见的是维度不匹配——模型定义的层和输入数据的形状对不上。其次是依赖问题模型有时候会引用一些没有安装的库。还有就是训练不收敛模型写出来的学习率或者初始化方式有问题。系统对这些问题有一套自动修复机制如果代码运行报错它会把错误信息回传给模型让模型尝试修复最多重试几次。这个机制在实际运行中能解决大部分简单的语法和维度错误但对于逻辑层面的问题——比如实验设计本身就不合理——它是无能为力的。2.3 结果分析与论文撰写数据到叙事的转换实验跑完之后系统会收集所有的输出训练曲线、评估指标、消融实验的结果。然后进入论文撰写阶段。这一步的输入是实验数据加上最初的idea描述输出是一篇完整的论文包括摘要、引言、相关工作、方法、实验、结论。我仔细看了它生成的论文结构上确实像模像样。摘要能概括工作内容引言能说清楚动机方法部分能把模型结构描述清楚实验部分会放上真实的图表和数据。引用也是真的从文献库里拉的相关论文格式基本正确。但问题也很明显。它的讲故事能力有限。人类写论文时会把实验结果包装成一个有说服力的叙事——我们的方法在X上取得了提升这是因为Y机制的作用。而AI生成的论文更像是我们做了A得到了B做了C得到了D的平铺直叙。它能把事实说清楚但很难把事实组织成一个有感染力的论证。另外它对负面结果的处理很粗糙。如果实验没有达到预期效果人类研究者会分析原因、讨论局限性甚至把负面结果转化为有价值的发现。而AI系统往往只是把数字放上去不做深入讨论。这一点在评审阶段很容易被抓住。2.4 自动评审AI当审稿人靠谱吗流程的最后一步是自动评审。系统会让另一个模型扮演审稿人对生成的论文进行打分和评论。评审的维度包括新颖性、技术质量、清晰度、实验充分性等基本模仿了真实会议的评审表格。我对比了几篇AI生成的论文和它们的AI评审意见发现评审意见的质量其实不低。它能指出论文的实验不够充分、某些claim缺乏证据支持、相关工作覆盖不全等问题。有些意见甚至相当犀利比如作者声称的方法优势在实验中并没有得到统计显著的验证。但这里有一个根本性的问题评审模型和写作模型往往是同一个或者同源的。这意味着它们有相似的偏见和盲区。写作模型忽略的东西评审模型可能也注意不到。这就好比让一个学生自己出题考自己很难真正检验出水平。3. 实测一遍我在本地跑通AI Scientist的完整记录3.1 环境准备中最容易忽略的三个细节我是在一台单卡机器上跑的配置不算高但跑通整个流程足够了。环境准备阶段踩了几个坑这里列出来给后来的人省点时间。第一个坑是API配额。整个流程跑一篇论文需要调用模型几十次甚至上百次包括创意生成、代码生成、错误修复、论文撰写、评审。如果你用的是按量计费的API一定要先估算好成本。我跑一篇完整的论文大概消耗了几十万token具体数字取决于实验的复杂度和重试次数。第二个坑是依赖版本。项目依赖的一些库对版本很敏感特别是深度学习框架和数据处理库。我一开始用了最新版本的框架结果代码生成阶段模型写出来的代码和框架API对不上频繁报错。后来锁定了项目推荐的版本问题就少了很多。第三个坑是实验超时设置。有些实验跑起来很慢如果没有设置合理的超时整个流程会卡住。我在配置里加了一个超时阈值超过时间就终止当前实验让模型基于已有的部分结果继续。这个设置救了我好几次。3.2 从idea到论文一次完整运行的流水账我选了一个相对简单的领域——小样本图像分类中的数据增强策略让系统自己跑。整个过程大概花了几个小时中间我干预了两次。第一次干预是在创意生成之后。系统生成了十几个idea我人工筛掉了几个明显不靠谱的保留了三个进入下一阶段。这一步其实可以完全自动化但我想看看人工筛选和自动筛选的差异。结果发现人工筛选主要筛掉的是表述不清和过于宽泛的idea而自动打分机制更倾向于选择实验容易实现的idea。两者各有侧重。第二次干预是在代码生成阶段。模型写出来的第一版代码有一个维度错误自动修复了两次都没搞定。我手动改了一行后面就顺利了。这个错误其实很简单就是卷积层的输入通道数写错了但模型反复在错误的地方找原因。后面的流程就比较顺了。实验跑完生成了训练曲线和准确率表格。论文撰写阶段产出了一篇八页左右的论文结构完整图表清晰。自动评审给了弱接受的评价主要意见是实验规模偏小建议在更多数据集上验证。3.3 生成论文的质量到底怎么样我把生成的论文和一篇真实的人类写的同领域论文做了对比。差距主要在三个方面。第一是实验的深度。人类论文通常会做多组消融实验分析每个组件的贡献。AI生成的论文往往只做了最基本的对比实验消融实验很少或者没有。这不是模型不会做而是它在设计实验方案时倾向于选择最直接能出结果的路径而不是最能说明问题的路径。第二是论证的严密性。人类论文在提出一个claim之后会紧接着给出证据然后讨论可能的替代解释。AI论文经常是提出claim放一个实验结果然后就跳到下一个点。中间的论证链条是断裂的。第三是写作的流畅度。AI生成的论文在句子层面是通顺的但段落之间的过渡很生硬。读起来像是一份实验报告的拼凑而不是一篇有内在逻辑的论文。但话说回来如果只看能不能产出一篇格式正确、有数据、有引用的论文它确实做到了。对于一个完全没有科研经验的人来说这套流程能帮他快速走完一遍科研的完整流程理解每个环节在做什么。这个教育价值其实不小。4. 自动评审通过意味着什么拆解ICLR workshop的评审结果4.1 评审意见里的关键信号那篇通过评审的论文我专门去找了评审意见来看。三位审稿人给出了不同的分数最终结果是弱接受。评审意见里有几个点值得注意。一位审稿人写道这篇工作提出了一个有趣的想法将X方法应用到了Y场景中实验结果表明了一定的有效性。这说明论文的想法至少让审稿人觉得有意思。另一位审稿人则指出实验部分只在一个数据集上进行了验证建议增加更多数据集。这是典型的实验充分性质疑。还有一位审稿人关注的是写作论文的结构清晰但部分段落的逻辑衔接可以更好。这些意见其实和人类论文收到的评审意见非常相似。这说明AI生成的论文已经跨过了一个门槛它至少能让审稿人认真对待而不是一眼就看出是机器写的然后直接拒掉。4.2 通过评审不等于科研突破但这里必须泼一盆冷水。通过一个workshop的评审和做出真正的科研贡献是两件完全不同的事。Workshop的评审标准通常比主会宽松接收率也更高。而且评审本身有很大的随机性同样的论文换一批审稿人结果可能完全不同。更重要的是科研的价值不在于通过评审而在于推动了领域的认知。一篇论文即使发表了如果没有人引用、没有人跟进、没有对后续研究产生影响它的实际贡献就是有限的。AI生成的论文目前还很难产生这种影响力因为它缺乏对领域深层问题的理解也缺乏提出真正新颖方向的能力。4.3 审稿人视角下的AI论文破绽我后来把几篇AI生成的论文混在人类论文里让几个有审稿经验的朋友盲审。他们大部分能猜出哪些是AI写的但理由各不相同。有人说是实验部分太单薄有人说是引用的文献太新缺乏经典工作还有人说是讨论部分太浅没有深入分析。这些破绽其实指向同一个问题AI系统在做科研时缺乏品味。它不知道什么问题是重要的不知道什么实验是必须做的不知道什么讨论是有价值的。它只是按照一个固定的流程走完产出一个看起来完整的结果。而人类的科研品味是在长期的阅读、讨论、失败中积累出来的目前还没有办法被简单地编码进一个流程里。5. 如果你想在自己的领域复现这套流程5.1 从哪个环节开始自动化最划算如果你对这套思路感兴趣想在自己的研究领域里做类似的尝试我的建议是不要一上来就搞全流程。全流程的复杂度很高调试成本也大。更务实的做法是从单个环节开始。最容易切入的是文献调研和创意生成。你可以写一个简单的脚本让模型读一批论文摘要然后生成一批候选idea。这个环节的容错率高即使生成的idea质量一般也不会造成什么损失。而且这个环节能帮你快速了解一个陌生领域的现状对于刚进入一个新方向的研究者来说很实用。其次是实验编码。如果你有大量重复性的实验要跑比如调参、对比不同模型、跑消融实验可以尝试让模型生成代码模板然后你手动调整。这个环节的关键是提供一个好的模板让模型在模板的基础上填充而不是从零开始写。5.2 哪些环节必须保留人工介入论文撰写和评审这两个环节我强烈建议保留人工介入。论文撰写不只是把实验结果写出来更重要的是构建一个论证。这个论证需要你对领域的理解、对读者预期的判断、对什么是有说服力的证据的把握。这些目前还是人类的强项。评审环节更是如此。自动评审可以作为初筛帮你快速过滤掉明显有问题的论文但最终的判断还是需要人来做的。而且如果你自己就是作者让AI来评审自己的论文很容易陷入自己考自己的困境。5.3 成本与收益的现实评估最后算一笔账。跑一套完整的AI Scientist流程需要的时间成本、算力成本、API成本加起来并不低。如果你的研究领域比较成熟有大量的公开代码和基准那自动化的收益可能比较明显。但如果你的领域比较新缺乏标准化的数据和评估方法那自动化的难度会大很多。我的建议是把AI Scientist当成一个科研加速器而不是科研替代品。它能帮你快速走完一些重复性的流程让你把精力集中在真正需要人类判断的地方。但如果指望它替你做出真正的科研突破目前还不太现实。6. 这套系统暴露出的真问题6.1 科研评价体系会被倒逼改变吗AI Scientist通过评审这件事其实暴露了一个更深层的问题现有的科研评价体系在多大程度上依赖于论文这个形式本身如果一个系统能批量生产格式正确、数据真实、评审通过的论文那论文作为科研产出的衡量标准其有效性就会受到挑战。这不是一个技术问题而是一个制度问题。会议和期刊的评审资源是有限的如果投稿量因为AI的介入而大幅增加评审质量必然下降。而评审质量的下降又会让更多低质量的论文通过。这是一个恶性循环。6.2 当生成论文的成本趋近于零现在生成一篇论文还有一定的成本包括API调用、算力消耗、人工调试。但随着模型效率的提升和算力成本的下降这个成本会越来越低。当生成一篇论文的成本趋近于零时会发生什么一个可能的场景是投稿量爆炸评审系统崩溃然后会议和期刊被迫引入AI辅助评审甚至完全自动化评审。到那个时候科研的整个流程——从创意到发表——都可能被自动化。人类研究者的角色会变成什么这是一个值得每个科研工作者思考的问题。6.3 我个人的判断工具化是必然替代论是噪音我个人的判断是AI在科研中的角色会越来越像工具而不是替代者。就像计算器没有替代数学家编译器没有替代程序员AI也不会替代科学家。它会改变科研的方式让一些重复性的工作自动化让研究者能把精力集中在更有创造性的部分。但替代论的噪音也需要警惕。每次有新的AI科研工具出现都会有人喊科学家要失业了。这种论调除了制造焦虑没有什么实际价值。真正有价值的是去理解这个工具能做什么、不能做什么然后把它用在合适的地方。我在实际使用中的体会是AI Scientist目前最适合的场景是快速探索和流程验证。当你进入一个新领域想快速了解现状并生成一些初步想法时它很有用。当你有一个成熟的想法想快速验证可行性时它也能帮上忙。但当你需要做出真正有深度的科研工作时它还不能替代你的判断和品味。最后分享一个小技巧如果你打算尝试类似的流程先从文献调研创意生成这个环节开始用你熟悉的领域做测试。看看它生成的idea里有多少是你觉得有意思的。这个比例能帮你判断它在你的领域里到底有多大用。我测试下来这个比例大概在百分之十到百分之二十之间不算高但考虑到生成的成本很低这个比例其实已经可以接受了。