ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

48 小时、1 块 GPU:Claude 自己修好了 10 类安全问题,还超过了 28 名人类研究员

48 小时、1 块 GPU:Claude 自己修好了 10 类安全问题,还超过了 28 名人类研究员 48 小时、1 块 GPUClaude 自己修好了 10 类安全问题还超过了 28 名人类研究员一台 AI 用 48 小时和 1 块 GPU自己修好了自己的 10 类安全问题综合成绩还超过了 28 名人类安全研究员。这不是科幻设定而是 8 月 28 日 Anthropic 正式发表的一项研究结果Claude 被派去当「自动化安全研究员」从检索文献开始到提出方法、造训练数据、动手训练、跑测试整个研究闭环全部自己完成没有人类研究员在中间递工具。在欺骗类安全缺陷上Claude 的最佳方案比人类最好的方案好 20%把这一类的安全差距闭合了 85%。对比组里那 28 名人类研究员每人最多有 8 小时提出方案而 Claude 只有 48 小时和一块 GPU约束比人类更苛刻。结果一出AI 安全圈讨论最多的不是「AI 能不能修 bug」而是一个更尖锐的问题当 AI 能自己研究怎么让自己更安全的时候谁在负责最后一道关一、什么叫「自动化安全研究员」48 小时闭环跑完整套研究先说这套实验是怎么设计的。Anthropic 从自家 Claude 模型里挑出一个小模型作为「优化对象」再让 Claude 自己扮演研究员去改善这个小模型的安全表现。研究员 Claude 要做的不是动嘴而是完整复刻一名人类安全研究员的日常工作流程。这个流程分成四步。第一步检索文献Claude 自己读相关论文和安全资料弄清楚某一类安全缺陷的成因和已知解法。第二步提出方法与数据它要根据读到的内容设计一套训练方案包括方法本身和配套的训练数据。第三步训练目标模型用这套方案去训练被优化的那个小模型。第四步测试效果把训练好的模型放到公开安全基准上打分看缺陷有没有被修掉、能力有没有受损。整套循环被装进一个约束里Claude 只有 48 小时的工作时间只给一块 GPU。这两个数字是刻意压的Anthropic 在发布时专门强调目的就是证明这套流程的自动化和廉价程度已经到了任何一个实验室都能复跑的水平。换句话说这不是一个烧了上万张卡才能做的演示而是一个普通的夜间任务。把整个流程再看一遍会发现最关键的并不是「Claude 会写训练代码」这件事而是它能在无人干预的情况下自己决定下一步做什么读什么资料、造什么数据、怎么调训练参数。研究过程的自主性才是「自动化研究员」和「一个会写代码的工具」的本质区别。二、10 类安全缺陷全部修复欺骗、谄媚都在列这套流程一共跑了 10 类对齐失败也就是 AI 模型常见的安全毛病。清单里包括欺骗模型有意给出错误信息或隐瞒真实意图、谄媚模型一味顺着用户说哪怕用户的要求是错的、以及模型在追求目标时产生的其他几类行为偏差。结果是一项都没漏针对全部 10 类缺陷Claude 提出的修复方案都让目标基准的分数上升了同时没有损害模型的通用能力。这里「没有损害」不是口头保证而是有专门对照的实验同时跑了通用能力基准修复后的模型在通用任务上的表现没有明显退步也就是说这些修复不是靠牺牲能力换来的。更值得注意的是泛化性。实验里把 Claude 的方案用到它没见过的 withheld 安全基准上依然有效Anthropic 还用了一个叫 Petri 的开源模拟工具它专门构造对抗性的多轮对话场景来测试模型有没有走歪Claude 的修复方法在这些场景里同样站得住。这说明修出来的不是「背题」而是真正改变模型行为倾向的调整。还有一组数字经常被引用Claude 提出的最佳方法用在一个比优化对象大 4.7 倍的模型上依然能起效。这意味着这套自动化流程并不只适用于小模型玩具实验而是有一定跨规模的可迁移性这恰好是它从「演示」走向「实用」的关键一步。三、人机对决28 名人类研究员输在哪儿如果说前面的数字是工程指标那这场人机对比才是让这篇研究出圈的新闻点。Anthropic 给同一批 10 类安全缺陷请了 28 名人类安全研究员每人最多 8 小时提出自己的修复方案。Claude 的约束是 48 小时加一块 GPU人类的条件是 8 小时加自己的全部经验。最终综合成绩上Claude 超过了全部 28 名人类研究员。拆开看最有戏剧性的是欺骗类缺陷Claude 的最佳方案比人类最好的方案好 20%把这一类的安全差距闭合了 85%。注意这个数字的含金量欺骗是 AI 安全里最棘手的一类问题因为模型学会说谎后越强的模型危害越大人类研究者对着这类问题常年头疼。不过要诚实地说这场对比有一个对 Claude 有利的边界条件Anthropic 自己也承认了人类研究员提出方案后不能像 Claude 那样在自己的模型上反复迭代验证等于人类是被限制在「一次性提交」的规则里而 Claude 可以边测边改。这个差异让「超过 28 名人类研究员」的说法需要打个折扣但折扣有限因为即便在更苛刻的提交规则下Claude 的最佳方案在欺骗任务上依然显著优于人类最佳。对从业者来说这场对比真正重要的不是「AI 赢了人类」这个头条而是它揭示的能力拐点安全研究里最耗时的部分也就是读文献、造数据、试训练的循环正在被自动化而人类研究员的角色正在从「动手者」变成「定方向的人」。四、为什么这件事值得认真对待把这项研究放到更大的背景里看有三个信号值得从业者留意。第一个信号是安全研究的成本结构被改写。过去修一个安全缺陷要养一个研究团队、烧大量算力、磨数周时间。现在一块 GPU 跑 48 小时就能产出一个可用的修复方案还附送泛化验证。成本的断崖式下降意味着安全对齐从「少数大实验室的特权」向「普通团队可负担的工作」转变。第二个信号是自我改进的边界在被测试。当 Claude 能研究怎么让模型更安全同样一套自动化流程也可以被用来研究怎么让模型更强、更能绕过限制。Anthropic 把框架和 10 类基准套件都开源了这既是善意的分享也把同一个工具箱摆到了所有人面前。AI 安全能力的军备竞赛正在从「人 vs 人」变成「AI 辅助的人 vs AI 辅助的人」。第三个信号是方法论的可迁移性。Anthropic 在发布时特别强调这套 AAR自动化对齐研究员框架里有一个与具体任务无关的模板同一个研究循环可以套到其他可测量的目标上。这意味着「让 AI 自己研究自己」不只是安全这一个议题的解法而是一整套可以复用的研究范式。对科技从业者和 AI 观察者来说这篇研究最大的启示不是某个具体数字而是它把一个问题摆到了桌面上当 AI 能自己设计训练方法、自己验证效果、自己迭代改进的时候人类在 AI 研发链条里的位置需要重新定义。过去大家讨论的是 AI 替代白领工作现在讨论的升级成了 AI 替代 AI 研发里的执行环节。这种替代未必是坏事。安全对齐领域常年被诟病「研究跟不上模型发布速度」自动化研究员的出现至少在安全这个方向上把速度拉回来了一截。至于拉回来的速度够不够、方向对不对那就要靠人类在更高一层把关了而这恰恰说明AI 越能自己干活人类负责的那部分工作反而越接近真正的判断和取舍。五、数据表格一项研究里的关键数字把这篇研究里最容易被引用的几个数字放在一起方便直接取用指标数字说明可用时间48 小时Claude 完成整个对齐研究闭环的时限算力约束1 块 GPU全程只使用一张显卡对齐失败类别10 类欺骗、谄媚等全部成功修复人类对比组28 名研究员每人最多 8 小时提交方案欺骗类最优比人类最佳好 20%该类安全差距闭合 85%跨规模迁移大 4.7 倍的模型仍有效最佳方法的泛化验证许可协议Apache 2.0 开源框架与基准套件公开六、留给读这篇文章的人的三个问题第一个问题如果你的团队也在做模型安全或者模型评估这套自动化流程里哪一步是最容易被替换掉的哪一步是必须留给人做的多数团队会发现自己最贵的成本恰恰在「试训练参数」这个环节而这正是自动化最擅长的。第二个问题开源意味着同样的工具所有人都能用那你的安全优势从哪里来答案大概率不是工具本身而是你对业务场景的理解以及你能定义出哪些「其他可测量目标」值得跑这套循环。第三个问题当 AI 能自己研究安全人类安全研究员的职业路径会怎么变短期看执行层会被压缩但方向定义、目标设定、结果审计这些更高层的能力会变得更重要。与其焦虑被替代不如想想怎么把自己的工作重心往上移。这篇研究的完整细节在 Anthropic 的研究博客上可以查到感兴趣的可以对照着里面的实验设置和数据自己推一遍。对绝大多数人来说记住那个最反直觉的结论就够了安全对齐这件被认为最需要人类智慧和判断的事正在被 AI 用最朴素的方式接手而人类真正的价值正在退到更靠后的位置。七、说在最后再回到开头的那个荒谬事实一台 AI 用 48 小时和 1 块 GPU自己修好了自己 10 类安全问题。把它翻译成对产业的语言就是安全研究的边际成本正在趋近于零而速度正在成倍加快。对认真做 AI 产品的团队来说这是一个可以立刻利用的信号模型安全的入场券比想象中便宜得多。但便宜不等于免费速度快不等于方向对。Claude 能自己提出方案、自己验证但「什么是值得修的安全缺陷」「修复到什么程度算够」「哪些边界不该碰」这些判断依然要人来定。AI 研究 AI人定义研究的价值这大概是接下来很长时间里这个行业最真实的分工。
返回列表