
Meta推出了一款测试版编程智能体专为处理大型代码库中的复杂软件开发任务而设计。Muse Code目前支持macOS和Linux系统采用该公司最新推出的Muse Spark 1.2模型。与以往需要为每项任务单独创建智能体的方式不同Muse Code内置了多个可在整个会话期间持续运行的专属后台智能体。这些智能体以异步方式执行任务并可自主判断何时向主智能体汇报工作进展。Meta表示保持智能体持续活跃的设计能够减少重复收集信息的开销并降低开发者在处理复杂多步骤任务时的介入需求。Muse Code采用本地事件日志机制每一次模型调用、工具运行、操作审批和代码编辑都会被记录其中Meta在官方博文中表示这套记录机制使运行时具备精确回放能力和安全重启能力智能体在崩溃后可从中断位置精准恢复。Muse Spark 1.2模型可通过Muse Code及Meta模型API使用Meta同时宣布扩大该API的全球访问权限。Meta表示Muse Spark 1.2与Muse Code经过协同训练以提升模型在智能体环境下的表现和易用性。训练过程融合了Muse Code的工具集和智能体工作流程同时Meta增加了用于代码生成的算力投入并扩展了所覆盖的开发环境范围。此外该模型还针对更长周期的任务进行了专项训练包括整仓代码生成和大型端到端软件项目。Omdia首席分析师苏连杰表示Meta的协同训练方式未必能形成明显的竞争优势因为竞争对手同样在同步推进各自编程模型与智能体框架的深度协同开发。OpenAI和Anthropic等厂商已将智能体框架工程纳入训练流程的一部分他说。Pareekh Consulting首席执行官Pareekh Jain指出模型与智能体的协同优化确实有助于提升任务规划和上下文处理能力但要形成真正的竞争优势还需在企业级项目上拿出更好的实际成绩并切实减少人工干预。在基准测试方面Muse Spark 1.2在Terminal-Bench 2.1上取得了82.9%的pass1得分低于Claude Opus 5但略高于GPT-5.6 Terra在DeepSWE 1.1上得分为59.3%落后于上述两款竞品。值得注意的是Meta在进行Terminal-Bench 2.1和DeepSWE 1.1评测时对每款模型均搭配其对应的编程智能体而非使用统一的智能体框架。Meta也坦承竞品专有模型若使用专为其设计的工具和提示词表现可能有所不同。Counterpoint Research研究副总裁Neil Shah表示只有采用第三方工具或统一智能体框架进行评测跨厂商的横向比较才更具参考价值。对于CIO而言真正关键的指标是模型在企业自有开发流水线上的通过率这才是衡量模型与智能体框架组合是否成功的核心标准——对Meta的Muse Spark 1.2和Muse Code来说也不例外他说。这才是真正意义上的基准测试。在企业采用层面苏连杰指出安全合规与治理要求可能会拖慢落地进程尤其是在编程智能体需要与企业现有身份认证系统对接的场景下。很多企业对于将AI工具接入CI/CD环境仍持谨慎态度他说。Shah则表示企业需要建立完善的访问管控机制规范智能体对代码仓库的访问行为并保留模型和智能体工作流处理企业数据的完整记录。他还特别提到了Token用量难以预测这一问题及其对成本的潜在影响。Meta的定价结构也带来了数据治理方面的选择。Meta表示低价的Contributor版本所产生的数据可能被用于改进其产品而标准版则不作此用途。Contributor版定价为每百万输入Token 0.10美元、每百万输出Token 0.20美元标准版则分别为1.25美元和4.25美元。此外企业对厂商绑定和依赖性也存在顾虑担心这会影响长期的系统灵活性和互操作性苏连杰补充道。Jain认为企业的实际采用路径可能会从定义清晰、风险较低的工作场景起步在允许持续运行的智能体修改关键生产代码之前会经历较为审慎的渐进过程。QAQ1Muse Code和普通编程工具有什么区别AMuse Code最大的不同在于引入了持续运行的后台智能体。普通工具通常为每个任务临时创建智能体而Muse Code的智能体在整个会话中保持活跃能够异步执行任务、自主决定何时汇报进展并在崩溃后精准恢复中断前的状态特别适合处理大型代码库中复杂的多步骤开发任务。Q2Muse Spark 1.2在基准测试中表现如何AMuse Spark 1.2在Terminal-Bench 2.1上的pass1得分为82.9%低于Claude Opus 5但略高于GPT-5.6 Terra在DeepSWE 1.1上得分59.3%落后于两款竞品。需要注意的是Meta的测评方式是为每款模型配套其专属智能体而非使用统一框架因此跨模型比较的客观性存在一定局限。Q3企业在采用Muse Code时主要面临哪些顾虑A企业的顾虑主要集中在三个方面一是安全与合规要求许多企业不愿将AI工具接入CI/CD环境二是数据治理风险需要明确智能体访问代码仓库的权限边界及数据使用记录三是Token用量难以预测带来的成本不确定性以及对厂商绑定影响长期系统灵活性的担忧。