Meta 今天发布了两款 AI 产品:Muse Code,一个在终端里运行的编程 agent;Muse Spark 1.2,驱动这个 agent 的新模型。一句话概括:你可以用 curl -fsSL https://dev.meta.ai/install.sh | bash 安装一个能在大项目里自动规划、写代码、验证结果的 AI 终端工具。

据介绍,Muse Code 是 Meta 的编程 agent 产品。它和市场上已有的终端编程 agent 在设计理念上有几个明显的差异点。
- 异步后台 agent:Muse Code 有一个主 agent 循环,外加一组后台 agent。这些后台 agent 不是每次任务临时创建的,而是一直运行在整个 session 里,负责收集信息、执行下一步操作,并在需要时主动通知主 agent。因为它们是持久化的,不用每次重新收集上下文,在多步骤任务中延迟更低,也不需要用户频繁给指令。
- 事件日志作为单点真相:Muse Code 的运行时把每一次模型调用、工具执行、用户审批、代码编辑都以事件的形式追加到本地日志中。这个设计的直接好处是:agent 崩溃后可以精确恢复到中断点继续执行,不用从头开始。对于需要跑几个小时的长任务来说,这个能力是刚需。
- 内置技能:
/plan 把任务变成需要审批的计划,/grill 对这个计划进行压力测试直到它站得住脚,/goal 则持续推进目标的完成。Meta 给的 demo 是把一个房子的航拍视频扔给终端,Muse Code 自动生成了一个度假屋营销页面。
模型端:Muse Spark 1.2
Muse Spark 1.2 是 Muse Spark 1.1 的"编程特化版"。Meta 在编程任务上大幅增加了训练算力,同时扩展了训练环境的多样性。几个值得注意的点:
与 Muse Code 联合训练:不是先训好模型再适配工具,而是在训练过程中就让模型和 Muse Code 的工具集、harness 交互。训练数据包括 rejection sampling 产出的 harness 轨迹、针对 goal 和 subagent 的 recipe 优化。
长时域训练:模型在整仓库级别的代码生成、大型端到端项目、自动研究等场景上做了大量训练。通过 planning 来排序工作、goal conditioning 来维持方向、context compaction 来保留进度中需要的知识。
自我改进:Muse Spark 1.1 被用来生成挑战性的编程环境和指令遵循模板,然后由同一个模型对输出评分,看是否满足要求。这个循环产出了一个可扩展的训练数据集,让 1.2 在复杂指令遵循上更强。
GPU 内核优化:24 小时连续跑
Meta 给了一个具体案例:让 Muse Spark 1.2 在 NVIDIA Hopper GPU 上优化 KDA 和 MLA 内核,超过 1000 次工具调用,最长连续跑 24 小时。agent 写代码、编译、profile、迭代优化,最终在 baseline 之上实现了显著性能提升。测试规则是:禁止直接导入 FLA 等第三方内核库,必须自己用 Triton 实现算法。
Muse Spark 1.2 的做法是:把 chunk-parallel 的准备内核和跨 chunk 的顺序扫描配对,结合常规的融合和分块优化,再加上 KDA 专属的优化——比如在 chunk 中点重置 gated cumulative decay。
定价策略引起广泛讨论
Muse Spark 1.2 的 API 定价让大家关注的重点跑偏了——比起模型能力,大家更关心价格。
Meta 给了一个选择:如果你允许 Meta 用你的数据来训练模型,输入价格从 $1.25/M token 降到 $0.10/M token(10 倍),输出从 $4.25/M token 降到 $0.20/M token(20 倍)。这个折扣幅度在 API 定价里是罕见的。
"我太喜欢这个定价策略了,非常透明。"一位 HN 用户在评论区写道。但紧接着就有人质疑:"Meta 不可能因为你没勾那个框就真的不用你的数据训练,你只是多付了钱让他们对你撒谎并违反合同。"
有人把 OpenAI 的政策翻出来对比。OpenAI 也有数据共享换免费额度的机制,但门槛复杂:不同价格层级、不同 opt-in 配置、基于用量的可用性。"比 Meta 的方案复杂太多了。我宁可翻个参数开关就拿 10 倍折扣,也不要在 OpenAI 那一堆配置里翻来翻去。"
不过也有用户指出 OpenAI 的免费额度限制很严——每天 1M 到 10M token,按 100K 上下文算也就是 10 到 100 个请求。"不多,这反而是付费给 Meta 的另一个理由。"
参考来源: