🤖 科技 · AI大模型 · 编程智能体
一、这是一次"为编程而生"的精准更新🔥 核心观点:Muse Spark 1.2 是 Meta 押注编程赛道的专用模型,性能逼近第一梯队,靠"低价换数据"打法正面硬刚 Claude 与 GPT。
8月5日,Meta 发布了全新的编程模型 Muse Spark 1.2,并同步推出基于终端的编程智能体 Muse Code。这是 Meta 首次以如此认真的姿态切入 AI 编程工具市场,扎克伯格亲自在 X 上发文站台,称其能"在大型代码库中执行完整的软件工程任务"。与上一代 Muse Spark 1.1 相比,1.2 在代码生成、复杂调试、代码库理解和端到端开发者工作流四个方向都有明显提升,训练时大量加码了编程任务的算力。
从技术路线看,Meta 这次做了三件事:与 Muse Code 联合训练、强化长周期任务能力、以及用 1.1 版模型自我生成训练数据做"自我改进"。尤其是最后一点,让 1.2 在遵循复杂指令上比前任更精准,也解释了它为何能在代际间蹿升明显。
二、跑分不弱,但离第一仍有距离在 Terminal-Bench 2.1 上,Muse Spark 1.2 拿下 82.9%,略高于 GPT-5.6 Terra(81.8%)和 Grok 4.5(81.6%),却落后于 Claude Code 里 Opus 5 的 86.7%。在 DeepSWE 1.1 上,它 59.3% 排第三,同样排在 Opus 5(65.0%)和 GPT-5.6 Terra(64.8%)之后。即便在 Meta 自设的内部编程基准里,Anthropic 的模型依然稳居榜首。
不过代际提升是实打实的:1.2 在 Terminal-Bench 上比 1.1 高出 6.7 个百分点,DeepSWE 高出 6.3 个百分点。第三方机构 Artificial Analysis 给它打出 Intelligence Index 54 分,较 1.1 提升 3 分,与 GPT-5.5、Grok 4.5 打平,已进入美国实验室第一梯队的争夺区间。换句话说,它不是第一,但已经足够有威胁。
三、低价换数据,是聪明还是冒险定价是 Muse Spark 1.2 最锋利的一张牌。标准层每百万输入 token 1.25 美元、输出 4.25 美元,比 Anthropic 的 Sonnet 5 便宜一大截;更狠的是"贡献者层级",输入低至 每百万 0.10 美元,比刚刚宣布涨价的 DeepSeek 还要低,代价是开发者必须"选择加入"让 Meta 用数据改进模型。这种以低价换训练数据、再反哺模型的循环,是 Meta 在追分阶段的务实选择。
综合 Meta 官方博客、36氪及 Artificial Analysis 报道,Muse Spark 1.2 的战略意义远超单款模型本身:它标志着 Meta 在专有模型与开源路线之间重新找到平衡,也向 Anthropic、OpenAI 发起了编程赛道的正面挑战。结论一句话——它还不是最强,但它的性价比与节奏,足以让所有人都得抬头看它一眼。
综合 Meta 官方博客、36氪、Artificial Analysis 报道 | 2026年8月