meta版Harness环境:Muse Code开放测试,一个命令就能安装。
同时最新大模型Muse Spark 1.2版更新。
虽然与1.1相比提升有限……
But!
meta提供了一个“贡献者”版本,只要你同意上传数据,就能获得0.5折,立省95%,比DeepSeek还便宜。
这是赔本也要收集数据啊。
司马扎之心,路人皆知了。
meta版Code来了Muse Code接收的是完整工程任务:在大型代码库中理解需求、规划变更、跨文件改动、编写代码并验证结果。
官方演示中,用户把一段房屋航拍飞行视频以mp4文件输入终端,Muse Code读懂视频内容,产出一个度假屋营销与预订页面,并在浏览器中验证成品。
它的结构是一个简单的主循环,外加一组异步后台智能体。
与遇到子任务才临时派生智能体的做法不同,这些后台智能体在整个会话中保持活跃,自行推进下一步工作,并自己决定何时向主智能体反馈。
一个已经扫描过项目结构、依赖、测试配置和历史改动的后台智能体,不必因为新任务重复同样的探索。
后台观察智能体围绕记忆召回、技能召回、目标追踪和验证四个质量维度工作,前三项默认启用,验证观察器默认关闭。这些观察器自身也会发起模型调用,因此会带来额外的token开销。
当任务可以拆成若干相对独立的部分时,Muse Code会把工作分派给多个子智能体。
开发者可以用muse —subagent-worktree-isolation启用隔离,此时每个子智能体从主提交点创建独立的Git worktree,在各自的目录里修改并独立提交,主工作副本不被直接改动,主智能体再审查或合并结果。
执行中断之后,智能体可以从停止点继续,而不是靠重新提示或猜测已有状态。这份日志同时构成一条可审计的时间线:哪个智能体在何时调用了什么工具、拿到什么结果、执行了哪些改动、在哪一步被批准或取消,都可以回看。
Muse Code自带几个默认技能:
/plan把任务转成需要审批才能推进的计划
/grill反复压力测试这份计划直到它站得住
/goal朝指定目标推进到完成。
兼容性方面,Muse Code支持内置、用户级和项目级三层skills,会扫描.codex/skills与.claude/skills,支持从Claude或Codex导入skills,可通过MCP连接外部工具,通过hooks接入生命周期事件,
和harness一起训练的模型Muse Spark 1.2是Muse Spark 1.1和harness一起训练的模型的结果。
meta显著增加了编程任务上的训练算力,并扩展训练环境的多样性,改进集中在代码生成、复杂调试、代码库理解和端到端开发流程,同时保留通用智能体能力。
Muse Spark训练深度结合Muse Code,训练素材包括经过拒绝采样的 arness轨迹,以及针对目标设定、上下文压缩和子智能体的配方优化,Muse Code的工具集也被直接整合进训练,以最大化模型与运行时的兼容性。
长时程能力来自另一组任务:整仓库生成、大型端到端项目和自动研究,模型用规划给工作排序,用目标条件化维持方向,用上下文压缩保留继续推进所需的知识。
此外还有一条自我改进回路,用上一代的Muse Spark 1.1生成有难度的编码环境和指令遵循模板,再由模型对候选解是否满足要求打分,形成可规模化的训练数据,用于提升1.2的复杂指令遵循能力。
meta还展示了一个高强度案例:在英伟达Hopper GPU上迭代优化KDA和MLA kernel,执行超过1000次工具调用,运行时间最长达24小时。
在不得直接导入第三方kernel库的限制下,模型自己编写、编译、剖析并逐步改进实现,相对给定基线取得了显著性能提升。