十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Meta Muse Spark 1.3 发布,跑分超 GPT-5.6,性价比吊打同行!

Meta Muse Spark 1.3 发布,跑分超 GPT-5.6,性价比吊打同行! 前沿模型密集发布RSI 时代来临九月仅过去 3 天已有五个前沿模型发布包括 Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber以及 Meta 的 Muse Spark 1.3。这是否意味着 RSI 已经到来Meta 强势出击Muse Spark 1.3 挑战谷歌昨晚谷歌的 Gemini 3.8 Flash 成为轻量霸主然而 Meta 迅速踢馆。小扎在 X 上官宣 Muse Spark 1.3 正式发布称其以前沿性能带来几乎便宜到无需计量的体验是编程和智能体工作的最大飞跃。Meta 超级智能实验室掌舵人 Alexandr Wang 揭秘核心杀手锏与 Muse Spark 1.2 相比Muse Spark 1.3 减少无效轮次工具调用次数减少约 20%token 消耗减少约 25%长周期任务中能更好保持需求。跑分显示Muse Spark 1.3 提升更大反超 GPT-5.6 Sol 和 Fable 5Max 推理强度下智力指数达 62 分进入第一梯队。Muse Spark 1.3 实力超群打乱行业阵脚在五个月里Meta 已迭代 4 个 Muse Spark 版本。在 DeepSWE v1.1 基准测试中Muse Spark 1.3 超越 Opus 5 和 GPT-5.6 Sol甩开刚发布的 Gemini 3.8 Flash拿下最高分。在其他关键开发者指标中Muse Spark 1.3 也表现出色如在 SWEAtlas CodeBase QnA 中获 59.4 分Terminal-Bench 2.1 中获 88.8 分MRCR 512K - 1M 上获 98.1 分碾压 GPT-5.6 Sol。在 Agent 能力上基本追平前沿水平Artificial Analysis 上甩开 Gemini 3.8 Flash智能指数与 Claude Fable 5 持平跻身顶尖行列。成本方面Muse 输入成本比 Fable 5 低 8 倍输出成本低近 12 倍性价比极高。Alexandr Wang 嘲讽谷歌戏称其只能“吸别家模型尾气”。Less is MoreMuse Spark 1.3 成性价比之王如今 AI 圈好用且便宜才是开发者关注重点。Muse Spark 1.3 被称为性价比之王它不走“大力出奇迹、疯狂堆叠参数”的路而是做减法。针对长周期编程和指令遵循能力专门训练减少交互轮次输出更简洁成本大幅下降。开发者 SPAC89 实测Muse Spark 1.3 Ultra Contributor 模式与 Fable 5.1 xHigh 对比在严苛规则下运行约 2 小时Muse Spark 1.3 进行 20 轮自我改进循环启动 3 个智能体2 小时内跑 60 多次智能体运行总成本不到 1 美元。宏观定价上新模型加量不加价贡献者版定价更是国外模型地板价。在同等智力水平模型中Muse Spark 1.3 单任务成本仅 0.55 美元远低于 Grok 4.6、GPT-5.6 Sol 和 Claude Opus 5。开发者 Kartik 指出它具备类似 Sol 和 Fable 的“循环深度”推理能力token 效率惊人。Alexandr Wang 助力Meta 瞄准智能体工程Muse Spark 1.3 的快速迭代是 Alexandr Wang 接手 Meta 超级智能实验室的成果。今年 7 月Meta 发布 Muse Spark 1.1主打 1M 超长上下文和计算机操作不到两个月1.3 版本将长程编码能力提升到 GPT-5.6 档次。Meta 目标是“智能体”和“便宜到忽略不计”瞄准“智能体工程”风口。Meta AI 负责人 Alexandr Wang 表示所有改进是为打造 7×24 小时在线个人智能体。该智能体需极度聪明稳定能撑住长对话线程、并行处理工作流、主动提问、求助、确认且不产生幻觉还需极度便宜否则只能是少数人玩具。Muse Spark 1.3 为其铺路像资深工程师能自我规划、纠错和交付。北大校友、Meta 研究员孙之清透露团队对牛油果 avocado 模型再次后训练实现更好测试 scaling。狂欢背后Muse Spark 1.3 遭质疑Muse Spark 1.3 也受到质疑。知名 AI 机构 BridgeMind 指出本月 AI 发布分数飙升但真实体验无长进对基准测试信任减少。网友压力测试揭穿 Muse Spark 1.4 和 Gemini Flash 3.5 老底前者没那么好后者纯刷榜。目前各大实验室陷入“为跑分而训练”怪圈Muse Spark 1.3 也有退步如 AA - Omniscience 测试中xhigh 和 max 版本下降因“弃权率”变高虽降低幻觉率但说明绝对知识储备提升没跑分夸张。大模型下半场比拼什么今天 Muse Spark 1.3 和 Gemini 3.8 Flash 发布带来思考。首先基座模型“参数红利”见顶靠扩大参数规模提升智力边际效益降低未来需引入“循环深度”推理机制、工具调用做“减法”才能提升体验。其次“智能体工程”是胜负手大模型之争从“谁更会说话”转向“谁更能干活”核心壁垒是低成本下长程任务真实落地能力像 Muse Spark 1.3 这样低成本跑完多次试错循环的模型将重塑商业模式。那么大模型的未来究竟会走向何方
返回列表