就在剛剛 Meta 在台灣時間 9 月 3 日凌晨由執行長 Mark Zuckerberg 親自宣布推出第四代旗艦模型 Muse Spark 1.3,這是過去五個月內第四個版本迭代,也是 Meta 首次擠進 AI 模型的第一梯隊。根據獨立評測機構 Artificial Analysis 的數據,Muse Spark 1.3 在智力指數(Intelligence Index)上以 62 分位居全球第三,僅次於 Anthropic 的兩款模型,正式超越 OpenAI 與 Google。
五個月衝刺:從追趕到超車
Muse Spark 家族的進化速度相當驚人,7 月推出的 1.1 版僅有 53 分,8 月的 1.2 版進步到 57 分,如今 Spark 1.3 版一舉衝上 61 至 62 分。而公開版本 Spark 1.3 xhigh 以 61 分與 GPT-5.6 Sol(max)、Grok 4.6(high)和 Claude Opus 5(high)並列,僅供合作夥伴內測的 max 版本則達到 62 分,排在其前面的只有 Claude Fable 5.1(max)的 66 分與 Claude Opus 5(max)的 63 分。
這個排名背後的意涵很清楚:Google 最高分的 Gemini 3.8 Flash(high)僅有 59 分,已經被擠到第四名之後。OpenAI 與 xAI 的最高配置也未超越 Muse Spark 1.3。曾經在 Llama 4 世代落後的 Meta,現在已經站穩全球前三大 AI 模型提供商的位置。
Muse Spark 1.3 目前也已在 OpenCode 平台上免費提供,X 平台上已有開發者回報實際使用體驗良好。有用戶在 Codex 中切換至 Muse Spark 1.3 後直言「真的好用到爆」,也有開發者將其與 Claude Code 並用處理複雜任務。甚至有用戶在 DeepSWE(自主軟體工程評測)上觀察到,Gemini 3.8 Flash 原本短暫佔據第一名,幾小時後就被 Muse Spark 1.3 取代。
Meta Muse Spark 1.3 is now free on OpenCode
— OpenCode (@opencode) September 3, 2026
代理任務是最大亮點
根據 Artificial Analysis 的細項評測,這次主要成長來自代理型任務(Agentic Tasks)與科學推理能力。Tau3-Bench Banking(銀行代理決策)從 1.2 版的 35% 躍升至 xhigh 的 47%,max 版更達到 52%,是目前所有測試模型中的最高分。Terminal-Bench 2.1(終端操作)從 80% 進步到 85%。衡量白領工作品質的 GDPval-AA v2 Elo 評分也從 1,615 大幅拉升至 1,709(xhigh)與 1,754(max)。max 版本之所以代理分數更高,是因為它在推理上花了更多時間:GDPval-AA v2 上的推理 token 比 xhigh 多出 62%,Tau3-Bench Banking 也多出 28%。
科學推理方面同樣有進步:CritPt 從 18% 拉高到 26%,GPQA Diamond 從 90% 提升至 94%,Humanity’s Last Exam 與 SciCode 也各自增長 2 至 3 個百分點。
不過也有退步的地方。長文檢索分數從 83% 降到 79%,百科知識準確度也略有下滑。但 Artificial Analysis 指出,百科分數下降很大程度是因為模型更常說「我不確定」。它不願亂答,反而讓幻覺率跟著降低,算是一種取捨。
價格策略:用 CP 值打穿市場
Meta 在定價上仍然維持強勢策略。Muse Spark 1.3 的每百萬 token 輸入 $1.25 美元(約 NT$40 元)、輸出 $4.25 美元(約 NT$138 元),快取命中僅 $0.15 美元,與 1.2 版完全相同(如果使用資料共享的 muse-spark-1.3-contributor 價格更是只要每百萬 token 輸入 $0.1 美元/輸出 $0.2 美元)。但若以每道智力題的成本計算,xhigh 僅需 $0.55 美元,是同級模型中最便宜的選項:Grok 4.6 需要 $0.94、GPT-5.6 Sol 需要 $0.95、Claude Opus 5 更高達 $1.23。
效率提升同樣是賣點。Wang 表示 Muse Spark 1.3 比 1.2 版減少約 25% 的 token 用量就能完成相同任務。模型同時支援多重工作流程並行處理,處理長指令與跨任務的語境保持也比上一代更流暢。Crypto Briefing 的報導則指出,Muse Spark 1.3 的工具呼叫次數減少了 20%。
此外,模型對於自身能力的邊界有更清楚的認知。在執行不可逆操作前,模型會主動請求確認,這項安全機制比過去更嚴格。
百萬 token 上下文與多模態能力
Muse Spark 1.3 維持 100 萬 token 的超長上下文視窗,支援文字、圖片與影片多模態輸入。模型可透過 Meta API 存取,也已整合進 Muse Code(Meta 對標 Claude Code 與 OpenAI Codex 的程式碼編輯器)。OpenCode 平台也在發布後數小時內宣布免費提供此模型。
Zuckerberg 在推文中特別強調,Muse Spark 1.3 在編碼與代理任務上的進步是「至今最大的一次跳躍」,形容其性能「便宜到幾乎不值得一提」。市場上已經有用戶在 Codex 平台上測試後給予正面回饋,認為其表現與頂級模型相當但價格只有三分之一。
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the biggest jump we’ve made so far on coding and agentic work. Try it in Muse Code and our API.
Next up 🍉 and Muse Spark open weights releases coming soon. pic.twitter.com/XQQEDEJGD7
— Mark Zuckerberg (@finkd) September 2, 2026
西瓜與開源權重:Meta 的下一步
Zuckerberg 在推文結尾留下兩個懸念。其一是 🍉(西瓜)代號的新模型。根據 SiliconANGLE 報導,西瓜被描述為比 Muse Spark 系列規模更大、能力更強的下一代模型,目前仍在開發中。Wang 僅表示「西瓜將會極具競爭力」。Meta 在開源模型領域曾因 Llama 系列而享有極高聲譽,但隨著 Muse Spark 轉向商業化封閉策略,這方面的影響力正在下滑。若後續將 1.3 版的權重開源,Meta 有機會一舉奪回開源陣營的領先地位。
另一個則是「Muse Spark 開源權重」即將到來,目前開源模型陣營幾乎都是由中國團隊主導:Kimi K3(max)與 GLM-5.3(max)均為 60 分,阿里巴巴的 Qwen3.8 為 58 分。若 Meta 釋出 Muse Spark 1.3 等級的權重,將成為第一個可與封閉模型匹敵的開源方案。
結語
Muse Spark 1.3 的發布,象徵 Meta 從 Llama 時代的開源策略正式轉向商業化封閉模型,並在五個月內證明這條路走得通。五次迭代、每次明顯進步、價格卻壓到對手的三分之一,這樣的節奏讓 Meta 從追趕者變成領先集團中「價格最有競爭力」的那個。接下來西瓜模型與開源權重的最終決策,將決定 Meta 在 AI 賽局中的長期定位。對開發者而言,Muse Spark 1.3 已經在 Meta API 與 Muse Code 上線,可以立即試用。





