騰訊的 AI 大模型疊代速度快的驚人,混元 Hy3 正式版才在七月初上線沒多久,在 8 月 28 日早上,騰訊混元團隊又在 X 上官宣 Hy4 preview 正式開放權重。770B 總參數、49B 激活參數、1M token 上下文,Apache 2.0 授權,同一天登上 Hugging Face、GitHub 和騰訊雲 。
中國騰訊推出混元 Hy4 preview 開放權重模型
參數規模翻倍,架構延續 MoE 路線
Hy4 preview 是騰訊混元今年 2 月重建訓練基礎設施以來的第三個大版本。上一代 Hy3 總參數 295B、激活 21B,Hy4 preview 把兩個數字都翻倍到 770B 和 49B,上下文窗口從 262K 拉到 1M。架構上仍是 Mixture-of-Experts(混合專家模型):backbone 共 78 層,第一層用標準 dense FFN,剩下 77 層採用 MoE 路由。騰訊混元團隊表示,模型在規模、上下文長度和數據規模上全面擴展,預訓練和後訓練同步改進,把定位穩在開源模型第一梯隊。
1M 上下文不是靠 rope-scaling 硬拉出來的。根據 model card 描述,Hy4 preview 的長上下文由 sparse attention 搭配 IndexCache 設計支撐。OpenRouter 上列出的實際上限是 1,048,576 token,最大輸出 64,000 token。對需要處理整份代碼庫或長文件的工作流來說,這個窗口比多數競品寬出不少。
12 項基準測試全面超越 Hy3
騰訊公布的 12 項基準中,Hy4 preview 沒有一項是最低分。幾個關鍵數字:
Terminal-Bench 2.1(終端命令列編程)拿到 85.4,比 Hy3 的 70.8 高出 14.6 分,超過 DeepSeek V4 Pro,與 Claude Opus 5 並列第一梯隊。DeepSWE(真實軟體工程長任務)從 Hy3 的 28.0 跳到 64.3,是四項指標中提升最劇烈的一項。Toolathlon-Verified(工具調用馬拉松)得 74.1,超過 Qwen 3.8 Max 和 GPT-5.6 Sol,接近 Kimi K3 與 Claude Opus 5。APEX-Agents(pass@1,agent 一次成功率)拿到 37.1,與 Kimi K3 的 37.2 幾乎打平。
內部盲測提供了另一組參考。騰訊請 163 位內部專家在 WorkBuddy 環境下對 203 個工程任務做盲評,Hy4 preview 平均 2.99/4.00,略勝 GLM 5.3(2.92)和 Kimi K3(2.94)。這組數據是自家測試,參考價值要打折,但至少說明模型在真實工程工作流中的表現與基準分數方向一致。
從參數效率的角度看,Hy4 preview 的 770B 總參數和 49B 激活參數遠低於同級競品。OrcaRouter 的對比文章特別指出,Hy4 preview 在 Terminal-Bench 上的分數已經超過 DeepSeek V4 Pro,但後者的激活參數規模明顯更大。MoE 路由讓模型在推理時只激活部分專家,實際計算量遠低於總參數暗示的水平。自架部署的團隊可以用較少的 GPU 資源跑動一個能力接近第一梯隊的模型。
四大場景定位:為生產力而生
騰訊把 Hy4 preview 定義為「built for productivity」,重點投入四個場景。軟體工程方面,模型在長任務的理解、規劃、除錯和驗證能力上有明顯提升,前端開發的視覺美感和交互品質也做了優化。辦公分析方面,複雜辦公環境理解與財務分析能力增強,重點優化數據分析和跨文件協作,能從信息處理一路跑到文檔、試算表、簡報交付。
遊戲開發是比較少見被單獨列出的場景。Hy4 preview 能從單一需求 prompt 直接生成可玩原型,並通過多輪交互迭代複雜遊戲項目。對獨立開發者或小型工作室來說,這個能力把原型驗證的門檻壓得很低:寫一段需求描述,模型直接吐出一個能跑的版本,再根據實際手感調整參數和機制。
科學研究方面,模型在 AI 研發、分子動力學模擬、凝聚態物理和基礎數學上都有進展。比較亮眼的是三維 Blaschke-Lebesgue 幾何問題:Hy4 preview 搭配 Hyra 把體積下界從 0.380799 推到 0.41104,與 Meissner tetrahedron 猜想給出的 0.41986 只剩 2% 的差距。這個結果雖然還不是最終證明,但把一個懸置多年的幾何問題推進到了接近收斂的位置。
定價與開放策略
API 定價維持混元一貫的「高性價比」路線:輸入每百萬 token 6 元人民幣(約 NT$28),輸出 18 元(約 NT$84),快取命中 0.3 元(約 NT$1.4)。OpenRouter 上的美元報價為輸入 $0.834/M、輸出 $2.501/M、快取讀取 $0.042/M[6]。對比同級開源模型,這個價格在 770B 規模中屬於最低檔。
授權方面沿用 Apache 2.0,與 Hy3 正式版的開放策略一致。上個月 Hy3 從限制性 community license 轉為 Apache 2.0 時,LocalLLaMA 社群的反應集中在一件事:終於可以合法用在商業和地區受限的場景了。Hy4 preview 直接以 Apache 2.0 出爐,省去了這道轉換。模型同步接入 WorkBuddy、CodeBuddy(國內外版)、元寶和 ima 等騰訊產品。開發者可以透過這些產品直接體驗,也可以走 API。
已知限制與下一步
騰訊混元團隊自己列了兩項已知問題:複雜任務上傾向過度思考和過量自我驗證,以及目前沒有多模態(視覺)能力。預覽版本身就是為收集反饋而設計,團隊希望開發者的真實使用能幫助正式版 Hy4 大幅改進。
模型「自我進化」是這次發布中另一個值得留意的細節。騰訊披露了 Hy4 preview 參與自身研發管線的案例:模型第一次在訓練方法、數據策略、評估框架和底層算子的自動優化中扮演主動角色,提出方案、執行實驗、根據結果繼續迭代,形成初步的遞迴自我改進循環[3]。這套機制在 Hy4 preview 上只是起步,但方向指向模型不再完全依賴人類工程師手動調參的未來。
基礎設施投入是背後支撐。騰訊本季度研發支出同比增長 35% 到 273 億人民幣(約 NT$1,280 億),資本支出暴增 176% 到 528 億人民幣(約 NT$2,460 億)。管理層在法說會上的路線是「先建自有模型、再發展應用、最後對外出租算力」,目標是做出規模化的原生 AI 業務。
從 2 月重建基礎設施到現在,混元平均兩個月迭代一個大版本。按這個節奏,正式版 Hy4 不會太遠。Hy4 preview 的 770B MoE 架構、1M 上下文和 Apache 2.0 授權,讓它在開源模型中站到了參數規模與實測能力都靠前的位置。接下來要看的是開發者社群在真實場景中的反饋,以及正式版在多模態和效率上的補齊。





