面壁智能(OpenBMB)與清華大學在 9 月 7 日正式開源 MiniCPM5-2B,一款 25 億參數的稠密語言模型。這款模型的定位很明確:在不需要資料中心 GPU 的前提下,讓手機和筆電跑得動的模型也能具備工具調用、長上下文理解和 Agent 能力。這是 MiniCPM5 系列繼 5 月的 1B 版本後的第二款模型,也是 OpenBMB 目前最強的端側語言模型,所有權重、訓練資料和部署工具全部以 Apache-2.0 授權完整公開。

在 Artificial Analysis Intelligence Index v4 榜單上,MiniCPM5-2B 以 23 分拿下 4B 參數以下開源模型第一名,Agent Index 則拿到 20 分。在 OpenBMB 自己的 34 項基準測試中,平均得分 53.9,涵蓋程式碼推理、數學推理、長上下文理解、工具調用和 Agent 任務。相較前代 MiniCPM5-1B 的平均約 48 分,2B 版本在各項能力上都有明顯提升。
部署:手機、筆電、多晶片平台
MiniCPM5-2B 提供多種部署格式:
- BF16:完整精度版本,用於 vLLM、SGLang 等推理框架
- GGUF:適用於 llama.cpp、Ollama、LM Studio 的本地推理
- MLX 4-bit:Apple Silicon 專用,可在 Mac/iPhone 上直接跑
- GPTQ 4-bit:量化版本,降低記憶體需求
- DSpark:草稿模型,用於推測解碼加速
透過 FlagOS 平台,MiniCPM5-2B 還支援 9 個晶片家族的自動遷移和部署。這意味著不只 NVIDIA GPU,包括華為昇騰、寒武紀等國產晶片也能直接跑。用 vLLM 啟動只需一行指令:`vllm serve openbmb/MiniCPM5-2B –port 8000`,SGLang 和 Transformers 同樣開箱即用。
已有人在 16GB RAM 的 MacBook 上進行部署,進行網頁搜尋並提取結果總結,效果出乎意外的好:
Running MiniCPM5-2B locally on a 16GB MacBook 💻
It beats Qwen3.5-4B on benchmarks, so we asked it to find recent AI news, it called web search, pulled back 10 results and summarized the key developments inside Atomic Chat
Run local models via https://t.co/RbcCOIgVkj https://t.co/afCy4YtNIq pic.twitter.com/ODWz7Xfl8B
— atomic.chat (@atomic_chat_hq) September 7, 2026
MiniCPM5-2B 採用標準 LlamaForCausalLM 架構,42 層、GQA 注意力機制,總參數 25.2 億,其中非嵌入層參數 19.8 億。上下文窗口 131,072 token,授權為 Apache-2.0。
「稠密」(Dense)是相對於 MoE(混合專家)而言:每一顆參數在每次推理時都會被啟用。AI/TLDR 指出,這讓記憶體佔用在手機上可預測,不像 MoE 模型那樣取決於哪些專家被啟用。對行動裝置來說,可預測的記憶體佔用比峰值效能更重要。
基準測試:打贏 Qwen3.5-4B,但知識和程式碼是弱項
在 OpenBMB 自己的基準測試中,MiniCPM5-2B 平均 53.9 分,超越 Qwen3.5-4B(參數量約為其兩倍)的 53.2 分。同場比較的 2B 級模型還包括 LFM2.5-2B 和 Gemma-4-E2B-it,MiniCPM5-2B 在程式碼推理、數學推理和 Agent 任務上均取得領先。
差距最大的項目是長上下文:MiniCPM5-2B 在 NoLiMa 測試拿到 68.4 分,Qwen3.5-4B 為 59.0 分。對需要處理長文件或長對話的應用來說,這個差距有實際意義。工具調用方面的表現同樣突出,這也是 OpenBMB 特別強調「Agent 能力下放到邊緣」的核心依據。
不過,Artificial Analysis 的獨立測試也發現了弱點:在 Humanity’s Last Exam 和 Terminal-Bench 上,MiniCPM5-2B 各只拿到 9%,知識廣度和複雜程式碼任務的能力與大模型仍有明顯差距。Agent 方面的表現則相對亮眼,在 GDPval-AA v2 上拿到 831 Elo。整體來看,MiniCPM5-2B 擅長的是結構化推理和工具調用,而非百科全書式的知識問答(畢竟模型體量太小了)。
MiniCPM5-2B – Huggine Face
對開發者的意義
MiniCPM5-2B 的核心價值是讓 Agent 能力落地到不需要雲端的場景。一個能在手機上跑的 2B 模型,如果真的能穩定執行工具調用和長上下文推理,就意味著本機助理、離線編碼助手、邊緣裝置上的智慧代理這些應用不再只是 demo。對隱私敏感的應用場景(如醫療紀錄處理、企業內部文件分析),資料不需要離開裝置本身就是巨大的優勢。



