
商傳媒|責任編輯/綜合外電報導
JetBrains公司昨日宣布推出 Mellum 2.1,這是一個具備 120 億參數的 Mixture-of-Experts(MoE)模型,並以 Apache 2.0 授權開源釋出。此模型旨在成為軟體開發領域中,AI Agent(能自動執行複雜任務、甚至自主規劃行動的人工智慧軟體)程式開發的快速且輕量化選項。
Mellum 2.1 在 Hugging Face 平台以 JetBrains/Mellum2.1-12B-A2.5B-Thinking 名稱公開,並提供量化後的 GGUF 版本,方便本地端部署。此模型採用 Qwen3-MoE 架構,其核心是 MoE 設計——一種人工智慧架構,能讓模型在處理每個 Token(語言模型處理的最小單位,如單字、符號或程式碼片段)時,僅啟動其內部部分專業子網路,而非整個龐大模型,藉此提升效率並降低運算成本。Mellum 2.1 總計有 120 億參數,但在實際運作時,每個 Token 只會啟用約 25 億參數。
JetBrains 將 Mellum 2.1 定位為程式開發 AI Agent 的通用建構模塊,而非獨立的聊天模型。該公司解釋,這項策略的目的是解決生產環境中 AI 面臨的延遲、吞吐量和成本等挑戰。藉由 MoE 架構,模型能以更小的運算資源達到高性能,例如 25 億個活躍參數的模型可望在一張高階消費級繪圖處理器(GPU)上順利運行。
根據 JetBrains 的說法,Mellum 2.1 專為路由、問答、子 AI Agent 以及軟體工程系統中的私有 AI 用途而設計。其「Thinking」版本能在產生最終答案前,透過 … 區塊輸出思維鏈(chain-of-thought),並且具有高達 131,072 Token 的上下文視窗,足以處理龐大的程式碼庫。該公司自 2024 年 10 月推出初代 Mellum 以來,已迭代多次,從最初用於 JetBrains AI Assistant 的閉源程式碼補齊模型,發展至現在的開源推論模型。
Mellum 2.1 的開源發布,強化了 AI 模型層走向商品化的趨勢,並可能促使其他整合開發環境(IDE)供應商也公布自身的模型策略。這也意味著企業用戶能根據 Apache 2.0 授權條款,在嚴格的資料隱私要求下於內部使用 Mellum 2.1,自行託管模型以確保資料安全。儘管 JetBrains 尚未公開 Mellum 2.1 與其他競爭對手(如 DeepSeek Coder 或通義千問 Coder)的詳細基準測試數據,但其開源、低成本和自託管的特性,預期將吸引重視隱私的企業採用。

