Google 正式釋出 Gemma 4 12B-it 多模態模型適合本地部署



Google DeepMind 於 2026 年 6 月 3 日正式在 Hugging Face 釋出 Gemma 4 12B-it(Unified 版本),這是 Gemma 4 系列中備受期待的中型多模態模型。該模型採用 encoder-free(無編碼器)統一架構,能直接處理文字、圖像與音頻,具備 256K 超長上下文,並在多項基準測試中展現強勁實力,特別適合本地部署與開發者使用。


Gemma 4 12B-it 主要特色

  • 參數規模:11.95B(約 120 億)參數
  • 多模態能力:原生支援文字、圖像、音頻(Audio),可處理可變長寬比與解析度的圖像,以及音頻波形
  • 統一架構:捨棄傳統獨立編碼器,直接將圖像 patch 與音頻波形透過輕量線性層投影至模型嵌入空間,大幅降低延遲並提升整合性
  • 上下文長度:最高支援 256K tokens
  • 多語言支援:超過 140 種語言
  • 授權方式:Apache 2.0(商業友好)

根據官方基準測試,Gemma 4 12B-it 在多項重要評測中表現出色:

  • GPQA Diamond:78.8%
  • MMMU Pro(多模態推理):69.0%
  • LiveCodeBench v6(程式碼能力):72.0%
  • AIME 2026(數學):77.5%
  • 長上下文測試(128K 8-needle):43.4%

整體效能已逼近更大規模的模型,特別在程式碼生成與多模態理解上表現優異。

適合本地部署的設計
Gemma 4 12B 被定位為「工作站級」甜蜜點模型。量化後(Q4_K_M)檔案大小僅約 6.7 GB,適合具備 16GB 以上記憶體的筆電或工作站運行。這也讓它成為目前最強大的「可本地高效運行」的多模態開源模型之一。
使用方式

開發者可透過 Transformers 輕鬆載入:

from transformers import AutoProcessor, AutoModelForMultimodalLM 
model_id = "google/gemma-4-12B-it" 
processor = AutoProcessor.from_pretrained(model_id) 
model = AutoModelForMultimodalLM.from_pretrained(model_id, device_map="auto") 

目前已支援 Ollama、LM Studio 等本地工具,可快速體驗。

Gemma 4 12B-it 的推出,顯示 Google 持續推動開源多模態模型的民主化策略。它在效能、效率與易用性之間取得良好平衡,尤其適合開發者、研究人員與企業在本地環境部署多模態 AI 應用。


相關文章:

Google Gemini 3.7 Flash 登場,強化編碼與 Agent 能力,同步調降價格  [8/14/2026]
Google Gemini Notebook 升級雲端電腦環境,實測支援生成原生可編輯 PPTX 簡  [8/5/2026]
Google Earth整合 AI生成功能引發深偽造假疑慮,上線不到24小時緊急撤回  [8/3/2026]
Google Gemini Spark 個人 AI 代理助理在台開放  [7/30/2026]
Google 發布三款 Gemini Flash 新模型,聚焦效率與成本優化  [7/22/2026]
[「擇法善思林之蘭室藏津」的緣起]
屏縣「金鑰獎」2年僅5.71%旅宿參選 今年祭出獎金催人氣
中國1架次軍機擾台 進入北部空域
檢舉第三方支付涉詐博!遠東銀經理當內鬼 翻拍陳情函傳業者遭起訴
企業關懷醫護 捐贈屏東榮總物資逾2400件
立院亂砍預算踩違憲紅線? 去年總預算釋憲案躺1年 憲法法庭陷僵局
「夜間市長」管紅燈區?沈伯洋:不怕抹黑抹紅 就怕抹黃
東部縱谷原遊會-部落食樂園開唱 原民音樂點亮夏夜
健保挹注精神科、胸腔重症照護4.7億元 2支付新規8/1起上路
老翁到農會領500萬要買台積電股票 驚動警方到場
陳幸妤去年離婚忍到現在才開撕 毀滅式爆料關鍵曝
華爾街日報:川普政府表明立場 反對蘋果採購中國記憶體晶片
這就是台灣! 柯一正吃飯身上沒錢 老闆完全不在意
因應醫療AI轉型浪潮 奇美醫院攜手資策會辦論壇
焦點股》南亞:CCL漲價潮啟動 法人看好後市表現
高雄路霸再升級! 三角錐綁樹幹圈地停車引民怨
[擇法善思林之蘭室藏津]