Google 推出 DiffusionGemma 開放實驗模型,文字生成速度提升 4 倍



Google DeepMind 於 2026 年 6 月 10 日正式發布 DiffusionGemma,這是 Google 第一款採用「擴散技術」(Diffusion)進行文字生成的開放實驗模型。與傳統自迴歸(Autoregressive)模型逐詞從左到右生成的方式不同,DiffusionGemma 可以一次生成整段文字,大幅提升推理速度。

DiffusionGemma 建立在 Gemma 4 系列與 Gemini Diffusion 研究之上,採用 26B Mixture-of-Experts(MoE)架構,推論時僅激活約 3.8B 參數。
其最大特色在於使用「擴散」機制進行文字生成:

  • 模型會先建立一個充滿隨機佔位符的「文字畫布」。
  • 透過多次迭代優化,逐步修正文字內容。
  • 具備雙向注意力(Bidirectional Attention),能同時考量整段文字的上下文。
  • 支援自我修正機制,可在生成過程中即時修復錯誤。

這種方式特別適合需要非線性處理的任務,例如程式碼補全、即時編輯、數學圖形推理等。

根據 Google 公布的數據,DiffusionGemma 在 GPU 上的推理速度最高可比傳統自迴歸模型快 4 倍。量化後的版本可在高階消費級 GPU(如 RTX 5090)上運行,VRAM 需求約 18GB。
Google 表示,該模型特別適合以下場景:

  • 本地端互動式應用
  • 即時程式碼生成與編輯
  • 低延遲的單用戶工作流程

不過,Google 也坦言,DiffusionGemma 在部分基準測試中的輸出品質仍略低於標準 Gemma 4 模型,因此建議在需要最高品質的應用中,仍優先使用傳統 Gemma 4。

DiffusionGemma 已正式開放,採用 Apache 2.0 授權,使用者可自由使用、修改與商業化。目前可在以下平台取得:

  • Hugging Face:google/diffusiongemma-26B-A4B-it
  • Google Cloud Model Garden
  • NVIDIA NIM
  • vLLM
  • llama.cpp(即將支援)

傳統大型語言模型大多採用自迴歸架構,一次只能生成一個 token,這在單一 GPU 的本地環境中效率較低。DiffusionGemma 則借鏡圖像生成領域的擴散模型概念,將文字生成轉為「平行處理整段文字」的模式。 Google 研究團隊指出,這種架構在互動式 coding、即時編輯,以及需要雙向上下文理解的任務上,具有明顯優勢。


相關文章:

Google Gemini 3.7 Flash 登場,強化編碼與 Agent 能力,同步調降價格  [8/14/2026]
Google Gemini Notebook 升級雲端電腦環境,實測支援生成原生可編輯 PPTX 簡  [8/5/2026]
Google Earth整合 AI生成功能引發深偽造假疑慮,上線不到24小時緊急撤回  [8/3/2026]
Google Gemini Spark 個人 AI 代理助理在台開放  [7/30/2026]
Google 發布三款 Gemini Flash 新模型,聚焦效率與成本優化  [7/22/2026]
[「擇法善思林之蘭室藏津」的緣起]
「夜間市長」管紅燈區?沈伯洋:不怕抹黑抹紅 就怕抹黃
立院亂砍預算踩違憲紅線? 去年總預算釋憲案躺1年 憲法法庭陷僵局
網球》締千分大賽「送蛋紀錄」波蘭前球后辛辛那提輾壓黑馬
兩性作家小彤抗癌成功 確診急性胰臟發炎又住院
網球》梁恩碩辛辛那提女雙開胡 台日聯軍化解4盤末點晉16強
中國1架次軍機擾台 進入北部空域
華爾街日報:川普政府表明立場 反對蘋果採購中國記憶體晶片
高雄路霸再升級! 三角錐綁樹幹圈地停車引民怨
去年狂掃40金! 雲林、苗栗3校80名獅隊學生聯訓拚「再創高峰」
中元看恆春搶孤改運 廖大乙指點「秘訣」號召到恆春體驗
吸一口毒煙副駕冒僵屍 高雄警拍鬼月反毒駕影片爆紅
焦點股》世芯:法說會行情只演10分鐘 開高跳水急殺
LLB次青少棒》突破僵局制鏖戰10局沒能逆轉 台灣代表無緣5連霸
受傷2秒快解、落水1秒自救 海軍陸戰隊新戰鬥背心藏「保命巧思」
卓伯源點名鄭麗文:若彰化敗選 要勇敢負責辭職下台
[擇法善思林之蘭室藏津]