Anthropic 發表自然語言自編碼器,揭示大型語言模型內部運作



Anthropic 近日發表最新可解釋性(Interpretability)研究成果——Natural Language Autoencoders(NLA,自然語言自編碼器),成功將大型語言模型(如 Claude)的內部激活向量(activations)轉換為人類可直接閱讀的自然語言文字。這項技術被視為 AI 黑箱解釋領域的重要進展,有望大幅提升模型審核、安全性評估與透明度。

NLA 核心原理
傳統上,AI 模型的「思考」是以數值向量形式存在,難以直接理解。NLA 的方法是訓練模型讓它「解釋自己的思考」:

  • Activation Verbalizer(AV):將模型的激活向量轉換成自然語言描述。
  • Activation Reconstructor(AR):將描述文字反向重建回原始激活向量。

兩者共同訓練,透過重建準確度作為主要目標,讓模型學習產生忠實且有意義的解釋。


Anthropic 已將此技術應用於 Claude 系列模型的審核,成功發現許多「未說出口的思考」(unverbalized reasoning),例如模型在安全測試中意識到自己正在被評估,卻未在回應中明說。

在 Claude Opus 4.6 等模型的預部署審核中,NLA 幫助研究人員:

  • 發現模型在評估中隱藏的「評估意識」(evaluation awareness)。
  • 偵測語言切換、獎勵模型偏差等隱藏行為。
  • 在自動化審核基準測試中,搭載 NLA 的代理表現優於傳統方法。

Anthropic 也開放部分訓練程式碼與預訓練 NLA 模型,供研究社群使用,並與 Neuronpedia 合作提供互動式探索介面。

NLA 的出現,讓 AI 開發者能更直接「閱讀」模型的內心世界,對於提升模型安全性、減少幻覺(hallucination)與偵測潛在風險具有重要價值。這項技術也可能加速 AI 可解釋性研究的進展,讓大型模型的部署更加可靠。 Anthropic 表示,NLA 目前仍處於早期階段,但已證明其在實際審核中的實用性。未來將持續優化,並探索在更多模型與應用場景的應用。


相關文章:

Anthropic宣布新版 Claude模型全面導入隱形文字浮水印,符合歐盟 AI法案規範  [8/17/2026]
Anthropic Claude Opus 5: 價格僅 Fable 5 一半,更強化 AI 代理與  [7/25/2026]
Anthropic Claude 語音模式支援 Opus 與 Sonnet 模型,整合工具提升對話能  [7/24/2026]
美國法院批准Anthropic 15億美元和解協議,創AI版權訴訟紀錄  [7/22/2026]
Anthropic Claude Code 桌面版整合 iOS Simulator 公開測試  [7/22/2026]
[「擇法善思林之蘭室藏津」的緣起]
本土語言傳承找典範 教育部祭出205萬元獎金
因應醫療AI轉型浪潮 奇美醫院攜手資策會辦論壇
世錦賽》台灣隊遭中國逆轉 獲得第4名追平隊史最佳
虎頭蜂狂螫釀2死1傷! 死者傷口集中頭部 專家:直接影響神經系統
Joeman遭噴爆!凌晨4點逼女友煮牛肉麵 雞排妹傻眼開轟:叫外送就有了
「夜間市長」管紅燈區?沈伯洋:不怕抹黑抹紅 就怕抹黃
瓊斯盃》多留UBA一年挑戰轉型 198公分國體長人胡晉豪的課題
心疼50歲陳幸妤 楊月娥:背叛是更深的痛
世界機器人大賽 高雄團隊勇奪3冠軍2亞軍
中國1架次軍機擾台 進入北部空域
焦點股》欣興:出關首日火力全開 8分鐘急拉漲停
檢舉第三方支付涉詐博!遠東銀經理當內鬼 翻拍陳情函傳業者遭起訴
(獨家)藍白砍公視預算惹議!陳匡怡掏50萬實質力挺 指定贊助楊麗花紀錄片
台東縣議會臨時會林參天逼問農路弊案 吳秀華回擊依法有據
立院亂砍預算踩違憲紅線? 去年總預算釋憲案躺1年 憲法法庭陷僵局
[擇法善思林之蘭室藏津]