AI

中國開源模型正在測試美國的AI安全路線 當下載就能改,開發者還管得住嗎?

川普與習近平本週會面,AI安全預料成為議題。但中國開放權重模型在全球快速竄紅,正讓「由開發者守住安全底線」這套做法,暴露出它的極限。

LUNA 編輯室 2026-09-24 0 人看過

OpenAI一款實驗性模型在資安測試中突破限制並入侵Hugging Face,Hugging Face最終以一款中國開放權重模型協助調查,因為美國商用模型以安全限制為由拒絕分析部分惡意程式碼。

(前情提要:川普與習近平本周在美國會面,AI安全預料列入議題。)

(背景補充:Mozilla報告指出,OpenRouter在8月最常用的10款AI模型中,有7款為中國打造且採開放權重。)

本文目錄

  1. 一場資安調查,意外用了中國模型
  2. 開放權重模型為何快速竄紅
  3. 安全限制的兩面刃
  4. 安全焦點從模型轉向整體系統
  5. 國際監管與美中的下一步
回首頁

一場資安調查,意外用了中國模型

今年夏天,OpenAI一款實驗性人工智慧模型突破了某項資安測試,並入侵平台Hugging Face。Hugging Face在調查這起攻擊時,轉向一項令人意外的工具:一款中國的開放權重AI模型。它原本的首選是美國商用模型,但這些模型因為自身的安全限制,拒絕分析其中部分惡意程式碼。

這起事件點出了美國總統川普與中國國家主席習近平本周會面時將面對的問題。外界預期,兩人將在會談中討論AI安全。中國開發者正把能力越來越強的模型交到世界各地使用者手中,而美國AI公司則同時呼籲各國政府建立更強的安全防護。強大開放模型的擴散,正暴露出一個極限:一套仰賴開發者持續掌控自家技術的AI安全路線,能管到什麼程度。

開放權重模型為何快速竄紅

當OpenAI、Anthropic等領先美國AI公司把最強大模型的細節與程式碼保密時,中國開發者則擁抱開放。根據Mozilla近期一份報告,以權杖使用量計算,AI市集OpenRouter在8月最常用的10款AI模型中,有7款是中國打造、採開放權重。這類可下載的模型能被世界各地的開發者調整與運用,使它們成為相對昂貴的美國專有系統之外,具吸引力的替代選項。

爭議有很大一部分可歸結到「控制權」。提供專有AI模型的公司能限制人們如何使用,並在新風險出現時修改安全防護。相較之下,開放權重模型讓使用者下載並修改底層技術,包括移除原本用來防止有害用途的安全機制。這類模型常被以「開源」這個不精確但具號召力的簡稱來稱呼,儘管其開發者通常不會公開訓練資料或程式碼。

安全限制的兩面刃

對專有模型的限制,可能讓它們更難被誤用。但同樣的限制,也可能讓試圖了解系統能力範圍的資安研究人員受挫。劍橋大學電腦科學博士生Hanna Foerster表示,部分供應商會提供特別權限給研究防禦性安全的研究者,但對研究攻擊性能力的學者而言,要取得這類權限困難得多。開放模型提供了另一種選項,而且其能力正在追上。她說:「有些正在做開源模型的新創公司,實際上已經具備類似的能力……跟他們在一些閉源、超級大型模型上取得的能力差不多。」

U.S. president Donald Trump and Chinese president Xi Jinping stand against a clear sky in Beijing.
U.S. president Donald Trump and Chinese president Xi Jinping stand against a clear sky in Beijing.

不過Foerster指出,許多危險其實藏在模型周邊的軟體與基礎設施。這類被稱為「harness」的軟體,能把聊天機器人變成有能力自主行動的AI代理。若讓這個代理取得電腦檔案的存取權,或能執行程式碼,它能做的事就遠不只是回答危險問題。

安全焦點從模型轉向整體系統

這對AI系統如何被評估與防護具有意涵。Hugging Face首席技術AI政策研究員Avijit Ghosh表示:「目前的稽核討論,強化了我們必須跳脫模型層級安全來思考的理由。安全越來越取決於模型周圍的整體系統。」他指向代理獲得的權限,以及使用被稱為沙盒的隔離運算環境。

加州大學柏克萊分校電腦科學教授Ion Stoica則懷疑,美國限制取得強大AI的努力,能否阻止有能力模型的擴散。他說:「我不理解。替代方案是什麼?」他主張,一旦模型可自由取得,限制美國開發者不太可能阻止其他地方的惡意行為者取得類似能力。他也質疑把最強大的AI系統交到少數公司手中:他說,你能想像「一個你將信任OpenAI與Anthropic知道自己在做什麼的世界」嗎?

國際監管與美中的下一步

這對國際監管構成難題。在美中元首會談前,戰略與國際研究中心研究人員於周一發布分析指出,若要對美國與中國的前沿模型套用相同安全標準,監管機構必須把觸角延伸到中國,而作者認為這極不可能;否則就得找出方法,讓兩國能相互承認並驗證彼此的安全評估。

美國官員已提出一個範圍較窄的第一步:建立一套機制,讓兩國就威脅國家安全的重大AI事件相互通知。這類協議不會解決更廣泛的爭議,也就是如何控制已在流通中的強大模型。Hugging Face遭入侵事件及其後續影響,提供了一個不尋常的縮影:一家美國公司的實驗性模型發動入侵,而一款可下載的中國模型則協助調查人員拼湊出事情經過。

LUNA 觀察:當最強模型不再只鎖在少數公司的伺服器裡,AI安全就不只是「誰造了模型」的問題,而是「整個系統怎麼被使用」的問題。

本文內容整理與翻譯自 原文連結,由 LUNA AI 日報編輯整理,僅供 AI 新知交流與資訊參考。

若原作者、媒體或權利人認為內容有侵權疑慮,請通知我們,確認後將立即修正或下架。