TechSpace 鐵客空間

每日科技新聞新知、硬體開箱評測、賣場優惠!

Kimi K3 疑似蒸餾 Claude Opus?研究揭 AI 推理加密漏洞,替川普政府「證據論」再添一把火

新研究揪出 AI 推理加密漏洞,Kimi K3 疑似高度模仿 Claude Opus 推理模式,蒸餾爭議再掀波瀾。
Kimi K3 疑似蒸餾 Claude Opus?研究揭 AI 推理加密漏洞,替川普政府「證據論」再添一把火

餵一小段 Opus 的思考,Kimi K3 的回答風格竟然整個變了

Moonshot 旗下的 Kimi K3 究竟是不是靠著「蒸餾」Anthropic 的模型訓練出來的?這個問題從 K3 上線以來就吵個不停,過去最常被拿出來反駁的理由,是 Anthropic 的 Fable 模型與 Kimi K3 上市時間只相差短短兩週左右,外界普遍認為要在這麼短的時間內完成大規模蒸餾根本不可能。不過,一份剛出爐的研究論文,似乎讓這個「不可能」出現了裂縫。

研究作者 Alexander Panfilov 在社群平台上表示,團隊發現了一個存在於各大前沿 AI 廠商 API 中的安全漏洞,能夠藉此還原出模型原本被隱藏起來的推理內容,而且他們驗證過,還原出的推理 token 數量與 API 實際計費的 thinking token 數量幾乎能一對一吻合。

AI 的「內心話」其實藏在一段加密文字裡

要理解這份研究為什麼重要,得先知道現在主流的推理模型是怎麼運作的。這類模型在給出最終答案之前會先在內部進行一連串的「思考」,但 OpenAI、Anthropic、Google 等業者通常會把這段思考過程用加密文字區塊包起來,使用者只看得到最後的回答,加密區塊則在使用者端與伺服器之間來回傳遞,藉此節省伺服器端的儲存負擔。

研究團隊指出,問題出在這些業者在整個服務架構中,竟然都使用了同一組全域加密金鑰。更麻煩的是,雖然像 Claude Opus 這樣「聰明」的模型,本身被訓練成會拒絕洩漏自己的思考內容,但只要把 Opus 加密過的思考區塊,直接餵給同系列裡較弱、較便宜的機型(例如 Claude Haiku),這個防護較鬆散的小模型就會乖乖把區塊解密,並且把大模型的原始思考內容整段印出來。

研究人員也強調,這種做法帶來三種風險:第一是資料與憑證外洩,他們從公開的開發者對話紀錄中,實際解碼出 367 筆個人資料與 182 組帳密、API 金鑰等機密憑證;第二是安全防線可能被繞過,即使模型最終拒絕給出危險答案,解密後的思考過程往往還是會透露出它內部曾經考慮過的危險步驟;第三則是攻擊者可以把惡意指令藏進這些看不見的加密區塊裡,藉此劫持 AI 的工作流程。

研究作者接著做了一個相當有意思的實驗:他們只截取 Claude Opus 4.8 解密後推理內容的 1% 片段,拿去餵給 Kimi K3。結果 Kimi K3 接下來的思考走向與最終答案,竟然明顯往 Claude 的風格與用字靠攏,論文中甚至寫道,「特定的 Claude 與 GPT 推理片段,從 Kimi K3 身上萃取出來的難度,比從第二接近的模型低了大約六個數量級」。

研究團隊也比較了 Kimi K3 與其他開源模型(例如 DeepSeek-V4-Flash)在「預測並接續 Claude 文字」這件事上的統計機率,結果發現 Kimi K3 的表現明顯偏高,顯示它與 Claude Opus 的推理模式之間存在著相當強的行為相容性。研究作者也直言,這樣的結果暗示「蒸餾推理軌跡這件事,或許長期以來都不需要真正破解加密演算法就能辦到」。

當然,除非 Moonshot 執行長哪天親口承認,否則外界大概很難百分之百坐實蒸餾這件事。但就目前掌握的證據來看,這份研究已是相當有力的間接佐證,或許足以讓那些原本對 K3 蒸餾說抱持懷疑的人重新思考。

中美 AI 角力持續升溫,Moonshot 陷入多線壓力

事實上,Moonshot 近來已深陷中美 AI 角力的核心。今年二月,Anthropic 就曾公開指出偵測到約 340 萬筆 Claude 對話紀錄與 Moonshot 有關,認為這是系統性抽取自家模型能力的證據;到了七月,白宮科技政策辦公室主任 Michael Kratsios 更直接點名,指控 Moonshot 對 Anthropic 的 Fable 模型進行「大規模、隱蔽的工業化蒸餾」,同時財政部長 Bessent 也放話,大規模蒸餾美國 AI 模型的中國企業,未來可能面臨制裁與「實體清單」等級的出口管制。

美方長期懷疑,部分中國工程師會把載有模型參數的硬碟帶到對美方較友善的第三國,再透過強化學習等技術,搭配當地取得的高階 NVIDIA GPU,把既有模型的能力拉升到前沿水準。而根據先前一名川普政府官員提出的指控,Moonshot 不僅私下擁有 NVIDIA GB300 伺服器,還透過泰國管道取得了額外的 GB300 運算資源。面對排山倒海的質疑,也有不少 AI 研究者跳出來反駁,認為單憑上市時間相近就斷言蒸餾並不嚴謹,也有人指出模型輸出本身並不受著作權保護,不能簡單套用「抄襲」的框架來看待。這場關於蒸餾、智慧財產與地緣政治交織的爭論,顯然還會繼續延燒下去。

快速 Q&A 整理

這份研究發現了什麼樣的 AI 安全漏洞?

研究團隊發現,OpenAI、Anthropic、Google 等前沿 AI 業者的 API 架構中,使用了同一組全域加密金鑰來保護模型的推理內容,只要把強模型加密過的思考區塊餵給防護較弱的同系列小模型,就能讓對方把原始推理內容解密還原。

為什麼把 Claude Opus 的推理片段餵給 Kimi K3 這麼重要?

研究人員僅用 Claude Opus 4.8 解密推理內容的 1% 片段餵給 Kimi K3,結果 K3 的思考走向與最終答案風格明顯往 Claude 靠攏,顯示兩者的推理模式存在高度行為相容性。

這個漏洞除了蒸餾疑慮之外,還帶來哪些風險?

研究團隊指出三大風險,分別是開發者對話紀錄中可能外洩的個資與 API 憑證、原本被拒絕的危險內容仍可能透過解密思考過程曝光,以及攻擊者可利用加密區塊藏入惡意指令劫持 AI 工作流程。

美國政府對 Moonshot 的蒸餾指控是什麼時候開始的?

Anthropic 在 2026 年 2 月就已指出約 340 萬筆 Claude 對話與 Moonshot 有關;同年 7 月,白宮科技政策辦公室主任 Michael Kratsios 進一步公開指控 Moonshot 對 Fable 模型進行大規模工業化蒸餾。

外界對蒸餾指控有哪些反對聲音?

部分 AI 研究者與 Moonshot 員工認為,Fable 與 Kimi K3 上市時間僅相隔約兩週,大規模蒸餾在技術上難以在如此短時間內完成,也有人指出模型輸出本身不受著作權保護,質疑指控的法律基礎。

參考網頁來源

延伸閱讀

歡迎加入我們的 Facebook 粉絲團,隨時掌握最新消息!
喜歡看圖說故事的話,也可以追蹤 Instagram 專頁!
我們也有 Threads 可以隨時 follow!

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *