TechSpace 鐵客空間

每日科技新聞新知、硬體開箱評測、賣場優惠!

Apple M4 晶片限制遭逆向工程破解!神人解鎖 15.8 TFLOPS 隱藏 AI 算力

Apple M4 晶片遭國外神人成功逆向工程!開發者成功突破蘋果官方軟體限制,解鎖神經網路引擎(ANE)高達 15.8 TFLOPS 的 AI 運算潛力。
Apple M4 M4 Pro M4 Max M4 Ultra

Apple M4 被繞過 CoreML 與 Metal 的黑科技!自製 MIL 語言直接溝通晶片

眾所周知,蘋果(Apple)在先前的 M4 晶片中就有塞入神經網路引擎(Neural Engine, ANE),但官方在軟體層面設下重重限制。一般來說,開發者只能將 ANE 用於「AI 推理」(Inference),也就是執行已訓練好的模型,而無法直接在設備上訓練新模型。不過,這項鐵律最近被一位國外技術高手給打破了。

資安專家兼開發者 @0x0SojalSec 近期在 GitHub 上釋出令人驚豔的開源原始碼,在正常狀況下,蘋果並未對外開放直接與 ANE 晶片底層溝通的權限,通常開發者必須透過官方提供的 CoreML 或 Metal 等架構來調用算力。

然而,這位神人選擇了一條完全不同的路。他沒有使用任何蘋果官方的工具,也沒有驚動 GPU 算力,而是從零開始打造了一套客製化的模型中間語言(Model Intermediate Language, MIL),直接與 M4 晶片的 ANE 進行底層對話。更厲害的是,他成功在 ANE 上實作完整的反向傳播(Backpropagation)與 Transformer 模型訓練。

為了追求極致的運算效率,這項逆向工程技術在執行時完全不寫入 NAND 快閃記憶體,而是將所有暫存資料與運算流程留在速度極快的 RAM 記憶體中,這讓整體運行過程變得無比順暢且迅速。

在訓練過程中難免會遇到程序卡死、需要重置才能繼續的情況。對此,開發者巧妙運用 exec() 指令來實現「自動重生成(Respawn)」,讓程式能在不崩潰的前提下重新整理當前狀態並持續學習。透過這種突破軟體封鎖的方式,讓 iPad 或 Mac 裡面的 M4 晶片,直接爆發出高達 15.8 TFLOPS 的 AI 原始運算效能。這代表使用者不再需要花費巨資去組裝高階電腦,或是購買價格高昂的 NVIDIA 獨立顯示卡,就能在手邊的蘋果裝置上進行 AI 模型訓練。

雖然這項壯舉目前是在 M4 晶片上實現,也讓人不禁期待未來在更先進的晶片上能激發出什麼潛能,不過目前還無法確認這套客製化的 MIL 語言是否能直接套用到其他世代的 Apple Silicon 晶片上。

快速 Q&A 整理

蘋果 ANE 的「推理」與「訓練」限制是什麼?

蘋果官方設計神經網路引擎(ANE)時,主要定位讓它處理日常的 AI 應用,例如照片物體辨識或語音轉文字,這稱為「推理」。而「訓練」則是從零打造 AI 模型的過程,需要極為龐大的雙向運算,原本蘋果官方並未開放 ANE 執行訓練。

這次的破解有使用到蘋果官方的開發工具嗎?

完全沒有。開發者繞過了蘋果常規的 CoreML 以及 Metal 繪圖 API,也沒有動用到 GPU 算力,而是完全透過自行開發的客製化中間語言(MIL)直接與硬體溝通。

為什麼把資料留在 RAM 裡面運作會比較快?

傳統硬碟或 NAND 快閃記憶體的讀寫速度遠慢於記憶體(RAM)。將所有訓練數據保留在 RAM 當中,能大幅減少資料傳輸的延遲,這也是本次逆向工程能讓運算變得 buttery smooth(流暢如絲)的關鍵。

達到 15.8 TFLOPS 的算力對一般用戶有什麼好處?

這代表原本只能用來跑完現成 AI 應用的 iPad 或 Mac,現在有潛力直接變成一台小型 AI 訓練工作站。用戶不需要購買昂貴的 NVIDIA 顯示卡,就能進行基礎的 Transformer 模型訓練。

這套方法可以用在 M5 或其他舊款 Apple 晶片上嗎?

目前該開源代碼主要是針對 M4 晶片進行逆向工程與測試。由於不同世代晶片的私人 API 與底層架構可能有所轉變,因此目前無法百分之百保證該方法能完美在其他晶片上運行。

延伸閱讀

歡迎加入我們的 Facebook 粉絲團,隨時掌握最新消息!
喜歡看圖說故事的話,也可以追蹤 Instagram 專頁!
我們也有 Threads 可以隨時 follow!

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *