Buterin 在筆電上測試本地 AI,看到隱私與速度的提升

Vitalik Buterin 在他的筆電上執行阿里的 Qwen3.8-Flash-Next,發現其速度足以應付日常任務,並強調了隱私優勢。

2026-09-17 08:56約 5 分鐘閱讀

以太坊共同創辦人 Vitalik Buterin 認為,本地 AI 已幾乎有能力處理日常活動中的很大一部分。他在個人筆電上測試了阿里的 Qwen3.8-Flash-Next,並分享了效能數據。

相較於 ChatGPT,這個配置不會與任何雲端伺服器通訊。模型存在於裝置上,且裝置會獨立處理請求。

Buterin 的本地 AI 測試展現了實際速度

Buterin 的筆電配備 AMD 的 Strix Halo 晶片。一般電腦會將工作分配給 CPU 和獨立 GPU,兩者各有自己的記憶體庫。Strix Halo 將兩者整合在單一晶片上,讓兩者能存取共享的記憶體池。

這種架構很重要,因為 AI 模型必須載入記憶體才能運作。標準顯示卡僅提供 8 到 24 GB,對這種規模的模型來說不夠用。Strix Halo 系統提供最高 128 GB,可供任一元件存取。因此,單一筆電就能容納先前需要伺服器級設備的模型。

他回報的速度對典型任務來說已足夠。簡短查詢的回應速度適合閱讀。當提示長度達到數萬字時,生成速度會變慢,因此長篇文件仍是一項限制。

阿里於 8 月 26 日釋出開放權重。根據團隊說法,該模型包含 1250 億個參數,但一次只啟動 60 億個,使記憶體需求保持在低點。

Buterin 將它稱為 Qwen3.8-Flash,但阿里提供的下載版本叫做 Qwen3.8-Flash-Next。其較大的對應版本 Qwen3.8-Max 在 8 月取得了顯著的基準測試結果。

Qwen 3.8 flash 真的很令人印象深刻,而 llama.cpp 在處理它方面也愈來愈快

欄位是:既有提示、新提示、生成的、輸入 tok/s、輸出 tok/s

這是在我的筆電(strix halo)上跑的。我認為我們非常接近那個時間點,你… pic.twitter.com/v5Ze4Fv5Wr

— vitalik.eth (@VitalikButerin) 2026 年 9 月 17 日

隱私如何改變這個方程式

除了速度之外,Buterin 還提到另一項好處。在地端執行的模型會在裝置上回應,代表沒有服務供應商會取得請求。

對較重的任務,他建議一種分工方式。本地模型會處理它能處理的,並在它轉發給較大的雲端系統的任何內容中移除敏感資訊。

「使用你的本地模型來編排對強大模型的查詢,這樣你的查詢就不會洩漏你的個人資訊」

實務上,本地模型會從提示中擷取名稱、錢包地址或私有程式碼,只送出剩下的問題。這種過濾會減少離開裝置的資料。它無法保證沒有敏感資訊外洩。

這個立場與他過去的行動一致。他曾在歐盟聊天控制辯論中提出對監控的擔憂,而加密貨幣使用者出於類似理由,也主張對代理程式施加更嚴格限制。

5 月時,一場集體訴訟指控 OpenAI 將 ChatGPT 使用者查詢分享給 Meta 和 Google。

雲端供應商仍主導前沿。然而,本地效能的每一項改進,都會將更多日常任務從他們的伺服器轉移開來,而平價的共享記憶體硬體也持續普及。

剩下的問題是,個人願意犧牲多少效能來換取掌控權。

分享至

免責聲明:本文內容來源於第三方媒體,僅供參考,不構成任何投資建議。加密貨幣及其他金融產品存在較大價格波動風險,請謹慎決策。

相關文章