Buterin 在笔记本电脑上测试本地 AI,发现隐私和速度优势

Vitalik Buterin 在他的笔记本电脑上运行了阿里巴巴的 Qwen3.8-Flash-Next,发现它足以处理日常任务,并强调了隐私优势。

2026-09-17 08:56约 5 分钟阅读

以太坊联合创始人 Vitalik Buterin 认为,本地 AI 几乎能够处理日常活动中的很大一部分。他在个人笔记本电脑上测试了阿里巴巴的 Qwen3.8-Flash-Next,并分享了性能数据。

与 ChatGPT 不同,这种配置不会与任何云服务器通信。模型驻留在设备上,设备独立处理请求。

Buterin 的本地 AI 测试展示了实际速度

Buterin 的笔记本电脑配备了 AMD 的 Strix Halo 芯片。普通计算机将任务分配给 CPU 和独立 GPU,各自拥有自己的内存库。Strix Halo 将两者集成到单个芯片上,使它们能够访问共享内存池。

这种架构至关重要,因为 AI 模型必须加载到内存中才能运行。标准显卡仅提供 8 到 24 GB,不足以处理如此规模的模型。Strix Halo 系统提供最高 128 GB 内存,供任一组件访问。因此,单个笔记本电脑就能容纳以前需要服务器级设备的模型。

他报告的速度足以满足典型任务。简短查询的响应速度适合阅读。当提示达到数万个词时,生成速度会变慢,因此长文档仍然是一个限制。

阿里巴巴于 8 月 26 日发布了开放权重。据团队称,该模型包含 1250 亿个参数,但一次仅激活 60 亿个,从而保持了较低的内存需求。

Buterin 将其称为 Qwen3.8-Flash,但阿里巴巴提供的可下载版本称为 Qwen3.8-Flash-Next。其更大的版本 Qwen3.8-Max 在 8 月取得了显著的基准测试结果。

Qwen 3.8 flash 确实令人印象深刻,llama.cpp 在处理它方面的表现也在迅速改进

列包括:预存提示、新提示、生成内容、输入 tok/s、输出 tok/s

这是在我的笔记本电脑(strix halo)上运行的。我认为我们已经非常接近…… pic.twitter.com/v5Ze4Fv5Wr

— vitalik.eth (@VitalikButerin) 2026 年 9 月 17 日

隐私如何改变局面

除了速度,Buterin 还指出了另一个好处。本地运行的模型在设备上响应,这意味着没有服务提供商会收到请求。

对于较重的任务,他建议进行分工。本地模型会处理它能处理的,同时从转发给更大的云端系统的任何内容中移除敏感信息。

“使用你的本地模型来编排对强大模型的查询,这样你的查询就不会泄露你的个人信息”

在实践中,本地模型会从提示中提取姓名、钱包地址或私有代码,只发送剩余的问题。这种过滤会减少离开设备的数据。但这并不能确保没有敏感信息泄露出去。

这一立场与他过去的行动一致。他在欧盟聊天控制辩论中提出了对监控的担忧,加密货币用户也出于类似原因主张对代理进行更严格的限制。

5 月,一起集体诉讼指控 OpenAI 将 ChatGPT 用户查询分享给了 Meta 和 Google。

云服务提供商仍然主导着前沿领域。然而,本地性能的每一次改进都会将更多日常任务从他们的服务器上转移出去,而且价格合理的共享内存硬件也在持续普及。

剩下的问题是,个人愿意牺牲多少性能来换取控制权。

分享至

免责声明:本文内容来源于第三方媒体,仅供参考,不构成任何投资建议。加密货币及其他金融产品存在较大价格波动风险,请谨慎决策。

相关文章