Đồng sáng lập Ethereum, Vitalik Buterin, tin rằng AI cục bộ gần như có khả năng quản lý một phần đáng kể các hoạt động hàng ngày. Ông đã thử nghiệm Qwen3.8-Flash-Next của Alibaba trên laptop cá nhân và chia sẻ dữ liệu hiệu suất.
Trái ngược với ChatGPT, cấu hình này không giao tiếp với bất kỳ máy chủ đám mây nào. Mô hình nằm trên thiết bị và thiết bị tự xử lý yêu cầu.
Thử nghiệm AI cục bộ của Buterin cho thấy tốc độ thực tế
Laptop của Buterin được trang bị chip Strix Halo của AMD. Máy tính thông thường phân chia tác vụ giữa CPU và GPU riêng biệt, mỗi bộ có bộ nhớ riêng. Strix Halo tích hợp cả hai vào một chip, cho phép chúng truy cập vào một bộ nhớ dùng chung.
Kiến trúc này rất quan trọng vì một mô hình AI phải được nạp vào bộ nhớ để hoạt động. Card đồ họa tiêu chuẩn chỉ cung cấp 8 đến 24 GB, không đủ cho một mô hình quy mô đó. Hệ thống Strix Halo có dung lượng lên tới 128 GB mà cả hai thành phần đều có thể truy cập. Do đó, một chiếc laptop đơn có thể chứa một mô hình trước đây yêu cầu thiết bị cấp máy chủ.
Tốc độ ông báo cáo là đủ cho các tác vụ điển hình. Các truy vấn ngắn trả về với tốc độ thoải mái để đọc. Quá trình sinh chậm lại khi lời nhắc đạt tới hàng chục nghìn từ, khiến các tài liệu dài vẫn là một hạn chế.
Alibaba đã phát hành trọng số mở vào ngày 26 tháng 8. Theo nhóm phát triển, mô hình chứa 125 tỷ tham số nhưng chỉ kích hoạt sáu tỷ tại một thời điểm, giữ cho yêu cầu bộ nhớ ở mức thấp.
Buterin gọi nó là Qwen3.8-Flash, nhưng phiên bản có thể tải xuống từ Alibaba được gọi là Qwen3.8-Flash-Next. Đối tác lớn hơn của nó, Qwen3.8-Max, đã đạt được các kết quả điểm chuẩn đáng chú ý vào tháng 8.
Qwen 3.8 flash thực sự ấn tượng, và llama.cpp đã ngày càng nhanh chóng cải thiện trong việc xử lý nó
các cột là: lời nhắc có sẵn, lời nhắc mới, đã sinh, đầu vào tok/s, đầu ra tok/s
Đây là trên laptop của tôi (strix halo). Tôi nghĩ chúng ta đang rất gần điểm mà bạn… pic.twitter.com/v5Ze4Fv5Wr
— vitalik.eth (@VitalikButerin) 17 tháng 9, 2026
Quyền riêng tư thay đổi phương trình như thế nào
Ngoài tốc độ, Buterin ghi nhận một lợi ích khác. Một mô hình chạy cục bộ phản hồi trên thiết bị, nghĩa là không có nhà cung cấp dịch vụ nào nhận được yêu cầu.
Đối với các tác vụ nặng hơn, ông đề xuất sự phân công lao động. Mô hình cục bộ sẽ xử lý những gì nó có thể, loại bỏ thông tin nhạy cảm khỏi bất cứ thứ gì nó chuyển tiếp đến một hệ thống đám mây lớn hơn.
“sử dụng mô hình cục bộ của bạn để điều phối các truy vấn đến các mô hình mạnh mẽ để truy vấn của bạn không làm rò rỉ thông tin cá nhân của bạn”
Trong thực tế, mô hình cục bộ sẽ trích xuất tên, địa chỉ ví hoặc mã riêng tư từ lời nhắc, chỉ gửi phần câu hỏi còn lại. Việc lọc này sẽ giảm lượng dữ liệu rời khỏi thiết bị. Nó sẽ không đảm bảo rằng không có thông tin nhạy cảm nào thoát ra ngoài.
Quan điểm này phù hợp với các hành động trước đây của ông. Ông đã nêu lên mối lo ngại về giám sát trong cuộc tranh luận về kiểm soát trò chuyện của EU, và người dùng tiền điện tử đã ủng hộ các giới hạn chặt chẽ hơn đối với tác nhân vì những lý do tương tự.
Vào tháng 5, một vụ kiện tập thể đã cáo buộc rằng OpenAI đã chia sẻ truy vấn của người dùng ChatGPT với Meta và Google.
Các nhà cung cấp đám mây vẫn thống trị ở biên giới. Tuy nhiên, mỗi cải tiến về hiệu suất cục bộ sẽ chuyển nhiều tác vụ hàng ngày hơn ra khỏi máy chủ của họ và phần cứng bộ nhớ dùng chung giá rẻ tiếp tục phát triển.
Câu hỏi còn lại là mọi người sẵn sàng hy sinh bao nhiêu hiệu suất để đổi lấy quyền kiểm soát.