Google và Meta Ra mắt Mô Hình AI Cùng Ngày, Kết Quả Đánh Giá Phân Hóa

Google đã phát hành Gemini 3.8 Flash và một biến thể an ninh mạng, trong khi Meta phát hành Muse Spark 1.3 vào thứ Tư. Các tiêu chuẩn đánh giá độc lập đã phân chia lợi thế hiệu suất.

03/09/2026 06:17Đọc khoảng 13 phút

Vào thứ Tư, Google và Meta đã ra mắt các mô hình AI tiên tiến mới nhất của họ chỉ cách nhau vài giờ. Google tung ra Gemini 3.8 Flash cùng với một phiên bản an ninh mạng, trong khi Meta giới thiệu Muse Spark 1.3.

Hai bản phát hành này mời gọi một sự so sánh trực tiếp. Thử nghiệm độc lập bởi Artificial Analysis cho kết quả phân hóa. Meta dẫn đầu về công việc tác nhân tri thức và lý luận khoa học, trong khi Google chiếm ưu thế về khả năng ghi nhớ thực tế và lập trình đầu cuối.

Hai Bản Phát Hành Tiên Tiến Ra Mắt Cùng Ngày

Gemini 3.8 Flash là bản phát hành Flash thứ ba của Google trong vòng sáu tuần. Mô hình này được định giá 0,75 USD cho mỗi 1 triệu token đầu vào và 3,75 USD cho mỗi 1 triệu token đầu ra.

Hôm nay chúng tôi đang giới thiệu một mô hình 3.8 Flash mới, bản phát hành Flash thứ 3 của chúng tôi chỉ trong 6 tuần.

Nó mang lại những bước tiến đáng kể so với 3.7 Flash trong kỹ thuật phần mềm, các tác vụ tác nhân và lý luận đa bước. Trên DeepSWE v1.1, nó vượt trội hơn hầu hết các mô hình tiên tiến lớn hơn trong việc tự động… pic.twitter.com/MB5seliluh

— Sundar Pichai (@sundarpichai) 2 tháng 9, 2026

Các mức giá giới thiệu có hiệu lực đến ngày 31 tháng 12, 2026. Sau đó, giá sẽ tăng gấp đôi lên 1,50 USD và 7,50 USD cho mỗi 1 triệu token.

Google cũng đi kèm mô hình tổng quát với Gemini 3.8 Flash Cyber. Quyền truy cập bị giới hạn đối với một nhóm các nhà bảo vệ đáng tin cậy. Trên CyberGym, một tiêu chuẩn đánh giá để tìm điểm yếu, nó đạt điểm 86,2%.

Mô hình an ninh mạng cũng đạt 47,2% trên CWE-Bench, một tiêu chuẩn đánh giá vá lỗi. Google báo cáo rằng mô hình này tạo ra nhiều hơn gấp 2,6 lần các bản vá chính xác cho các lỗ hổng của Chrome so với các mô hình thương mại lớn hơn.

Quyền truy cập nằm trong Chương trình Fairwind, giới hạn việc sử dụng cho các cơ quan chính phủ và nhà khai thác cơ sở hạ tầng quan trọng. Một ngày trước đó, OpenAI đã vẽ một ranh giới tương tự xung quanh Astra, mô hình đầu tiên mà họ đánh giá ở ngưỡng an ninh mạng quan trọng.

Trong khi đó, Meta đã triển khai Muse Spark 1.3 thông qua Muse Code và Meta Model API. Các kỹ sư của công ty đã đo lường số lượng cuộc gọi công cụ ít hơn khoảng 20% so với phiên bản 1.2.

Muse Spark 1.3 đang được triển khai hôm nay với hiệu suất tiên tiến gần như quá rẻ để đo lường. Đây là bước nhảy lớn nhất mà chúng tôi đã thực hiện cho đến nay về lập trình và công việc tác nhân. Hãy thử nó trong Muse Code và API của chúng tôi.

Tiếp theo 🍉 và các bản phát hành trọng số mở của Muse Spark sắp ra mắt. pic.twitter.com/XQQEDEJGD7

— Mark Zuckerberg (@finkd) 2 tháng 9, 2026

Gemini 3.8 Flash đấu với Muse Spark 1.3: Các Tiêu Chuẩn Độc Lập Phân Chia Kết Quả

Artificial Analysis đã thử nghiệm các mô hình, và kết quả cho thấy cách chúng xếp hạng. Ở chế độ tối đa, Muse Spark 1.3 đạt 1.754 Elo trên GDPval-AA v2. Gemini 3.8 Flash (cao) trả về 1.545.

Meta cũng dẫn đầu bài kiểm tra tác nhân ngân hàng Sierra Research, với 52,4% so với 44,9%, và lý luận vật lý CritPt. Gemini 3.8 Flash dẫn đầu Terminal-Bench 2.1 ở mức 87,6%, ngữ cảnh dài AA-LCR ở mức 81%, và độ chính xác AA-Omniscience ở mức 55%.

Gemini 3.8 Flash đạt điểm GPQA Diamond cao nhất trong số các mô hình được thử nghiệm, ở mức 95%. Hai mô hình kết thúc trong vòng một điểm của nhau trên Humanity's Last Exam.

Mô hình đạt điểm cao nhất của Meta không được phát hành hôm nay. Công ty cho biết lý luận tối đa sẽ đến sau khi thử nghiệm an toàn thêm, để lại xhigh làm biến thể có sẵn.

Phiên bản đó đạt 61 trên Chỉ số Trí tuệ Phân tích Nhân tạo, cao hơn bốn điểm so với Muse Spark 1.2. Nó theo sau Claude Fable 5.1 ở mức 66 và Claude Opus 5 ở mức 63.

Các bản phát hành bổ sung đã được xếp hàng chờ. Elon Musk đã nói Grok 4.7 sẽ ra mắt trong thời gian ngắn, điều này có nghĩa là bốn bản phát hành tiên tiến trong vòng hai tuần.

Chia sẻ tới

X (Twitter)Telegram

Tuyên bố miễn trừ trách nhiệm: Nội dung bài viết đến từ bên thứ ba, chỉ mang tính tham khảo và không phải lời khuyên đầu tư. Tiền mã hóa và các sản phẩm tài chính khác có rủi ro biến động giá lớn, vui lòng cân nhắc kỹ trước khi quyết định.

Bài viết liên quan