Mô hình AI Gemini 4 Argon mạnh đến đâu?

Gemini 4 Argon nhắm tới lập trình, công việc tri thức và phòng thủ mạng, song phạm vi thử nghiệm hiện còn hạn chế.

Argon hướng tới quy trình dài và phức tạp

Vừa qua Google đã giới thiệu Gemini 4 Argon - mô hình AI tuyến đầu dành cho những quy trình phức tạp, kéo dài qua nhiều bước. Ba nhóm công việc được hãng đặt ở vị trí trung tâm gồm kỹ thuật phần mềm trong môi trường thực tế, công việc tri thức tại doanh nghiệp và phòng thủ an ninh mạng.

Khác với mô hình phục vụ câu hỏi ngắn hoặc tác vụ thường ngày, Argon được thiết kế để duy trì suy luận trong một chuỗi công việc dài. Google cho biết mô hình đã được dùng nội bộ cho lập trình chuyên biệt, nghiên cứu sâu và viết nội dung; các nhóm kỹ sư sử dụng từ gỡ lỗi đến chuyển đổi kho mã quy mô lớn và thiết kế thuật toán.

Dữ liệu nội bộ cho thấy Argon được giao những nhiệm vụ có đầu ra kiểm tra được. Một nhóm tác nhân AI đã phân tích dữ liệu vận hành để tối ưu bộ nhớ tại trung tâm dữ liệu của Google, giải phóng hơn 300 TiB sau khi triển khai; mức tiết kiệm ước tính tổng cộng từ 500 TiB đến 1 PiB. Đây vẫn là kết quả do Google tự công bố, chưa có kiểm chứng độc lập trong văn bản nguồn.

Một triệu token đầu ra mở rộng độ sâu xử lý

Gemini 4 Argon nâng giới hạn đầu ra từ 64.000 lên một triệu token. Đây là dung lượng phần nội dung mô hình có thể tạo ra, khác với cửa sổ ngữ cảnh dùng để tiếp nhận dữ liệu đầu vào. Theo Google, giới hạn mới cho phép Argon suy luận sâu và tạo hàng trăm nghìn token trong một hành trình xử lý. Năng lực này hướng tới những bài toán khó cần duy trì mạch suy luận dài, thay vì chia nhỏ thành nhiều lượt trao đổi rời rạc.

Giới hạn đầu ra lớn tạo thêm dư địa cho lập trình, nghiên cứu và quy trình tác nhân nhiều bước, nhưng bản thân con số một triệu token chưa chứng minh chất lượng của mọi câu trả lời. Hiệu quả còn phụ thuộc độ chính xác, khả năng kiểm soát hành động, thời gian xử lý và chi phí khi mô hình được phát hành rộng rãi.

Điểm số cao ở lập trình và công việc tri thức

Google công bố Gemini 4 Argon đạt 77,9% trên DeepSWE v1.1, phép đánh giá kỹ thuật phần mềm trong môi trường thực tế với các nhiệm vụ kéo dài. Trên AutomationBench của Zapier, mô hình đứng đầu với 51,3% ở nhóm quy trình nghiệp vụ đầu - cuối.

Gemini 4 Argon nhắm tới lập trình, công việc tri thức và phòng thủ mạng, song phạm vi thử nghiệm hiện còn hạn chế.

Gemini 4 Argon nhắm tới lập trình, công việc tri thức và phòng thủ mạng, song phạm vi thử nghiệm hiện còn hạn chế.

Trong thử nghiệm nội bộ, các tác nhân Argon hỗ trợ chuyển đổi mã C/C++ sang Rust ở nhiều quy mô. Với libgav1, mô hình thay thế 32.000 dòng mã SIMD trong bản Rust; kết quả được Google mô tả chạy nhanh gấp 2,7 lần bản Rust trước đó và giữ đầu ra video giống nhau.

Ở công việc tri thức, Google cho biết Argon dẫn đầu Vals Index, đồng thời đạt kết quả cao trong nghiên cứu tài chính và soạn thảo pháp lý. Khả năng hiểu dữ liệu trực quan cũng được thể hiện qua điểm 91,7% trên LVBench, phép đánh giá khả năng hiểu video dài. Các con số cho thấy trọng tâm của Argon nằm ở tác vụ chuyên môn nhiều bước, nhưng đều xuất phát từ công bố của nhà phát triển.

Phòng thủ mạng là năng lực được ưu tiên

Gemini 4 Argon được huấn luyện để tự động tìm, xác thực và vá lỗ hổng phần mềm. Google cung cấp mô hình trước cho nhóm chuyên gia phòng thủ mạng tin cậy thông qua chương trình Fairwind, thay vì mở ngay cho người dùng phổ thông.

Trên CWE-bench v1, phép đánh giá khả năng khắc phục lỗ hổng, Argon đồng hạng nhất với 68%. Google cũng cho biết mô hình phát hiện nhiều dạng điểm yếu trong các kho mã phức tạp sử dụng 20 ngôn ngữ lập trình và vượt Gemini 3.8 Flash Cyber trong thử nghiệm xâm nhập hộp đen của Wiz.

Wiz đang sử dụng Argon trong sáng kiến Scan for Good để bảo vệ miễn phí hạ tầng công cộng trọng yếu. Theo Google, mô hình đã phát hiện một lỗ hổng nghiêm trọng làm lộ dữ liệu cá nhân trong phần mềm y tế được nhiều bệnh viện sử dụng.

Bốn lớp an toàn trước khi phát hành rộng rãi

Google chia biện pháp an toàn của Argon thành bốn nhóm: ngăn sử dụng sai mục đích, chống tấn công chèn chỉ dẫn, giám sát hành vi lệch mục tiêu và gia cố môi trường thử nghiệm.

Mô hình được thiết kế để từ chối yêu cầu gây hại liên quan đến tấn công mạng hoặc các rủi ro hóa học, sinh học, phóng xạ và hạt nhân, trong khi vẫn hỗ trợ nghiên cứu lưỡng dụng hợp pháp. Google cho biết các biện pháp này đã qua kiểm thử của những nhóm đánh giá nội bộ và bên ngoài.

Argon còn được huấn luyện đối kháng để tăng khả năng chống chèn chỉ dẫn gián tiếp. Hệ thống giám sát sẽ theo dõi chuỗi suy luận và hành động nhằm dừng quá trình khi mô hình vượt khỏi ý định người dùng. Việc Google vẫn tiếp tục gia cố bốn lớp bảo vệ trước khi phát hành rộng rãi cho thấy rủi ro vận hành chưa được xem là đã giải quyết hoàn toàn.

Nhân Trí

Có thể bạn quan tâm