Google đưa Gemini 3.8 Live vào cuộc đua trợ lý giọng nói

Google giới thiệu Gemini 3.8 Live và bản Extended Thinking, tập trung vào đối thoại gần thời gian thực, suy luận đa bước và thực hiện tác vụ bằng giọng nói.

Hai mô hình cho đối thoại trực tiếp và tác vụ phức tạp
Mới đây, Google đã công bố Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking. Đây là những mô hình đối thoại trực tiếp tiên tiến nhất của hãng, được nâng cấp về năng lực trí tuệ và suy luận song song để người dùng có thể cộng tác và thực hiện các tác vụ phức tạp bằng giọng nói.

Gemini 3.8 Live được xây dựng cho khả năng mở rộng và hiệu quả chi phí, kết hợp năng lực hội thoại với đối thoại tự nhiên, liền mạch và khả năng tiếp nhận ngữ cảnh hình ảnh. Phiên bản Gemini 3.8 Live Extended Thinking hướng tới các tác vụ có độ phức tạp cao, với năng lực trí tuệ và suy luận nhiều bước được tăng cường.

Google cho biết hai mô hình cung cấp các thành phần để nhà phát triển và doanh nghiệp xây dựng những trợ lý giọng nói đáng tin cậy, sẵn sàng đưa vào vận hành. Các mô hình cũng giúp việc trò chuyện với Gemini trong ứng dụng Gemini, Google Workspace và Search trở nên liền mạch, có tính cộng tác hơn khi người dùng xử lý tác vụ phức tạp bằng giọng nói.

Về kết quả đánh giá, Google cho biết Gemini 3.8 Live Extended Thinking đứng đầu Speech to Speech Quality Index của Artificial Analysis với 82,6 điểm. Trong khi đó, Gemini 3.8 Live đứng thứ hai trong Speech Agent Arena và vẫn duy trì hiệu quả chi phí, phù hợp với nhu cầu triển khai ở quy mô lớn.

Trên EVA-Bench của ServiceNow, một bộ đánh giá trợ lý giọng nói, Google cho biết các mô hình đạt đường biên Pareto cho những quy trình phức tạp nhờ cân bằng giữa độ chính xác và chất lượng hội thoại. Google lưu ý kết quả này được chạy trên Live API thuộc Gemini Enterprise Agent Platform.

Xử lý hình ảnh, 97 ngôn ngữ và tác vụ nền

Gemini 3.8 Live xử lý đầu vào hình ảnh gần thời gian thực để bổ sung ngữ cảnh cho cuộc trò chuyện. Mô hình tự động nhận diện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ trong khi cuộc trò chuyện đang diễn ra. Mô hình cũng thực hiện công cụ và lệnh gọi API ở chế độ nền, đồng thời tiếp tục trò chuyện với người dùng trong lúc tác vụ được hoàn tất.

Với các yêu cầu cần suy luận sâu hơn, Gemini 3.8 Live Extended Thinking có thể vừa suy luận vừa nói. Google cho biết mô hình duy trì mạch hội thoại không bị gián đoạn khi xử lý quy trình phức tạp, sử dụng những tín hiệu bằng lời nói sớm như “Tôi sẽ kiểm tra…” để phản hồi tự nhiên và tường thuật tiến độ khi thực hiện tác vụ nhiều bước ở chế độ nền.

Gemini 3.8 Live có thể tiếp tục trò chuyện trong khi thực hiện công cụ và lệnh gọi API ở chế độ nền.

Gemini 3.8 Live có thể tiếp tục trò chuyện trong khi thực hiện công cụ và lệnh gọi API ở chế độ nền.

Google đưa ra các ví dụ gồm hướng dẫn nhân viên làm quen công việc bằng ngữ cảnh hình ảnh, chơi cờ gần thời gian thực, chuyển bản phác thảo thành thành phần React, điều phối đặt chỗ nhiều bước, xây dựng kế hoạch kinh doanh và tạo bộ công cụ tiếp thị bằng lời nói tự nhiên.

Trong Google Workspace, người dùng có thể thử Gemini 3.8 Live Extended Thinking với Docs Live, Gmail Live và Keep Live. Search Live cung cấp hướng dẫn xử lý sự cố theo từng bước; còn ứng dụng Gemini cho phép người dùng yêu cầu bản tóm tắt trong ngày, xử lý hộp thư đến hoặc chuyển giao các việc cần làm bằng giọng nói.

Mở rộng hệ sinh thái trợ lý giọng nói

Ở hệ sinh thái nhà phát triển và doanh nghiệp, Gemini Live API được các nền tảng Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel và Vision Agents sử dụng để xây dựng, triển khai giao diện điều khiển bằng giọng nói. Google cho biết, các nền tảng này xử lý hạ tầng truyền phát đa phương tiện thời gian thực, giúp nhà phát triển tập trung vào trải nghiệm người dùng. Google cũng hợp tác với Salesforce, Genspark và Lumeris, những doanh nghiệp đánh giá cao độ trễ, độ liền mạch và khả năng gọi công cụ của các mô hình mới.

Google cho biết, toàn bộ âm thanh do các sản phẩm AI của hãng tạo ra đều được gắn dấu nhận diện SynthID. Dấu nhận diện không thể nhìn thấy này được tích hợp trực tiếp vào đầu ra âm thanh, giúp phát hiện nội dung do AI tạo ra và hỗ trợ phòng, chống thông tin sai lệch.

Gemini 3.8 Live bắt đầu được triển khai cho nhà phát triển qua Gemini API và Google AI Studio. Với doanh nghiệp, mô hình ở chế độ xem trước riêng trong Gemini Enterprise và sẽ sớm có trên Gemini Enterprise for Customer Experience; người dùng phổ thông có thể tiếp cận qua Search Live. Gemini 3.8 Live Extended Thinking cũng được triển khai qua Gemini API, Google AI Studio và Gemini Live; đồng thời được cung cấp cho một số người đăng ký Google AI trong Docs, Gmail và Keep theo phạm vi mà Google công bố.

Nhân Trí

Có thể bạn quan tâm