Siri đang chuẩn bị bước vào giai đoạn nâng cấp lớn nhất kể từ khi ra mắt. Theo Bloomberg, Apple và Google đang tiến gần đến thỏa thuận trị giá khoảng 1 tỷ USD mỗi năm để sử dụng mô hình Gemini cho Siri thế hệ mới. Điều đáng chú ý không chỉ là quy mô hợp tác, mà còn nằm ở cách Apple dự định triển khai mô hình này trong hệ thống của mình.
Mô hình 1.2 nghìn tỷ tham số – quy mô lớn đến mức nào?
Báo cáo cho biết phiên bản Gemini mà Apple dùng có tới 1.2 nghìn tỷ tham số (parameters), tức số lượng biến mà mô hình sử dụng để học và xử lý thông tin. Đây là con số khổng lồ, vượt xa hầu hết các mô hình AI hiện nay, và thể hiện độ phức tạp cũng như khả năng hiểu ngữ cảnh sâu của hệ thống.
Điều đáng nói là những mô hình hàng đầu như GPT-5 hay Claude Sonnet 4.5 hiện không còn công bố số tham số chính xác, nên việc so sánh trở nên khó khăn. Tuy nhiên, với quy mô 1.2 nghìn tỷ tham số, mô hình mà Siri sử dụng rõ ràng thuộc nhóm lớn nhất hiện nay.
Điểm đáng khen là Apple không vận hành mô hình này trực tiếp trên hạ tầng của Google. Thay vào đó, nó sẽ chạy trong môi trường Private Cloud Compute – nền tảng điện toán đám mây riêng của Apple – để đảm bảo dữ liệu người dùng không bị truy cập từ bên ngoài. Đây là cách hãng duy trì tiêu chuẩn bảo mật vốn là đặc trưng của hệ sinh thái iOS.
Gemini trong Siri và kiến trúc “Mixture of Experts” (hệ thống chuyên gia hỗn hợp)
Để vận hành hiệu quả một mô hình khổng lồ như vậy, nhiều khả năng Apple và Google sẽ áp dụng kiến trúc Mixture of Experts (MoE) – một phương pháp chia nhỏ mô hình thành nhiều mạng con, gọi là “chuyên gia” (experts). Mỗi chuyên gia được huấn luyện cho một nhóm nhiệm vụ cụ thể như hiểu ngôn ngữ, xử lý cảm xúc, hay lập luận logic.
Thay vì kích hoạt toàn bộ 1.2 nghìn tỷ tham số cùng lúc, hệ thống chỉ gọi một số chuyên gia cần thiết cho từng yêu cầu. Ví dụ, mô hình có 32 chuyên gia thì Siri chỉ sử dụng 2–4 chuyên gia khi xử lý mỗi câu lệnh. Nhờ vậy, chỉ khoảng 75–150 tỷ tham số hoạt động thực tế ở mỗi lần suy luận (inference), giúp tiết kiệm tài nguyên tính toán và tăng tốc độ phản hồi.

Với cách tiếp cận này, Apple có thể khai thác sức mạnh của mô hình quy mô lớn mà không làm tăng độ trễ hoặc chi phí xử lý. Đồng thời, MoE cũng giúp Siri phản ứng linh hoạt hơn, vì hệ thống có thể “chọn đúng chuyên gia” cho từng loại câu hỏi người dùng đặt ra.
Ý nghĩa thực tế của kiến trúc này với Siri mới
Khi được vận hành bằng mô hình Gemini theo kiến trúc MoE, Siri có thể đạt bước nhảy vọt cả về độ thông minh lẫn tốc độ phản hồi. Trợ lý ảo có khả năng hiểu ngữ cảnh tốt hơn, phản hồi tự nhiên và chính xác hơn, đồng thời duy trì mức độ bảo mật cao khi toàn bộ xử lý đều diễn ra trong hạ tầng của Apple.
Quan trọng hơn, việc chọn cách triển khai riêng biệt cho thấy Apple muốn kết hợp sức mạnh của Gemini với giá trị cốt lõi của hãng: quyền riêng tư và kiểm soát dữ liệu người dùng. Điều này khác hẳn cách Google hoặc OpenAI triển khai mô hình AI của họ dựa trên nền tảng đám mây công cộng.
Siri thế hệ mới vì thế không chỉ là sự thay đổi trong khả năng trò chuyện, mà còn là minh chứng cho cách Apple tiếp cận AI theo hướng an toàn và bền vững hơn. Nếu mọi thứ diễn ra đúng kế hoạch, người dùng có thể được trải nghiệm phiên bản Siri thông minh hơn, nhanh hơn và “riêng tư hơn” ngay trong năm tới.
