Tại WWDC 2026, Apple công bố thế hệ thứ 3 của Apple Foundation Models (AFM), gồm 5 model trải dài từ xử lý hoàn toàn trên thiết bị đến server chạy trên GPU NVIDIA trong hạ tầng Google Cloud. Đây là thế hệ model được Apple mô tả là cải thiện đáng kể cả về chất lượng lẫn khả năng so với thế hệ trước.
Apple Foundation Models là gì
Apple Foundation Models là bộ mô hình AI nền tảng của Apple, lần đầu ra mắt vào năm 2024. Thế hệ đầu tiên gồm 1 model on-device khoảng 3 tỷ tham số và 1 model server chạy trên Apple Silicon thông qua Private Cloud Compute.
Private Cloud Compute là hạ tầng điện toán đám mây riêng của Apple, được thiết kế để mang lại khả năng AI từ server trong khi vẫn đảm bảo quyền riêng tư tương đương xử lý on-device. Toàn bộ hạ tầng ban đầu chạy trong trung tâm dữ liệu của Apple trên máy chủ Apple Silicon, và các cam kết bảo mật có thể được các nhà nghiên cứu bên ngoài xác minh độc lập.
Đến WWDC 2026, Apple hợp tác với Google sử dụng công nghệ Gemini làm nền tảng huấn luyện cho thế hệ model mới, đồng thời lần đầu tiên mở rộng Private Cloud Compute sang hạ tầng bên ngoài Apple.
5 model thế hệ mới
Thế hệ 3 Apple Foundation Models chia thành 2 nhóm: 2 model on-device và 3 model server.
- AFM 3 Core là model on-device cơ bản, kế thừa từ thế hệ trước với kiến trúc dense và khoảng 3 tỷ tham số. Toàn bộ tham số được kích hoạt cho mỗi yêu cầu, phù hợp với các tác vụ AI thông thường hàng ngày.
- AFM 3 Core Advanced là điểm nhấn kỹ thuật của thế hệ này. Model có tổng cộng 20 tỷ tham số — con số lớn bất thường cho một model on-device — nhưng nhờ kiến trúc thưa (sparse architecture), mỗi yêu cầu chỉ kích hoạt từ 1 đến 4 tỷ tham số tùy mức độ phức tạp. Cách tiếp cận này tương tự nhưng không giống hoàn toàn với Mixture of Experts: thay vì chia model thành các “chuyên gia” độc lập, Apple dùng kỹ thuật pruning (cắt tỉa) riêng để chọn tham số phù hợp cho từng yêu cầu. Nhờ đó, model có thể chạy hoàn toàn on-device mà không cần gửi dữ liệu lên server, hỗ trợ các tính năng như giọng nói truyền cảm và nhận dạng giọng nói nâng cao. AFM 3 Core Advanced yêu cầu Apple Silicon thế hệ mạnh nhất để hoạt động.
- AFM 3 Cloud là model server chủ lực, được tối ưu hóa cho độ trễ thấp và chi phí vận hành, xử lý các yêu cầu phức tạp hơn khả năng on-device thông qua Private Cloud Compute.
- ADM 3 Cloud Image là model server chuyên biệt cho tạo ảnh và chỉnh sửa ảnh. Chữ D trong tên viết tắt là “diffusion” — kỹ thuật tạo ảnh hoạt động bằng cách bắt đầu từ nhiễu ngẫu nhiên rồi dần dần tái tạo hình ảnh rõ nét theo mô tả. Model này hỗ trợ các tính năng như Spatial Reframing trong ứng dụng Ảnh và Image Playground mới.
- AFM 3 Cloud Pro là model mạnh nhất trong bộ 5, phục vụ các tác vụ agentic AI và suy luận phức tạp. Đây là model duy nhất không chạy trên Apple Silicon: Apple mở rộng Private Cloud Compute sang GPU NVIDIA trong hạ tầng Google Cloud, lần đầu tiên đưa PCC ra ngoài hạ tầng nội bộ. Apple và Google xây dựng thêm các lớp bảo mật bổ sung, bao gồm sổ cái phần cứng có thể xác minh bằng mã hóa và nhiều nguồn xác thực độc lập, để đảm bảo không có dữ liệu người dùng nào bị lưu trữ hay rò rỉ.

Cả 5 model đều xuất phát từ cùng một nền tảng chung trước khi được tùy chỉnh riêng cho kiến trúc và mục đích sử dụng của từng model, bổ sung thêm khả năng đa phương thức như xử lý âm thanh, hiểu hình ảnh, suy luận ngữ cảnh dài và tạo ảnh chất lượng cao.
Kết quả đánh giá
Apple thực hiện đánh giá nội bộ thông qua so sánh song song (side-by-side) bởi người đánh giá thực, chấm điểm theo 4 tiêu chí: tuân theo hướng dẫn, độ trung thực, trình bày và hiểu hình ảnh. Kết quả cho thấy AFM 3 Core và AFM 3 Cloud vượt trội so với thế hệ trước trên tất cả tiêu chí, đồng đều trên nhiều nhóm ngôn ngữ khác nhau bao gồm tiếng Anh, tiếng Nhật, tiếng Trung, tiếng Hàn và các ngôn ngữ châu Âu.

Về nhận dạng giọng nói, AFM 3 Core Advanced được đánh giá vượt hệ thống nhận dạng giọng nói sản xuất hiện tại của Apple trên tất cả 7 tiêu chí đánh giá, bao gồm định dạng và khả năng hiểu ngôn ngữ.

Về dữ liệu huấn luyện, Apple sử dụng kết hợp dữ liệu công khai, dữ liệu mua bản quyền từ bên thứ ba, dữ liệu mã nguồn mở, dữ liệu từ các nghiên cứu riêng và dữ liệu tổng hợp. Apple khẳng định quá trình huấn luyện không dùng dữ liệu người dùng hay lịch sử tương tác, và các nhà xuất bản web có thể opt-out khỏi việc dữ liệu của họ được dùng để huấn luyện.

