Apple vừa công bố nghiên cứu mới mang tên FS-DFM (Few-Step Discrete Flow-Matching), mô hình ngôn ngữ tạo sinh có thể viết văn bản dài nhanh gấp 128 lần so với các mô hình hiện nay. Đây là kết quả hợp tác giữa nhóm nghiên cứu trí tuệ nhân tạo của Apple và Đại học Ohio State, đánh dấu bước tiến đáng chú ý của Apple trong lĩnh vực AI tạo sinh.
FS-DFM là gì và hoạt động ra sao
Thông thường, các mô hình ngôn ngữ lớn (LLM) như ChatGPT hoạt động theo cơ chế autoregressive – tạo từng từ (token) một cách tuần tự, mỗi bước lại dựa vào kết quả trước đó. Cách này giúp mô hình tạo ra câu chữ tự nhiên, nhưng lại khiến quá trình sinh văn bản trở nên chậm, đặc biệt với các đoạn dài.
FS-DFM đi theo hướng khác, dựa trên nền tảng của diffusion model – loại mô hình có thể sinh ra nhiều token song song, sau đó tinh chỉnh dần qua vài vòng lặp. Điểm đặc biệt của FS-DFM nằm ở kỹ thuật flow-matching, cho phép mô hình rút ngắn quá trình “khuếch tán” này chỉ còn vài bước, mà vẫn đảm bảo chất lượng đầu ra.
Cụ thể, thay vì cần đến hàng nghìn vòng tinh chỉnh như các diffusion model truyền thống, FS-DFM chỉ cần 8 vòng để tạo ra đoạn văn hoàn chỉnh với chất lượng tương đương. Đội ngũ nghiên cứu cho biết họ đã huấn luyện mô hình theo ba giai đoạn: Cho phép xử lý nhiều mức độ tinh chỉnh khác nhau, dùng mô hình “giáo viên” để hướng dẫn điều chỉnh từng bước chính xác hơn, và cuối cùng tối ưu cách mô hình cập nhật để đạt kết quả nhanh và ổn định.
Vì sao đây là bước tiến đáng chú ý của Apple
Trong thử nghiệm, FS-DFM đạt kết quả ấn tượng trên hai chỉ số then chốt của các mô hình ngôn ngữ là perplexity và entropy. Perplexity phản ánh mức độ tự nhiên và chính xác của văn bản đầu ra – chỉ số càng thấp thì văn bản càng mạch lạc. Entropy thể hiện độ tự tin của mô hình khi chọn từng từ – quá thấp khiến nội dung lặp lại, quá cao lại dễ thành “vô nghĩa”.

So với các đối thủ như Dream diffusion model (7 tỷ tham số) và LLaDA diffusion model (8 tỷ tham số), FS-DFM phiên bản nhỏ hơn với 1,7 – 1,3 – 0,17 tỷ tham số vẫn đạt kết quả ổn định hơn về cả hai chỉ số. Điều này cho thấy Apple đang tìm ra hướng tối ưu hiệu suất thay vì đơn thuần mở rộng quy mô mô hình như nhiều hãng AI khác.
FS-DFM cũng mở ra tiềm năng lớn cho các ứng dụng tạo sinh ngay trên thiết bị – đặc biệt trong bối cảnh Apple đang hướng tới hệ sinh thái on-device AI nhằm tăng tốc xử lý và bảo mật dữ liệu người dùng. Một mô hình có khả năng viết nhanh, gọn và chính xác như FS-DFM hoàn toàn có thể được tích hợp vào các sản phẩm như Apple Intelligence trên iPhone, iPad hoặc Mac trong tương lai gần.
Apple cho biết họ sẽ sớm công bố mã nguồn và bộ tham số huấn luyện của FS-DFM nhằm khuyến khích cộng đồng nghiên cứu tiếp tục phát triển. Bản báo cáo chi tiết đã được đăng tải trên arXiv, kèm theo ví dụ minh họa trực quan về cách từng từ được hình thành và tinh chỉnh trong quá trình tạo văn bản.

Với tốc độ và độ chính xác mà FS-DFM đạt được, nghiên cứu này cho thấy Apple không còn đứng ngoài cuộc chơi AI tạo sinh, mà đang dần định hình hướng phát triển riêng: ưu tiên hiệu quả, tiết kiệm năng lượng và tối ưu cho trải nghiệm người dùng thực tế.
