Anthropic vừa chính thức ra mắt Claude Opus 5, mẫu AI cao cấp mới được định vị cho nhu cầu sử dụng hằng ngày. Theo công ty, model này mang đến năng lực tiệm cận Claude Fable 5 trong nhiều tác vụ lập trình và công việc tri thức, nhưng chi phí hoàn thành mỗi tác vụ chỉ bằng khoảng một nửa.
Claude Opus 5 hiện trở thành model mặc định trên gói Claude Max, đồng thời là lựa chọn mạnh nhất dành cho người dùng Claude Pro. Anthropic cho biết model mới hoạt động hiệu quả hơn các thế hệ trước, chủ động kiểm tra kết quả và có xu hướng tiếp tục điều chỉnh cho đến khi hoàn thành tác vụ.

Hiệu năng tiệm cận Fable 5 với chi phí thấp hơn
Claude Opus 5 được Anthropic công bố đạt hiệu năng cao hơn đáng kể so với Opus 4.8 dù giữ nguyên mức giá API. Người dùng cũng có thể điều chỉnh mức độ suy luận của model để ưu tiên năng lực xử lý hoặc giảm lượng token, qua đó cân bằng giữa chất lượng, tốc độ và chi phí.
Trong bài đánh giá Frontier-Bench v0.1 dành cho các tác vụ kỹ thuật phần mềm có giá trị thực tế, Opus 5 vượt qua các model còn lại và đạt kết quả cao hơn gấp đôi Opus 4.8 với chi phí trung bình cho mỗi tác vụ thấp hơn.
Trên CursorBench 3.2 ở mức suy luận tối đa, Opus 5 chỉ kém điểm số cao nhất của Fable 5 khoảng 0.5%, trong khi chi phí hoàn thành tác vụ bằng một nửa. Anthropic cho biết model mới cũng mang lại tỷ lệ hiệu năng trên chi phí tốt hơn các đối thủ ở những mức suy luận cao.
Một số kết quả đáng chú ý khác gồm:
- Điểm số trên ARC-AGI 3 cao gấp ba lần model đứng thứ hai trong bài kiểm tra giải quyết các vấn đề mới.
- Tỷ lệ hoàn thành trên Zapier AutomationBench cao hơn khoảng 1.5x model xếp sau ở cùng mức chi phí.
- Vượt kết quả tốt nhất của Fable 5 trên OSWorld 2.0 với chi phí chỉ hơn một phần ba.
Anthropic cũng ghi nhận Opus 5 cải thiện trên các tác vụ nghiên cứu khoa học, đặc biệt trong sinh học cấu trúc, hóa học hữu cơ và tin sinh học. Khả năng tạo nội dung trực quan cũng được nâng cấp, với các ví dụ như xây dựng mô phỏng đường hầm gió và mô hình tế bào động vật tương tác.
Chủ động kiểm tra và xử lý tác vụ dài tốt hơn
Một trong những thay đổi chính của Claude Opus 5 nằm ở khả năng xác minh công việc trước khi đưa ra kết quả cuối cùng. Model có thể tự xây dựng công cụ kiểm thử, tìm nguyên nhân gốc của lỗi và điều chỉnh phương án khi gặp trở ngại thay vì chỉ xử lý triệu chứng bề mặt.
Trong một thử nghiệm, Opus 5 được yêu cầu tái tạo bản vẽ linh kiện máy thành mô hình 3D trên FreeCAD nhưng không được cung cấp công cụ xem trực tiếp hình ảnh. Model đã tự viết một quy trình thị giác máy tính để trích xuất hình học từ các điểm ảnh, sau đó dựng lại linh kiện hoàn chỉnh. Anthropic cho biết các model cạnh tranh không thể giải quyết tác vụ này sau năm lần thử trong cùng điều kiện.
Ở một trường hợp khác, model phát hiện nguyên nhân gốc của lỗi trong trình quản lý gói mã nguồn mở và sửa thêm một trường hợp biên mà bản vá từ cộng đồng đã bỏ sót. Opus 5 cũng được thử nghiệm với các quy trình dài như xây dựng luồng dữ liệu thị trường, phân tích tài chính, nghiên cứu khoa học và chỉnh sửa dự án phần mềm quy mô lớn.
Các khách hàng dùng thử sớm nhận xét model mới ổn định hơn giữa nhiều lần chạy, xử lý tốt các yêu cầu mơ hồ và có khả năng phản biện quyết định kỹ thuật thay vì luôn đồng ý với người dùng. Khả năng kiểm tra giao diện trên nhiều kích thước màn hình, rà soát nhánh mã nguồn và đánh giá ảnh hưởng của bản vá cũng được cải thiện.
Giữ nguyên giá Opus 4.8 và có chế độ Fast
Claude Opus 5 hiện có mặt trên các nền tảng của Anthropic với giá 5 USD cho mỗi 1 triệu token đầu vào và 25 USD cho mỗi 1 triệu token đầu ra, tương đương Opus 4.8. Nhà phát triển có thể sử dụng model thông qua API với tên claude-opus-5.
Anthropic còn cung cấp chế độ Fast, cho tốc độ xử lý nhanh hơn khoảng 2.5x so với thiết lập mặc định. Chế độ này có giá gấp đôi trên Claude Platform và được cung cấp thông qua hạn mức sử dụng trong Claude Code.
Về an toàn, Anthropic đánh giá Opus 5 là model tuân thủ tốt nhất của hãng tính đến nay, với tỷ lệ hành vi sai lệch và khả năng bị lợi dụng thấp hơn Opus 4.8, Sonnet 5 và Fable 5. Tuy nhiên, model vẫn đứng sau Mythos 5 trong một số tác vụ an ninh mạng và nghiên cứu sinh học có rủi ro cao.

Cùng với Opus 5, Anthropic đang thử nghiệm hai tính năng mới gồm thay đổi công cụ ngay giữa cuộc hội thoại mà không làm mất bộ nhớ đệm prompt, cùng cơ chế tự động chuyển yêu cầu sang model khác khi hệ thống an toàn chặn tác vụ trên Opus 5 hoặc Fable 5.



