Anthropic giải thích cách watermark trên nội dung do Claude tạo ra hoạt động

Anthropic dùng SynthID-Text để watermark văn bản Claude bằng mẫu thống kê lựa chọn từ ngữ, đáp ứng minh bạch theo EU AI Act.

Anthropic giải thích cách watermark trên nội dung do Claude tạo ra hoạt động

Anthropic vừa công bố thêm chi tiết về cơ chế watermark sẽ được áp dụng cho văn bản do Claude tạo ra. Thay vì chèn một dấu hiệu có thể nhìn thấy, hệ thống sẽ tạo ra những mẫu thống kê trong cách mô hình lựa chọn từ ngữ, cho phép xác định nội dung do AI tạo ra bằng công cụ phù hợp.

Cơ chế này được Anthropic triển khai nhằm đáp ứng các yêu cầu về minh bạch của EU AI Act. Trước đó, công ty xác nhận sẽ đánh dấu văn bản do các mô hình của mình tạo ra để giúp nhận diện nội dung do AI sinh ra.

Theo Anthropic, Claude có thể tạo watermark thông qua những lựa chọn từ ngữ không ảnh hưởng đáng kể đến ý nghĩa của câu. Chẳng hạn, khi có nhiều từ hoặc cách diễn đạt đều phù hợp trong cùng một ngữ cảnh, mô hình có thể ưu tiên một số lựa chọn nhất định để hình thành một mẫu mà người đọc bình thường không nhận ra.

Anthropic cho biết cách làm này không ảnh hưởng đến chất lượng nội dung đầu ra. Với người đọc, văn bản có watermark về cơ bản không khác so với văn bản không được đánh dấu.

Anthropic giải thích cách watermark trên nội dung do Claude tạo ra hoạt động

Công ty sẽ sử dụng SynthID-Text, phương pháp watermark văn bản do Google DeepMind giới thiệu vào năm 2024. Anthropic cũng có kế hoạch cung cấp API phát hiện watermark, cho phép các hệ thống bên ngoài kiểm tra xem một đoạn văn bản có mang dấu hiệu được tạo bởi Claude hay không.

Khả năng phát hiện sẽ phụ thuộc vào mức độ chỉnh sửa nội dung. Theo Anthropic, những thay đổi nhỏ nhiều khả năng không loại bỏ hoàn toàn watermark. Tuy nhiên, nếu toàn bộ nội dung được viết lại với gần như tất cả từ ngữ được thay thế, dấu hiệu này có thể biến mất. Trong trường hợp đó, Anthropic cho rằng cũng khó còn xem văn bản ban đầu là nội dung hoàn toàn do AI tạo ra.

Đối với văn bản chỉ được Claude kiểm tra hoặc chỉnh sửa nhẹ, watermark có thể rất yếu hoặc không xuất hiện. Nếu phần lớn từ ngữ vẫn do người dùng viết và Claude chỉ thay đổi một số chi tiết nhỏ, hệ thống sẽ có rất ít nội dung để tạo mẫu watermark.

Code cũng là trường hợp đặc biệt. Anthropic cho biết watermark trong mã nguồn sẽ ít hơn văn bản thông thường vì mô hình phải ưu tiên tạo ra code hoạt động chính xác, thay vì tự do lựa chọn giữa nhiều cách diễn đạt tương đương. Watermark có thể xuất hiện ở những phần có nhiều lựa chọn hơn, chẳng hạn comment trong code, nhưng gần như không ảnh hưởng đến phần mã thực thi.

Anthropic cũng phân biệt watermark với các công cụ phát hiện nội dung AI hiện nay. Những hệ thống phát hiện AI thường tìm kiếm đặc điểm hoặc phong cách viết đặc trưng, trong khi watermark được tạo trực tiếp trong quá trình mô hình sinh văn bản và được xác định dựa trên một mẫu đã biết.

Công ty cho biết Claude sẽ không phải chatbot duy nhất áp dụng phương pháp này. Những nhà phát triển mô hình lớn khác đã ký cùng bộ quy tắc thực hành liên quan đến AI Act cũng dự kiến triển khai các cơ chế watermark riêng cho nội dung do AI tạo ra.