Các mô hình Claude trong tương lai sẽ tạo ra văn bản có chứa watermark - một cách để xác định khả năng Claude đã tham gia viết văn bản đó. Đây là thay đổi mà Anthropic, cùng với một số nhà cung cấp AI lớn khác, đang triển khai để tuân thủ EU AI Act (Đạo luật AI của Liên minh châu Âu).
Trong bài này, Anthropic trả lời một số câu hỏi thường gặp về cách phương pháp watermark mà họ chọn hoạt động, việc này có ảnh hưởng đến đầu ra của Claude hay không, và lý do vì sao họ thực hiện thay đổi này. Tóm tắt:
- Phương pháp watermark được sử dụng không gây ảnh hưởng thực tế nào đến chất lượng hay nội dung đầu ra của Claude;
- Người đọc sẽ không thể phân biệt được văn bản có watermark và không có watermark;
- Không có gì được thêm vào văn bản, và không tồn tại ký tự ẩn nào;
- Watermark không tốn thêm token, do đó không làm tăng chi phí;
- Watermark không mang bất kỳ thông tin định danh nào và không thể truy ngược về một cá nhân, tổ chức, hay cuộc trò chuyện cụ thể;
- Watermark không phải là thứ riêng của Claude. Kể từ ngày 2/8/2026, EU yêu cầu các nhà cung cấp AI phục vụ thị trường của họ phải đánh dấu nội dung do AI tạo ra. Các nhà phát triển mô hình lớn khác cũng đã ký cùng Bộ Quy tắc Ứng xử (Code of Practice) này và sẽ triển khai watermark của riêng họ.
Watermark là gì?
Phần tiêu đề “Watermark là gì?”Các mô hình ngôn ngữ lớn như Claude hoạt động bằng cách tạo ra từng từ một. Mỗi khi mô hình quyết định từ tiếp theo, nó chọn trong một danh sách các ứng viên tiềm năng, và cuối cùng chọn ra từ hợp lý hoặc có khả năng cao nhất dựa trên phần văn bản trước đó. Lấy ví dụ câu “Thời tiết hôm nay lạnh và…”. Từ tiếp theo khó có khả năng là “ngọt ngào.” Nhưng lại khá có khả năng là “âm u” hoặc “xám xịt.” Trong hầu hết trường hợp, việc mô hình chọn từ nào trong hai từ sau không quan trọng lắm với người đọc - ý nghĩa của câu về cơ bản vẫn giống nhau. Trong những trường hợp như vậy, lựa chọn được quyết định bởi một số ngẫu nhiên.
Watermark hoạt động bằng cách tận dụng chính những lựa chọn “không quan trọng” đó - vì chúng xảy ra rất nhiều lần trong một đoạn văn bản - để âm thầm cài một khuôn mẫu vào các câu trả lời của Claude. Người đọc bình thường sẽ không nhận ra khuôn mẫu này, nhưng ai đang giữ một “key” bí mật (do Anthropic tạo ra) thì có thể nhận ra được. Cách làm cụ thể là: thay vì để máy tính tung “xúc xắc” hoàn toàn ngẫu nhiên mỗi khi chọn từ tiếp theo, hệ thống dùng chiếc key đó kết hợp với vài từ đứng ngay trước để quyết định phần “ngẫu nhiên” ấy. Kết quả là các từ Claude chọn ra nhìn bề ngoài vẫn ngẫu nhiên như bình thường, nhưng nếu ai đó có key, họ có thể đối chiếu xem chuỗi từ này có “khớp” với những gì key sẽ tạo ra hay không - càng khớp nhiều, càng có khả năng văn bản đó do Claude viết.
Điều quan trọng cần lưu ý là điều này không có nghĩa mô hình giờ đây sẽ luôn thiên về chọn “âm u” hay “xám xịt.” Cũng giống như văn bản không có watermark, “âm u” có thể được chọn ở câu này, “xám xịt” ở câu khác, tuỳ vào các từ đứng trước. Và cũng không phải watermark buộc Claude chọn một từ mà nó vốn sẽ không cân nhắc (chẳng hạn, nó sẽ không khiến Claude chọn một từ như “nubilous” - một từ đồng nghĩa hiếm gặp1 với “âm u” hay “xám xịt” mà Claude gần như chắc chắn sẽ không dùng trong điều kiện bình thường).
Watermark ảnh hưởng thế nào đến đầu ra của Claude?
Phần tiêu đề “Watermark ảnh hưởng thế nào đến đầu ra của Claude?”Watermark không ảnh hưởng đến chất lượng đầu ra của Claude. Đối với người đọc, một câu trả lời có watermark không thể phân biệt được với một câu trả lời không có watermark (theo cách này, watermark AI khác biệt đáng kể so với watermark cùng tên trên tiền giấy, các vật thể vật lý khác, và một số tài liệu số - vốn có thể nhìn thấy bằng mắt thường).
Qua các thử nghiệm nội bộ, Anthropic nhận thấy watermark không làm thay đổi nội dung, độ sáng tạo, hay khiến văn bản của Claude khó đọc hơn. Google DeepMind - nhóm nghiên cứu công bố kỹ thuật SynthID-Text mà Anthropic đang sử dụng - cũng từng kiểm tra điều này theo cách rất thực tế: họ cho một phần người dùng Gemini dùng thử phiên bản có watermark, rồi so sánh xem người dùng bấm “thích” hay “không thích” câu trả lời có khác biệt gì so với phiên bản không có watermark hay không. Kết quả là không có khác biệt đáng kể nào. Ngoài ra, trong một thử nghiệm khác, khi cho người đánh giá đọc song song hai câu trả lời - một có watermark, một không - họ cũng không nhận ra được sự khác biệt nào về chất lượng.
Một cách ví von hữu ích: hãy tưởng tượng bạn đang chơi một trò chơi như Cờ tỷ phú (Monopoly). Mỗi lượt, mỗi người chơi di chuyển một số ô ngẫu nhiên theo kết quả tung xúc xắc. Giả sử, thay vì tung xúc xắc để tạo ra tính ngẫu nhiên này, chúng ta quyết định dùng một cuốn sách ghi các chữ số của số pi.2 Ta bắt đầu từ một chữ số được chọn ngẫu nhiên (giả sử là chữ số thứ 1.012.845 sau dấu phẩy, tình cờ là số 6), và từ đó, mỗi người chơi chỉ đơn giản dùng chữ số tiếp theo trong dãy làm kết quả “tung xúc xắc” của mình.
Xét về mọi mục đích thực tế, các bước di chuyển vẫn ngẫu nhiên: nó không tạo ra khác biệt nào cho người chơi - hay cho kết quả trò chơi - dù tính ngẫu nhiên đến từ số pi hay từ việc tung xúc xắc thật mỗi lần. Nhưng nếu sau ván chơi, ta có thể nhìn thấy toàn bộ chuỗi các bước di chuyển (và biết giá trị của số pi), ta có thể xác định liệu đây có phải là ván chơi dùng số pi để quyết định các bước đi hay không. Ván chơi dùng số pi, theo một nghĩa nào đó, đã được “gắn watermark.”
Điều tương tự cũng đúng với văn bản do Claude tạo ra. Watermark không thay đổi ý nghĩa hay trải nghiệm của người đọc, nhưng nếu bạn muốn kiểm tra sau đó liệu văn bản có khả năng được Claude tạo ra hay không, watermark cho phép bạn làm điều đó.
Anthropic dùng phương pháp watermark cụ thể nào?
Phần tiêu đề “Anthropic dùng phương pháp watermark cụ thể nào?”Watermark văn bản của Claude là một phiên bản của phương pháp SynthID-Text do Google DeepMind công bố trong một bài báo trên tạp chí Nature năm 2024. Nó thuộc một họ phương pháp có nguồn gốc từ đề xuất của Scott Aaronson năm 2022, tất cả đều chia sẻ cùng nguyên tắc thiết kế đã mô tả ở trên - watermark chỉ thay đổi nguồn gốc của tính ngẫu nhiên dùng để chọn giữa các từ.
Cách này cũng có những giới hạn nhất định. Với key của Anthropic, người ta chỉ có thể trả lời được câu hỏi “Văn bản này có khả năng được Claude viết (một phần) hay không?” - chứ không thể khẳng định chắc chắn văn bản có phải do con người viết hay không, và cũng không thể nhận diện được văn bản do một AI khác tạo ra (kể cả khi AI đó cũng gắn watermark, nó sẽ dùng key riêng, thậm chí là một cách gắn watermark hoàn toàn khác). Cách này cũng kém chính xác hơn với những đoạn văn bản rất ngắn, vì càng ít từ thì càng ít “dấu vết” để đối chiếu. Ngược lại, văn bản càng dài, độ tin cậy của kết quả kiểm tra càng cao.
Watermark thưa hơn trên các đoạn văn bản mang tính sự kiện (factual), nơi có ít lựa chọn từ mà không làm giảm độ chính xác của văn bản. Ví dụ, lấy câu “Tác phẩm nổi tiếng nhất của Isaac Newton có tên là Principia…”. Từ tiếp theo bắt buộc phải là “Mathematica” (đó là đáp án đúng duy nhất), nên watermark sẽ không có gì để tác động vào. Điều tương tự cũng đúng với việc hiệu đính (proofreading). Nếu bạn đưa Claude một đoạn văn và yêu cầu nó chỉ sửa ngữ pháp và dấu câu mà không thay đổi gì khác, watermark chỉ có thể tồn tại trong một số ít chỗ sửa, và có thể quá ít để có thể phát hiện được.
Điều gì xảy ra khi Claude hiệu đính hoặc chỉnh sửa văn bản của con người?
Phần tiêu đề “Điều gì xảy ra khi Claude hiệu đính hoặc chỉnh sửa văn bản của con người?”Watermark chỉ áp dụng cho những từ do Claude chọn. Khi Claude hiệu đính một văn bản do người viết, những gì nó trả lại thường chỉ được chỉnh sửa nhẹ; vì gần như toàn bộ các từ vẫn là của người viết, nên có rất ít (nếu có) chỗ để watermark bám vào. Tuỳ vào độ dài văn bản và mức độ Claude chỉnh sửa, những thay đổi đó có thể không đủ để khiến sự tham gia của Claude được phát hiện. Claude viết càng nhiều, nó càng phải đưa ra nhiều quyết định, và càng có nhiều không gian cho watermark.
Còn với code thì sao?
Phần tiêu đề “Còn với code thì sao?”Như đã nói ở trên, watermark AI tận dụng những quyết định mà bất kỳ lựa chọn từ nào cũng tốt như nhau. Ở những nơi cần một đầu ra chính xác - nơi không có sự lựa chọn, và một thuật ngữ khác sẽ khiến nội dung sai về mặt sự kiện hoặc khiến một đoạn code bị lỗi - watermark sẽ không được áp dụng.
Ví dụ, sau khi mô hình đã viết “2 + 2 =”, token tiếp theo gần như luôn chỉ có một đáp án đúng: “4” - không có từ nào khác “tốt ngang” để cân nhắc thay thế. (Có một ngoại lệ vui: nếu ngữ cảnh đang nói về tiểu thuyết Nineteen Eighty-Four của George Orwell - nơi khẩu hiệu tuyên truyền của chế độ toàn trị trong truyện là “2 + 2 = 5” - thì lúc đó đáp án đúng duy nhất lại là “5”. Nhưng đây vẫn chỉ là một đáp án đúng duy nhất, chỉ khác ngữ cảnh mà thôi.) Vì không có “lựa chọn ngang sức” nào để tận dụng, watermark sẽ không can thiệp vào những chỗ như thế này. Vì lý do tương tự, code - vốn trong rất nhiều trường hợp phải chính xác tuyệt đối - nhìn chung có ít watermark hơn so với một số dạng văn bản khác.
Tuy vậy, ở những chỗ có lựa chọn tuỳ ý giữa các từ hoặc thuật ngữ cụ thể trong code, watermark vẫn có thể được sử dụng, chẳng hạn như trong các comment (chú thích) trong code. Nhưng theo định nghĩa, nó sẽ có tác động không đáng kể đến phần code thực sự được tạo ra.
Điều này có ý nghĩa gì với người dùng?
Phần tiêu đề “Điều này có ý nghĩa gì với người dùng?”Việc này có làm chậm mô hình, hay khiến nó đắt hơn không?
Phần tiêu đề “Việc này có làm chậm mô hình, hay khiến nó đắt hơn không?”Không. Watermark có tác động không đáng kể đến tốc độ của mô hình, và vì nó không tạo ra token nào thêm, chi phí phục vụ và sử dụng mô hình vẫn giữ nguyên.
Watermark có thể bị truy ngược về tôi hoặc tổ chức của tôi không?
Phần tiêu đề “Watermark có thể bị truy ngược về tôi hoặc tổ chức của tôi không?”Không. Watermark áp dụng cho Claude và các đầu ra của nó. Nó không định danh bất cứ điều gì liên quan đến người dùng cá nhân. Không có gì trong watermark, hay trong khoá của nó, cho phép bất kỳ ai khôi phục thông tin về người dùng, tổ chức của họ, hay các cuộc trò chuyện của họ với Claude.
Vì sao Anthropic gắn watermark cho đầu ra của Claude?
Phần tiêu đề “Vì sao Anthropic gắn watermark cho đầu ra của Claude?”Anthropic đang triển khai watermark để tuân thủ EU AI Act. Anthropic, cùng với một số nhà cung cấp mô hình AI lớn khác và khoảng 190 bên ký kết tổng cộng, đã ký Bộ Quy tắc Ứng xử của EU về Minh bạch Nội dung do AI Tạo ra (EU Code of Practice on Transparency of AI-Generated Content) vào tháng 7/2026. Quy tắc này yêu cầu các nhà cung cấp hệ thống AI phải sử dụng các phương pháp “đánh dấu” văn bản do AI tạo ra. Anthropic áp dụng watermark trên toàn cầu ngay từ khi ra mắt vì hiện tại chưa có cách bền vững để giới hạn nó theo khu vực. Tuy nhiên, Anthropic sẽ tiếp tục đánh giá các phương án khác nhau, và sẽ chia sẻ cập nhật khi có.
Các câu hỏi khác
Phần tiêu đề “Các câu hỏi khác”Làm sao để kiểm tra một đoạn văn bản có phải do Claude viết hay không?
Phần tiêu đề “Làm sao để kiểm tra một đoạn văn bản có phải do Claude viết hay không?”Anthropic sẽ sớm cung cấp một API phát hiện watermark (watermark detection API). Họ hiện đang trong quá trình hoàn thiện chi tiết triển khai.
Còn hình ảnh và các loại tệp khác thì sao?
Phần tiêu đề “Còn hình ảnh và các loại tệp khác thì sao?”Khi Claude tạo ra một tệp thuộc loại được hỗ trợ (như .png, .jpg, hoặc .svg), nó sẽ đính kèm một “nhãn xác thực nội dung” - hiểu đơn giản là một dòng ghi chú nhỏ, được “niêm phong” bằng mật mã, giấu trong phần thông tin ẩn (metadata) của tệp, cho biết tệp này được Claude tạo ra hoặc xử lý. Đây không phải là công nghệ riêng của Anthropic mà là một chuẩn mở của cả ngành công nghiệp, tên là C2PA - chuẩn này cũng được các hãng máy ảnh và phần mềm chỉnh sửa ảnh dùng để ghi lại nguồn gốc của một bức ảnh. Bất kỳ công cụ nào hỗ trợ C2PA cũng đọc được nhãn này; Anthropic cũng sẽ cung cấp một công cụ riêng để bạn kéo-thả tệp vào và kiểm tra.
Metadata này rất khác với watermark. Không có gì trong tệp bị thay đổi - nó không được nhúng hay giấu đi. Cũng giống như với văn bản, credential chỉ cho biết Claude đã tham gia tạo ra tệp; nó không chứa bất kỳ thông tin định danh nào.
Liệu có thể chỉnh sửa văn bản để né watermark không?
Phần tiêu đề “Liệu có thể chỉnh sửa văn bản để né watermark không?”Ở một mức độ nào đó, có thể. Chỉnh sửa nhẹ khó có thể xoá hoàn toàn watermark; nhưng viết lại toàn bộ, thay mọi từ, thì có thể. Trong trường hợp sau, dĩ nhiên, việc văn bản đó còn có thể được gọi là “do AI tạo ra” hay không cũng là điều đáng bàn.
Watermark thực sự chứng minh được điều gì?
Phần tiêu đề “Watermark thực sự chứng minh được điều gì?”Watermark chỉ có thể xác định rằng Claude nhiều khả năng đã tham gia vào nội dung ở một thời điểm nào đó. Nó không thể phân biệt giữa “Claude viết cái này” và “Claude chỉnh sửa nhiều cái này.”
Watermark có áp dụng cho bản dịch không?
Phần tiêu đề “Watermark có áp dụng cho bản dịch không?”Có. Một bản dịch do Claude thực hiện sẽ mang watermark, vì trong trường hợp này mọi từ đều do Claude lựa chọn.
Còn các mô hình Claude cũ hơn thì sao?
Phần tiêu đề “Còn các mô hình Claude cũ hơn thì sao?”Luật của EU có một giai đoạn chuyển tiếp cho các mô hình Anthropic ra mắt trước ngày 2/8/2026, và Anthropic đang nỗ lực bổ sung watermark cho các mô hình đó. Việc này sẽ được triển khai dần trong những tháng tới.
Điều này khác gì với các phần mềm phát hiện AI, như Pangram?
Phần tiêu đề “Điều này khác gì với các phần mềm phát hiện AI, như Pangram?”Các công cụ như Pangram làm việc theo một cách hoàn toàn khác, vì họ không có key của Anthropic. Thay vào đó, họ “đoán” bằng cách nhận diện những thói quen viết đặc trưng của AI - có những khá rõ ràng, có những rất tinh vi. Chẳng hạn, các mô hình AI có xu hướng thích dùng cấu trúc câu kiểu “đây không phải là [X], mà là [Y]”, hay dùng từ “quietly” (lặng lẽ) nhiều hơn hẳn mức bình thường. Đó là kiểu đoán dựa trên văn phong, khác hẳn về bản chất so với việc kiểm tra một watermark thực sự.
Việc này có thay đổi quyền sở hữu đầu ra, hay ai chịu trách nhiệm pháp lý cho nó không?
Phần tiêu đề “Việc này có thay đổi quyền sở hữu đầu ra, hay ai chịu trách nhiệm pháp lý cho nó không?”Không. Watermark chỉ giúp kiểm tra xem Claude có khả năng đã tạo ra hoặc xử lý nội dung đó hay không. Nó không nói gì về quyền sở hữu hay quyền tác giả, và không thay đổi quyền của người dùng theo điều khoản sử dụng của Anthropic. Anthropic chỉ áp dụng watermark khi Claude tham gia xử lý nội dung hoặc tệp đó.
Chú thích
Footnotes
Phần tiêu đề “Footnotes”-
Hay nói cách khác, “nubilous” - một từ đồng nghĩa khác của “obscure” (hiếm gặp/khó hiểu). ↩
-
Số pi về mặt kỹ thuật là có thể dự đoán được, nhưng bất kỳ dãy chữ số nào lấy từ giữa số pi cũng không thể phân biệt được với một dãy kết quả tung xúc xắc 10 mặt. Ngoài ra, phép ví von này cũng chưa hoàn hảo vì xúc xắc trong Cờ tỷ phú chỉ có giá trị từ 1 đến 6, trong khi một chữ số của pi có thể từ 0 đến 9. ↩
Bài viết đã được dịch, biên tập và kiểm tra nội dung bởi Phuc Tran.
lượt xem