Thẩm phán liên bang tại bang California vừa chính thức phê duyệt thỏa thuận dàn xếp trị giá 1,5 tỷ USD giữa Anthropic và nhóm tác giả cùng nhà xuất bản sách. Quyết định mang tính bước ngoặt này chấm dứt vụ kiện tập thể cáo buộc Anthropic vi phạm bản quyền khi huấn luyện mô hình Claude. Đây được ghi nhận là khoản bồi thường bản quyền lớn nhất từ trước đến nay trong lịch sử pháp lý Mỹ đối với một công ty AI.
Bối cảnh & Nguyên nhân
Vụ kiện bắt nguồn từ việc nhóm tác giả cáo buộc Anthropic tự ý tải xuống và lưu trữ hàng triệu tác phẩm có bản quyền để làm dữ liệu huấn luyện. Trước khi nghỉ hưu, Thẩm phán William Alsup đã đưa ra phán quyết sơ bộ xác định hành vi của Anthropic là bất hợp pháp. Điểm mấu chốt khiến Anthropic phải tìm kiếm thỏa thuận dàn xếp là nguồn gốc dữ liệu. Thay vì chỉ sử dụng sách mua hợp pháp, Anthropic bị phát hiện đã tải lượng lớn dữ liệu từ các trang web lậu như Library Genesis và Pirate Library Mirror.
Phân tích kỹ thuật & Công nghệ
Trong quy trình huấn luyện các mô hình Claude, Anthropic đã sử dụng một thư viện huấn luyện khổng lồ chứa hàng trăm ngàn tác phẩm văn học. Phán quyết của tòa án đã vạch ra một ranh giới công nghệ quan trọng: việc huấn luyện mô hình AI trên văn bản có bản quyền có thể được xem là "sử dụng hợp lý" (fair use). Tuy nhiên, hành vi thu thập thông tin đầu vào bằng cách tải trực tiếp từ các kho lưu trữ lậu lại cấu thành hành vi vi phạm độc lập. Anthropic buộc phải chấp nhận dàn xếp nhằm tránh một phiên tòa phân xử trực tiếp về nguồn gốc dữ liệu lậu này.
Ý kiến chuyên gia & Nhận định
Theo báo cáo từ TechCrunch, khoản bồi thường sẽ phân bổ 3.000 USD cho mỗi tác phẩm trong số khoảng 500.000 tác phẩm bị ảnh hưởng. Dù số tiền rất lớn, nhiều nhà sáng tạo nội dung vẫn không xem đây là một chiến thắng. Giới chuyên gia nhận định rằng việc tòa án công nhận huấn luyện AI là "sử dụng hợp lý" vô tình tạo tiền đề thuận lợi cho các công ty công nghệ tiếp tục khai thác dữ liệu sách, miễn là họ chứng minh được nguồn gốc tải về không phải từ các trang web lậu.
Tác động & Tương lai
Quyết định này khép lại vụ kiện của Anthropic nhưng không giải quyết triệt để rủi ro pháp lý cho toàn ngành công nghệ. Do vụ việc được dàn xếp ngoài tòa, nó không tạo thành tiền lệ pháp lý ràng buộc cho các tòa án khác. Hiện tại, hàng loạt vụ kiện tương tự vẫn đang bủa vây OpenAI, Meta, Midjourney và Google. Việc các nhà xuất bản lớn như Hachette hay Elsevier vừa tiếp tục kiện Google vì mô hình Gemini cho thấy cuộc chiến pháp lý xung quanh dữ liệu huấn luyện AI sẽ còn kéo dài và phức tạp hơn nữa.