Tin AI

New York Times tố OpenAI giấu bằng chứng trong vụ kiện bản quyền ChatGPT

New York Times tố OpenAI giấu bằng chứng trong vụ kiện bản quyền ChatGPT

New York Times và Daily News cáo buộc OpenAI đã âm thầm thu thập và phân tích dữ liệu chat log cùng kho dữ liệu huấn luyện để dò tìm nội dung vi phạm bản quyền, trong khi liên tục nói với tòa rằng việc này là bất khả thi về mặt kỹ thuật.

Vụ kiện bản quyền kéo dài hai năm giữa New York Times, Daily News và OpenAI vừa leo thang thêm một bậc, khi hai tờ báo này cáo buộc OpenAI đã nói dối tòa án về khả năng tìm kiếm dữ liệu trong kho chat log của người dùng cũng như trong tập dữ liệu huấn luyện mô hình ChatGPT.

Xuyên suốt vụ kiện, OpenAI luôn lập luận rằng công ty không có khả năng kỹ thuật để rà soát toàn bộ kho dữ liệu huấn luyện khổng lồ của mình. Hãng cũng cho rằng việc tìm kiếm hay cung cấp dữ liệu từ hàng loạt cuộc trò chuyện của người dùng ChatGPT sẽ tốn nhiều công sức và ảnh hưởng đến quyền riêng tư, vì phải trích xuất, xử lý và ẩn danh hóa dữ liệu. Phía New York Times và Daily News muốn có dữ liệu này để chứng minh liệu các bài báo có bản quyền của họ có nằm trong tập huấn luyện của OpenAI hay không, và ChatGPT có thường xuyên tái tạo lại nội dung đó trong câu trả lời cho người dùng hay không.

Những tiết lộ gây bất ngờ từ nội bộ OpenAI

Theo hồ sơ điều trần hồi tháng 4 do tòa yêu cầu, kỹ sư bảo mật dữ liệu của OpenAI, ông Vinnie Monaco, được cho là đã tiết lộ rằng công ty thực chất đã tự thực hiện các đợt tìm kiếm và đánh giá nội bộ đối với kho dữ liệu huấn luyện để xác định sự hiện diện của các tác phẩm báo chí có bản quyền.

Đáng chú ý hơn, lời khai của ông Monaco còn cho thấy, ngay từ trước khi New York Times chính thức nộp đơn kiện, OpenAI đã âm thầm xây dựng một cơ sở dữ liệu gồm khoảng 78 triệu cuộc hội thoại ChatGPT đã được ẩn danh hóa, dùng để nội bộ đánh giá mức độ vi phạm bản quyền của công ty đối với các tác phẩm của bên khác. Không chỉ vậy, OpenAI còn được cho là đã triển khai một bộ lọc mang tên “Bloom” như một phần của công cụ nội bộ có tên “Project Giraffe”, nhằm phát hiện và ghi lại các trường hợp ChatGPT “lặp lại nguyên văn” (regurgitation) nội dung có sẵn – và việc này diễn ra ngay sau khi vụ kiện được nộp.

Cáo buộc cản trở quá trình thu thập bằng chứng

Hai tiết lộ trên đặc biệt quan trọng bởi ban đầu, nguyên đơn yêu cầu OpenAI cung cấp mẫu 120 triệu đoạn chat log, nhưng qua đàm phán, con số này đã giảm xuống chỉ còn 20 triệu. Đến tháng 12 năm ngoái, OpenAI mới nộp mẫu dữ liệu này cho tòa, nhưng bị cho là đã che (redact) quá nhiều thông tin đến mức tòa án nhận định mẫu dữ liệu này “không thể sử dụng được”.

Nguyên đơn cũng cáo buộc OpenAI đã xóa hàng tỷ output của ChatGPT sau khi vụ kiện được nộp – hành vi bị cho là vi phạm trực tiếp lệnh bảo toàn bằng chứng của tòa, đồng thời thay thế hàng triệu bản ghi trong mẫu dữ liệu được yêu cầu. Nói cách khác, phía nguyên đơn cho rằng OpenAI đã cố tình gây khó khăn không cần thiết để tiếp cận những thông tin mà thực chất công ty đã thu thập sẵn từ trước.

“Nếu OpenAI thực sự tin rằng việc sao chép nội dung báo chí của khách hàng chúng tôi là hợp pháp và thuộc phạm vi sử dụng hợp lý (fair use), thì họ đã không cần che giấu sự thật về việc đã làm điều đó,” ông Ian B. Crosby, luật sư trưởng đại diện nguyên đơn, tuyên bố.

Hiện New York Times và Daily News đang đề nghị thẩm phán xử phạt OpenAI vì hành vi được cho là giấu bằng chứng và can thiệp vào quá trình thu thập chứng cứ (discovery). Cụ thể, họ yêu cầu tòa không cho phép OpenAI sử dụng mẫu 20 triệu chat log làm bằng chứng vì cho rằng dữ liệu này không đáng tin cậy; công nhận rằng nếu có đầy đủ log, sẽ cho thấy mức độ lặp lại nội dung có bản quyền là rất lớn; không cho phép OpenAI lập luận rằng dữ liệu đã cung cấp không chứng minh được hành vi sao chép đáng kể; và buộc OpenAI chi trả phí pháp lý cho quá trình truy tìm bằng chứng này.

Về phía mình, người phát ngôn của OpenAI, ông Drew Pusateri, đã bác bỏ toàn bộ cáo buộc, đồng thời cho rằng New York Times đang cố tình xâm phạm quyền riêng tư của người dùng khi vụ kiện của họ ngày càng đuối lý. “Khi vụ kiện của Times ngày càng yếu đi và họ buộc phải rút một số cáo buộc, họ vẫn tiếp tục nỗ lực xâm phạm quyền riêng tư của những người không liên quan gì đến vụ kiện này, bằng cách đưa ra những cáo buộc sai sự thật trắng trợn,” ông Pusateri nói. “Chúng tôi sẽ tiếp tục bảo vệ quyền riêng tư của người dùng cũng như các nguyên tắc sử dụng hợp lý đã được thiết lập từ lâu.”


Nguồn tham khảo: AI News & Artificial Intelligence | TechCrunch — Biên tập bởi Cà Phê AI.

Không phải AI sẽ thay thế bạn, mà là những người biết dùng AI sẽ thay thế bạn.

— CÀ PHÊ AI
💡

Mẹo nhanh

Hãy bắt đầu với 1–2 công cụ AI phù hợp nhất với nhu cầu của bạn, sau đó mở rộng dần khi đã thành thạo.

Đăng nhập

Để Lưu lịch sử trò truyện và nhiều tính năng khác

Hoặc, đăng nhập với Google Account

Đăng ký tài khoản

Tạo tài khoản mới để bắt đầu