Giám đốc Microsoft thú nhận: AI là “vụ đánh cắp sức lao động lớn nhất lịch sử nhân loại”

Lời thừa nhận này của lãnh đạo Microsoft được công bố trong vụ kiện giữa tờ New York Times với Microsoft và OpenAI.

Một giám đốc Microsoft từng mô tả việc các mô hình AI thu thập nội dung để huấn luyện là “vụ đánh cắp sức lao động lớn nhất trong lịch sử nhân loại”. Điều đáng chú ý là phát biểu này xuất hiện trong chính những tài liệu nội bộ được đưa vào hồ sơ vụ kiện bản quyền giữa The New York Times với Microsoft và OpenAI.

Brent Hecht, Giám đốc khoa học ứng dụng của Microsoft, đưa ra nhận xét trên trong một bản ghi nhớ nội bộ vào tháng 1/2023. Theo hồ sơ được công khai, ông cho rằng hàng triệu người trên thế giới có thể xem việc các mô hình ngôn ngữ lớn “hút” toàn bộ công việc của họ vào hệ thống AI là một hành động “đánh cắp đáng kinh ngạc với quy mô chưa từng có”.

Tài liệu nội bộ cho thấy lời thừa nhận của ông Brent Hecht, Giám đốc khoa học ứng dụng của Microsoft

Những tài liệu này được The New York Times đưa ra trong hồ sơ pháp lý mới, nhằm đề nghị tòa án phán quyết rằng Microsoft và OpenAI phải chịu trách nhiệm về việc sao chép nội dung có bản quyền mà không được cho phép. Phía tờ báo cho rằng các tài liệu thu thập trong quá trình tố tụng cho thấy hai công ty hiểu rõ những tác động của việc sử dụng nội dung báo chí để huấn luyện AI.

Điểm đáng chú ý nằm ở sự khác biệt giữa những tranh luận nội bộ này và lập luận mà các công ty đưa ra trước công chúng. Microsoft và OpenAI cho rằng việc sử dụng dữ liệu có sẵn trên Internet để huấn luyện AI thuộc phạm vi “fair use”, tức một số trường hợp sử dụng tác phẩm có bản quyền được pháp luật cho phép.

Trong khi đó, các tài liệu được New York Times trích dẫn lại cho thấy chính những người phát triển công nghệ cũng nhận thức được khả năng AI có thể tác động trực tiếp đến ngành báo chí.

Greg Brockman, Chủ tịch kiêm đồng sáng lập OpenAI, từng viết trong một trao đổi năm 2020 rằng các mô hình AI đặc biệt giỏi dự đoán phần tiếp theo của những bài báo. Ông mô tả việc mô hình có thể hoàn thành chính xác câu đang viết dở trong một bài của New York Times và nhận xét rằng AI “rất giỏi” với các tác vụ liên quan đến tin tức.

Khả năng này đồng thời tạo ra một nghịch lý. Nội dung báo chí là nguồn dữ liệu quan trọng giúp AI học cách xử lý thông tin, nhưng khi chatbot ngày càng có khả năng trả lời trực tiếp câu hỏi của người dùng, chúng lại có thể khiến độc giả không cần truy cập vào trang web của các tờ báo.

Dữ liệu nội bộ của Microsoft được nêu trong hồ sơ vụ kiện cho thấy mức độ tác động này không chỉ là giả thuyết. Theo tài liệu, Copilot từng khiến tỷ lệ người dùng nhấp vào nội dung của New York Times giảm tới 93% so với Bing Search. Brent Hecht gọi đây là một “vòng xoáy đi xuống”, có khả năng ảnh hưởng đồng thời đến hiệu quả của các mô hình AI và toàn bộ hệ sinh thái web.

Trong khi báo chí là một trong những nguồn dữ liệu sạch đối với báo chí, nhưng giờ AI lại đang ăn vào lượt truy cập của báo chí

Một tài liệu khác được trích dẫn còn mô tả nghịch lý sâu hơn: sản phẩm AI đang đe dọa nền tảng kinh tế của chính những đơn vị cung cấp nội dung cho nó. Theo lập luận được ghi lại, đây là tình huống đặc biệt bởi một sản phẩm cuối cùng lại có khả năng làm suy yếu nguồn cung cấp nội dung cần thiết cho hoạt động của chính hệ thống AI.

Phía OpenAI cũng được cho là đã nhận thức được vấn đề này. Nick Turley, người đứng đầu ChatGPT, từng gọi chatbot là một “mối đe dọa sống còn” đối với các nhà xuất bản vì các hệ thống AI có khả năng thay thế ngày càng nhiều chức năng mà trước đây người dùng phải tìm đến các trang tin. Một nhà nghiên cứu OpenAI khác thậm chí nhận xét rằng người dùng sẽ không nhấp vào liên kết, dù các liên kết đó được hiển thị nổi bật.

Trong khi đó, Microsoft CEO Satya Nadella đưa ra một lập trường có phần cụ thể hơn về nội dung nằm sau tường phí. Trong lời khai được hồ sơ vụ kiện trích dẫn, ông cho rằng những nội dung bị khóa bằng paywall cần được cấp phép nếu muốn sử dụng cho việc huấn luyện hoặc làm dữ liệu nền cho AI. Nadella cũng nói rằng nếu biết OpenAI đã sử dụng nội dung phía sau paywall để huấn luyện mô hình, Microsoft sẽ yêu cầu công ty này huấn luyện lại.

Vụ kiện giữa New York Times với Microsoft và OpenAI bắt đầu vào cuối năm 2023, khoảng một năm sau khi ChatGPT ra mắt. Sau đó, nhiều tổ chức báo chí khác như New York Daily News, The Intercept và Center for Investigative Reporting cũng tham gia các vụ kiện liên quan.

Trọng tâm của cuộc tranh chấp là câu hỏi liệu việc thu thập hàng loạt tác phẩm có bản quyền trên Internet để xây dựng các mô hình AI có được xem là “fair use” hay không. Các công ty AI lập luận rằng việc sử dụng thông tin công khai để huấn luyện mô hình tương tự quá trình con người đọc sách và tài liệu để học hỏi. Ngược lại, các nhà văn, nhạc sĩ và nhiều người làm công việc sáng tạo cho rằng tác phẩm của họ đã bị sử dụng để xây dựng những công cụ có khả năng thay thế chính họ.

Tin cùng chuyên mục
Xem theo ngày