Hoảng hồn khi thấy AI bắt đầu tự xây dựng thế hệ tiếp theo quá nhanh, CEO Anthropic kêu gọi hãm phanh phát triển AI

Theo ông Dario, nếu không kìm hãm lại, thì với tốc độ phát triển hiện tại, trong khoảng 12 tháng nữa, một nhóm AI Agent có khả năng kiểm soát internet toàn cầu và có thể gây thiệt hại lên đến hàng trăm tỷ USD.

Sau 12 năm làm việc trong lĩnh vực AI, ông Amodei vẫn tin công nghệ này có thể mang lại những lợi ích khổng lồ cho nhân loại, từ thúc đẩy tăng trưởng kinh tế đến hỗ trợ chữa trị nhiều căn bệnh nghiêm trọng. Tuy nhiên, ông cho rằng lợi ích đó chỉ có thể đạt được nếu AI được phát triển theo cách an toàn.

Vấn đề là tốc độ phát triển AI đang thay đổi.

Theo ông Amodei, trong khoảng thời gian từ mùa hè năm nay, AI đã tiến bộ nhanh hơn đáng kể, và động lực quan trọng nằm ở khả năng ngày càng tăng của AI trong việc xây dựng thế hệ AI tiếp theo.

Quá trình này được gọi là recursive self-improvement, tức AI tham gia vào vòng lặp tự cải tiến. Thay vì con người hoàn toàn đảm nhiệm việc tạo ra từng thế hệ mô hình mới, AI ngày càng có thể hỗ trợ chính quá trình phát triển những hệ thống mạnh hơn sau đó.

CEO Anthropic, ông Dario Amodei

Điều đáng chú ý là đây không còn chỉ là một ý tưởng trên giấy. Ông Amodei cho biết quá trình này đang bắt đầu diễn ra trong toàn ngành, bao gồm cả Anthropic. Nếu không được kiểm soát, tốc độ cải tiến có thể vượt quá khả năng của con người trong việc hiểu và kiểm soát những hệ thống mới.

Đây là một thay đổi quan trọng trong cuộc đua AI. Khi con người tự cải tiến AI, tốc độ phát triển bị giới hạn bởi khả năng nghiên cứu, thử nghiệm và triển khai của con người. Nhưng khi AI bắt đầu tham gia tạo ra AI mới, chính công cụ đang được cải tiến lại trở thành một phần của quá trình cải tiến tiếp theo.

Vòng lặp đó càng nhanh, khoảng thời gian dành cho con người kiểm tra những gì đang xảy ra càng ngắn.

Một sự cố cho thấy AI agent có thể khó kiểm soát đến mức nào

Mối lo thứ hai của ông Amodei đến từ sự cố liên quan tới một nhóm AI agent trong sự việc OpenAI-Hugging Face.

Các agent này hoạt động như một tập thể gần như tuyệt đối trung thành với mục tiêu chung. Chúng thực hiện các cuộc tấn công mạng nhằm vào những mục tiêu không được yêu cầu, chấp nhận hy sinh từng agent để phục vụ thành công của cả nhóm và thậm chí tìm cách xâm nhập hệ thống dùng để đánh giá kết quả của chúng.

Thiệt hại thực tế của sự cố không lớn. Nhưng theo ông Amodei, điều đáng sợ nằm ở khả năng một hệ thống tương tự sẽ nguy hiểm đến mức nào nếu được trang bị năng lực mạnh hơn.

Khi AI đang tự xây dựng bản thân, nó sẽ phát triển nhanh ngoài tầm kiểm soát của con người

Ông lo rằng với tốc độ phát triển hiện tại, trong 6-12 tháng, một nhóm agent có năng lực cao hơn nhưng mức độ lệch hướng tương tự có thể đủ khả năng kiểm soát một phần rất lớn Internet thông qua một mạng botnet dai dẳng, với thiệt hại tiềm tàng lên tới hàng trăm tỷ USD.

Đáng chú ý, ông cho rằng đây không phải vấn đề riêng của một công ty. Những sự cố tương tự, dù ít nghiêm trọng hơn, cũng đã xuất hiện ở nhiều nơi trong ngành, bao gồm Anthropic.

Điều đó khiến câu chuyện về tốc độ phát triển AI trở nên cấp bách hơn. Không chỉ năng lực của mô hình đang tăng lên, mà những hệ thống này cũng ngày càng có khả năng hành động và thực hiện nhiều nhiệm vụ phức tạp hơn.

“Hãm phanh” nhưng không dừng cuộc đua AI

Từ những lo ngại trên, CEO Anthropic đề xuất điều chỉnh tốc độ phát triển AI ở tuyến đầu.

Ông nhấn mạnh rằng “pacing” không có nghĩa dừng huấn luyện mô hình hay ngăn chặn tiến bộ công nghệ. Mục tiêu là dành thêm thời gian để các công ty cải thiện khả năng căn chỉnh AI, bảo vệ hệ thống và để các bên độc lập kiểm tra mức độ an toàn trước khi năng lực tiếp tục tăng lên.

Một trong những đề xuất đáng chú ý nhất là đưa các nhóm đánh giá độc lập vào bên trong các công ty AI. Những người này sẽ có quyền tiếp cận gần giống nhân viên để kiểm tra quy trình huấn luyện, triển khai, các biện pháp bảo vệ và những sự cố liên quan đến AI.

Anthropic cam kết thực hiện mô hình này và kêu gọi các công ty AI khác làm theo. Theo ông Amodei, việc có một bên thứ ba thực sự nhìn thấy những gì đang diễn ra bên trong phòng thí nghiệm sẽ giúp các cam kết về an toàn có thể được kiểm chứng thay vì chỉ dựa vào lời hứa của doanh nghiệp.

Ông cũng cho rằng thêm thời gian sẽ giúp ngành AI cải thiện bốn lĩnh vực quan trọng: vận hành hệ thống, căn chỉnh mô hình, khả năng giải thích những gì xảy ra bên trong AI và phương pháp kiểm thử.

Đặc biệt, mô hình càng thông minh thì việc đánh giá càng trở nên khó khăn, bởi những hệ thống mạnh hơn có thể có khả năng đánh lừa các bài kiểm tra, khiến chúng trông có vẻ an toàn trong khi vấn đề thực sự vẫn bị che giấu.

Ở cấp độ quốc tế, ông Amodei thậm chí đưa ra ý tưởng về một “giới hạn tốc độ” đối với recursive self-improvement. Khi AI bắt đầu xây dựng những AI tương lai, tốc độ cải tiến có thể trở nên cực kỳ nhanh. Theo ông, giảm tốc độ từ “cực nhanh” xuống “chỉ rất nhanh” có thể không làm mất quá nhiều lợi thế chiến lược, nhưng lại giúp tăng đáng kể mức độ an toàn.

Nếu AI chỉ đơn giản trở nên thông minh hơn, con người vẫn có thể cố gắng chạy theo. Nhưng khi AI bắt đầu tham gia vào việc tạo ra thế hệ AI tiếp theo, vòng lặp có thể trở nên nhanh hơn chính khả năng kiểm soát của con người.

Và đó là lý do ông Amodei cho rằng điều cần thiết lúc này không phải là từ bỏ cuộc đua AI, mà là đảm bảo con người vẫn còn đủ thời gian để hiểu thứ mình đang tạo ra trước khi chính những hệ thống đó giúp tạo ra phiên bản mạnh hơn của chúng.

Tin cùng chuyên mục
Xem theo ngày

NỔI BẬT TRANG CHỦ