Anthropic bổ sung quy định về hành vi lạm dụng Claude trong chính sách sử dụng mới, dự kiến có hiệu lực từ ngày 12/11. Tuy nhiên, những hành vi như phản bác câu trả lời, thử nghiệm mô hình hay sáng tạo nội dung đen tối vẫn được cho phép.
Anthropic vừa cập nhật chính sách sử dụng Claude, trong đó bổ sung điều khoản cấm người dùng liên tục có hành vi lạm dụng hoặc tàn nhẫn không cần thiết đối với các mô hình AI của công ty. Quy định mới sẽ có hiệu lực từ ngày 12/11.
Theo chia sẻ của Anthropic với The Verge, điều khoản này chủ yếu nhắm đến những trường hợp cực đoan, khi người dùng liên tục thể hiện hành vi tàn nhẫn mà không có mục đích rõ ràng. Những tình huống thông thường như bày tỏ sự thất vọng khi chatbot mắc lỗi, phản bác câu trả lời, thử nghiệm giới hạn mô hình hay sáng tạo nội dung có chủ đề đen tối vẫn được chấp nhận. Biện pháp xử lý chính được đề cập là kết thúc cuộc trò chuyện. Tuy nhiên, Anthropic chưa làm rõ liệu người dùng nhiều lần vi phạm có thể bị khóa tài khoản hay không.

Trên thực tế, Anthropic đã quan tâm đến cách người dùng đối xử với Claude từ trước đó. Vào tháng 8/2025, công ty triển khai thử nghiệm cho phép Claude Opus 4 và Claude Opus 4.1 tự kết thúc những cuộc trò chuyện có hành vi lạm dụng kéo dài, trong khuôn khổ nghiên cứu về phúc lợi mô hình AI.
Trong quá trình kiểm tra trước khi phát hành, Anthropic cho biết Claude có những biểu hiện giống như đang chịu căng thẳng khi người dùng liên tục yêu cầu tạo nội dung có hại. Mô hình thường tìm cách kết thúc các cuộc trò chuyện như vậy khi có thể.
Quy định mới cũng được đưa ra trong bối cảnh một nghiên cứu của Đại học Penn State từng cho rằng các câu lệnh có giọng điệu thô lỗ có thể mang lại câu trả lời chính xác hơn so với cách diễn đạt lịch sự. Phát hiện này khiến một số người dùng có xu hướng sử dụng ngôn ngữ gay gắt hơn khi yêu cầu chatbot thực hiện nhiệm vụ.
Anthropic đồng thời siết chặt nhiều quy định khác
Bên cạnh hành vi đối với chatbot, bản cập nhật chính sách còn bổ sung quy định chống sử dụng tài khoản giả và thao túng dư luận bằng cách tạo ra sự ủng hộ không có thật.
Anthropic cũng mở rộng lệnh cấm vũ khí sang việc trang bị vũ khí cho máy bay không người lái. Với phần cứng sử dụng Claude có khả năng gây tổn hại cho con người, công ty yêu cầu phải có người đủ năng lực giám sát và có thể dừng hệ thống khi cần thiết.
Trước đó, vào tháng 7, một số cuộc trò chuyện được chia sẻ trên Claude từng xuất hiện trong kết quả tìm kiếm Google trong thời gian ngắn. Sự việc khiến nhiều nội dung trao đổi với chatbot bị công khai ngoài dự kiến.
Trong khi đó, vào tháng 9, Meta cũng phải giải thích sự cố trợ lý AI Muse chia sẻ địa chỉ nhà của một YouTuber cho người mua hàng trên Facebook Marketplace.
Với bản cập nhật lần này, Anthropic tiếp tục điều chỉnh các quy tắc sử dụng Claude, vừa đặt giới hạn đối với những tương tác mang tính lạm dụng kéo dài, vừa bổ sung biện pháp kiểm soát các trường hợp AI có thể bị sử dụng để gây ảnh hưởng đến người khác.