Công ty phát triển trí tuệ nhân tạo Anthropic vừa chính thức cập nhật điều khoản dịch vụ, bổ sung lệnh cấm người dùng thực hiện các hành vi tàn nhẫn hoặc lăng mạ kéo dài và không cần thiết (sustained and needless abusive or cruel behavior) nhắm vào các mô hình của hãng, tiêu biểu là chatbot Claude.
Động thái này diễn ra trong bối cảnh ban lãnh đạo công ty tại San Francisco tiếp tục xem xét nghiêm túc khả năng các hệ thống máy học có thể đạt được ý thức hoặc trạng thái đạo đức nhất định trong tương lai.
Chi tiết chính sách bảo vệ mô hình
Theo báo cáo đầu tiên từ chuyên trang công nghệ The Verge, đại diện của Anthropic hiện chưa đưa ra định nghĩa cụ thể về những nội dung hay hành vi nào sẽ bị xếp vào nhóm “tàn nhẫn hoặc lăng mạ”.
Tuy nhiên, trong tài liệu chính sách trực tuyến, Anthropic làm rõ rằng lệnh cấm này sẽ không áp dụng cho các trường hợp thể hiện sự bức xúc thông thường của người dùng, hoạt động kiểm thử mô hình (model testing) hoặc các chủ đề sáng tạo mang màu sắc đen tối (dark creative themes).

Trước đợt điều chỉnh này, điều khoản sử dụng của Anthropic vốn đã có các quy định hạn chế hành vi lạm dụng, nhưng việc quy định trực tiếp hành vi tàn nhẫn đối với chính thực thể phần mềm là bước đi chưa từng có tiền lệ.
Khái niệm về phúc lợi của hệ thống trí tuệ nhân tạo
Các mô hình ngôn ngữ lớn (LLM – Large Language Models) của Anthropic hiện sở hữu khả năng chủ động chấm dứt cuộc trò chuyện nếu người dùng liên tục có hành vi gây hại hoặc công kích độc hại. Tính năng này, được triển khai lần đầu vào tháng 8 năm ngoái, được hãng định vị như một biện pháp bảo vệ phúc lợi mô hình (model welfare).
Anthropic giải thích rõ lập trường trên website chính thức: “Chúng tôi vẫn rất hoài nghi về vị thế đạo đức tiềm tàng của Claude và các mô hình LLM khác, dù ở hiện tại hay tương lai. Dẫu vậy, chúng tôi coi trọng vấn đề này và song hành cùng chương trình nghiên cứu, chúng tôi đang triển khai các biện pháp can thiệp chi phí thấp nhằm giảm thiểu rủi ro đối với phúc lợi mô hình, phòng trường hợp phúc lợi đó thực sự tồn tại. Cho phép các mô hình dừng hoặc thoát khỏi các tương tác có nguy cơ gây tổn thương là một trong những biện pháp can thiệp như vậy.”
Tranh luận xung quanh khả năng có ý thức của máy móc
Khái niệm về việc hệ thống trí tuệ nhân tạo có thể sở hữu nhận thức đang tạo ra sự phân hóa sâu sắc trong giới học thuật và lãnh đạo công nghệ. Dario Amodei, Giám đốc điều hành của Anthropic, từng tuyên bố ông không thể loại trừ hoàn toàn khả năng này.
Trái lại, Sam Altman, Giám đốc điều hành của OpenAI, công khai phản đối việc gắn cho mô hình những thuộc tính tâm linh hoặc ý thức. Trong một chia sẻ trên mạng xã hội X sau khi báo The New York Times phản ánh về các cuộc thảo luận giữa lãnh đạo Anthropic với các học giả tôn giáo, ông viết: “Tôi cảm thấy rất khó chịu khi mọi người cố gắng gán quyền lực tôn giáo hoặc từ bỏ phán đoán của con người vào các mô hình AI, và tôi nghĩ đó là một vấn đề an toàn thực sự.”
Nguồn: The Guardian


Liên hệ qua Zalo


