An toàn cho người dùng là cốt lõi trong sứ mệnh của Anthropic nhằm tạo ra các hệ thống AI đáng tin cậy, có thể giải thích và có thể điều hướng. Khi chúng tôi ra mắt những cách mới để mọi người tương tác với Claude, chúng tôi cũng dự kiến sẽ thấy xuất hiện các loại tổn hại tiềm ẩn mới, có thể thông qua việc tạo ra thông tin sai lệch, nội dung phản cảm, ngôn từ thù ghét hoặc các việc sử dụng sai khác. Chúng tôi đang tích cực đầu tư và thử nghiệm các tính năng an toàn bổ sung để hỗ trợ các nỗ lực an toàn mô hình hiện có và đang làm việc để cung cấp các công cụ hữu ích cho đông đảo công chúng trong khi cũng cố gắng hết sức để giảm thiểu hại. Việc ra mắt các sản phẩm mới ở dạng beta mở cho phép chúng tôi thử nghiệm, lặp lại và lắng nghe phản hồi của bạn. Dưới đây là một số tính năng an toàn mà chúng tôi đã giới thiệu:
-
Các mô hình phát hiện cảnh báo nội dung có khả năng gây hại dựa trên của chúng tôiChính sách sử dụng.
-
Bộ lọc an toàn trên các lời nhắc, có thể chặn các phản hồi từ mô hình khi các mô hình phát hiện của chúng tôi đánh dấu nội dung là có hại.
-
Các bộ lọc an toàn nâng cao, cho phép chúng tôi tăng độ nhạy của các mô hình phát hiện. Chúng tôi có thể tạm thời áp dụng các bộ lọc an toàn nâng cao cho những người dùng liên tục vi phạm chính sách của chúng tôi, và gỡ bỏ các kiểm soát này sau một thời gian không vi phạm hoặc vi phạm ít.
Những tính năng này không đảm bảo hoàn toàn, và chúng tôi có thể mắc lỗi do kết quả dương tính giả hoặc âm tính giả. Phản hồi của bạn về những biện pháp này và cách chúng tôi giải thích chúng cho người dùng sẽ đóng vai trò quan trọng trong việc giúp chúng tôi cải thiện các hệ thống an toàn này, và chúng tôi khuyến khích bạn liên hệ với chúng tôi tại[email protected]với bất kỳ phản hồi nào bạn có thể có. Để tìm hiểu thêm,đọc về những quan điểm cốt lõi của chúng tôi về an toàn AI.
Hỗ trợ tư vấn, đào tạo và chuyển giao giải pháp AI cho cá nhân, doanh nghiệp và tổ chức.

Liên hệ qua Zalo