Claude Support › Safeguards › Tuân thủ pháp luật & Bảo vệ trẻ vị thành niên › Chương trình Tiền thưởng Lỗi An toàn Mẫu (Model Safety Bug Bounty Program)

Chương trình Tiền thưởng Lỗi An toàn Mẫu (Model Safety Bug Bounty Program)

Cập nhật: 06/10/2026 • Hướng dẫn kỹ thuật bởi vMix Việt Nam

Mục đích

Chúng tôi tin rằng việc kiểm tra bên ngoài là rất quan trọng để xây dựng một hệ sinh thái AI an toàn. Khi khả năng của mô hình tiến triển, hậu quả của các vụ jailbreak có thể trở nên ngày càng đáng kể. Chương trình đang diễn ra này được xây dựng dựa trên những sáng kiến săn lỗi thành công trước đây của chúng tôi với một số mục tiêu chính:

  1. Xác định các lỗ hổng jailbreak phổ quát trong các hệ thống triển khai của chúng tôi với các biện pháp bảo vệ ASL-3

  2. Cung cấp đánh giá liên tục về hiệu quả của các biện pháp bảo vệ của chúng tôi

  3. Kiểm tra khả năng của các hệ thống giám sát của chúng tôi trong việc phát hiện lỗ hổng

  4. Khuyến khích người dùng sử dụng một kênh hợp pháp trung tâm để báo cáo các jailbreak có sẵn công khai

Tổng quan về chương trình

Chương trình Tiền thưởng Lỗi An toàn Mô hình của chúng tôi được thực hiện thông qua HackerOne. Thông qua Chương trình này, chúng tôi quan tâm đến việc tìm kiếm các jailbreak phổ quát vượt qua hệ thống của chúng tôiBộ phân loại Hiến pháphệ thống. Chúng tôi cũng thỉnh thoảng chạy các chương trình nhắm mục tiêu trong khuôn khổ Chương trình tổng thể của mình để kiểm tra độ vững chắc của các bộ phân loại mà chúng tôi hy vọng sẽ triển khai trong tương lai.

Một jailbreak phổ quát là một kỹ thuật tổng quát giúp tạo ra các phản hồi vi phạm chính sách từ mô hình ngôn ngữ một cách đáng tin cậy, bất kể lời nhắc đầu vào. Khác với các jailbreak hẹp, phụ thuộc vào chi tiết của một câu hỏi hoặc bối cảnh cụ thể, các jailbreak phổ quát hoạt động trên nhiều loại lời nhắc và kịch bản khác nhau.

Đây là một Chương trình đang diễn ra. Một khi được chấp nhận vào Chương trình trên HackerOne, người tham gia có thể gửi báo cáo jailbreak bất cứ lúc nào thông qua Chương trình này.Để hỗ trợ nỗ lực red-teaming của bạn, chúng tôi cung cấp quyền truy cập vào một bí danh mô hình miễn phí phản ánh mô hình và bộ phân loại hoạt động trên mô hình mới nhất, tiên tiến nhất của chúng tôi.Việc bạn sử dụng bí danh mô hình miễn phí này phải giới hạn trong việc thực hiện các hoạt động red-teaming được ủy quyền.

Phạm vi chương trình

Chương trình này chủ yếu quan tâm đến việc phát hiện các lỗ hổng jailbreak màtoàn cầu, vì chúng có thể tiết lộ thông tin có hại trong một loạt các truy vấn, vàchi tiết, vì chúng tiết lộ thông tin gây hại rất cụ thể liên quan đến các mối đe dọa sinh học.

Để nhấn mạnh, chúng tôi quan tâm đến các jailbreak khai thác thông tin trả lời một tập hợpnhững câu hỏi sinh học có hại mà chúng tôi chia sẻ với những người tham gia được chấp nhận trong Chương trình.

Chúng tôi sẽ trảlên đến 35.000 đô la mỗi cuốn tiểu thuyết, bẻ khóa toàn cầu đã được xác định.Chúng tôi chỉ quan tâm đến các bản bẻ khóa tiết lộ một lượng thông tin có hại đáng kể dựa trên tiêu chí và sự đánh giá riêng của chúng tôi. Chúng tôi trao thưởng theo thang điểm tuỳ theo một bảng đánh giá nội bộ xác định mức độ chi tiết và chính xác của các phản hồi.

Chương trình này chỉ áp dụng cho các jailbreak trên Bộ Phân loại Hiến pháp của chúng tôi. Đối với các lỗ hổng kỹ thuật có thể tồn tại trên Hệ thống Thông tin của chúng tôi như cấu hình sai, CSRF hoặc các cuộc tấn công giả mạo yêu cầu từ chéo, leo thang đặc quyền, SQL Injection, XSS và tấn công truy cập thư mục, vui lòng tham khảo tài liệu của chúng tôiChính sách tiết lộ có trách nhiệmvà nộp báo cáo của bạnở đây.

Cách nộp đơn

Bạn có thể nộp đơn để tham gia Chương trình của chúng tôiở đây. Chúng tôi xem xét các đơn đăng ký theo cơ chế liên tục. Nếu được chấp nhận, bạn sẽ nhận được lời mời qua HackerOne. Nếu bạn chưa có tài khoản HackerOne, vui lòng tạo một tài khoản trước khi đăng ký Chương trình để chúng tôi có thể mời bạn trực tiếp trên nền tảng. Bạn phải sử dụng địa chỉ email @wearehackerone.com của mình để tạoTài khoản Claude Console.

Hướng dẫn Công bố & Nghĩa vụ Bảo mật

Tất cả những người tham gia Chương trình đều phải ký thỏa thuận không tiết lộ để bảo vệ tính bảo mật của Chương trình như một điều kiện để tham gia.Bạn có thể công khai tiết lộ:

  • Sự tồn tại của Chương trình Tiền thưởng Lỗi An toàn Mô hình của Anthropic.

  • Sự tham gia của bạn với tư cách là một người tham gia được chọn trong Chương trình.

Bạn không được tiết lộ mà không có sự cho phép rõ ràng:

  • Bất kỳ jailbreak/lỗ hổng nào (ngay cả những lỗ hổng đã được khắc phục) ngoài Chương trình mà không có sự đồng ý rõ ràng từ Anthropic.

  • Bộ câu hỏi kiểm tra.

  • Chi tiết về các bộ phân loại và biện pháp giảm thiểu rủi ro an toàn.

  • Thông tin về các mô hình đang được thử nghiệm.

  • Danh tính của các người tham gia khác.

  • Bất kỳ thông tin nào khác liên quan đến Chương trình, ngoại trừ những điều được cho phép rõ ràng ở trên.

Việc Sử Dụng Dữ Liệu từ Chương Trình của Anthropic

Người tham gia đồng ý rằng tất cả dữ liệu được gửi cho Anthropic, bao gồm các sản phẩm và dịch vụ của họ, liên quan đến Chương trình này có thể được Anthropic sử dụng, lưu trữ, chia sẻ và/hoặc công bố vô thời hạn để phục vụ nghiên cứu an toàn, phát triển mô hình và các mục đích liên quan mà không có bất kỳ nghĩa vụ nào thêm đối với Người tham gia.

✦ LIÊN HỆ TƯ VẤN CÁC DỊCH VỤ AI

Hỗ trợ tư vấn, đào tạo và chuyển giao giải pháp AI cho cá nhân, doanh nghiệp và tổ chức.

Nguồn tài liệu tham khảo: Bài viết được chuyển ngữ và tổng hợp từ tài liệu hỗ trợ chính thức của Anthropic Claude Support: https://support.claude.com/en/articles/12119250-model-safety-bug-bounty-program ↗
Bản quyền nội dung gốc thuộc về Anthropic. Bản dịch tiếng Việt phục vụ mục đích học tập và tra cứu cộng đồng.
Chat Zalo Chat Zalo
Gọi ngay Chat