VIỆN CÔNG NGHỆ VÀ ĐÀO TẠO DEVMASTER
Đào tạo - Phần mềm - Cho thuê nhân sự
VIỆN CÔNG NGHỆ VÀ ĐÀO TẠO DEVMASTER
Đào tạo - Phần mềm - Cho thuê nhân sự
Nếu phải dạy một cỗ máy phân biệt đúng – sai, bạn sẽ đưa cho nó một cuốn sổ nội quy dày 1.000 trang bắt học thuộc, hay dạy nó hiểu vì sao có những việc không nên làm?

Một mô hình AI được huấn luyện trên lượng dữ liệu khổng lồ từ internet, nên nó "biết" cả điều hay lẫn điều dở. Câu hỏi khó là: làm sao để nó hữu ích với người dùng nhưng vẫn từ chối những yêu cầu nguy hại?
Cách làm phổ biến trước đây là RLHF – học tăng cường từ phản hồi của con người. Hàng nghìn người được thuê để đọc, so sánh và chấm điểm câu trả lời của AI, trong đó có cả những nội dung độc hại. Cách này tốn kém, chậm và gây áp lực tâm lý cho chính người gán nhãn. Tệ hơn, mô hình học xong thường trả lời né tránh, kiểu "Tôi không thể giúp việc này" mà không giải thích lý do – an toàn đấy, nhưng vô dụng.
Tháng 12/2022, nhóm nghiên cứu của Anthropic công bố bài báo Constitutional AI: Harmlessness from AI Feedback. Ý tưởng cốt lõi: thay vì để con người gán nhãn từng câu trả lời có hại, con người chỉ cần viết ra một danh sách nguyên tắc – gọi là "hiến pháp" – và để AI tự đối chiếu với danh sách đó.
Hãy hình dung một học sinh làm bài xong, tự đọc lại theo barem chấm điểm rồi sửa bài của mình. Quy trình gồm hai giai đoạn:
Kết quả theo nghiên cứu: một trợ lý vô hại nhưng không né tránh – nó vẫn tham gia trao đổi với câu hỏi nhạy cảm và giải thích vì sao nó phản đối, thay vì đóng cửa im lặng. Đồng thời, việc phải xem hàng loạt nội dung độc hại của con người giảm đi đáng kể.

Theo giải thích của Anthropic năm 2023, các nguyên tắc không do một nhóm nhỏ tự nghĩ ra, mà tham khảo từ nhiều nguồn: Tuyên ngôn Quốc tế Nhân quyền của Liên Hợp Quốc, các điều khoản dịch vụ của nền tảng công nghệ, nguyên tắc của các phòng nghiên cứu AI khác và cả góc nhìn ngoài văn hóa phương Tây.
Một lợi ích ít được nói tới: minh bạch. Khi nguyên tắc được viết ra thành văn bản, chúng ta có thể đọc, tranh luận và chỉnh sửa, thay vì để giá trị của AI ẩn trong hàng triệu nhãn chấm điểm rời rạc.

Ngày 21/1/2026, Anthropic công bố bản hiến chương mới của Claude, dài khoảng 80 trang và được phát hành theo giấy phép CC0 – ai cũng có thể đọc và tái sử dụng. Điểm khác biệt lớn nhất so với bản 2023: thay vì liệt kê từng điều cấm, văn bản giải thích lý do đằng sau mỗi nguyên tắc, với kỳ vọng Claude đủ hiểu để tự phán đoán trong tình huống chưa ai lường trước.
Bản hiến chương xác định bốn nhóm giá trị theo thứ tự ưu tiên: an toàn, đạo đức, tuân thủ hướng dẫn của Anthropic và hữu ích thực chất. Thứ tự này dùng để cân nhắc tổng thể chứ không phải cơ chế máy móc; trong thực tế, phần lớn cuộc trò chuyện (viết code, soạn bài, phân tích dữ liệu) không có xung đột giữa bốn nhóm này.
Bên cạnh đó là một danh sách ngắn các "ranh giới cứng" – những hành vi Claude không làm dù ai yêu cầu. Văn bản cũng mô tả Claude như một "người phản đối theo lương tâm": có thể từ chối việc sai trái, kể cả khi yêu cầu đến từ chính Anthropic.

Cần nói thẳng: hiến chương mô tả ý định, không phải lời bảo đảm. Chính văn bản thừa nhận đầu ra của Claude có thể không phải lúc nào cũng khớp với lý tưởng đã viết. Giới nghiên cứu cũng đặt câu hỏi về tính chính danh khi quy trình cập nhật còn nằm hoàn toàn trong nội bộ công ty, hay việc nhân quyền chưa được nêu rõ như một cam kết riêng. Đây là những cuộc tranh luận lành mạnh, và người làm công nghệ nên theo dõi.
Với sinh viên và người đang chuyển ngành sang IT, có ba điều đáng mang theo:
Muốn ứng dụng AI vào học tập và xây dựng sự nghiệp IT?
Viện Công nghệ và Đào tạo Devmaster đồng hành cùng học sinh THPT, sinh viên và người đi làm muốn chuyển ngành IT với lộ trình bám sát nhu cầu doanh nghiệp.
Bạn nghĩ AI nên được dạy bằng "luật" hay bằng "lý lẽ"? Chia sẻ quan điểm của bạn ở phần bình luận, và đón đọc các bài tiếp theo trong series về Claude.
#Claude #Anthropic #ConstitutionalAI #AISafety #TríTuệNhânTạo #AI #Devmaster #HọcIT #ChuyểnNgànhIT #CôngNghệGiáoDục
Nguồn tham khảo