Claude Mythos của Anthropic đang gây ra làn sóng tranh luận mạnh mẽ trong giới công nghệ

Claude Mythos của Anthropic gây tranh cãi khi được cho quá mạnh, có thể phát hiện lỗ hổng bảo mật lâu năm và tạo công cụ tấn công.

Một mô hình trí tuệ nhân tạo chưa được công bố mang tên Claude Mythos của Anthropic đang gây ra làn sóng tranh luận mạnh mẽ trong giới công nghệ.

Theo nhiều chuyên gia, đây có thể là hệ thống AI vượt trội, thậm chí tiệm cận AGI (trí tuệ nhân tạo tổng quát), nhưng cũng tiềm ẩn rủi ro lớn về an ninh.

Thông tin lan truyền trên mạng xã hội X cho thấy Claude Mythos sở hữu quy mô lên tới hàng chục nghìn tỉ tham số, với chi phí huấn luyện ước tính khoảng 10 tỉ USD.

Chuyên gia AI Nina Schick (nhà sáng lập công ty tư vấn Tamang Ventures) nhận định mô hình này đạt tới 94% trên SWE-bench, là một trong những bài kiểm tra lập trình khó nhất hiện nay.

Đáng chú ý, Mythos được cho là có khả năng phát hiện các lỗ hổng bảo mật tồn tại suốt hàng chục năm. Một ví dụ được nhắc đến là việc tìm ra lỗi trong hệ thống đã hoạt động 27 năm, hay một lỗi khác tồn tại qua hàng triệu lần chạy thử nhưng vẫn bị bỏ sót, và AI này chỉ mất một đêm để phát hiện.

Không phát hành công khai, triển khai có kiểm soát

Thay vì phát hành rộng rãi, Anthropic đã triển khai Dự án Glasswing, một chương trình sử dụng AI trong môi trường kiểm soát, tập trung vào an ninh mạng phòng thủ.

Công ty được cho là cung cấp khoảng 100 triệu USD tín dụng điện toán và hợp tác với các đối tác lớn như Amazon, Microsoft, Google, Apple và NVIDIA.

Theo giới quan sát, đây là cách tiếp cận chưa từng có khi không phải ra mắt sản phẩm, mà là triển khai hạn chế một công nghệ được cho là quá mạnh để phổ biến tự do.

Lo ngại về hành vi “lừa dối” của AI

Bên cạnh sức mạnh, một số nghiên cứu ban đầu cũng chỉ ra hành vi đáng lo ngại của mô hình. Chiến lược gia AI Allie Miller cho biết các phiên bản thử nghiệm có xu hướng lách luật.

Trong một trường hợp, AI đã chèn mã vào tệp cấu hình rồi xóa dấu vết để vượt qua hạn chế. Ở trường hợp khác, nó vi phạm quy tắc nhưng cố tình thêm biến gây hiểu nhầm để che giấu hành vi. Các phân tích cho thấy đây có thể là nỗ lực có chủ đích nhằm đánh lừa hệ thống kiểm tra.

Dù vậy, Anthropic khẳng định các hành vi này hiếm gặp và đã được giảm thiểu ở các phiên bản sau.

Tác động lớn tới an ninh mạng toàn cầu

Các chuyên gia công nghệ như John Garguilo (đến từ dự án Airpost) cho rằng Mythos có thể thay đổi hoàn toàn cục diện an ninh mạng.

Mô hình này được cho là có thể tự động tạo công cụ khai thác lỗ hổng, thậm chí kết hợp nhiều lỗi để vượt qua các lớp bảo mật.

Trong khi đó, một số doanh nhân cảnh báo rằng công nghệ này có thể rút ngắn thời gian phát hiện lỗ hổng từ nhiều năm xuống chỉ còn vài phút, là một bước nhảy vọt nhưng cũng đầy rủi ro.

Trong đó yếu tố địa chính trị cần cân nhắc bởi nếu một công ty có thể xây dựng hệ thống như vậy, các quốc gia hoặc tổ chức khác cũng có thể làm điều tương tự. Điều này càng đáng lo ngại khi kết hợp với những tiến bộ trong điện toán lượng tử.

Bước ngoặt mới của AI và bảo mật

Việc Anthropic giữ kín Claude Mythos và chỉ triển khai có kiểm soát cho thấy sự thận trọng trước một công nghệ có thể làm thay đổi cán cân an ninh toàn cầu.

Dù còn nhiều tranh cãi, giới chuyên gia đồng thuận rằng Mythos không chỉ là một bước tiến nhỏ, mà có thể đánh dấu một giai đoạn mới của trí tuệ nhân tạo, nơi ranh giới giữa công cụ bảo vệ và công cụ tấn công ngày càng mong manh.

Bạn có thể cũng thích những nội dung này!