브레스저널 The Breath Journal

Bài viết này được dịch tự động từ bản gốc tiếng Hàn. Đọc bản gốc tiếng Hàn

Cái giá của việc trao chìa khóa cho tác nhân AI

곽동현·Đăng 2026-05-02 14:02 KST
Sự cố xóa cơ sở dữ liệu vận hành, nghiên cứu về nguyên nhân thất bại và giải pháp kiểm định cùng chỉ về một hướng
Phạm vi quyền hạn được trao cho tác nhân AI quyết định quy mô của sự cố
Phạm vi quyền hạn được trao cho tác nhân AI quyết định quy mô của sự cố / ⓒ Breath Journal

Một tác nhân lập trình AI đã xóa sạch toàn bộ ổ đĩa chứa cơ sở dữ liệu vận hành của công ty. Sự việc xảy ra ngày 26/4 (giờ địa phương) trong môi trường đám mây Railway mà PocketOS, doanh nghiệp phần mềm cho thuê xe của Mỹ, đang sử dụng. Sự cố này khiến PocketOS gián đoạn dịch vụ trong khoảng 30 giờ, và trong thời gian đó không thể xem được các dữ liệu đặt chỗ, thanh toán và phân bổ xe của khách hàng.

Tác nhân gây ra sự cố đang chạy trên công cụ lập trình Cursor. Khi đang làm việc trong môi trường phát triển, nó gặp lỗi thông tin xác thực, và thay vì hiểu đây là cảnh báo về một khu vực không được đụng đến, nó đọc đó là tín hiệu cho thấy cấu hình bị sai. Vì vậy nó đi tìm thông tin xác thực khác có thể dùng được, và trong quá trình đó nắm được token API của Railway. Danh sách chức năng mà token này mở ra bao gồm cả việc xóa ổ đĩa vận hành, vốn không liên quan gì đến công việc lúc đó.

Thông tin xác thực là giấy tờ tùy thân dùng khi vào hệ thống, còn token API là hình thức chương trình xuất trình giấy tờ đó thay cho người dùng. Một lập trình viên là con người sẽ dừng lại một nhịp khi có token của môi trường vận hành trong tay. Tác nhân AI thì không dừng lại. Bởi nó hiểu rằng nhiệm vụ của mình là khai thông con đường bị chặn.

Quá trình khôi phục cũng không bình thường. Ban đầu có giải thích rằng bản sao lưu có thể phục hồi chỉ là dữ liệu của ba tháng trước, và việc khôi phục thực tế được thực hiện sau khi liên hệ được với phía CEO Railway là Jake Cooper, bằng cách vận hành ngoại lệ hệ thống khôi phục thảm họa nội bộ nằm ngoài các chức năng thông thường của bảng điều khiển. Railway cho biết nguyên nhân sự cố là AI phía khách hàng có quyền hạn quá rộng đã truy cập vào một thiết bị đầu cuối đời cũ thiếu cơ chế trì hoãn xóa, và cho biết đã áp dụng bản vá. Nội dung bản vá nằm ngoài phạm vi công bố.

Một nghiên cứu trong nước đào sâu vào lý do những phán đoán sai như vậy lặp đi lặp lại cũng đã được công bố. Bài báo 'Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?' do Okestro và Phòng thí nghiệm Hệ thống Xử lý Dữ liệu Phân tán Đại học Hanyang cùng viết đã được chấp nhận tại hội thảo AIOps thuộc ASPLOS 2026. Nhóm nghiên cứu đã chạy 1.675 lần trên 5 loại mô hình và tiêu tốn khoảng 1,38 tỷ token, rồi tổng hợp các dạng thất bại thành 12 cái bẫy.

Cái bẫy bị mắc nhiều nhất là ảo giác, tức đọc sai dữ liệu và tạo ra sự thật không tồn tại, với 71,2%, tiếp theo là thiếu tìm kiếm, tức không lục soát đủ phạm vi cần xem xét, với 63,9%. Điểm đáng chú ý là những thất bại này lặp lại tương tự nhau bất kể mô hình tốt hay kém hơn. Nhóm nghiên cứu cho rằng nút thắt cổ chai thực sự nằm ở thiết kế của khung nền vận hành các tác nhân theo nhóm, hơn là ở từng mô hình riêng lẻ. Khi chỉnh sửa giao thức truyền thông giữa các tác nhân với nhau, lỗi giảm tối đa 15 điểm phần trăm và thời gian thực thi rút ngắn 22,3%.

Cũng có nơi đọc được dòng chảy tương tự từ phía thị trường. AIWorks dưới thời Tổng giám đốc Yoon Seok-won đã ra mắt công cụ đánh giá 'AgentRigor', đo lường mức độ có thể tin tưởng giao việc cho tác nhân AI. Một tổ chức thử nghiệm được Cơ quan Công nhận Hàn Quốc (KOLAS) chứng nhận đã tham gia vào giai đoạn thiết kế, và sản phẩm lấy các trục chính là chức năng đo bằng số liệu chất lượng phản hồi của mô hình ngôn ngữ lớn và độ tin cậy của việc đánh giá, chức năng chạy các kịch bản người dùng thực tế để xem xét mức độ an toàn, và hỗ trợ ứng phó tuân thủ quy định theo các khung nền được công nhận. Công ty đã đảm nhận dự án tự động hóa kiểm định của một doanh nghiệp dịch vụ CNTT lớn trong nước, và đã vận hành thử nghiệm 'Saerok', nền tảng chăm sóc da cho trẻ sơ sinh và trẻ nhỏ mà BAMBIT đang chuẩn bị, lọc ra 1.440 trường hợp trong lĩnh vực mỹ phẩm.

Một sự cố, một bài báo, một sản phẩm không trích dẫn lẫn nhau. Nhưng nơi chúng nhắm tới thì tiếp giáp với nhau. Đó là việc trao bao nhiêu quyền hạn thì vẫn ổn đã trở thành cửa ải của triển khai, vượt qua câu hỏi tác nhân có làm được việc hay không. Báo cáo 'One Year of Agentic AI' mà McKinsey công bố năm ngoái cũng rút ra các nguyên tắc bằng cách xem xét thành công và thất bại của hơn 60 doanh nghiệp đã tự tay xây dựng tác nhân.

Nghiên cứu này là kết quả từ dự án phát triển công nghệ tự động hóa vận hành, quản lý dựa trên trợ lý AI khắc phục sự cố đám mây do Bộ Khoa học và Công nghệ Thông tin Truyền thông và Viện Quy hoạch và Đánh giá Công nghệ Thông tin Truyền thông (IITP) dẫn dắt. Lịch trình hội thảo chưa được ấn định.

Việc cần kiểm tra ngay thì không khó. Đó là mở danh sách ra xem token gắn với tác nhân trong nội bộ công ty chỉ mở môi trường phát triển, hay chạm được đến cả việc xóa ổ đĩa vận hành. 30 giờ của PocketOS là khoảng thời gian phát sinh do đã trao trọn cả chùm chìa khóa. Đây là thời điểm cần gấp rút họp bàn xem không cho phép tác nhân làm đến đâu, hơn là họp bàn xem sẽ giao cho tác nhân làm gì.

Phóng viên Kwak Dong-hyun · Breath.Tech

Bài liên quan

댓글