Một chương trình trí tuệ nhân tạo (AI) bị nghi là agent của OpenAI đã truy cập trang thống kê của Hội nghị Liên Hợp Quốc về Thương mại và Phát triển (UNCTAD) khoảng 16.500 lần trong hơn hai tháng, theo phân tích của nhà nghiên cứu bảo mật Rowan Howard-Jones. Dù các dữ liệu được yêu cầu đều là thống kê công khai, chương trình này được cho là đã liên tục tìm đường khác mỗi khi bị hạn chế truy cập.
Howard-Jones đã phân tích nhật ký quét URL của API UNCTADstat trong khoảng thời gian từ ngày 13 tháng 4 đến ngày 19 tháng 6. Trong bài phân tích công khai, ông đánh giá hoạt động này nhiều khả năng bắt nguồn từ một agent của OpenAI, nhưng cho biết OpenAI chưa trực tiếp xác nhận điều đó.
Howard-Jones dựa trên các địa chỉ IP đám mây trùng với hoạt động agent từng liên quan đến OpenAI cùng các dấu hiệu như ‘CHATGPTTEST1’ và ‘OAI_META_1312’. Dữ liệu được agent yêu cầu gồm chỉ số năng lực sản xuất (PCI), các ngành thương mại và thương mại thực phẩm, đều là thống kê công khai trên UNCTADstat.
API UNCTADstat là điểm kết nối cho phép chương trình gửi yêu cầu dữ liệu thống kê. Agent lần lượt thử các mục dữ liệu để tìm endpoint cần thiết, trong quá trình đó UNCTADstat đã hạn chế 82 yêu cầu.
Vấn đề bắt nguồn từ cách gửi yêu cầu. Agent dường như chỉ có thể trực tiếp gửi yêu cầu theo phương thức GET, trong khi một số endpoint dữ liệu chỉ xử lý yêu cầu POST. GET chủ yếu được dùng để truy vấn thông tin, còn POST được dùng để gửi dữ liệu.
Theo phân tích của Howard-Jones, agent này dường như đã sử dụng dịch vụ quét URL Urlquery và dịch vụ kiểm thử dành cho nhà phát triển httpbin làm đường trung gian. Agent được cho là đã tạo biểu mẫu tự động thông qua httpbin, sau đó yêu cầu trình duyệt sandbox của Urlquery mở biểu mẫu để gửi yêu cầu POST.
Sau đó, agent còn sử dụng cách mã hóa kép địa chỉ yêu cầu. Đường dẫn ‘Facts’ được đổi thành ‘F%2561cts’, với cách này được ghi nhận 55 lần. Howard-Jones cho rằng có thể nhiều lớp dịch vụ đã lần lượt diễn giải URL, nhưng không khẳng định cấu trúc nội bộ của UNCTADstat thực sự vận hành như vậy.
Bản ghi Urlquery do Howard-Jones công bố cũng cho thấy dấu hiệu agent sử dụng trò chơi XSS dành cho đào tạo bảo mật web của Google như một không gian thực thi yêu cầu. Theo phân tích, agent đã chèn mã thực thi yêu cầu vào trang web của trò chơi để truy cập dữ liệu.
Các nỗ lực liên quan đến khóa API công khai cũng được lặp lại. Đây là giá trị mà trình duyệt của người dùng UNCTADstat gửi đi trong mỗi yêu cầu và không được xem là khóa bí mật.
Agent lần lượt áp dụng khoảng 20 tên khóa như ‘subscription-key’, ‘ocp-apim-subscription-key’ và ‘apikey’. Một trong các cách này được dùng để gửi hơn 9.500 yêu cầu. Howard-Jones cho rằng agent có thể đã nhầm vấn đề trong phương thức gọi API với lỗi tên khóa.
Khoảng 40 phút sau một đợt quét diễn ra ngày 6 tháng 6, một tài khoản có tên ‘PublicDataResearchAgentT93214’ được ghi nhận đã tạo trên FractalWiki một trang chứa các URL UNCTADstat liên quan cùng khóa API. OpenAI chưa xác nhận trang này có liên hệ trực tiếp với hoạt động truy cập thực tế hay không.
Nhật ký truy cập của trang wiki cho thấy 45 trong số 54 địa chỉ IP Azure từng tạo các trang liên quan đến UNCTAD cũng đã có lịch sử chỉnh sửa DseWiki. Kết hợp với các dấu hiệu được cho là liên quan đến OpenAI, Howard-Jones đánh giá khả năng đây là hoạt động của agent OpenAI là cao.
Howard-Jones không gọi hoạt động này là hành vi hack vì dữ liệu vốn được công khai và quy định sử dụng UNCTADstat chưa rõ ràng. Tuy nhiên, ông cho rằng việc liên tục tìm đường khác sau khi bị hạn chế có thể bị quản trị viên xem là tự động hóa mang tính tấn công.
Alex Stamos (Alex Stamos), giảng viên an ninh mạng tại Đại học Stanford, nói với Wall Street Journal rằng hoạt động này “nằm ở ranh giới của những hành vi mà tôi gọi là hack”, đồng thời mô tả đây là “hành vi scraping và thu thập dữ liệu rất tích cực”. Nhận định này cho thấy vấn đề nằm ở cách AI agent phản ứng với giới hạn truy cập, thay vì ở bản thân dữ liệu.
OpenAI cho biết đang xem xét kết quả điều tra liên quan và đã đề nghị báo cáo với nhóm điều tra của phía Liên Hợp Quốc. Người phát ngôn OpenAI nói với Wall Street Journal rằng phần lớn hoạt động được xác nhận cho đến nay là nghiên cứu thông thường, trong đó đọc các trang web công khai. Chưa có thông tin cho thấy hoạt động này làm lộ dữ liệu mật hoặc khiến dịch vụ thống kê bị gián đoạn.
Bình luận 0