Chainalysis khẳng định trong lĩnh vực blockchain intelligence, machine learning không nên đóng vai trò ra phán quyết mà chỉ nên là công cụ hỗ trợ. Theo công ty, việc gộp địa chỉ (address clustering) và gán thực thể (entity attribution) cần được xử lý theo tiêu chuẩn bằng chứng có thể tái lập và kiểm chứng, thay vì dựa vào mô hình dự đoán.
Trong bài viết công bố ngày 14 với tiêu đề "Machine Learning Has a Specific Role in Blockchain Intelligence", Chainalysis cho biết nếu chấp nhận kết quả của các công cụ tự động mà không kiểm chứng, có thể dẫn đến việc gộp địa chỉ sai và gây thiệt hại về sau. Công ty cho biết không sử dụng machine learning để xác định phân đoạn ví, mà chỉ áp dụng có chọn lọc trong các lĩnh vực chấp nhận tín hiệu xác suất như tạo đầu mối điều tra, phát hiện bất thường, nhận diện mẫu hình và phát hiện lừa đảo.
Điểm mấu chốt nằm ở việc phân tách ý nghĩa của cụm địa chỉ (cluster). Trong báo cáo riêng mang tên "Defining the Cluster", Chainalysis chia phân tích địa chỉ blockchain thành ba nhóm: phán đoán cấu trúc, gán thuộc tính và xác định người vận hành. Công ty cho rằng nhận định mang tính cấu trúc, tức phán đoán xem nhiều địa chỉ có cùng nằm dưới một sự kiểm soát hay không, cần tiêu chuẩn mang tính tất định (deterministic), có thể tái lập và kiểm chứng được.
Theo tiêu chuẩn này, machine learning không thuộc phạm vi nhận định mang tính cấu trúc. Mô hình dự đoán có thể được dùng để tìm mẫu hình đáng ngờ hoặc thu hẹp đầu mối điều tra, nhưng không thể thay thế cho kết luận rằng các địa chỉ được kiểm soát bởi cùng một chủ thể. Khái niệm "machine learning có trách nhiệm" mà Chainalysis nhấn mạnh trong bài viết lần này không phải là mở rộng tự động hóa, mà là xác định trước những lĩnh vực không nên áp dụng tự động hóa.
Vấn đề này cũng liên quan trực tiếp đến thị trường tài sản số trong nước. Các sàn giao dịch, cơ quan điều tra và bộ phận tuân thủ đều sử dụng phân tích địa chỉ on-chain để phát hiện giao dịch đáng ngờ và truy vết dòng tiền. Nếu việc gộp địa chỉ và gán thực thể thiếu chính xác, người dùng bình thường có thể bị xếp vào nhóm rủi ro cao, hoặc đầu mối điều tra có thể bị dẫn sai hướng. TokenPost từng đưa tin về trường hợp việc sử dụng sai địa chỉ và phân loại địa chỉ rủi ro cao dẫn đến ước tính thiệt hại thực tế.
Một nghiên cứu độc lập cũng được đưa ra làm điểm tham chiếu cho tranh luận này. Nghiên cứu "Ghost Clusters" trình bày tại USENIX Security 25 đã đối chiếu kết quả phân tích của Chainalysis với dữ liệu địa chỉ thực tế thu được từ ba dịch vụ bất hợp pháp bị tịch thu. Nhóm nghiên cứu đưa ra ngưỡng dưới của độ chính xác gán cho từng dịch vụ cụ thể trong khoảng 24,54%-94,85%, và cho biết tỷ lệ nhận diện sai (false positive) dưới 0,5%.
Chainalysis trích dẫn chính nghiên cứu này để nhấn mạnh độ chính xác dữ liệu và tỷ lệ nhận diện sai thấp của công ty. Tuy nhiên, nghiên cứu gốc trình bày khoảng độ chính xác như ngưỡng dưới theo từng dịch vụ, trong khi bài viết tiếp theo của công ty lại đưa con số "lên đến 94,85%" cùng cách diễn đạt tỷ lệ sai thấp hơn lên vị trí nổi bật. Khi đưa tin, cần phân biệt rõ số liệu gốc trong nghiên cứu với cách diễn đạt mang tính quảng bá của công ty.
Tranh luận về phương pháp luận của Chainalysis cũng liên quan đến độ tin cậy trước tòa án. Công ty viện dẫn phán quyết liên quan vụ "United States v. Sterlingov" năm 2024 để lý giải rằng các phương pháp suy luận (heuristic) có thể kiểm chứng và quy trình có thể tái lập giúp tăng khả năng bảo vệ cho phân tích blockchain. Bài viết lần này cũng nằm trên cùng mạch lập luận đó, đặt tiêu chuẩn bằng chứng lên trên hiệu năng kỹ thuật.
Phản ứng công khai hiện còn hạn chế. Trên LinkedIn, một số nhân vật trong ngành bày tỏ đồng tình với quan điểm không nên đồng nhất ngay cụm địa chỉ với tổ chức thực tế, hay đồng nhất mẫu hình với ý đồ phạm tội. Chưa ghi nhận tranh luận công khai rộng rãi xoay quanh chính bài viết này.
Thông điệp của Chainalysis được đưa ra trong bối cảnh cạnh tranh ứng dụng AI trong thị trường blockchain intelligence ngày càng gia tăng. Công ty cho biết vẫn sẽ áp dụng machine learning, nhưng cần phân tách rõ giữa việc phán đoán cấu trúc địa chỉ và việc gán thực thể dựa trên bằng chứng. Tự động hóa có thể giúp tăng tốc độ phân tích, nhưng điều thực sự cần thiết tại tòa án và trong công tác tuân thủ vẫn là những tiêu chuẩn có thể giải thích được.
Bình luận 0