Sáng nay, tôi mở console và check một dòng log từ Hugging Face. Có điều gì đó không ổn. Một file .safetensors có kích thước khác thường, metadata bị chỉnh sửa. Không phải lỗi tải lên. Là tấn công. Không phải tấn công vào server, mà là tấn công vào một điểm yếu căn bản của AI supply chain: chúng ta không có cơ chế xác minh độc lập cho model binary.
Bối cảnh: Artifactory của JFrog có lỗ hổng zero-day. Open AI model bị khai thác trên Hugging Face. Đây là câu chuyện cũ trong ngành bảo mật phần mềm: một trusted repo bị nhiễm độc. Nhưng lần này, nạn nhân không phải file .exe hay .jar, mà là file model AI — những binary chứa hàng triệu tham số, không thể đọc được bằng mắt thường. Cộng đồng vẫn tin tưởng tải model từ Hugging Face và push vào Artifactory nội bộ. Một quy trình trust-on-first-use điển hình.
Core insight là: Model AI, ở dạng binary, không có cơ chế xác minh toàn vẹn ở cấp độ giao thức. Trong blockchain, bạn có Merkle Tree, ZK proof, signature aggregation. Trong AI, bạn chỉ có checksum SHA256, thứ có thể bị bypass nếu attacker thay đổi binary và recalculate hash. Không có proof-of-integrity nào được thiết kế ngay từ đầu. Lỗ hổng JFrog chỉ là cái cớ; vấn đề thực sự là toàn bộ pipeline trust đang dựa vào một giả định sai lầm: model từ Hugging Face là an toàn. Hãy nhìn vào con số: mỗi giây, có hàng trăm ngàn lượt tải model từ Hugging Face. Không một file nào được xác minh qua zero-knowledge proof. Điều này giống như chạy smart contract mà không có formal verification. Một thảm họa đang chờ xảy ra.
Contrarian angle ở đây là: nhiều người sẽ đổ lỗi cho JFrog, nói rằng họ cần patch nhanh. Sai. Patch không giải quyết được vấn đề. Ngay cả khi JFrog vá lỗi, attacker chỉ cần tìm một điểm yếu khác trong pipeline. Vấn đề là thiếu một layer xác minh phi tập trung cho model AI. Chúng ta cần một giao thức mà bất kỳ node nào cũng có thể verify rằng model resnet-50.safetensors đúng là do OpenAI ký, và chưa bị sửa đổi kể từ lúc ký. Không phải là tin tưởng Hugging Face. Không phải là tin tưởng JFrog. Mà là tin tưởng vào một ZK proof có thể public-check.
Đây là điểm mù của ngành AI hiện tại. Họ mải mê train model, tối ưu inference, thu thập data. Còn bảo mật thì để sau. Nhưng sau là quá muộn. Khi tôi audit một zkSync module vào năm 2024 — phát hiện lỗi trong batch proof verification, lỗi đó có thể chấp nhận fake proof. Cả nhóm developer bảo tôi: "Chúng tôi không nghĩ attacker sẽ tinh vi đến thế." Đó là suy nghĩ sai lầm. Attacker luôn tinh vi hơn bạn nghĩ. Với AI model attack, họ có thể chèn một vài neuron độc hại vào phần cuối của model, không ảnh hưởng đến accuracy, nhưng khi deploy sẽ kích hoạt backdoor. Không có tool nào detect được, trừ khi bạn check từng parameter một — điều không thể.

Takeaway: Đừng chờ patch. Hãy bắt đầu ngay hôm nay kiểm tra model integrity trong pipeline của bạn. Nếu bạn làm AI, hãy yêu cầu team của bạn thêm một bước verify. Làm thế nào? Bắt đầu bằng việc ký tất cả model bằng một key riêng, và public key đó lên một DHT hoặc blockchain. Điều này không khó. Mất khoảng 2 ngày dev. Nhưng nó sẽ cứu bạn khỏi một cuộc tấn công có thể làm sập hoàn toàn hệ thống. Hãy nhớ: ZK proof im lặng nhưng vạn lời.
