AI agents thất bại trong nghiên cứu khoa học: Bài học cho DeSci và nhà đầu tư blockchain
Phan Huyền
Một nhóm nghiên cứu đa tổ chức vừa đưa các tác nhân AI tiên tiến nhất vào một bài kiểm tra đặc biệt: thực hiện toàn bộ quy trình nghiên cứu khoa học từ đầu đến cuối. Kết quả không có một bài báo nào do AI tạo ra được chấp nhận tại các hội nghị AI hàng đầu. Với số đông, đó là cú sốc. Nhưng đối với những người từng trải qua những chu kỳ thổi phồng rồi vỡ của blockchain, đây không phải là một câu chuyện thất bại - đây là một tín hiệu định vị lại. DeFi Summer đã qua, nhưng câu hỏi liệu những công cụ tự trị mới có thực sự tạo ra giá trị, hay chỉ là một vòng kêu gọi vốn khác, vẫn chưa có lời đáp.
Bối cảnh của nghiên cứu này quan trọng hơn tiêu đề của nó. Các nhà nghiên cứu không đơn thuần kiểm tra "năng lực AI". Họ chia khoa học thành hai tầng: tầng cơ chế gồm viết mã, tra cứu tài liệu, xử lý số liệu; tầng sáng tạo gồm đặt câu hỏi gốc, xây dựng giả thuyết, thiết kế hướng nghiên cứu mới. Kết quả cho thấy AI thực hiện tốt tầng đầu tiên và gần như bất lực ở tầng thứ hai. Một chi tiết đáng chú ý là thiết kế thí nghiệm có thể sử dụng nhiều tác nhân phối hợp, mỗi tác nhân đảm nhận một công đoạn - tác nhân đọc tài liệu, tác nhân viết code, tác nhân phân tích dữ liệu. Điều này phức tạp hơn một chatbox thông thường rất nhiều, nhưng vẫn không đủ để tạo ra đột phá.
Đối với hệ sinh thái blockchain, kết quả này là một hồi chuông. Hàng loạt dự án DeSci đang gắn AI agents vào câu chuyện "tự động hóa tri thức", phát hành token để trả thưởng cho AI tạo ra bài báo. Nhưng khi chính nghiên cứu cho thấy AI chưa thể tạo ra một bài báo khoa học đạt chuẩn, thì những token đó đang trả thưởng cho thứ gì? Có lẽ là một hệ thống sản xuất rác học thuật có bằng chứng trên chuỗi. Dựa trên kinh nghiệm kiểm toán của tôi, khi một dự án huy động vốn cộng đồng bằng khái niệm "AI làm khoa học", điều đầu tiên tôi nhìn vào là token của họ có vai trò gì trong vòng lặp nghiên cứu. Hầu hết các token này chỉ dùng để staking hoặc quản trị, không liên quan đến việc tạo ra tri thức. Nghiên cứu vừa công bố là một lời nhắc nhở rằng ranh giới giữa "công cụ hỗ trợ" và "nhà khoa học tự trị" là một ranh giới rất dễ bị làm mờ trong marketing.
Trong chu kỳ thị trường tăng giá hiện tại, câu chuyện AI agents đang được dùng để thổi phồng định giá. Nhiều dự án không có sản phẩm cụ thể, chỉ có một trang web với đồ thị đẹp và một biểu tượng rô-bốt. Nhìn vào mã nguồn, bạn sẽ chỉ thấy một hợp đồng chuyển token. Tôi đã chứng kiến cảnh tượng này quá nhiều lần trước mỗi đợt điều chỉnh. Sự hưng phấn của thị trường có thể che giấu ngay cả những lỗi kỹ thuật nghiêm trọng nhất.
Nhưng ở một tầng khác, nghiên cứu này mở ra những cơ hội cụ thể. Ở mảng công cụ, các sản phẩm Research Copilot - trợ lý nghiên cứu giúp nhà khoa học tìm tài liệu, kiểm tra code, định dạng bài báo - có thể thương mại hóa ngay. Tiếp đến là các mô hình AI theo chiều dọc, được huấn luyện trên dữ liệu chất lượng cao của từng ngành như dược phẩm hay vật liệu; những mô hình này sẽ có lợi thế rõ rệt so với các mô hình tổng quát. DeFi Summer đã qua, nhưng câu hỏi liệu một quỹ đầu tư mạo hiểm có đủ nhẫn nại để đợi các mô hình này trưởng thành trong 12-24 tháng hay không, vẫn chưa có lời đáp. Quan trọng nhất, chúng ta đang thiếu cơ sở hạ tầng đánh giá - những công cụ độc lập để đo lường chất lượng nghiên cứu của AI. Blockchain có thể cung cấp một lớp xác minh phi tập trung: nội dung được lưu dấu vết, các nhà phản biện được thưởng, lịch sử đánh giá được ghi lại vĩnh viễn.
Điều này dẫn đến một góc nhìn phản trực giác. Thất bại của AI tại hội nghị hàng đầu thực ra là một tin tốt về mặt an toàn. Nếu AI có thể tự đặt câu hỏi nghiên cứu, tự thiết kế thí nghiệm và tự thực hiện, trong các lĩnh vực như sinh học tổng hợp hoặc an ninh mạng, thì một vòng lặp tự trị nguy hiểm sẽ được khép kín. Việc AI chưa thể làm được điều đó chứng tỏ vòng lặp này chưa hoàn thiện. Nhưng đó là một sự an toàn giả tạo. Năng lực hạn chế không đồng nghĩa với an toàn tuyệt đối. AI vẫn có thể bị lạm dụng để sản xuất hàng loạt bài báo khoa học giả với hình thức hợp lệ, đầu độc tri thức nhân loại. Và nếu các nền tảng blockchain không được kiểm soát, chúng có thể trở thành nơi phát hành những sản phẩm đó một cách hợp pháp.
Cũng có một thiếu sót thông tin: báo cáo gốc không nêu rõ phiên bản mô hình và thời điểm thử nghiệm. Nếu mô hình đã cũ vài năm, kết luận "AI không làm được khoa học" có thể đã lỗi thời. Nhà đầu tư cần đọc dữ liệu gốc, thay vì tiêu đề giật gân.
Nhìn lại toàn bộ sự kiện, tôi nghĩ rằng điều quan trọng nhất không phải là "AI làm khoa học" thành công hay thất bại, mà là cách chúng ta xây dựng các công cụ xác minh xung quanh nó. Chúng ta đang đứng trước một sự chuyển dịch từ kỷ nguyên "tự động hóa quy trình nghiên cứu" sang kỷ nguyên "đánh giá khoa học phi tập trung". Trong kỷ nguyên này, các nhà phát triển blockchain có một vai trò lịch sử: xây dựng hạ tầng kiểm chứng để bảo vệ sự trung thực của tri thức nhân loại, thay vì chỉ chạy theo những câu chuyện tăng giá.
Câu hỏi cuối cùng tôi để lại cho bạn đọc: nếu AI không thể tự làm ra một khám phá khoa học được công nhận, vậy thứ mà hàng trăm dự án crypto đang bán cho bạn - "trí tuệ nhân tạo sáng tạo trên blockchain" - thực chất là gì? DeFi Summer đã qua, nhưng câu hỏi đó, có lẽ, vẫn chưa có lời đáp.