Hook: 240 triệu USD. Một con số được đưa ra giữa hai gã khổng lồ công nghệ và một startup AI. Nhưng khi tôi đọc bản tin vội vã từ Crypto Briefing, tôi thấy một mớ thông tin thiếu hụt. Không có số GPU, không có dòng thời gian, không có điều khoản cụ thể. Tôi không tin vào lời hứa, tôi tin vào mã nguồn. Và ở đây, mã nguồn không tồn tại. Nhưng tôi vẫn mổ xẻ, bởi vì những con số lớn luôn che giấu sự thật.
Context: IBM, một tên tuổi lâu đời trong làng công nghệ doanh nghiệp, đang chạy đua để bắt kịp kỷ nguyên AI. Together AI, một startup mới nổi chuyên tối ưu hóa suy luận cho các mô hình nguồn mở, bỗng nhiên có được hợp đồng trị giá 240 triệu USD – một con số lớn hơn toàn bộ vòng gọi vốn Series A của họ (102,5 triệu USD). Thỏa thuận này nhằm xây dựng một cụm suy luận (inference cluster) quy mô lớn, được cho là sẽ tái định nghĩa dịch vụ đám mây doanh nghiệp. Nhưng tôi, với 14 năm kinh nghiệm trong ngành, thấy một câu chuyện phức tạp hơn nhiều. — Root: từ trải nghiệm về các dự án, những thỏa thuận như thế này thường ẩn chứa rủi ro kỹ thuật và chiến lược mà báo chí không đề cập.

Core: Mổ xẻ có hệ thống
1. Kỹ thuật: Cụm suy luận, không phải cụm huấn luyện Together AI nổi tiếng với nền tảng suy luận dựa trên vLLM, SGLang, hỗ trợ các mô hình nguồn mở như Llama, Mistral. Họ không phải là công ty đào tạo mô hình cơ bản; họ là kỹ sư tối ưu hóa suy luận. Với 240 triệu USD, tôi ước tính họ có thể triển khai khoảng 5.000-8.000 GPU H100 (hoặc H200). Con số này dựa trên chi phí trung bình 30.000 USD mỗi GPU (bao gồm server, networking, storage). Đây là một cụm 'nghìn thẻ', đủ để phục vụ hàng nghìn yêu cầu suy luận đồng thời. Nhưng câu hỏi đặt ra: họ sẽ đặt nó ở đâu? IBM có trung tâm dữ liệu toàn cầu, nhưng Together AI chưa từng vận hành cụm quy mô này. Tôi đã từng kiểm toán các dự án DeFi nơi một lỗi nhỏ trong quản lý bộ nhớ có thể gây sập toàn bộ hệ thống. Ở đây, lỗi trong KV cache hoặc scheduling có thể làm tăng độ trễ lên gấp đôi, phá vỡ SLA cam kết với khách hàng doanh nghiệp.

2. Thương mại: Bước ngoặt hay cái bẫy tài chính? Đối với Together AI, 240 triệu USD là một cú hích doanh thu khổng lồ. Nếu hợp đồng kéo dài 3 năm, doanh thu trung bình hàng năm là 80 triệu USD. Với mức định giá Series A khoảng 500-600 triệu USD, doanh thu này có thể đẩy định giá lên 1-1,5 tỷ USD trong vòng tiếp theo. Tuy nhiên, tôi thấy một rủi ro: chi phí vốn (CapEx) cho cụm GPU có thể lên tới 100-150 triệu USD, tạo áp lực dòng tiền. Nếu tỷ lệ sử dụng thấp hơn dự kiến, Together AI sẽ mất tiền. IBM, với dòng tiền tự do 12 tỷ USD mỗi năm, có thể chịu được khoản đầu tư này, nhưng họ không phải là công ty chuyên vận hành GPU. Họ đang đặt cược vào Together AI để lấp đầy lỗ hổng năng lực AI của mình. Đây là một chiến lược 'mua ngoài' điển hình, nhưng nó đi kèm với rủi ro phụ thuộc vào một startup.
3. Tác động ngành: Tín hiệu cho doanh nghiệp AI Thỏa thuận này xác nhận rằng nhu cầu suy luận AI doanh nghiệp đang bùng nổ. Các công ty đang chuyển từ thử nghiệm PoC sang sản xuất thực tế, và chi phí suy luận là một rào cản lớn. Together AI, với khả năng tối ưu hóa, có thể giảm chi phí token cho khách hàng của IBM. Điều này gây áp lực lên các đối thủ như AWS (với Bedrock), Azure (với OpenAI) và Google Cloud. Nếu IBM + Together AI thành công, họ có thể chiếm lĩnh phân khúc khách hàng doanh nghiệp nhạy cảm về dữ liệu, như ngân hàng, bảo hiểm và chính phủ. Nhưng đừng quên rằng các gã khổng lồ cloud cũng đang đổ tiền vào chip tự phát triển (Trainium, Inferentia) và có thể đáp trả bằng giảm giá.
Contrarian: Góc nhìn phe bò – Những gì thỏa thuận này đúng Tôi thường chỉ trích, nhưng lần này tôi phải thừa nhận: IBM có một lợi thế độc đáo. Họ có mối quan hệ sâu sắc với các doanh nghiệp truyền thống, những người không tin tưởng vào các đám mây lớn vì lo ngại về quyền riêng tư dữ liệu và khả năng khóa vendor. Bằng cách cung cấp suy luận nguồn mở thông qua Together AI, IBM có thể đưa ra một giải pháp 'doanh nghiệp đầu tiên' với khả năng triển khai tại chỗ hoặc hybrid. Điều này có thể tạo ra một thị trường ngách mà AWS/Azure khó có thể cạnh tranh. Hơn nữa, Together AI có công nghệ tối ưu hóa thực sự – tôi đã thấy benchmark của họ với vLLM cải thiện throughput 2-3 lần so với mặc định. Nếu họ duy trì được lợi thế này, chi phí suy luận có thể giảm đáng kể, mang lại lợi ích cho toàn bộ hệ sinh thái nguồn mở. Tôi không tin vào lời hứa, nhưng tôi tin vào mã nguồn – và mã nguồn của Together AI có vẻ ổn (từ góc nhìn kỹ thuật thuần túy).
Takeaway: Kêu gọi trách nhiệm 240 triệu USD là một con số lớn, nhưng nó cũng là một canh bạc. Nếu IBM và Together AI thực hiện đúng cam kết, chúng ta sẽ chứng kiến một làn sóng mới của suy luận AI doanh nghiệp, dựa trên nguồn mở và khả năng tùy chỉnh. Nếu họ thất bại, đó sẽ là một bài học đắt giá về sự khác biệt giữa việc bán một ý tưởng và vận hành một cụm GPU hàng nghìn thẻ. Tôi đang theo dõi chặt chẽ. Còn bạn, bạn có dám đặt cược vào mã nguồn không?