Nebius Group vừa chính thức công bố việc thâu tóm Inferize, một startup chỉ mới 10 tháng tuổi có trụ sở tại Tel Aviv, với mức giá lên tới 150 triệu USD. Thương vụ này không chỉ đơn thuần là một cuộc sáp nhập nhân sự mà còn là lời giải cho bài toán kinh tế hóc búa nhất trong hạ tầng AI: tình trạng GPU chạy không tải (idle). Trong quá trình vận hành, khoảng trễ giữa lúc mô hình AI bắt đầu khởi chạy và lúc sẵn sàng trả lời kết quả – hay còn gọi là cold start – đang tiêu tốn hàng triệu USD của các doanh nghiệp. Khi một mô hình được tải vào bộ nhớ hoặc cập nhật trọng số, GPU vẫn tiêu thụ điện năng và chi phí thuê mặt bằng nhưng không tạo ra giá trị. Việc tích hợp công nghệ của Inferize vào nền tảng Nebius Token Factory sẽ giúp tối ưu hóa hiệu suất cho các khối lượng công việc chạy trên các mô hình mã nguồn mở như Llama, DeepSeek hay Nvidia Nemotron. Đây là bước đi chiến lược giúp Nebius nâng cao năng lực cạnh tranh trực tiếp với các ông lớn như AWS hay Google Cloud trong phân khúc AI inference.
Giải pháp khắc phục điểm yếu chí tử của hạ tầng suy luận AI
Khác với chi phí huấn luyện (training) thường chỉ bùng phát trong một giai đoạn nhất định, chi phí suy luận (inference) là một khoản chi tiêu tích lũy và kéo dài vô tận theo vòng đời của sản phẩm. Mỗi yêu cầu từ người dùng đều tiêu tốn tài nguyên tính toán; do đó, chỉ cần vài giây lãng phí do cold start nhân với hàng triệu lượt truy vấn mỗi tháng sẽ tạo ra một lỗ hổng tài chính khổng lồ. Đội ngũ sáng lập Inferize, đứng đầu là Guy Bortnikov và Lior Gorbonos, vốn là những chuyên gia dày dặn kinh nghiệm từng bán startup Granulate cho Intel vào năm 2022. Họ tập trung xử lý sự kém hiệu quả trong cách sử dụng tài nguyên tính toán ở quy mô lớn.
Thay vì để khách hàng phải chọn lựa giữa việc duy trì GPU luôn “nóng” (tốn kém nhưng phản hồi nhanh) hoặc để GPU “nguội” (tiết kiệm nhưng độ trễ cao), giải pháp của Inferize cho phép mở rộng quy mô linh hoạt (elastic scaling) và tối ưu hóa kinh tế token (token economics). Điều này giúp các doanh nghiệp AI duy trì được tốc độ phản hồi tức thì mà không phải trả tiền cho những khoảng thời gian GPU ngồi không. Việc tích hợp này giúp Nebius giải quyết bài toán mà các đối thủ như CoreWeave đang phải xử lý bằng cách cho thuê theo giây – một giải pháp tình thế hơn là xử lý tận gốc vấn đề kỹ thuật của độ trễ hệ thống.
Với mục tiêu doanh thu đạt mức 3 tỷ đến 3,4 tỷ USD vào năm 2026, Nebius đang đặt cược toàn bộ chiến lược vào việc tối ưu hóa lớp hạ tầng suy luận. Việc sở hữu công nghệ chuyên biệt để triệt tiêu lãng phí tài nguyên giúp Nebius tạo ra lợi thế về giá thành và hiệu năng vượt trội so với các mô hình điện toán đám mây truyền thống. Đối với các doanh nghiệp đang xây dựng ứng dụng AI, đây là thời điểm cần rà soát lại cấu trúc chi phí vận hành và cân nhắc các nền tảng có khả năng tối ưu hóa GPU chuyên sâu để đảm bảo tính bền vững về mặt tài chính trong dài hạn.


Liên hệ qua Zalo


