Startup Baseten finalizuje rundę finansowania o wartości 1,5 miliarda dolarów, a jego wycena rośnie do 13 miliardów dolarów. To kolejny sygnał, że inferencja AI, czyli faza, w której gotowy model odpowiada na zapytania użytkowników, stała się jednym z najgorętszych segmentów rynku sztucznej inteligencji.
Tempo robi wrażenie. Jeszcze pięć miesięcy temu firma pozyskała 300 milionów dolarów przy wycenie 5 miliardów, a 14 miesięcy temu rundę 150 milionów. Nowa wycena oznacza wzrost o około 160 procent w niespełna pół roku. Rundę prowadzą Spark Capital, Sands Capital, Altimeter Capital oraz Wellington Management. Według doniesień Wall Street Journal ma ona strukturę „split-price", w której część inwestorów płaci po cenie odpowiadającej wycenie 11 miliardów dolarów.
Baseten, założony w 2019 roku, buduje infrastrukturę do uruchamiania modeli w środowisku produkcyjnym. Platforma optymalizuje szybkość odpowiedzi i obniża koszty, kierując zapytania do modeli dopasowanych do zadania, w tym do tańszych modeli open source. To odpowiedź na realny problem: trenowanie modelu zdarza się raz, a inferencja działa przy każdym zapytaniu i to ona generuje powtarzalny rachunek za AI.
Dlaczego inferencja AI przyciąga miliardy
Obserwatorzy rynku mówią o „gorączce inferencyjnej". Inwestorzy venture capital agresywnie finansują firmy budujące tę warstwę, bo to ona decyduje o kosztach codziennego korzystania z AI. Im więcej aplikacji opartych na modelach trafia do użytkowników, tym większy strumień zapytań trzeba obsłużyć szybko i tanio. Wysoka wycena Baseten to zakład, że ten ruch będzie tylko przyspieszał.
Dla polskich firm wdrażających AI płynie z tego praktyczny wniosek. Najważniejszy koszt rzadko leży w samym wyborze modelu, lecz w tym, jak i gdzie go uruchamiamy. Optymalizacja inferencji bezpośrednio przekłada się na rachunek za chmurę: chodzi o dobór modelu do zadania, użycie tańszych modeli open source tam, gdzie wystarczą, oraz kontrolę opóźnień. Zanim firma zacznie liczyć zwrot z wdrożenia, warto pamiętać, że miesięczny koszt budują powtarzalne zapytania, a nie jednorazowy trening.
Źródło: TechCrunch (EN), 18 czerwca 2026.



