Přeskočit na obsah
Infrastruktura 2 min čtení

IBM má za 240 milionů dolarů dodat Together AI cluster, kapacitu neuvádí

Vyhrazený inferenční cluster s Nvidia HGX B300 má být na IBM Cloud dostupný v prvním čtvrtletí 2027. Oznámení uvádí hodnotu kontraktu a vlastní provoz Together AI, nikoli počet systémů, příkon ani cenu za milion tokenů.

Řady serverových skříní v datovém centru
Nový cluster má sloužit výhradně inferenci modelů Together AI; snímek je ilustrační. Foto: Carl Lender, Wikimedia Commons (CC BY 2.0)

IBM a Together AI 11. srpna oznámily víceletou smlouvu za 240 milionů dolarů. IBM má pro poskytovatele modelů postavit na svém cloudu vyhrazený cluster se systémy Nvidia HGX B300. V provozu má být v prvním čtvrtletí 2027, takže zatím jde o objednanou infrastrukturu, ne o novou službu, kterou už lze změřit.

Oznámení IBM dává kontraktu cenu, termín a jméno hardwaru. Neříká však, kolik systémů HGX B300 cluster dostane, ve kterém datovém centru poběží, jaký bude mít příkon ani kolik tokenů za sekundu má při stanovené odezvě zpracovat. Bez těchto údajů nelze z částky odvodit velikost ani hospodárnost provozu.

Jeden systém má osm akcelerátorů, počet systémů chybí

HGX B300 není jeden samostatný čip. Podle technického přehledu Nvidie sdružuje jeden systém osm akcelerátorů Blackwell Ultra ve formátu SXM, celkem 2,1 TB jejich paměti a 14,4 TB/s souhrnné propustnosti propojení NVLink. U síťového připojení tabulka uvádí 1,6 TB/s. IBM k tomu přidává síť Nvidia Spectrum-X Ethernet.

Takový základ říká, z čeho se cluster skládá, ale ne kolikrát se v něm zopakuje. Deset systémů by znamenalo 80 akcelerátorů, stovka 800. Oznámená suma nepomůže, protože víceletá smlouva může vedle hardwaru zahrnovat síť, provoz datového centra, podporu i cloudové služby. Firmy její rozpad nezveřejnily.

Cluster má sloužit inferenci, tedy samotnému provozu už vytrénovaných modelů. To je jiná úloha než jejich trénování. U inference rozhoduje nejen počet akcelerátorů, ale také velikost modelu, přesnost výpočtů, délka vstupu, počet současných požadavků a požadovaná odezva. Samotné označení B300 proto ještě neříká, kolik uživatelů systém obslouží.

Třicetinásobek je tvrzení dodavatelů, ne výsledek clusteru

IBM píše, že platforma může proti předchozí generaci zvýšit výstup takzvané továrny na AI až třicetkrát. U této věty výslovně odkazuje na Nvidii. Není u ní uvedený model, číselná přesnost, velikost dávky, požadovaná odezva ani konkrétní předchozí sestava. Jde tedy o údaj výrobce pro vybraný scénář, nikoli o nezávislý test budoucího clusteru IBM.

Stejnou výhradu uvádí i nezávislý technický web StorageReview. Skutečný výkon podle něj závisí na architektuře modelu, přesnosti, dávkování a nastavení služby. Pro zákazníka by proto byly užitečnější údaje o počtu tokenů za sekundu při dané odezvě a o ceně za milion tokenů. Ty ve zveřejněných podkladech nejsou.

Čtyři sta bilionů tokenů popisuje dnešní provoz

Together AI v oznámení tvrdí, že její platforma už nyní zpracuje přes 400 bilionů tokenů měsíčně. Jde o údaj samotné firmy a není k němu přiložena metodika. Hlavně nepopisuje nový cluster: ten má být dostupný až v roce 2027. Číslo tak ukazuje řád současného provozu Together AI, ne výkon objednaných B300.

IBM používá pro nabídku Together AI spojení open-source modely. Ani tato zkratka neurčuje náročnost provozu. Modely s veřejně dostupnými vahami mají různé velikosti a licence a otevřené váhy samy o sobě neznamenají otevřený zdrojový kód. Oznámení navíc nejmenuje konkrétní modely, které budou na clusteru běžet.

Co bude možné ověřit v roce 2027

Kontrakt je konkrétní v tom, kdo infrastrukturu zaplatí, kdo ji dodá a jakou generaci akcelerátorů použije. Na posouzení výsledku ale chybějí provozní měřítka. Až IBM cluster spustí, bude podstatný počet systémů, dostupnost služby, výkon při známé odezvě a reálná cena. Bez nich zůstává 240 milionů dolarů cenou smlouvy a údaj 30× marketingovým srovnáním, nikoli měřítkem kapacity.

Zdroje: oznámení IBM a Together AI, specifikace Nvidia HGXrozbor StorageReview.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    SGLang 0.5.19 odmítne požadavek s víc než 32 zastavovacími řetězci

    Inferenční server SGLang přijme od verze 0.5.19 v jednom požadavku nejvýš 32 zastavovacích řetězců a 32 regulárních výrazů, každý výraz do 256 bajtů. Přes tu mez vrátí…

  2. Infrastruktura

    Experimentální backend v PyTorchi 2.14 umí postavit skupinu procesů po výpadku znovu

    PyTorch vydal 2. září verzi 2.14 a v ní backend nccl2, port komunikační vrstvy z projektu torchcomms. Proti dosavadnímu backendu umí přestavět skupinu procesů: zboří…

  3. Infrastruktura

    NVIDIA přesouvá řadič paměti z akcelerátoru do základního čipu NVHBM

    NVIDIA oznámila NVHBM, která přesouvá řadič paměti z akcelerátoru do základního čipu v HBM. Proti HBM4E slibuje až o 30 % vyšší propustnost a o 15 % nižší spotřebu, u…

  4. Infrastruktura

    Triton 3.8.0 překládá jádra pro Rubin, který je zatím jen v náhledu dokumentace PTX

    Vydání z 28. srpna přidalo do překladače Triton cíl „cuda:107“ pro architekturu, kterou NVIDIA popisuje zatím jen ve vývojářském náhledu dokumentace PTX. Z Tritonu i z…