Model Beam zaostal v tabulce Reflection za GLM-5.3 ve všech dvanácti společných testech
Reflection AI ohlásila 5. října svůj první otevřený model Beam s 501 miliardami parametrů, váhy ale zatím nevydala. V oznámení ho staví vedle staršího GLM-5.2; novější GLM-5.3 vede v téže tabulce ve všech dvanácti testech, kde mají výsledek oba modely.
Americká firma Reflection AI ohlásila 5. října 2026 model Beam, svůj první model s otevřenými vahami. Má 501 miliard parametrů, z nichž při každém tokenu pracuje 23 miliard, a je stavěný na programování, uvažování a práci agentů. Stáhnout se zatím nedá: váhy, technickou zprávu i kartu modelu slibuje firma „later this month“, tedy do konce října. Do té doby je Beam jen pro vybrané uživatele z čekací listiny.

Co oznámení slibuje a co zatím vyšlo
Model je čistě textový a patří mezi takzvané směsi expertů, kde se pro každý token zapojí jen část sítě. Předtrénování proběhlo podle firmy na 23,8 bilionu tokenů z webu a z licencovaných sad. Na ně navázalo posilované učení na 10 500 akcelerátorech Nvidia GB300 po čtyři týdny, s více než sto miliony pokusů o řešení úloh. Kontext má Beam podle oznámení až milion tokenů. Uživatel si u něj bude moct nastavit, jak dlouho má model přemýšlet.
Váhy mají vyjít pod licencí Apache 2.0. Ověřit se to dá až nad souborem LICENSE, a ten zatím nikde neleží. Že i Apache 2.0 umí mít vedle sebe další podmínky, ukázal v létě Inkling-Small s pravidly užití, která smí firma měnit. TechCrunch k tomu připomíná, že výkon Beamu zatím nikdo nezávisle neověřil.
Beam vede nad GLM-5.2 v osmi testech ze třinácti, nad GLM-5.3 v žádném
V textu oznámení se Beam poměřuje hlavně s GLM-5.2 od čínské Z.ai. Ten vyšel na Hugging Face 16. června 2026. Na úlohách s náročným uvažováním má podle Reflection Beam srovnatelné výsledky při třikrát až čtyřikrát nižší spotřebě výpočtu.
Tabulka pod tím textem má ale osm sloupců a čtyři skupiny testů. Když se sečte celá, vyjde tohle:
- S GLM-5.2 má Beam společný výsledek ve 13 testech. V osmi vede Beam, v pěti GLM-5.2. Mezi těmi pěti jsou všechny čtyři testy uvažování, kde mají čísla oba: AIME 2026 (97,8 proti 99,2), HLE bez nástrojů (36,2 proti 40,5), CriPT (16,3 proti 20,9) a GPQA Diamond (90,5 proti 91,2).
- S GLM-5.3, který Z.ai vydala 25. srpna, má Beam společných testů dvanáct. GLM-5.3 je vpředu ve všech. Nejtěsněji v dlouhém kontextu AA-LCR (79,3 proti 79,7), nejvíc v otázkách nad kódovou základnou SWE Atlas (34,6 proti 61,0) a v DeepSWE (44,4 proti 61,0).
Sloupec s GLM-5.3 přitom firma do tabulky sama zařadila, jen o něm text oznámení mlčí. Že Kimi K3 je v hrubém výkonu dál, Reflection naopak přiznává rovnou. Proč Beam postavila hlavně vedle starší verze, v oznámení nestojí. Jeden rozdíl mezi oběma GLM je ale vidět i bez něj: GLM-5.3 už nemá licenci MIT jako jeho předchůdce, nýbrž vlastní podmínky s prahem deseti miliard dolarů.
Kdo která čísla naměřil
Výsledky Beamu pocházejí od Reflection. U ostatních modelů firma podle vlastních slov převzala čísla od Artificial Analysis a DataCurve, u jednoho řádku (AA Omniscience) uvádí výsledky z vlastního měření. Kde žádné číslo není, píše NR.
I úspora výpočtu je odhad. Reflection ji počítá vzorcem dvakrát počet aktivních parametrů krát průměrný počet vygenerovaných tokenů. Zpracování zadání, operace pozornosti závislé na délce kontextu a režii serveru vynechává. Sama píše, že jde o přibližné srovnání výpočtu, ne o změřenou cenu provozu.
Kolik paměti budou váhy chtít
V jakém formátu váhy vyjdou, oznámení neuvádí. Vlastní výpočet z počtu parametrů: ve formátu BF16, tedy po dvou bajtech na parametr, by měly zhruba 1 002 GB. V osmibitovém FP8 kolem 501 GB, ve čtyřech bitech asi 251 GB. K tomu přijde paměť na kontext.
Pro srovnání: osm karet po 80 GB dává 640 GB, takže se do nich vejde nanejvýš osmibitová verze. Doma se Beam neprovozuje o nic snáz než jiné velké otevřené modely; Kimi K3 zabere i v jednobitové podobě 594 GB. Výhoda, kterou Reflection slibuje, se týká výpočtu na token, ne velikosti souborů.
Reflection založili v roce 2024 bývalí výzkumníci Google DeepMind Misha Laskin a Ioannis Antonoglou, uvádí The Decoder. Firma zveřejňuje váhy, trénovací data a postupy si nechává pro sebe. Výsledky bezpečnostních testů slibuje do technické zprávy, která má vyjít spolu s vahami.