Přeskočit na obsah
Modely 3 min čtení

Model Beam zaostal v tabulce Reflection za GLM-5.3 ve všech dvanácti společných testech

Reflection AI ohlásila 5. října svůj první otevřený model Beam s 501 miliardami parametrů, váhy ale zatím nevydala. V oznámení ho staví vedle staršího GLM-5.2; novější GLM-5.3 vede v téže tabulce ve všech dvanácti testech, kde mají výsledek oba modely.

Americká firma Reflection AI ohlásila 5. října 2026 model Beam, svůj první model s otevřenými vahami. Má 501 miliard parametrů, z nichž při každém tokenu pracuje 23 miliard, a je stavěný na programování, uvažování a práci agentů. Stáhnout se zatím nedá: váhy, technickou zprávu i kartu modelu slibuje firma „later this month“, tedy do konce října. Do té doby je Beam jen pro vybrané uživatele z čekací listiny.

Řada serverových skříní s nerezovými dveřmi a modrým podsvícením, nad nimi napájecí kabely
Sál superpočítače Frontier v Oak Ridge na ilustračním snímku; Beam se na něm netrénoval. Foto: oakridgelabnews, Flickr (CC BY 2.0)

Co oznámení slibuje a co zatím vyšlo

Model je čistě textový a patří mezi takzvané směsi expertů, kde se pro každý token zapojí jen část sítě. Předtrénování proběhlo podle firmy na 23,8 bilionu tokenů z webu a z licencovaných sad. Na ně navázalo posilované učení na 10 500 akcelerátorech Nvidia GB300 po čtyři týdny, s více než sto miliony pokusů o řešení úloh. Kontext má Beam podle oznámení až milion tokenů. Uživatel si u něj bude moct nastavit, jak dlouho má model přemýšlet.

Váhy mají vyjít pod licencí Apache 2.0. Ověřit se to dá až nad souborem LICENSE, a ten zatím nikde neleží. Že i Apache 2.0 umí mít vedle sebe další podmínky, ukázal v létě Inkling-Small s pravidly užití, která smí firma měnit. TechCrunch k tomu připomíná, že výkon Beamu zatím nikdo nezávisle neověřil.

Beam vede nad GLM-5.2 v osmi testech ze třinácti, nad GLM-5.3 v žádném

V textu oznámení se Beam poměřuje hlavně s GLM-5.2 od čínské Z.ai. Ten vyšel na Hugging Face 16. června 2026. Na úlohách s náročným uvažováním má podle Reflection Beam srovnatelné výsledky při třikrát až čtyřikrát nižší spotřebě výpočtu.

Tabulka pod tím textem má ale osm sloupců a čtyři skupiny testů. Když se sečte celá, vyjde tohle:

  • S GLM-5.2 má Beam společný výsledek ve 13 testech. V osmi vede Beam, v pěti GLM-5.2. Mezi těmi pěti jsou všechny čtyři testy uvažování, kde mají čísla oba: AIME 2026 (97,8 proti 99,2), HLE bez nástrojů (36,2 proti 40,5), CriPT (16,3 proti 20,9) a GPQA Diamond (90,5 proti 91,2).
  • S GLM-5.3, který Z.ai vydala 25. srpna, má Beam společných testů dvanáct. GLM-5.3 je vpředu ve všech. Nejtěsněji v dlouhém kontextu AA-LCR (79,3 proti 79,7), nejvíc v otázkách nad kódovou základnou SWE Atlas (34,6 proti 61,0) a v DeepSWE (44,4 proti 61,0).

Sloupec s GLM-5.3 přitom firma do tabulky sama zařadila, jen o něm text oznámení mlčí. Že Kimi K3 je v hrubém výkonu dál, Reflection naopak přiznává rovnou. Proč Beam postavila hlavně vedle starší verze, v oznámení nestojí. Jeden rozdíl mezi oběma GLM je ale vidět i bez něj: GLM-5.3 už nemá licenci MIT jako jeho předchůdce, nýbrž vlastní podmínky s prahem deseti miliard dolarů.

Kdo která čísla naměřil

Výsledky Beamu pocházejí od Reflection. U ostatních modelů firma podle vlastních slov převzala čísla od Artificial Analysis a DataCurve, u jednoho řádku (AA Omniscience) uvádí výsledky z vlastního měření. Kde žádné číslo není, píše NR.

I úspora výpočtu je odhad. Reflection ji počítá vzorcem dvakrát počet aktivních parametrů krát průměrný počet vygenerovaných tokenů. Zpracování zadání, operace pozornosti závislé na délce kontextu a režii serveru vynechává. Sama píše, že jde o přibližné srovnání výpočtu, ne o změřenou cenu provozu.

Kolik paměti budou váhy chtít

V jakém formátu váhy vyjdou, oznámení neuvádí. Vlastní výpočet z počtu parametrů: ve formátu BF16, tedy po dvou bajtech na parametr, by měly zhruba 1 002 GB. V osmibitovém FP8 kolem 501 GB, ve čtyřech bitech asi 251 GB. K tomu přijde paměť na kontext.

Pro srovnání: osm karet po 80 GB dává 640 GB, takže se do nich vejde nanejvýš osmibitová verze. Doma se Beam neprovozuje o nic snáz než jiné velké otevřené modely; Kimi K3 zabere i v jednobitové podobě 594 GB. Výhoda, kterou Reflection slibuje, se týká výpočtu na token, ne velikosti souborů.

Reflection založili v roce 2024 bývalí výzkumníci Google DeepMind Misha Laskin a Ioannis Antonoglou, uvádí The Decoder. Firma zveřejňuje váhy, trénovací data a postupy si nechává pro sebe. Výsledky bezpečnostních testů slibuje do technické zprávy, která má vyjít spolu s vahami.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Google vydal EmbeddingGemma 2 pro vyhledávání v textu, obrazech i zvuku

    Google 6. října vydal EmbeddingGemma 2, která hledá souvislosti mezi textem, obrázky, videem a zvukem přímo v zařízení. Údaj o 191 MB paměti platí jen pro textové váhy;…

  2. Modely

    Reka ukázala Rho-1 pro tvorbu videa a řízení robotů v jediné síti

    Reka představila Rho-1 jako výzkumnou ukázku, která spojuje text, obraz a pohybové příkazy. Při delším běhu se ale rozchází uspořádání scény a úpravy obrazu zůstávají…

  3. Modely

    Aleph Alpha vydala Kolibri s 78,8 GB otevřených vah

    Německo-anglický Kolibri používá přes 78 miliard parametrů, při každém kroku zapojí 3,46 miliardy. Aleph Alpha doporučuje pro složité úlohy nejvýše 262 144 tokenů,…

  4. Modely

    GPT-6 Astra vytvářel v testu funkční 3D scény, jejich věrnost ale zaostala

    Výzkumníci z Marylandské univerzity a AWS nechali agenty podle obrázku napsat scénu v Blenderu. GPT-6 Astra dosáhl nejvyššího skóre, ale ani funkční výstup nezaručil…