Přeskočit na obsah
Modely 3 min čtení

Firma Aikido vydala Altar, zmenšenou verzi GLM-5.3 o velikosti 328 GB

Firma Aikido odstranila z modelu GLM-5.3 88 z 256 směrovaných expertů a stlačila jeho váhy na 328 GB. V interním testu Altar objevil alespoň jednou 23 z 32 známých zranitelností; nezávislé opakování zatím chybí. Provoz vyžaduje čtyři karty H200 a licence omezuje velké poskytovatele modelu jako služby.

Dlouhá řada serverových stojanů v datovém sále
Altar má podle karty modelu běžet na čtyřech akcelerátorech H200; malý server do kanceláře to tedy není. Foto: Ed Schipul, Wikimedia Commons (CC BY-SA 2.0)

Belgická bezpečnostní firma Aikido 21. září představila model Altar. Nevznikl trénováním od začátku. Základem je GLM-5.3 od čínské Z.ai, přesněji jeho čtyřbitová verze od uživatele cyankiwi. Aikido z ní odstranilo část expertů, tedy specializovaných podsítí, mezi kterými model při každém tokenu vybírá.

Karta Altaru na Hugging Face uvádí 504 miliard parametrů. V konfiguraci zůstalo 168 z původních 256 směrovaných expertů v každé příslušné vrstvě. Osm se jich aktivuje pro každý token stejně jako před ořezáním. Změnil se tedy počet podsítí uložených v paměti, nikoli počet těch, které počítají jeden krok.

Ořezání ušetřilo 160 GB proti čtyřbitovému základu

Aikido srovnává tři podoby téhož modelu. Původní váhy v BF16 mají podle firmy 1 506,7 GB. Kvantizace AWQ INT4, která většinu čísel ukládá do čtyř bitů, zabrala 488,2 GB. Altar má 328 GB. Náš součet 39 souborů safetensors z rozhraní Hugging Face dává 327 957 368 440 bajtů, tedy 328,0 GB nebo 305,4 GiB.

Samotné ořezání tak proti čtyřbitovému základu ubralo 160,2 GB, tedy 32,8 %. Aikido ponechalo experty podle stop ze svého testovacího prostředí pro penetrační testy a přidalo vícejazyčné texty. Tvrdí, že nepoužilo data zákazníků. Zvenku se tento údaj ověřit nedá.

Výběr expertů vychází z metody REAP popsané v práci Cerebras Research. Ta posuzuje nejen to, jak často směrovač experta vybere, ale i váhu volby a velikost jeho výstupu. Autoři metodu zkoušeli na modelech od 20 miliard do jednoho bilionu parametrů. To dokládá postup, ne výsledek Altaru v bezpečnosti.

Průměr klesl málo, dva nálezy ale zmizely

Výsledky k Altaru pocházejí z interního testu Aikido. Sada obsahuje 32 známých zranitelností ve 30 repozitářích a každý případ firma spustila třikrát. Altar měl průměrnou úspěšnost 60,4 % na jeden průchod a alespoň jednou našel 23 z 32 chyb. Čtyřbitový GLM-5.3 dosáhl 61,5 % a stejného pokrytí 23 chyb. Původní model v BF16 měl 65,6 % a ve třech pokusech pokryl 25 chyb.

Věta o zachování 92 % pokrytí tedy znamená 23 z 25 chyb, které alespoň jednou objevil plný model. Neznamená, že Altar v jednom průchodu najde 92 % zranitelností. Firma navíc uvádí, že test měří cílené znovuobjevení známých CVE v postupu, kde okolní kroky zajišťují jiné modely. Nejde o slepé hledání v celém kódu, ověření útoku ani návrh opravy. Nezávislé zopakování firma necituje a nenašli jsme je ani my.

Nezávislý Techzine potvrzuje vydání modelu a jeho základní parametry, čísla z testu ale přebírá od Aikido. Bereme je proto jako měření výrobce, ne jako nezávislý test.

Čtyři H200 nejsou běžný server

Karta doporučuje nejnovější vLLM, čtyři akcelerátory H200 a rozdělení modelu mezi všechny čtyři karty. Nastavené okno má 131 072 tokenů. Altar je tedy menší než výchozí GLM-5.3, ale označení „běh ve vlastní infrastruktuře“ neznamená dostupnost na pracovní stanici. Je to sestava pro datové centrum.

Otevřené jsou váhy, ne všechny podklady. Aikido zveřejnilo konfiguraci, kartu modelu, plán ponechaných expertů a souhrn testu, nikoli však surové rozhovory agentů. Samostatný soubor LICENSE v repozitáři Altaru chybí; karta pouze odkazuje na zděděnou licenci GLM-5.3, jejíž změnu jsme už rozebrali.

Plné znění licence dovoluje váhy používat, měnit, rozdávat i prodávat. Přidává ale podmínku pro firmu nebo její propojené společnosti, které provozují model jako službu a za libovolných souvislých dvanáct měsíců utrží přes deset miliard dolarů. Před komerčním použitím musejí projít bezpečnostní kontrolou Z.ai. Z definice služby licence vyjímá hotový produkt, v němž je model zabudovaný jen do konkrétní funkce. Pro většinu uživatelů tedy hranice nehraje roli, velký poskytovatel ji ale přehlédnout nemůže.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Model Venus od Ant Group odkládá úkoly na pozadí čtyřmi novými tokeny

    Skupina inclusionAI zveřejnila dvojici devítimiliardových modelů, které poslouchají i během vlastní řeči a umějí si uprostřed hovoru zadat úkol na pozadí. Ve vahách po…

  2. Modely

    Salesforce u Koa slibuje třikrát méně chyb, studie však číslo neuvádí

    Salesforce 15. září představil Koa, model pro práci s nástroji v Agentforce, který vychází z Nemotronu 3 Super 120B. Produktová stránka mu připisuje třikrát méně chyb a…

  3. Modely

    Model GPT-6 Astra zvládl sedm pokusů ze sta v testu s robotickými rameny

    Zkouška StationeryBench dala dvěma modelům stejná dvouramenná ramena a pět úloh z psacího stolu. GPT-6 Astra od OpenAI splnil zadání v sedmi pokusech ze sta, MolmoAct2…

  4. Modely

    Streamovací VibeVoice-ASR od Microsoftu přepisuje řeč i s mluvčím už během nahrávky

    Microsoft vydal 2. září VibeVoice-ASR-Streaming ve dvou velikostech pod licencí MIT. Model vydává přepis po blocích 2,9 s a u každé věty říká, kdo ji řekl, bez…