Přeskočit na obsah
Modely aktualizováno 10. 8. 2026 4 min čtení

AMD popisuje Instella-MoE jako plně otevřený model, licence vah dovoluje jen výzkum

AMD dala na Hugging Face model Instella-MoE-16B-A3B a s ním kontrolní body ze všech šesti fází tréninku. Kód k němu je pod licencí MIT, váhy pod licencí RESEARCH-ONLY RAIL, která povoluje jen akademické a výzkumné použití. Zveřejněné konfigurace navíc uvádějí u doladěných kontrolních bodů poloviční kontextové okno, než jaké slibuje oznámení.

Sídlo AMD v Santa Claře
Sídlo AMD v Santa Claře. Váhy modelu Instella-MoE mají 31,73 GB a licence u nich dovoluje jen akademické a výzkumné použití. Foto: Lijiaxuan, Wikimedia Commons (CC0)

AMD dala 23. července na Hugging Face šest repozitářů s modelem Instella-MoE-16B-A3B. Nejsou to varianty jednoho modelu, ale kontrolní body z po sobě jdoucích fází jednoho tréninku: předtrénink, mezitrénink, rozšíření kontextu, supervizované doladění, preferenční ladění a závěrečné doladění posilovaným učením. Den nato k nim vyšel zápis na blogu ROCm, který popisuje datové směsi i nastavení každé fáze.

Blog i karta modelu o Instelle mluví jako o plně otevřeném modelu. Trénovacího kódu se to týká doslova: repozitář AMD-AGI/Instella-MoE má licenci MIT. Váhy mají jinou.

Šestnáct miliard parametrů, aktivních 2,8 miliardy

Instella-MoE je model se směsí expertů: místo aby na každý token počítal celou síť, zapojí jen její část. Konfigurace uvádí 27 vrstev, skrytý rozměr 2 048, 64 směrovaných expertů a 2 sdílené, přičemž na token se vybírá 6 směrovaných. Ze 16 miliard parametrů se tak podle blogu počítá 2,8 miliardy. Předtrénink spotřeboval 7,1 bilionu tokenů a běžel na kartách AMD Instinct MI300X a MI325X.

V souboru config.json stojí u položky model_type hodnota deepseek_v3. Architektura tedy vychází z pozornosti s latentní projekcí, kterou zavedl DeepSeek, a AMD k ní přidala učené hradlo na výstupu a vlastní propojení expertů zvané FarSkip-Collective.

Kód pod MIT, váhy jen pro výzkum

Soubor LICENSE u vah se jmenuje RESEARCH-ONLY RAIL Model License. Povolený účel v něm definuje jediná věta: v originále „academic or research purposes only“, tedy pouze akademické nebo výzkumné účely. Autorskoprávní i patentové oprávnění platí výhradně v souvislosti s tímto účelem, takže komerční nasazení licence nepokrývá.

Zkratka RAIL označuje rodinu licencí, které k modelu připojují omezení chování, ne jen podmínky šíření; spravuje ji volné sdružení Responsible AI Licenses. U AMD to není novinka. Stejný typ licence měl už Instella-3B z března 2025.

Vlastní zákazy jsou v příloze A pod hlavičkou AMD Responsible AI Use Policy a je jich devět: porušování zákonů, násilný nebo sexuálně explicitní obsah, škodlivá užití včetně podvodu a vydávání se za člověka, vysoce riziková nasazení včetně zbraní, zpracování osobních údajů bez oprávnění, zásahy do duševního vlastnictví, tvorba škodlivého kódu, zatajení toho, že s uživatelem mluví model, a spoléhání na výstup bez posouzení. Článek 4 z nich dělá závaznou podmínku užití.

Šířit váhy dál licence dovoluje a dovoluje i provozovat model jako vzdálenou službu. Článek 6 k tomu váže pět podmínek: předat příjemci celé znění licence, uvést zákazy jako předpoklad jakékoli navazující smlouvy, viditelně označit změněné soubory, ponechat údaje o autorství a držet povolený účel i u dalších příjemců. Při porušení licence podle článku 12 zaniká a stažené soubory se mají smazat.

Jiní výrobci to řeší jinak. Inkling-Small má váhy pod Apache 2.0 a pravidla chování vedle ní. U videomodelu MiniMax H3 je omezení naopak zeměpisné.

Okno na 65 536 tokenů má jen základní kontrolní bod

Blog uvádí, že fáze rozšíření kontextu protáhla okno ze 4 096 na 65 536 tokenů. Ve zveřejněných konfiguracích to tak má jediný ze šesti kontrolních bodů. Položka max_position_embeddings je 65 536 u bodu Base, ale 32 768 u doladěných bodů SFT, DPO i Think. U prvních dvou, z předtréninku a mezitréninku, zůstalo 4 096.

Prakticky to znamená, že kdo si stáhne Think, tedy verzi určenou k běžnému používání, dostane polovinu okna, o kterém mluví oznámení. Blog ani karta modelu ten rozdíl nezmiňují.

Váhy zaberou 31,73 GB

Šest souborů se samotnými váhami má podle rozhraní Hugging Face dohromady 31,73 GB, tedy 29,55 GiB; sečetli jsme je z výpisu repozitáře. Uloženy jsou v bfloat16, což jsou dva bajty na parametr. Na kartu s 24 GB paměti se tedy nevejdou. Na kartě s 32 GB po nich zbude kolem 2,5 GiB.

K tomu je potřeba připočíst vyrovnávací paměť klíčů a hodnot, kterou si model drží pro už zpracovaný text. Latentní pozornost ji udržuje malou: konfigurace uvádí 512 latentních hodnot a 32 hodnot s rotační složkou na vrstvu a token, což je 544 hodnot krát 27 vrstev krát dva bajty, tedy 28,7 KiB na token. Při plném okně 32 768 tokenů z toho vychází 0,9 GiB, takže se model i s plným kontextem na kartu s 32 GB vejde. Ten výpočet je náš, karta modelu žádné číslo o paměti neuvádí.

Čísla o zrychlení změřila AMD sama

Blog uvádí, že propojení FarSkip-Collective zrychlilo předtrénink o 12,7 % a že při obsluze s expertním paralelismem v SGLangu klesla doba do prvního tokenu až o 39,2 %. Obojí měřila AMD sama na vlastních kartách a doklad je zatím jen graf v tom blogu. Technická zpráva podle něj teprve vyjde.

Výsledky testů schopností jsou v kartě modelu i na blogu jen jako obrázky tabulek, takže se z nich nedá nic vyčíst jinak než okem. Průměry 76,7 u základního bodu a 73,22 u Thinku z nich vypsal přehled na serveru MarkTechPost. U doladěných bodů karta modelu uvádí, že je AMD měřila nástrojem OLMES s délkou odpovědi do 32 768 tokenů.

Pro čtenáře, který si chce z Instelly něco postavit, z toho plyne dělicí čára uprostřed vydání: trénovací a inferenční řetězec je použitelný bez omezení, váhy jen ve výzkumu. Dva první převody do formátu GGUF se na Hugging Face objevily 31. července a pole s licencí u obou zůstalo nevyplněné, ačkoli článek 6 předání licence dalším příjemcům vyžaduje.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Zrychlená verze videomodelu MiniMax H3 dokládá slíbenou kvalitu šesti srovnáními

    Váhy VDN-H3 přidávají k videomodelu MiniMax H3 druhou, levnější větev pozornosti a podle autorů z něj udělají 74,5násobně rychlejší stroj. Rychlost mají rozepsanou po…

  2. Modely

    Institut IFM vydal u rodiny K2 Horizon 309 značek se stavy z průběhu trénování

    Institute of Foundation Models při univerzitě MBZUAI zveřejnil 3. září 2026 šest modelů K2 Horizon pod licencí Apache 2.0. Vedle finálních vah nechal v repozitářích i…

  3. Modely

    Hlídač bezpečnosti k modelům Ling 3.0 stojí na jediné vrstvě pozornosti

    Ant Group vydal 1. září 2026 dvě sady vah pod jménem SingProbe. Nejsou to samostatné modely: napojí se na běžící Ling 3.0, odečtou mu skryté stavy ze tří vrstev a ke…

  4. Modely

    Destilovaný videomodel FastH3 nese strojově čitelný doklad o svém vzniku

    FastVideo zveřejnil čtyřkrokovou destilaci videomodelu MiniMax H3 a přiložil k ní soubor provenance.json: revizi základních vah, číslo kroku trénování, otisky sha256 i…