Přeskočit na obsah
U sebe doma 2 min čtení

Muse Glimmer v Ollamě má 21 GB a zatím běží jen na Apple Silicon

Ollama 0.32.7 přidala třicetimiliardový multimodální model od Mety. Varianta pro MLX stahuje 21,2 GB dat, Meta nejmenší kvantizaci míří do 24GB paměťového rozpočtu a podporu Nvidie či AMD Ollama teprve slibuje.

Ollama vydala 10. srpna verzi 0.32.7 a s ní první podporu modelu Muse Glimmer. Třicetimiliardový model od Mety umí vedle textu přijímat obrázky a je určený hlavně pro agenty, kteří volají nástroje nebo pracují s obrazovkou. Poznámky k vydání však obsahují podstatné omezení: v den vydání funguje jen nový engine MLX na počítačích s Apple Silicon. Podporu dalších Maců, Nvidie a AMD Ollama pouze slibuje na následující dny.

Záběr z videa o procesorech Apple M3 a M3 Max
Záběr z videa o procesorech Apple M3 a M3 Max. Snímek je ilustrační a nezobrazuje model Muse Glimmer. Foto: 极客湾Geekerwan, Wikimedia Commons (CC BY 3.0)

Stažení má 21,23 GB, 24 GB je těsný rozpočet

Ollama nabízí jedinou variantu příkazem ollama run muse-glimmer:30b-mlx. Její manifest v registru obsahuje 1 503 datových vrstev. Jejich součet je 21 232 870 780 bajtů, tedy 21,23 GB nebo 19,77 GiB. To je vlastní součet redakce; nejde o číslo uvedené na stránce produktu.

Rozdíl proti názvu nejmenší kvantizace 17GB není chyba. Meta v modelové kartě vysvětluje, že pod 20 GB stlačila jazykovou část. Vedle ní se musí vejít zrakový enkodér s 1,8 miliardy parametrů, pomocný model DFlash a průběžná paměť pro kontext. Soubor nejmenších vah má 16,76 GB, celý balík Ollamy je proto větší.

Meta pro tuto kvantizaci uvádí cílový rozpočet 24 GB, pro méně stlačenou variantu 32 GB. Nejde o slib, že libovolný Mac s 24 GB sjednocené paměti bude mít dostatečnou rezervu: stejnou paměť používá systém, model i jeho kontext. Plná přesnost podle Mety potřebuje 64 GB. Redakce příkaz nespouštěla, protože současná testovací sestava nemá Apple Silicon a stažení přesahuje 21 GB.

DFlash zrychluje, ale čísla nejsou z Ollamy

Muse Glimmer používá pomocný model DFlash, který navrhne blok 16 tokenů a hlavní model je najednou ověří. Stejný princip už v Ollamě ukázal velmi rozdílný přínos podle úlohy. U nového modelu Meta naměřila na M4 Max zrychlení z 23,7 na 37,8 tokenu za sekundu a na M5 Max z 26,6 na 50,2 tokenu za sekundu.

Ta čísla ale vznikla v ExecuTorch, ne v MLX enginu Ollamy. Jde o výsledky výrobce při dávce jednoho požadavku a deterministickém výběru tokenů. Na rychlost Ollamy je proto nelze přenést. Ollama ve svém oznámení vlastní měření nezveřejnila.

Silný agent v některých testech, ne ve všech

Model má kontext nejméně 131 072 tokenů a k jednomu obrázku může použít až 4 096 obrazových tokenů. Meta ho porovnala s modely Gemma4-31B a Qwen3.6-27B. Muse Glimmer vedl například v MCP Atlas se skóre 75,5 proti 54,2 a 62,5. Naopak v OSWorld-Verified dosáhl 65,9, zatímco Qwen 75,6, a v TerminalBench 2.1 získal 51,7 proti 60,7 u Qwenu.

Střízlivost je namístě i u bezpečnosti agentů. V testu Siren AgentDojo uspěl útok proti Muse Glimmeru ve 28,4 % případů; proti Gemmě ve 25,6 %. Všechna tato srovnání pocházejí od Mety a nezávislá reprodukce u čerstvě vydaného modelu zatím chybí. Samotná Meta doporučuje přidat vlastní ochranné vrstvy a potvrzení člověkem před nevratnými kroky.

Apache 2.0 doplňuje samostatná politika použití

Váhy, zrakový enkodér i DFlash jsou vydané pod licencí Apache 2.0. Ta dovoluje komerční použití, úpravy a další šíření při zachování licenčních a autorských oznámení. Repozitář však zároveň obsahuje samostatnou politiku použití. Uvádí, že model není určen osobám mladším 18 let, a zakazuje mimo jiné vojenské účely, kritickou infrastrukturu, klamání nebo vydávání výstupů za lidské.

Pro domácí zkoušení je tedy největší překážkou hardware a aktuálně úzká podpora. Pro nasazení do služby je potřeba číst oba dokumenty, ne jen štítek Apache 2.0. A kdo nemá vhodný Mac, získal ve verzi 0.32.7 zatím spíš příslib než použitelný model.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    llama.cpp počítal u sedmi architektur normalizaci jinak než jejich referenční kód

    Vektory dotazů a klíčů v hybridní vrstvě Gated DeltaNet dělil llama.cpp odmocninou ořezanou zdola, kdežto knihovna, ke které se jejich referenční kód hlásí, k té…

  2. U sebe doma

    llama.cpp nechá některé velké vkládací tabulky na disku místo v operační paměti

    Projekt llama.cpp vydal 4. září 2026 verzi 0.4.0 s volbou --lazy-mode: vybraná vkládací tabulka zůstane v souboru na disku a program z ní čte řádky až ve chvíli, kdy je…

  3. U sebe doma

    Ollama 0.33.3 čte doporučené hodnoty vzorkování přímo ze souboru modelu

    Ollama do teď používala vlastní výchozí teplotu a top_p vždycky, když je nepřepsal Modelfile nebo požadavek. Verze 0.33.3 z 2. září 2026 se nejdřív podívá, co si o sobě…

  4. U sebe doma

    Hugging Face zveřejnil 207 WebGPU kernelů pro prohlížeč, loader k nim vyšel jako náhled

    Organizace webgpu-kernels na Hubu nese 207 výpočetních programů pro grafický čip pod licencí Apache 2.0 a balíček @huggingface/kernels je z prohlížeče stáhne a spustí.…