Přeskočit na obsah
U sebe doma 4 min čtení

Ornith 1.5 nese v repozitáři obrazový kodér, jeho karta uvádí jen generování textu

Tři velikosti modelu Ornith 1.5 vyšly 18. srpna 2026 s obrazovým kodérem, procesorem videa a šablonou rozhovoru, která počítá obrázky. V balíčcích GGUF k nim leží samostatná projekce o zhruba devíti stech megabajtech a llama.cpp si ji při spuštění stáhne sám. Karta modelu i oznámení výrobce popisují Ornith jako model pro generování textu.

Obrazovy snimac CMOS vyjmuty z fotoaparatu
Snímač CMOS z bezzrcadlovky Canon EOS RP. Snímek je ilustrační. Foto: Islander61, Wikimedia Commons (CC BY-SA 4.0)

Tým Ornith vydal 18. srpna 2026 na Hugging Face tři velikosti modelu Ornith 1.5: hustý model o devíti miliardách parametrů a dvě směsi expertů, označené 35B a 397B. Všechny tři mají v hlavičce karty pipeline_tag: text-generation a licenci MIT, jejíž text v repozitářích chybí. Popis na kartě mluví o uvažování, programování a agentních úlohách.

Konfigurace říká něco navíc. V souboru config.json stojí u všech tří velikostí blok vision_config, tedy popis obrazového kodéru, a vedle něj čísla značek pro obraz i video.

Kodér, procesor videa a šablona, která umí počítat obrázky

Architektura se u modelu 35B jmenuje Qwen3_5MoeForConditionalGeneration. Obrazová část má 27 vrstev, vnitřní rozměr 1 152, dlaždici 16 bodů a výstup srovnaný na 2 048, tedy na skrytý rozměr textové části. Vedle vah leží tři soubory, které by u textového modelu neměly co dělat: preprocessor_config.json, processor_config.jsonvideo_preprocessor_config.json. Všechny se hlásí ke třídě Qwen3VLProcessor.

Nejvíc řekne šablona rozhovoru. Soubor chat_template.jinja si vede počitadlo obrázků, obaluje je značkami <|vision_start|><|vision_end|>, umí je očíslovat popiskem „Picture 1:“ a obrázek v systémové zprávě odmítne chybou. Hugging Face si z architektury sám odvodil štítek image-text-to-text a vypisuje ho u všech tří modelů vedle štítku pro text.

Projekce v balíčku GGUF váží devět set megabajtů

Ke každé ze tří velikostí vydal Ornith i repozitář s balíčky GGUF pro llama.cpp. Kromě čtyř kvantizací a nezmenšené verze BF16 v nich leží ještě jeden soubor navíc, pojmenovaný mmproj. To je multimodální projekce, tedy ta část modelu, která z obrázku udělá vstup srozumitelný jazykové části.

Velikosti sedí na bajt: 902 822 240 B u modelu 35B, 921 704 672 B u devítimiliardového a 921 704 800 B u největšího. Zhruba devět set megabajtů v každém případě.

Hlavička toho souboru se dá přečíst bez stahování celku. Stojí v ní general.architecture = clip, general.type = mmproj, clip.has_vision_encoder = true a 27 bloků o rozměru 1 152, tedy tytéž údaje jako v config.json. Pole general.size_label uvádí 447M. Typ projekce je qwen3vl_merger, což je označení, které llama.cpp zná od modelů řady Qwen3-VL a má pro ně v souboru clip-impl.h vlastní položku. Pole general.tags uvnitř téže projekce přitom nese jedinou hodnotu, text-generation.

Kdo spustí server podle návodu, stáhne si projekci taky

Karta modelu radí dva způsoby spuštění doma. Jeden je ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF, druhý llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144. Ani u jednoho není o obrázcích zmínka.

llama.cpp se přitom o projekci postará sám. Nápověda k přepínači --mmproj-autosouboru common/arg.cpp zní: „whether to use multimodal projector file (if available), useful when using -hf“, tedy jestli se má použít soubor s multimodální projekcí, je-li k dispozici, což se hodí právě při stahování z Hugging Face (přeloženo). Výchozí stav je zapnuto a vypíná se protějškem --no-mmproj.

K 21,7 GB kvantizace Q4_K_M tak přiteče ještě těch 903 MB, aniž o ně kdo požádal, a server pak obrázek na vstupu přijme. Kdo o vidění nestojí, ušetří ten soubor jedním přepínačem.

Šestnáct megapixelů a šest minut záznamu

Meze pro vstup stojí v preprocessor_config.json: shortest_edge 65 536 a longest_edge 16 777 216. Navzdory jménům to nejsou délky hran. Obrazový procesor Qwen2VL, ke kterému se ten soubor sám hlásí, je v knihovně Transformers čte jako dolní a horní mez počtu obrazových bodů a ve výchozím stavu má 3 136 a 1 003 520. Ornith horní mez posunul na 16 777 216, tedy zhruba na 16,8 megapixelu.

Kolik z kontextového okna takový obrázek spolkne, se dá dopočítat. Dlaždice je 16 bodů a sousední čtveřice dlaždic se slučuje do jednoho tokenu (spatial_merge_size 2), takže na jeden token připadá 32 × 32 bodů, tedy 1 024. Obrázek na horní mezi zabere 16 384 tokenů, tedy šestnáctinu okna, které má model podle konfigurace k dispozici. Je to vlastní výpočet z těch dvou hodnot, ne měření.

U videa jsou čísla v processor_config.json: dva snímky za sekundu, nejméně čtyři snímky, nejvíc 768. Při dvou snímcích za sekundu to dělá 384 sekund, tedy šest minut a 24 sekund záznamu na jeden vstup.

Jak dobře model vidí, zatím neukázal nikdo

Karta je jinak na čísla štědrá. Vypisuje výsledky z Terminal-Bench 2.1, ze tří sad SWE-bench, z DeepSWE a z dalších, a u každé popisuje podmínky měření. Ani jedna z nich ale nepracuje s obrázky. Oznámení na webu Ornithu popisuje tři velikosti, způsob tréninku a tytéž sady; slovo o obrazu nebo videu v něm nepadne ani jednou.

Zbývá tedy jediný způsob, jak se to dozvědět: pustit model a podat mu obrázek. Soubory k tomu v repozitáři jsou a server si je stáhne sám.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    llama.cpp počítal u sedmi architektur normalizaci jinak než jejich referenční kód

    Vektory dotazů a klíčů v hybridní vrstvě Gated DeltaNet dělil llama.cpp odmocninou ořezanou zdola, kdežto knihovna, ke které se jejich referenční kód hlásí, k té…

  2. U sebe doma

    llama.cpp nechá některé velké vkládací tabulky na disku místo v operační paměti

    Projekt llama.cpp vydal 4. září 2026 verzi 0.4.0 s volbou --lazy-mode: vybraná vkládací tabulka zůstane v souboru na disku a program z ní čte řádky až ve chvíli, kdy je…

  3. U sebe doma

    Ollama 0.33.3 čte doporučené hodnoty vzorkování přímo ze souboru modelu

    Ollama do teď používala vlastní výchozí teplotu a top_p vždycky, když je nepřepsal Modelfile nebo požadavek. Verze 0.33.3 z 2. září 2026 se nejdřív podívá, co si o sobě…

  4. U sebe doma

    Hugging Face zveřejnil 207 WebGPU kernelů pro prohlížeč, loader k nim vyšel jako náhled

    Organizace webgpu-kernels na Hubu nese 207 výpočetních programů pro grafický čip pod licencí Apache 2.0 a balíček @huggingface/kernels je z prohlížeče stáhne a spustí.…