Apple vypsal u LensVLM-9B soubor po souboru, co v převzatých vahách Qwenu změnil
Apple zveřejnil 21. září 2026 vizuální model LensVLM-9B doladěný z Qwen3.5-9B. K vahám přiložil soubor NOTICE, který jmenuje původní dílo i držitele práv a u každého souboru uvádí, jestli do něj Apple zasáhl. Dvě tvrzení z toho seznamu jsme přeměřili a obě platí; blok o 243 290 624 parametrech, který ve vahách proti základu chybí, v něm ale není.
Apple zveřejnil 21. září 2026 na Hugging Face model LensVLM-9B, který místo dlouhé řady textových tokenů dostává text vykreslený jako obrázek stránky. Doladěný je z Qwen3.5-9B od Alibaba Cloud, tedy z vah pod licencí Apache 2.0. Ta dovoluje komerční užití; licence, kterou k výsledku připojil Apple, ho zakazuje.

Obrázek stránky místo tokenů
Myšlenka je popsaná v práci LensVLM: Selective Context Expansion for Compressed Visual Representation of Text, kterou deset autorů v čele s Royem Xiem vydalo na arXivu 7. května 2026. Vizuální kodér mapuje obrázek libovolného rozlišení na pevný počet tokenů, takže hustota vykreslení funguje jako plynulý ovladač komprese. Čím drobnější písmo, tím méně tokenů – a tím dřív se znaky dostanou pod rozlišovací schopnost kodéru a přesnost spadne. LensVLM proto stránky nejdřív přehlédne v komprimované podobě a teprve u těch, které k odpovědi potřebuje, si zvlášť vyžádá nekomprimované znění. Karta modelu nabízí tři stupně, 5×, 10× a 15×.
Podle měření autorů drží model přesnost srovnatelnou s plným textem při 4,3násobné účinné kompresi a až do 10,1násobné je nad postupy, se kterými se porovnávali; měřeno na sedmi testovacích sadách otázek a odpovědí nad textem. Zopakoval to zatím nikdo jiný. V abstraktu té práce se přitom jako základ jmenuje Qwen3.5-9B-Base, kdežto vydaný repozitář uvádí Qwen3.5-9B; oba mají tutéž licenci i shodný počet parametrů, takže z vah samotných se to rozhodnout nedá.
Seznam změněných souborů, ne jedna věta
Soubor NOTICE má 6 401 bajtů a pět oddílů. Pojmenuje původní dílo i s adresou a držitelem práv (Copyright 2026 Alibaba Cloud), opře podřízení celku vlastní licenci o článek 4 licence Apache 2.0 a označí všechny své úpravy za NOT A CONTRIBUTION ve smyslu jejího článku 1, tedy za něco, co Apple nikomu nepředkládá k začlenění zpět.
Pak přijde vlastní výčet. U vah stojí, že je Apple doladil; u config.json, že je znovu zapsala novější verze knihovny Transformers a že architektura, velikost skryté vrstvy, počet i typy vrstev a velikost slovníku zůstaly beze změny; u tokenizéru, že se změnila jen třída, kdežto slovník je bajt po bajtu týž. Soubor chat_template.jinja je uvedený jako nezměněný. Apple k tomu píše, proč to stojí tady a ne v souborech samotných, jak žádá článek 4 písm. b): binární archivy tenzorů ani JSON komentáře neumí. Doslovná kopie licence Apache 2.0 je v ACKNOWLEDGEMENTS spolu s licencí písem DejaVu, kterými se stránky vykreslují.
Dvě tvrzení jsme přeměřili
Obě platí. Soubor chat_template.jinja má u Applu i u Qwenu 7 756 bajtů a shodný otisk sha256. Slovník má v obou repozitářích 248 044 položek a porovnání po záznamech nenašlo jediný rozdíl.
Z hlaviček souborů safetensors, které se dají přečíst bez stahování vah, ale vyjde ještě něco, co v seznamu není. Váhy LensVLM-9B mají 760 tenzorů a 9 409 813 744 parametrů, základ od Qwenu 775 tenzorů a 9 653 104 368. Chybí přesně patnáct tenzorů s předponou mtp., tedy blok pro předpověď více tokenů dopředu, a je v nich 243 290 624 parametrů – 2,5 % celku, vlastní výpočet z obou čísel. Naopak žádný tenzor u Applu nepřebývá. Je to týž jev, jaký má ve vahách Intern-Decision, a stejně jako tam ho config.json dál deklaruje: mtp_num_hidden_layers zůstává na jedničce.
Pod větu o nezměněném config.json se dá přiřadit i druhý rozdíl. Čtyřicet osm tenzorů lineární pozornosti, které Qwen ukládá ve čtyřbajtových číslech, má Apple v dvoubajtových. Souborů se to netýká jmenovitě, jen výsledné velikosti: jediný archiv vah má 18,82 GB proti 19,31 GB u čtyř archivů Qwenu.
Licence pouští jen výzkum, a dá se odvolat
Apple Machine Learning Research Model License dává na 5 816 bajtech osobní, nepřenosné a odvolatelné právo model užívat, upravovat, šířit a dělat z něj odvozeniny – ale výhradně pro účely výzkumu. Ty jsou v textu vymezené jako nekomerční vědecká a akademická činnost a výslovně do nich nepatří vývoj produktu ani užití v jakémkoli komerčním produktu nebo službě. Totéž omezení musí nést každá odvozenina a u každé se musí uvést, co se v ní změnilo. Při porušení smí Apple licenci ukončit kdykoli; pak je nutné přestat model používat a všechny kopie smazat. Rozhodné je právo Kalifornie. Zdrojový kód k modelu je v repozitáři ml-lensvlm pod jinou licencí, Apple Sample Code License; založený byl 22. září 2026.
Pro kohokoli, kdo chtěl na LensVLM postavit službu, tím věc končí. Kdo si ale nechává práci s licencemi cizích vah na později, má tu vzor: na Hugging Face nemá u sebe text licence ani soubor NOTICE 101 z 201 odvozenin tří modelů, které to samy žádají.
Zdroje
- Karta a soubory modelu apple/LensVLM-9B, včetně NOTICE, LICENSE a ACKNOWLEDGEMENTS
- Repozitář základu Qwen/Qwen3.5-9B
- Roy Xie a kol.: LensVLM: Selective Context Expansion for Compressed Visual Representation of Text, arXiv, 7. května 2026
- Zdrojový kód apple-aiml-research/ml-lensvlm
- Počty tenzorů a parametrů jsou z hlaviček souborů
safetensorsobou repozitářů, čtené 26. září 2026