Návrh na opravu štítku u GLM-OCR ležel v repozitáři Z.ai od května do září
Vývojář Hugging Face nechal u čínského modelu GLM-OCR návrh na opravu štítku 19. května. Z.ai ho sloučila 11. září. Dvě hlášení uživatelů, kterým se model přes rozhraní té platformy nedařilo zavolat, jsou po čtyřech měsících pořád otevřená.
Čínská laboratoř Z.ai sloučila 11. září 2026 v repozitáři svého modelu GLM-OCR návrh, který jí tam vývojář Hugging Face nechal 19. května. Šlo o jediný řádek v hlavičce karty modelu: štítek úlohy, podle kterého platforma pozná, k čemu model je. Mezi oběma daty uplynuly skoro čtyři měsíce a dvě hlášení uživatelů, kteří si na tentýž problém stěžovali, zůstala otevřená dodnes.

GLM-OCR je model pro čtení dokumentů: dostane obrázek stránky a vrátí text, vzorec nebo tabulku. Repozitář na Hugging Face vznikl 30. ledna 2026 a váhy do něj přibyly 2. února. Karta se hlásí k licenci MIT, tedy k té bez prahů obratu a bez seznamu zakázaných zemí; soubor s jejím textem v repozitáři není, platí jen ta kolonka. U novějšího GLM-5.3 už táž firma MIT vyměnila za vlastní podmínky. K modelu vyšla technická zpráva na arXivu (11. března 2026, druhá verze 16. března) a karta uvádí návody pro vLLM, SGLang i Transformers. Hlásí se v ní také k prvnímu místu v testu OmniDocBench V1.5 se skóre 94,62; to číslo naměřil vydavatel sám. Rozhraní Hugging Face u něj 14. září 2026 vede 1 904 001 stažení za posledních třicet dnů a 31 002 851 za celou dobu.
Štítek úlohy rozhoduje o víc než o zařazení
Každý model má na Hugging Face pole pipeline_tag. Vypadá jako kolonka pro katalog, ale platforma podle ní skládá i vzorové útržky kódu, zkušební okénko na stránce modelu a směrování na poskytovatele inference, tedy na firmy, které model provozují a pouštějí k němu přes API cizí lidi.
V hlavičce karty stálo image-to-text – tedy „z obrázku text“. Ta úloha je v katalogu starší a počítá s jedním obrázkem na vstupu. GLM-OCR přitom dostává obrázek i pokyn, co se z něj má vytáhnout, a má vlastní šablonu rozhovoru. Novější modely téže firmy, třeba GLM-5.3-Flash, nesou image-text-to-text.
Dvě hlášení z poloviny května
Čtrnáctého května založil uživatel vystupující jako procioni vlákno u modelu. Napsal v něm, že všechny ukázky kódu pro poskytovatele inference vracejí chybu:
ValueError: Task 'image-to-text' not supported for provider 'zai-org'.
Available tasks: ['conversational', 'text-to-image']
Za dva dny přidal uživatel raccoon70 totéž jako hlášení v repozitáři dokumentace Hugging Face, tentokrát s odkazem na konkrétní útržek z karty GLM-OCR. Chtěl po platformě jedno ze dvou: buď ať poskytovatel zai-org úlohu image-to-text umí, nebo ať se opraví ukázky, které tvrdí, že ji umí. Obě hlášení jsou 14. září pořád otevřená a na vlákně u modelu neodpověděl nikdo.
Návrh, protinávrh a čtyři měsíce
Změnu navrhl 18. května návrhem číslo 57 Lucain Pouget, který na Hugging Face vystupuje jako Wauplin a jeho účet patří do organizace té platformy; ve svém komentáři na to druhé hlášení odkázal. Navrhl řádek se štítkem z karty vyhodit a nechat platformu, ať si správnou úlohu odvodí sama. Argumentoval tím, že natvrdo zapsaný štítek má přednost jako hlavní, a proto podle něj rozbíjí několik napojení: chybí označení conversational, nefunguje zkušební okénko a nečte se šablona rozhovoru. Z.ai návrh druhý den v 12.28 přijala.
O necelých dvaačtyřicet minut později otevřel Pouget návrh číslo 58, který jeho vlastní změnu vracel zpátky. Napsal, že se omlouvá a že to byl z jeho strany přehmat: dokonalé řešení tu není, protože poskytovatele inference a štítek image-text-to-text nejde mít naráz. Návrat do původního stavu podle něj obnoví poskytovatele a vrátí modelu označení conversational, díky kterému se dá najít.
Tenhle druhý návrh pak v repozitáři ležel od 19. května do 11. září. Hlavička karty po tu dobu neuváděla žádný štítek úlohy, protože Pougetova první změna štítek odstranila a druhá, která ho měla vrátit, čekala na schválení. Spolu se štítkem zmizelo i označení conversational. Vrátilo se až se sloučením 11. září v 11.59; o hodinu a půl dřív téhož dne Z.ai nahrála do repozitáře upravené nastavení a tokenizér.
Co rozhraní vrací teď
Stav napojení na poskytovatele vydá rozhraní Hugging Face u každého modelu zvlášť. U GLM-OCR v něm 14. září 2026 stojí jediný poskytovatel, samotná Z.ai, a u něj hodnota "status": "error"; sousední pole previousStatus nese live, takže ta trasa dřív odpovídala. Model tak přes rozhraní platformy zrovna nemá kudy.
Ojedinělé to u Z.ai není. Ze 154 jejích modelů má napojení na poskytovatele vyplněné dvaatřicet a u šesti z nich je v chybě celá sada – vedle GLM-OCR ještě GLM-Image, GLM-5.1-FP8, CogView4-6B, GLM-Z1-9B-0414 a GLM-4.5. Novější GLM-5.3 a GLM-5.3-Flash naopak vedou po šesti živých poskytovatelích, z toho pět cizích firem. Co za těmi chybami je, rozhraní neříká a Z.ai to nekomentuje.
Devět desetin miliardy, nebo jedna a třetina
Karta modelu staví rychlé nasazení na tom, že modelu stačí 0,9 miliardy parametrů. Soubor vah jich obsahuje 1 325 258 240, tedy 1,33 miliardy. Rozdíl je vidět z hlavičky souboru, ve které je u každého tenzoru jméno a tvar: jazyková část má 617,5 milionu parametrů, tabulka slovníku na vstupu 182,5 milionu a výstupní vrstva dalších 91,2 milionu. Dohromady 891,2 milionu, tedy těch devět desetin miliardy z karty. Obrazový kodér CogViT, bez kterého model žádnou stránku nepřečte, přidává 434,1 milionu a do součtu na kartě se nepočítá. Je to vlastní výpočet z čísel v hlavičce vah, ne údaj od Z.ai.
Zdroje
- Karta modelu zai-org/GLM-OCR na Hugging Face, včetně historie revizí a diskusí 56, 57 a 58
- Hlášení huggingface/hub-docs#2481 na GitHubu
- GLM-OCR Technical Report, arXiv 2603.10910
- Rozhraní
huggingface.co/api/modelss rozšířeníminferenceProviderMapping, dotazováno 14. září 2026