Přeskočit na obsah
Čínské modely 3 min čtení

Qwen účtuje za Omni-Flash pětinu ceny Gemini 3.8 Flash a váhy drží u sebe

Alibaba pustila 18. září omnimodální model Qwen3.8-Omni-Flash a chce za něj 0,15 dolaru za milion vstupních tokenů bez ohledu na to, jestli jde o text, zvuk, nebo video. Google si za Gemini 3.8 Flash účtuje 0,75 dolaru. Váhy modelu ale na Hugging Face nejsou a poslední omnimodální váhy tam Qwen nahrál loni v září.

Čínská Alibaba zveřejnila 18. září Qwen3.8-Omni-Flash, model, který bere text, obrázky, zvuk i video v jednom okně o milionu tokenů. Oznámení ho popisuje jako nástroj pro agenty, tedy pro programy, které samy plánují kroky a volají další software: stříhat video, dabovat seriál do jiného jazyka, sepsat zápis z porady i s úkoly.

Střižna s monitory a ovládacím pultem
Střih videa a dabing jsou dvě z úloh, na které Qwen nový model cílí. Foto: Leon Terra, Flickr (CC BY 2.0)

Jedna sazba místo dvou

Zajímavější než seznam schopností je ceník Model Studia, kde Alibaba svoje modely prodává. Za milion vstupních tokenů tam u qwen3.8-omni-flash stojí 0,15 dolaru, za milion výstupních 0,47 dolaru a vstup obsloužený z mezipaměti 0,016 dolaru. Jedno číslo, ať do modelu posíláte cokoli.

Předchůdci to měli jinak. Týž ceník vede u qwen3.5-omni-flash dvě sazby: 0,40 dolaru za milion tokenů textu, obrazu a videa, ale 3 dolary za milion tokenů zvuku; na výstupu 2,20 proti 11,90 dolaru. U dražšího qwen3.5-omni-plus to je 1,40 a 11 dolarů na vstupu a 8,30 a 44 dolarů na výstupu. Zvuk byl u starší řady sedmi- až osminásobně dražší než text.

Odtud plyne i to, čím se Qwen v oznámení chlubí: že cena za hodinu zvukového vstupu klesla o víc než 98 % a za hodinu audiovizuálního vstupu o víc než 93 %. Přepočet na hodinu záznamu ale závisí na tom, kolik tokenů z minuty zvuku vznikne, a to oznámení neuvádí. Doložit jde jedině sazba: z 11 dolarů za milion tokenů zvuku na 0,15 dolaru.

Proti Googlu

Qwen svůj model srovnává s Gemini 3.8 Flash. Google má ceník veřejný a datovaný: 0,75 dolaru za milion vstupních tokenů a 3,75 dolaru za milion výstupních, a to do 31. prosince 2026. Od 1. ledna 2027 se obě čísla zdvojnásobí na 1,50 a 7,50 dolaru.

Vydělením obou ceníků vyjde, že Qwen chce dnes za vstup pětinu a za výstup zhruba osminu toho, co Google. Po Novém roce to bude desetina a šestnáctina, pokud se mezitím nezmění i čínský ceník. Je to vlastní dopočet ze dvou zveřejněných sazebníků, ne údaj od výrobce.

Čísla, která zatím nikdo nezopakoval

Výkon dokládá Qwen sám. Na 29 testech hlásí proti Qwen3.5-Omni-Plus průměrné zlepšení o víc než 25 %, u rozpoznávání mluvčích na sadě AliMeeting pokles chybovosti z 88,11 na 3,35. U audiovizuálního výkonu mluví o výsledku blízkém Gemini 3.8 Flash, u samotného zvuku o lepším. Nezávislé měření zatím není, takže to jsou tvrzení výrobce.

Nejnázornější je tabulka k testu OmniVideoBench, kde Qwen staví vedle sebe dva režimy vlastního modelu. Když video projde celé, vyjde přesnost 63,4 při 145 736 tokenech na dotaz. Když si model sám vybírá, které úseky si pustí, přesnost stoupne na 67,8 a spotřeba klesne na 79 117 tokenů. Za dnešní sazbu to je rozdíl asi dvou centů na dotaz.

Ke stažení to není

Model běží jen na serverech Alibaby. Ve výpisu organizace Qwen na Hugging Face je sedm omnimodálních repozitářů a všechny patří starším řadám: Qwen2.5-Omni ve dvou velikostech s kvantizacemi a Qwen3-Omni-30B-A3B ve třech variantách. Ten poslední tam Qwen nahrál 20. září 2025. Řada 3.5-Omni, která přišla letos v březnu, ani nová 3.8-Omni mezi nimi nejsou.

Oznámení mlčí i o tom, kolik má model parametrů a jak je postavený. U modelu, který si nikdo nestáhne, to není chyba v psaní: údaj nemá komu sloužit, protože nároky na paměť řeší poskytovatel.

Otevřené zůstává nářadí okolo. Qwen zveřejnil běhové prostředí Qwen-Live Harness pro hlasovou a obrazovou konverzaci a rozšířil sadu doplňků Qwen-MM-Plugins, která umí z videa vyrobit poznámky v PDF nebo z ukázky odvodit opakovatelný postup. Ty se instalují z npm a dají se zapojit do cizích agentů. Model samotný ale volají přes rozhraní Alibaby.

Pro čtenáře, který si vybírá podle licence, je to podstatný rozdíl proti tomu, co se o čínských laboratořích běžně říká. Qwen textové váhy dál vydává, i když od srpna pod vlastní licencí se třemi prahy místo pod Apache 2.0 a se zvláštní smlouvou pro poskytovatele inference. U omnimodálních modelů ale rok po posledním zveřejnění vah nabízí jen předplacenou službu, u které se podmínky mění stejně snadno jako ceník.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čínské modely

    Agentní model Atria Dawn stojí na nezměněné architektuře GLM-5.2

    Šanghajská laboratoř umělé inteligence zveřejnila váhy agentního modelu Atria Dawn Preview a technickou zprávu k němu. Soubor s nastavením se od modelu GLM-5.2 firmy Z…

  2. Čínské modely

    Návrh na opravu štítku u GLM-OCR ležel v repozitáři Z.ai od května do září

    Vývojář Hugging Face nechal u čínského modelu GLM-OCR návrh na opravu štítku 19. května. Z.ai ho sloučila 11. září. Dvě hlášení uživatelů, kterým se model přes rozhraní…

  3. Čínské modely

    Anthropic tvrdí, že Moonshot a DeepSeek posílaly dotazy svých uživatelů Claudovi

    Tým Threat Intelligence společnosti Anthropic popsal 10. září pět kampaní, ve kterých čínské laboratoře sbíraly odpovědi Claudu pro výcvik vlastních modelů. U Moonshotu…