Přeskočit na obsah
Čísla 2 min čtení

OpenAI uvádí u čipu Jalapeño až 1,9krát více práce na watt

První vlastní čip OpenAI pro běh modelů má podle výsledků výrobce zvládnout 1,5 až 1,9krát více práce na watt než srovnávané systémy Nvidia. Při stejné práci by to znamenalo o 33 až 47 procent méně energie. Jalapeño zároveň dosáhlo nižší latence, čísla však zatím nikdo nezopakoval nezávisle.

Historický polovodičový wafer s neoddělenými čipy
Ilustrační snímek historického polovodičového waferu; podobu Jalapeña OpenAI ve zveřejněných výsledcích neukázalo. Foto: Retro-Computing Society of Rhode Island, Wikimedia Commons (CC BY-SA 4.0)

OpenAI zveřejnilo 25. srpna 2026 první výsledky čipu Jalapeño, který navrhlo s Broadcomem pro běh velkých jazykových modelů. V benchmarku InferenceX má proti srovnávaným systémům Nvidia zvládnout 1,5 až 1,9krát více práce na watt. Tohle číslo pochází od výrobce čipu, nikoli od nezávislé laboratoře.

Jalapeño je první vlastní inferenční čip OpenAI. Neučí modely, ale počítá jejich odpovědi poté, co už jsou natrénované. Firma ho na konferenci Hot Chips postavila proti systémům s akcelerátory Nvidia GB200 a GB300 a měřila tři otevřeně dostupné modely: GPT-OSS 120B, DeepSeek R1 670B a Kimi K2.5 1T. Podle TechCrunch jde o čip zaměřený na rychlou odezvu ve velkém provozu, ne o univerzální náhradu všech akcelerátorů.

Stejná práce by spotřebovala o třetinu až polovinu méně

Údaj „práce na watt“ říká, kolik výpočtu systém provede z každé jednotky energie. Pokud Jalapeño při stejné zátěži skutečně dosahuje 1,5násobné účinnosti, potřebuje na tutéž práci dvě třetiny energie, tedy o 33 procent méně. Při 1,9násobku je to přibližně 53 procent původní spotřeby, úspora skoro 47 procent. Jde o náš přepočet z poměrů OpenAI, ne o další měření.

Samotný příkon čipu má jmenovitou hodnotu 700 wattů. OpenAI uvádí, že při testech Jalapeño trvale nepřekročilo 550 wattů. To není totéž jako spotřeba celého serveru: paměti, procesory, síť a chlazení si berou další energii. Zveřejněný poměr je proto užitečný pro srovnání testovaných sestav, ale z jednoho čísla nelze spočítat účet za celé datové centrum.

Výrobce naměřil také kratší čekání na odpověď

Druhým výsledkem je koncová latence, tedy čas od přijetí požadavku po dokončení odpovědi. OpenAI hlásí 1,7 až 3,6krát nižší latenci a u interaktivní zátěže 2,1 až 4,1krát vyšší výkon. Právě spojení obou veličin je důležité. Server může vyrobit hodně tokenů za sekundu tím, že požadavky spojí do velkých dávek, ale jednotlivý člověk pak čeká. Jalapeño má podle zveřejněných grafů zvýšit propustnost bez stejné daně v podobě čekání.

Srovnání má několik pevných bodů: testované modely jsou pojmenované, InferenceX je veřejný benchmark a protihráči nejsou neurčitá „běžná GPU“, nýbrž systémy GB200 a GB300. Chybí však úplné zopakování někým, kdo čip nevyrábí ani nenasazuje. Také The Verge výsledky popisuje jako benchmarky zveřejněné OpenAI. Veřejná metodika tedy usnadňuje kontrolu podmínek, sama z firemního testu nezávislý test neudělá.

První kusy mají přijít letos

OpenAI počítá s nasazením malých objemů do konce roku 2026 a s větším rozšířením v roce 2027. Současně vyvíjí druhou generaci a připravuje třetí. Firma výslovně neříká, že akcelerátory Nvidia opustí. Vlastní čip jí dává další zdroj výpočetního výkonu pro jednu přesně vymezenou úlohu, zatímco trénování a ostatní zátěže mohou dál běžet na jiném hardwaru.

Do návrhu se zapojila i umělá inteligence. OpenAI uvádí, že se čip dostal od začátku návrhu k odeslání výrobních podkladů za devět měsíců. U vybraných bloků pro GPT-OSS byly implementace vytvořené s pomocí AI 1,5 až 1,8krát rychlejší než dřívější ruční varianty. Výrok se vztahuje jen k těmto blokům, ne k celému modelu ani k celému čipu.

Nejpřesnější závěr z prvních výsledků proto není, že Jalapeño „porazilo Nvidii“. OpenAI ukázalo, že jeho čip ve zvolených testech slibuje méně energie a kratší čekání při obsluze velkých modelů. Jestli se stejný náskok udrží v běžném provozu a v cizím měření, se ukáže až s dostupností skutečných systémů.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Čísla

    Známku ověřeného měření nemá ani jeden z 2 542 výsledků v žebříčcích Hugging Face

    Hugging Face ukládá od prosince 2025 výsledky testů přímo do repozitáře modelu a skládá z nich žebříčky benchmarků. Ze 2 542 položek, které v nich 4. září 2026 stály,…

  2. Čísla

    Experti uložení po čtyřech bitech tvoří 94 % vah DeepSeeku V4 Flash Vision

    DeepSeek nahrál 31. srpna 2026 na Hugging Face váhy experimentálního modelu DeepSeek-V4-Flash-Vision-Exp. Osmačtyřicet souborů má dohromady 167,8 GB a 93,8 % z toho…

  3. Čísla

    Zrychlení jádra Qwen-Image se v celém požadavku neprojevilo

    SGLang sloučil závěrečnou normalizaci a modulaci obrazového modelu Qwen-Image do jediného jádra. Samotná operace zrychlila podle délky vstupu 3,1krát až 5,6krát, deset…

  4. Čísla

    Sada Monsoon ukázala větší rozdíly mezi regiony Indie než mezi osmi modely přepisu řeči

    Hugging Face a Voice Arena přidaly do žebříčku Open ASR Leaderboard sady Monsoon pro indickou angličtinu a hindštinu. Každý klip v nich nese dvanáct údajů o mluvčím, a…