Přeskočit na obsah
Laboratoře 3 min čtení

Cache promptu vydrží u GPT-6 nejméně třicet minut od posledního použití

OpenAI 22. září popsala, jak u řady GPT-6 funguje ukládání promptů do cache. Čtení z ní stojí desetinu běžné sazby za vstup, zápis do ní naopak o čtvrtinu víc. Lhůtu, po kterou uložený začátek promptu zůstane použitelný, nastavit nejde: povolená hodnota je jediná a zní třicet minut.

OpenAI 22. září popsala, jak u řady GPT-6 funguje ukládání promptů do cache – tedy opakované použití části zadání, kterou model už jednou zpracoval. Firma slibuje vyšší úspěšnost ve výchozím nastavení a nabízí dvě nová měřidla. Zajímavější než oznámení je ale příručka, která k němu vyšla: v ní stojí, za jakých podmínek se do cache trefíte a co za to zaplatíte.

Mechanické stopky Minerva s malým počitadlem do třiceti minut
Mechanické stopky Minerva. Foto: Ansgar Koreng, Wikimedia Commons (CC BY-SA 4.0)

Třicet minut se počítá od posledního sáhnutí

Životnost řídí u GPT-5.6 a novějších pole prompt_cache_options.ttl. Jediná podporovaná hodnota je 30m a zároveň je výchozí. Uložený začátek promptu zůstane podle příručky použitelný nejméně třicet minut od posledního zápisu nebo použití, přičemž OpenAI si ho může nechat déle.

Podstatné je to slovo „posledního“. Každé další čtení lhůtu obnoví, a to bez dalšího poplatku za zápis. Agentovi, který pracuje několik hodin, tedy cache nezanikne půl hodiny po založení, ale půl hodiny poté, co se k ní program naposledy dostal.

Starší modely na to mají jiné pole, prompt_cache_retention, a u něj jde vybírat. Hodnota in_memory drží záznam zhruba pět až deset minut nečinnosti, nejvýš hodinu. Hodnota 24h ho typicky nechá kolem třiceti minut a může ho podržet až čtyřiadvacet hodin. U nové řady se volba ztratila: podle tabulky rozdílů v příručce je u GPT-5.6 a novějších povolená jediná hodnota.

Za zápis do cache se u nové řady platí

Zápis stojí 1,25 násobku běžné sazby za nekešovaný vstup, čtení z ní desetinu. V ceníku je to vidět po trojicích: u GPT-6 Astra stojí milion vstupních tokenů deset dolarů, čtení z cache jeden dolar a zápis 12,50. U Solu jsou to dva dolary, 0,20 a 2,50, u Luny 0,10, 0,01 a 0,125 dolaru. Stejné hodnoty vede ve svém katalogu modelů i OpenRouter, tedy někdo mimo OpenAI. Poměr sazeb Luny a Solu jsme rozebírali samostatně.

U starších modelů zůstává sloupec se zápisem v ceníku prázdný. Dokumentace Azure OpenAI od Microsoftu to říká natvrdo: modely před řadou GPT-5.6 za zápis do cache nic neúčtují, od 5.6 dál se účtovat může.

Příplatek se k běžné ceně nepřičítá, nahrazuje ji – každý vstupní token se počítá buď sazbou nekešovaného vstupu, nebo kešovaného, nebo zápisu. Příručka k tomu rovnou přikládá vlastní propočet. Jeden zápis a jedno úplné přečtení vyjde na 1,35 násobku běžné ceny vstupu, kdežto dvojí zpracování bez cache na dvojnásobek. Přes deset požadavků, tedy jeden zápis a devět čtení, je to 2,15 proti deseti. Zápis se tak vyplatí od druhého použití – jen o něm musíte dopředu vědět.

Kde se do cache netrefíte

Podmínek je několik a oznámení je nezmiňuje. Uložit se dá až prefix o 1 024 viditelných vstupních tokenech; skrytý systémový text OpenAI se do toho minima nepočítá. Shodovat se musí celý vykreslený začátek promptu, takže ho rozbije jiný model, přepsaná definice nástrojů i jejich přeházené pořadí. Jednu výjimku oznámení jmenuje: u GPT-6 lze mezi odpověďmi změnit míru uvažování, aniž se cache rozpadne.

Zbytek je otázka fyzického umístění. Uložené stavy leží podle příručky na jednotlivých strojích a provoz nad patnáct požadavků za minutu vede k přesměrování jinam. Požadavek najde uložený prefix jedině tehdy, když dorazí na stroj, který ho má. U modelů starších než GPT-5.6 tomu jde pomoci ustáleným klíčem prompt_cache_key, u nové řady si směrování řídí OpenAI sama a klíč slouží jen k oddělenému účtování.

Nové je hlavně měřidlo

Vlastní novinkou oznámení jsou dvě věci, kterými se dá chování cache sledovat. Přehled v administraci ukazuje podíl vstupu obslouženého z cache a vývoj úspěšnosti v čase. Diagnostický nástroj porovná požadavek s nedávnou odpovědí a vrátí důvod minutí i odhad zasažených tokenů – v ukázce z oznámení je to tools_changed a 5 629 tokenů, které šlo znovu použít. K tomu přibylo v odpovědi pole cache_write_tokens vedle staršího cached_tokens a možnost určit vlastní hranice ukládaného úseku ručně.

Kolik z toho dělá rychlost, se z oznámení nepozná. Jediné číslo o provozním dopadu v něm patří Mariu Rodriguezovi z GitHub Copilotu: podíl promptových tokenů, které bylo nutné zpracovat znovu, podle něj za několik měsíců klesl o víc než polovinu proti dřívějšímu stavu. Vlastní měření latence OpenAI nezveřejnila.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Laboratoře

    OpenAI účtuje za GPT-6 Luna dvacetinu sazeb modelu Sol

    OpenAI za milion vstupních tokenů u nového GPT-6 Luna účtuje 0,10 dolaru, u GPT-6 Sol dva dolary. Oba modely mají kontextové okno 1,05 milionu tokenů, ale firma je staví…

  2. Laboratoře

    Claude vede podle Anthropicu 26 % jeho vlastního výzkumu umělé inteligence

    Anthropic zveřejnil tři čísla o tom, jak uvnitř firmy vznikají modely: kolik práce na nich vede Claude, jak se hlídají jeho agenti a kolik výpočetního výkonu jde na…

  3. Laboratoře

    OpenAI vyřadí GPT-5.5 z ChatGPT i Codexu, v rozhraní API ho nabízí dál

    OpenAI zapsala 14. září do poznámek k vydání, že GPT-5.5 přestane 14. října fungovat v ChatGPT, ChatGPT Work a Codexu, a to na všech tarifech. Rozhraní API se to netýká…

  4. Laboratoře

    Nová Siri stojí na modelech Gemini od Googlu, v EU ale na iPhonu zatím nevyjde

    Apple 14. září vydal Siri AI jako betu v angličtině a v oznámení uvádí, že jeho nové základní modely vznikly ve spolupráci s Googlem a jeho modely Gemini. Asistent běží…