Cache promptu vydrží u GPT-6 nejméně třicet minut od posledního použití
OpenAI 22. září popsala, jak u řady GPT-6 funguje ukládání promptů do cache. Čtení z ní stojí desetinu běžné sazby za vstup, zápis do ní naopak o čtvrtinu víc. Lhůtu, po kterou uložený začátek promptu zůstane použitelný, nastavit nejde: povolená hodnota je jediná a zní třicet minut.
OpenAI 22. září popsala, jak u řady GPT-6 funguje ukládání promptů do cache – tedy opakované použití části zadání, kterou model už jednou zpracoval. Firma slibuje vyšší úspěšnost ve výchozím nastavení a nabízí dvě nová měřidla. Zajímavější než oznámení je ale příručka, která k němu vyšla: v ní stojí, za jakých podmínek se do cache trefíte a co za to zaplatíte.

Třicet minut se počítá od posledního sáhnutí
Životnost řídí u GPT-5.6 a novějších pole prompt_cache_options.ttl. Jediná podporovaná hodnota je 30m a zároveň je výchozí. Uložený začátek promptu zůstane podle příručky použitelný nejméně třicet minut od posledního zápisu nebo použití, přičemž OpenAI si ho může nechat déle.
Podstatné je to slovo „posledního“. Každé další čtení lhůtu obnoví, a to bez dalšího poplatku za zápis. Agentovi, který pracuje několik hodin, tedy cache nezanikne půl hodiny po založení, ale půl hodiny poté, co se k ní program naposledy dostal.
Starší modely na to mají jiné pole, prompt_cache_retention, a u něj jde vybírat. Hodnota in_memory drží záznam zhruba pět až deset minut nečinnosti, nejvýš hodinu. Hodnota 24h ho typicky nechá kolem třiceti minut a může ho podržet až čtyřiadvacet hodin. U nové řady se volba ztratila: podle tabulky rozdílů v příručce je u GPT-5.6 a novějších povolená jediná hodnota.
Za zápis do cache se u nové řady platí
Zápis stojí 1,25 násobku běžné sazby za nekešovaný vstup, čtení z ní desetinu. V ceníku je to vidět po trojicích: u GPT-6 Astra stojí milion vstupních tokenů deset dolarů, čtení z cache jeden dolar a zápis 12,50. U Solu jsou to dva dolary, 0,20 a 2,50, u Luny 0,10, 0,01 a 0,125 dolaru. Stejné hodnoty vede ve svém katalogu modelů i OpenRouter, tedy někdo mimo OpenAI. Poměr sazeb Luny a Solu jsme rozebírali samostatně.
U starších modelů zůstává sloupec se zápisem v ceníku prázdný. Dokumentace Azure OpenAI od Microsoftu to říká natvrdo: modely před řadou GPT-5.6 za zápis do cache nic neúčtují, od 5.6 dál se účtovat může.
Příplatek se k běžné ceně nepřičítá, nahrazuje ji – každý vstupní token se počítá buď sazbou nekešovaného vstupu, nebo kešovaného, nebo zápisu. Příručka k tomu rovnou přikládá vlastní propočet. Jeden zápis a jedno úplné přečtení vyjde na 1,35 násobku běžné ceny vstupu, kdežto dvojí zpracování bez cache na dvojnásobek. Přes deset požadavků, tedy jeden zápis a devět čtení, je to 2,15 proti deseti. Zápis se tak vyplatí od druhého použití – jen o něm musíte dopředu vědět.
Kde se do cache netrefíte
Podmínek je několik a oznámení je nezmiňuje. Uložit se dá až prefix o 1 024 viditelných vstupních tokenech; skrytý systémový text OpenAI se do toho minima nepočítá. Shodovat se musí celý vykreslený začátek promptu, takže ho rozbije jiný model, přepsaná definice nástrojů i jejich přeházené pořadí. Jednu výjimku oznámení jmenuje: u GPT-6 lze mezi odpověďmi změnit míru uvažování, aniž se cache rozpadne.
Zbytek je otázka fyzického umístění. Uložené stavy leží podle příručky na jednotlivých strojích a provoz nad patnáct požadavků za minutu vede k přesměrování jinam. Požadavek najde uložený prefix jedině tehdy, když dorazí na stroj, který ho má. U modelů starších než GPT-5.6 tomu jde pomoci ustáleným klíčem prompt_cache_key, u nové řady si směrování řídí OpenAI sama a klíč slouží jen k oddělenému účtování.
Nové je hlavně měřidlo
Vlastní novinkou oznámení jsou dvě věci, kterými se dá chování cache sledovat. Přehled v administraci ukazuje podíl vstupu obslouženého z cache a vývoj úspěšnosti v čase. Diagnostický nástroj porovná požadavek s nedávnou odpovědí a vrátí důvod minutí i odhad zasažených tokenů – v ukázce z oznámení je to tools_changed a 5 629 tokenů, které šlo znovu použít. K tomu přibylo v odpovědi pole cache_write_tokens vedle staršího cached_tokens a možnost určit vlastní hranice ukládaného úseku ručně.
Kolik z toho dělá rychlost, se z oznámení nepozná. Jediné číslo o provozním dopadu v něm patří Mariu Rodriguezovi z GitHub Copilotu: podíl promptových tokenů, které bylo nutné zpracovat znovu, podle něj za několik měsíců klesl o víc než polovinu proti dřívějšímu stavu. Vlastní měření latence OpenAI nezveřejnila.
Zdroje
- Better prompt caching for GPT-6, OpenAI, 22. září 2026
- Prompt caching, příručka OpenAI
- API pricing, OpenAI
- Prompt caching with Azure OpenAI, Microsoft
- Katalog modelů, OpenRouter