Přeskočit na obsah
Infrastruktura 3 min čtení

Podle OpenAI LIFO pool v úložišti Habitat dál zatěžoval pomalé procesy

OpenAI popsala 11. září zpětnou vazbu v úložišti Habitat: po náporu vracely pomalé procesy spojení jako poslední a LIFO pool jim proto posílal další práci. Veřejné aiohttp se tak chovalo do řady 3.10. Verze 3.11.0 přešla na FIFO už v listopadu 2024, technický rozbor OpenAI však neuvádí verzi knihovny ani datum incidentu.

Úložiště Habitat obsluhuje přihlášení, nastavení Codexu i zahájení konverzace v ChatGPT. OpenAI 11. září zveřejnila technický rozbor jeho vývoje a v něm i poruchu, při které se provoz soustřeďoval na procesy, jež už nestíhaly. Příčinou podle firmy nebyla databáze, ale pořadí, v jakém klient znovu používal otevřená spojení.

Řady serverů v datovém centru
Řady serverů v datovém centru Virginia Tech. Foto: Christopher Bowns, Wikimedia Commons (CC BY-SA 2.0)

Poslední vrácené spojení dostalo další práci

Pool spojení nechává už navázané TCP spojení otevřené, aby je další požadavek nemusel zakládat znovu. Habitat tehdy používal klienta v Pythonu a knihovnu aiohttp. Její pool vybíral spojení způsobem LIFO: naposledy vrácené bylo první na řadě.

Po krátkém náporu se odpovědi z rychlých procesů vrátily dřív. Pomalé procesy odevzdaly svá spojení později, a proto zůstala na vrchu zásobníku. Následující požadavky zamířily právě k nim. Zátěž tak nevyrovnávala rozdíl, ale dál ho zvětšovala. OpenAI popisuje, že část procesů zůstala po skončení náporu ve zhoršeném stavu a bez restartu se sama nevzpamatovala.

Nejdřív pomohlo omezit, jak dlouho se může jedno spojení opakovaně používat. To podezření na pool potvrdilo. Trvalejší interní úprava změnila pořadí na FIFO, tedy první vrácené spojení se použije jako první. Firma dnes podle rozboru nechává většinu vyvažování a sdružování spojení na Istiu a Envoy.

Veřejné aiohttp už LIFO jako výchozí stav nemá

Zdrojový kód nezávisle potvrzuje mechanismus, ale také důležitou časovou hranici. Ve verzi aiohttp 3.10.11 vybírá metoda spojení příkazem conns.pop(), tedy z konce seznamu. Návrh číslo 9672 to 5. listopadu 2024 změnil na výběr nejstaršího volného spojení.

Osm dní nato vyšlo aiohttp 3.11.0. Jeho seznam změn výslovně říká, že pool spojení s udržovaným připojením přešel z LIFO na FIFO, aby se spojení znovu použila dřív, než se sama odpojí. V kódu stojí místo pop() příkaz popleft(); stejné pořadí má i dnešní hlavní větev.

Z toho nejde vyvodit, že OpenAI v září 2026 používá starou knihovnu. Její text neuvádí verzi aiohttp ani datum popsaného incidentu. Habitat začala firma převádět z klientské knihovny na samostatnou službu v polovině roku 2025, ale jednotlivé události v té části rozboru nedatuje. Jisté je jen to, že popsaný výchozí stav odpovídá řadě 3.10 a starší, ne současnému aiohttp.

Python obsloužil přes 20 milionů požadavků za sekundu

Pořadí spojení bylo jednou z více mezí Pythonu. Habitat vedle předávání požadavků řešila šifrování, kompresi, kontrolní součty i směrování. Tyhle výpočty brzdily plánování dalších korutin v asyncio; OpenAI ve špičkách naměřila čekání stovek milisekund, v ojedinělých případech několik sekund. Jeden proces proto dostával jen málo souběžných požadavků a služba se škálovala velkým počtem procesů.

Pythonová varianta podle firmy na vrcholu překročila 20 milionů požadavků za sekundu. Ve druhém čtvrtletí 2026 ji dva vývojáři s pomocí Codexu a GPT-5.5 přepsali do Rustu. Nová služba nyní nese 95 % produkčních požadavků; interní měření OpenAI jí přisuzuje šestkrát nižší spotřebu procesoru a patnáctkrát nižší spotřebu paměti. Nezávislé měření těchto čísel firma neodkazuje.

Dvě různá čísla na jednom webu

Současná stránka článku uvádí přes 70 milionů požadavků za sekundu, více než 500 PB dat, skoro čtyřicet oblastí a více než miliardu uživatelů týdně. RSS kanál OpenAI však tentýž text shrnuje číslem 22 milionů požadavků za sekundu. Rozdíl nevysvětluje a u kanálu je přitom datum poslední sestavy 16. září.

Číslo 22 milionů leží blízko výkonu, který rozbor připisuje starší pythonové službě, ale RSS ho vztahuje k Habitat jako celku. Bez vysvětlení od OpenAI se proto nedá rozhodnout, zda jde o starší stav, nebo o chybu v popisku. Do srovnání výkonu patří obě hodnoty; vydávat jednu z nich za jediný platný údaj by znamenalo rozpor na stránkách firmy přehlédnout.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Infrastruktura

    Nvidia cílí v Austrálii na 2 GW pro AI, rozpis po areálech ale chybí

    Nvidia spojila osm australských provozovatelů datových center pod společný cíl až 2 GW pro umělou inteligenci do roku 2027. Jednotlivá čísla v oznámení však míchají…

  2. Infrastruktura

    Dify 1.17.1 vyžaduje u Weaviate postup přes dvanáct menších verzí

    Vlastní instalace Dify s přibalenou databází Weaviate nesmí při přechodu na verzi 1.17.1 skočit rovnou z 1.27.0 na 1.39.2. Návod předepisuje zálohu a třináct spuštění…

  3. Infrastruktura

    vLLM 0.29 zapíná Model Runner V2, který dokumentace dál označuje za neúplný

    vLLM 0.29.0 změnilo 9. září výchozí cestu, která připravuje vstupy a spouští model na akcelerátoru. Model Runner V2 má zjednodušit asynchronní provoz a šetřit paměť, k…

  4. Infrastruktura

    Prompt delší než 272 tisíc tokenů zdraží u GPT-6 Astra celý požadavek

    OpenAI vydala 3. září GPT-6 Astra s oknem 1 050 000 tokenů a sazbou 10 dolarů za milion vstupních tokenů. Prompt nad 272 tisíc tokenů ale přepne účtování na dvojnásobek…