Codex CLI 0.155 přidal hlasové konverzace přímo do terminálu
OpenAI vydala 17. září Codex CLI 0.155.0 s experimentálním hlasovým režimem. Uživatel mluví do mikrofonu, v terminálu vidí živý přepis a odpověď slyší; funkce se musí ručně zapnout a vyžaduje sestavení s nativním zvukovým balíkem. Aktuální opravná verze 0.155.1 ji zachovává.
OpenAI přidala do Codexu konverzaci vedenou hlasem. Poznámky k vydání ji vedou mezi novinkami Codex CLI 0.155.0 z 17. září 2026. Nejde o diktování jednoho zadání: mikrofon zůstává otevřený pro rozhovor, terminál průběžně ukazuje přepis a hotovou odpověď agent přečte.
Funkce je experimentální a ve výchozím nastavení vypnutá. V novější opravné verzi 0.155.1 zůstává, takže ji OpenAI po prvním vydání nestáhla. Kdo ji v nabídce nevidí, nemusí mít špatné nastavení – hlas se ukazuje jen v balíku, který obsahuje potřebný nativní zvukový modul.

Zapnutí vyžaduje restart Codexu
Postup podle OpenAI má tři kroky. V textovém rozhraní se otevře nabídka /experimental, v ní se zapnou Voice conversations a Codex se restartuje. Novou relaci pak spustí příkaz /voice. Změna, která přepínač zveřejnila, nese interní klíč realtime_conversation a výslovně ho nechává ve stavu default_enabled: false.
Ve starší značce 0.154.0 byl tentýž příznak vedený jako odstraněný. Ve zdroji 0.155.1 už má název Voice conversations, popis „Talk with Codex using /voice“ a oznámení s pokynem k restartu. Rozdíl značek tak potvrzuje, že se funkce objevila právě v řadě 0.155, ne jen ve vývojové větvi.
Hlasový režim odděluje mluvení od práce agenta
Hlavní návrh změny rozlišuje hlasovou konverzaci a vlastní práci Codexu. Živý přepis se zobrazuje v terminálu. Když hlasová část předá agentovi úkol, jeho uvažování a průběžné komentáře se nepředčítají; zvukem se vrátí až finální odpověď. Odpověď zadaná běžným psaným příkazem naopak zůstane jen textová.
Tohle rozdělení brání tomu, aby terminál četl nahlas celý pracovní výpis včetně příkazů a výsledků nástrojů. Přepis ani rozpracovaná odpověď se přitom při přepnutí mezi vlákny nemají ztratit. Zdroj popisuje uchování titulků i nedodané odpovědi, dokud se uživatel k vláknu nevrátí.
Zvuk vede WebRTC a lokální pomocný program
Hlasová část používá WebRTC, tedy stejnou rodinu technologií, která přenáší zvuk při hovoru v prohlížeči. Codex vyjedná spojení přes aplikační server, ale k mikrofonu a reproduktorům sahá místní pomocný program. Zařízení se podle zdrojového kódu otevřou až po dokončení vyjednání spojení a zpočátku mají mikrofon i zvukový výstup potlačený.
Kontrola podpory připouští macOS, Linux a Windows sestavený nástroji MSVC. Samotný název systému ale nestačí: v instalačním balíku musí být také program codex-voice-host a knihovna GStreamer. Když chybějí, položka Voice conversations se v nabídce experimentů vůbec neukáže. Registr npm u balíčku 0.155.0 potvrzuje samostatné části pro Windows, macOS a Linux na procesorech x64 i Arm64; přítomnost balíku však sama ještě nedokládá, že zvukové zařízení nebo spojení v konkrétním počítači projde.
Mikrofon má příkaz i klávesovou zkratku
Aktivní relaci řídí příkazy /voice mute a /voice stop. Mikrofon lze během hovoru vypnout a znovu zapnout také zkratkou Ctrl+X. Druhá změna v téže sérii k tomu přidala tečku nahrávání v titulku terminálu, čtyřvzorkové ukazatele hlasitosti vykreslené braillovými znaky a krátké potvrzení, když vstup uživatele přeruší právě přehrávanou odpověď.
Pořadí změn mikrofonu kód zachovává. Když se fronta ovládacích povelů zaplní nebo spojení s pomocným programem zmizí, relace se ukončí místo toho, aby některý povel tiše zahodila. To je podstatné právě u vypnutí mikrofonu: zobrazený stav nemá tvrdit, že je mikrofon ztlumený, pokud se povel ke zvukové části nedostal.
Přepis se nemá objevit v ladicím záznamu
Mluvené zadání může obsahovat heslo, adresu serveru nebo jiný údaj z pracovního prostředí. Návrh změny proto odstranil text událostí a mluvený přepis ze záznamů o přijetí a z ladicích hlášek. Záznam dál potvrdí, že událost přišla, ale nevypíše její obsah. Tohle není slib, že se zvuk či přepis nikde nezpracovává; je to konkrétní ochrana dvou druhů místních logů.
Hlasová relace se také zastaví při porušení pravidla proti nežádoucímu chování modelu. Už zařazená, ale ještě nespouštěná hlasová předání se v takové chvíli zablokují. Nové spuštění začíná s čistým stavem, takže zákaz z předchozí relace se na další nepřenese.
Vydaná funkce pořád zůstává pokusem
Verze 0.155.0 je podle záznamu vydání na GitHubu řádné, nikoli předběžné vydání. Hlas uvnitř něj má ale jiný stav: experiment. OpenAI omezuje dostupnost podle přibaleného modulu, žádá ruční zapnutí a neuvádí záruku, že bude fungovat na každém podporovaném systému.
Opravná verze 0.155.1 měnila výchozí nastavení souhrnů uvažování, ne hlas. Kdo chce novinku vyzkoušet, má tedy použít aktuální vydání, nikoli se vracet přesně na 0.155.0. Jestli se Voice conversations v /experimental neobjeví, zdrojový kód dává první kontrolní otázku: obsahuje instalace nativní hlasový modul?
Zdroje
- Changelog ChatGPT a Codexu – datum vydání a souhrn hlasového režimu ve verzi 0.155.0
- Codex CLI 0.155.0 na GitHubu – stav vydání a úplný seznam změn
- Add live WebRTC voice conversations to the TUI – přenos zvuku, přepisy, mluvené odpovědi a ochrana logů
- Expose voice conversations in experimental features – zapnutí, restart a omezení na sestavení s nativním modulem
- Add voice mute shortcut and recording activity indicators – zkratka mikrofonu a ukazatele hlasitosti
- Balíček @openai/codex 0.155.0 v registru npm – vydaná verze a platformní balíky