Přeskočit na obsah
U sebe doma aktualizováno 10. 8. 2026 3 min čtení

llama.cpp ohlásil změnu portu serveru z 8080 na 9931, termín neuvedl

Kdo si pouští model doma přes llama-server, najde ve výpisu novou hlášku: výchozí port se má změnit z 8080 na 9931. Kdy k tomu dojde, projekt neuvádí, a v kódu zatím zůstává osmička. Nové číslo je leetspeak zkratky ggml a v registru IANA na rozdíl od portu Ollamy zapsané není.

Pětiportový gigabitový přepínač Netgear s jedním zapojeným červeným a jedním nezapojeným žlutým kabelem
Pětiportový přepínač Netgear. Port, o který jde v tomhle článku, ale žádnou zdířku nemá: je to číslo ve spojení a llama.cpp ho mění z 8080 na 9931. Foto: Simon A. Eugster, Wikimedia Commons (CC BY-SA 3.0)

Kdo si pouští jazykový model doma přes llama-server, dostane od vydání b10240 při startu řádek navíc. Server oznámí, že se jeho výchozí port změní z 8080 na 9931. Hotové to zatím není: ve zdrojovém kódu i v dokumentaci llama.cpp zůstává osmička a hláška mluví o „některém z příštích vydání“, bez data.

Sedm řádků, které to obstarají, se do souboru tools/server/server.cpp dostalo návrhem 26508 3. srpna 2026 v 10.45 UTC. Podmínka se ptá, jestli adresa, na které server poslouchá, končí na :8080; když ano, vypíše se varování a odkaz na ten návrh. Vydání b10240 z téhož dne, o necelých čtyřicet minut později, hlášku už obsahuje. Zní doslova „NOTICE: server default port will be changed to :9931 in a future release“, tedy v překladu, že se výchozí port serveru v některém z příštích vydání změní na 9931.

Číslo 9931 má být zkratka ggml

Nové číslo náhodné není. V popisu návrhu stojí, že 9931 je leetspeak zkratky GGML, tedy jména knihovny, na které llama.cpp stojí. A změna sama je částí většího záměru: llama-server se má z příkazu, který uživatel spustí, když zrovna potřebuje model, stát trvale běžícím procesem.

Popisuje to otevřený záznam 26116 z 25. července 2026. Příkaz llama serve -hf má podle něj spustit nový server jen tehdy, když ještě žádný neběží; jinak použije ten stávající. Modely, které nejsou ve vyrovnávací paměti, si má stáhnout sám. Otázku, na kterém portu má takový server poslouchat, si autor v záznamu položil a rovnou si odpověděl číslem 9931 s poznámkou, že se rovná „ggml“ – právě odtud to číslo je.

Ten příkaz ve vydání b10240 neexistuje. Mezi nástroji projektu žádná taková položka není a ve zdrojových souborech llama-cli se jako podpříkaz nevyskytuje. Záznam zůstává otevřený a jeho autor v něm rovnou napsal, že je práce už někomu přidělená.

Režim směrovače v serveru už funguje

To, na čem má chystaný příkaz stát, hotové je. llama-server se dá spustit v režimu směrovače (router mode): stačí mu nezadat žádný model. Hlavní proces pak podle dokumentace přeposílá každý požadavek té instanci modelu, kterou si klient vyžádá – u dotazů POST polem model v těle, u dotazů GET parametrem v adrese.

Modely bere ze tří míst: z vyrovnávací paměti řízené proměnnou LLAMA_CACHE, z adresáře zadaného přepínačem --models-dir, nebo z konfiguračního souboru INI přes --models-preset. Kolik jich drží načtených naráz, určuje --models-max; výchozí hodnota jsou čtyři a nula znamená bez omezení.

V registru IANA má 8080 jméno, 9931 ne

Ani jedno z těch čísel není libovolné. Port 8080 je v registru jmen služeb a čísel portů, který vede IANA, zapsaný pro TCP i UDP pod jménem http-alt s popisem „HTTP Alternate (see port 80)“.

Číslo 9931 v registru není. Ve strojovém výpisu, který jsem si 3. srpna 2026 stáhl, nemá záznam ani ono, ani žádné z čísel 9926 až 9942; nejbližší obsazené pod ním je 9925. Zapsané číslo přitom neznamená vyhrazené: registr je evidence, ne zámek, a nic nebrání tomu, aby na 9931 poslouchal někdo jiný.

Ve stejném souboru je ale vidět i druhý přístup. Ollama, druhý rozšířený způsob, jak si pustit model u sebe, má svůj port 11434 v registru zapsaný pod jménem ollama s datem 26. září 2025. Pro llama.cpp ani pro ggml v registru žádný záznam není.

Číslo 8080 stojí ve vlastní dokumentaci na šestnácti řádcích

Přechod se dotkne hotových postupů. V README llama-serveru jsem napočítal 21 výskytů čísla 8080 na 16 řádcích: v tabulce přepínačů u --port, v ukázkovém souboru pro Docker Compose, který mapuje 8080:8080, v příkazech docker run i v ukázkách volání přes curl. A to je jen vlastní dokumentace projektu; cizí návody, hotové skripty a pravidla na branách nikdo nespočítá.

Nová hláška má navíc jeden vedlejší účinek. Rozhoduje se podle adresy, na které server poslouchá, ne podle toho, odkud se to číslo vzalo. Vyskočí proto i tomu, kdo si 8080 zadal sám přepínačem --port a na výchozí hodnotě vůbec nestojí.

Kam to míří, je vidět i bez termínu. Trvale běžící proces s vlastním portem, který si modely stahuje a přepíná sám, je přesně tvar, ve kterém funguje Ollama. llama.cpp k témuž dochází po částech: režim směrovače v serveru je hotový, číslo portu se ohlásilo teď a příkaz, který to má spojit dohromady, je zatím jen zadáním.

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    llama.cpp počítal u sedmi architektur normalizaci jinak než jejich referenční kód

    Vektory dotazů a klíčů v hybridní vrstvě Gated DeltaNet dělil llama.cpp odmocninou ořezanou zdola, kdežto knihovna, ke které se jejich referenční kód hlásí, k té…

  2. U sebe doma

    llama.cpp nechá některé velké vkládací tabulky na disku místo v operační paměti

    Projekt llama.cpp vydal 4. září 2026 verzi 0.4.0 s volbou --lazy-mode: vybraná vkládací tabulka zůstane v souboru na disku a program z ní čte řádky až ve chvíli, kdy je…

  3. U sebe doma

    Ollama 0.33.3 čte doporučené hodnoty vzorkování přímo ze souboru modelu

    Ollama do teď používala vlastní výchozí teplotu a top_p vždycky, když je nepřepsal Modelfile nebo požadavek. Verze 0.33.3 z 2. září 2026 se nejdřív podívá, co si o sobě…

  4. U sebe doma

    Hugging Face zveřejnil 207 WebGPU kernelů pro prohlížeč, loader k nim vyšel jako náhled

    Organizace webgpu-kernels na Hubu nese 207 výpočetních programů pro grafický čip pod licencí Apache 2.0 a balíček @huggingface/kernels je z prohlížeče stáhne a spustí.…