U sebe doma
Přehled článků v rubrice u sebe doma. Nejnovější nahoře.
-
Ollama vrací Codexu shrnutí konverzace jako prostý JSON v poli encrypted_content
Testovací verze Ollamy 0.34.0 přidává do rozhraní kompatibilního s OpenAI koncový bod /v1/responses/compact a rozumí spouštěči kompakce, který Codex posílá na konci vstupu. Shrnutí dělá…
-
llama.cpp sloučil pro DeepSeek V4 zhruba 137 uzlů do jednoho spuštění
Backend Vulkan v llama.cpp dostal tři sloučené operace pro hyperpropojení DeepSeeku V4. Při dekódování na Strix Halo naměřil autor změny 16,77 místo 11,16 tokenu za sekundu, ale každé…
-
llama.cpp počítal u sedmi architektur normalizaci jinak než jejich referenční kód
Vektory dotazů a klíčů v hybridní vrstvě Gated DeltaNet dělil llama.cpp odmocninou ořezanou zdola, kdežto knihovna, ke které se jejich referenční kód hlásí, k té odmocnině malé číslo…
-
llama.cpp nechá některé velké vkládací tabulky na disku místo v operační paměti
Projekt llama.cpp vydal 4. září 2026 verzi 0.4.0 s volbou --lazy-mode: vybraná vkládací tabulka zůstane v souboru na disku a program z ní čte řádky až ve chvíli, kdy je potřebuje. Sama od…
-
Ollama 0.33.3 čte doporučené hodnoty vzorkování přímo ze souboru modelu
Ollama do teď používala vlastní výchozí teplotu a top_p vždycky, když je nepřepsal Modelfile nebo požadavek. Verze 0.33.3 z 2. září 2026 se nejdřív podívá, co si o sobě napsal sám vydavatel…
-
Hugging Face zveřejnil 207 WebGPU kernelů pro prohlížeč, loader k nim vyšel jako náhled
Organizace webgpu-kernels na Hubu nese 207 výpočetních programů pro grafický čip pod licencí Apache 2.0 a balíček @huggingface/kernels je z prohlížeče stáhne a spustí. Proti ONNX Runtime…
-
Projekt llama.cpp přestal převádět pět vah Qwen3-TTS 0,6B na 16 bitů
Sestavení b10760 mění převod pomocného souboru pro model Qwen3-TTS 0,6B. Pět vah zůstane ve 32 bitech, protože mezivýsledek o hodnotě kolem 145 tisíc překračoval limit F16 a výpočet končil…
-
Nová cesta v llama.cpp zrychluje dávkové zpracování IQ vah na procesoru
Sestavení b10726 přidalo procesorový panel, který u IQ kvantizací dekóduje osm řádků vah najednou. Autor změny naměřil při dávce 512 na AMD EPYC 9654 podle modelu a formátu 1,9násobnou až 8…
-
llama-quantize si na velký tenzor bere nejvýš osm gigabajtů operační paměti
Kvantizační nástroj z llama.cpp si na každý tenzor alokoval dva pomocné bloky po čtyřech bajtech na parametr, takže u opravdu velké vkládací tabulky šly nároky do stovek gigabajtů. Od 27.…
-
llama.cpp podporuje od sestavení b10665 DSpark pro Nemotron 3.5
Sestavení llama.cpp b10665 z 28. srpna umí vedle hlavního Nemotronu 3.5 načíst samostatný draft model DSpark od Nvidie. Ten přidá 1,35 GB dat k 21,58 GB cílového repozitáře. Autor změny…
-
vLLM 0.28.0 přesunul podporu bitsandbytes z hlavního stromu do zásuvného modulu
Obsluha jazykových modelů vLLM vydala 26. srpna 2026 verzi 0.28.0 s 584 commity od 270 přispěvatelů. Podpora kvantizace bitsandbytes odešla z hlavního stromu do samostatného zásuvného…
-
SGLang odstranil přepínač pro kvantizaci, který v devíti vydáních jen hlásil chybu
Přepínač --torchao-config končil v SGLangu chybou ImportError, ať mu uživatel předal kteroukoli z povolených hodnot. Rozbil ho skok verze knihovny torchao, který se svezl s úpravou…
-
Převodník llama.cpp devět měsíců přehlížel doporučený postih za opakování
Oprava z 24. srpna 2026 mění v převodníku llama.cpp jediný řádek: doporučený postih za opakování se nově čte i pod jménem repetition_penalty. Dosud se hledal jen pod jménem penalty_repeat,…
-
Ornith 1.5 nese v repozitáři obrazový kodér, jeho karta uvádí jen generování textu
Tři velikosti modelu Ornith 1.5 vyšly 18. srpna 2026 s obrazovým kodérem, procesorem videa a šablonou rozhovoru, která počítá obrázky. V balíčcích GGUF k nim leží samostatná projekce o…
-
Kalibrační text pro kvantizaci do GGUF se projeví až pod čtyřmi bity na váhu
Vydavatel kvantizovaných kopií modelů, který na Hugging Face vystupuje jako bartowski, zveřejnil 17. srpna novou kalibrační sadu a měření, které za ní stojí. Nad zhruba čtyřmi bity na váhu…
-
Unsloth Desktop odsune při přetečení kontextu nejstarší část chatu do archivu
Unsloth vydal 20. srpna 2026 verzi 0.1.801-beta své desktopové aplikace. Dlouhý chat v ní po přetečení kontextového okna nekončí chybou: okno se vyprázdní, starší kola konverzace se…
-
Ollama 0.32.15 přestala číst metadata GGUF při každém dotazu
Server Ollamy otevíral soubor GGUF a četl z něj metadata při každém dotazu na chat i generování; autor změny odhaduje tu režii na 300 ms za volání. Verze 0.32.15 z 19. srpna 2026 si…
-
llama.cpp přidal k nočním sestavením verze 0.1.x, postup je zatím rozdělaný
llama.cpp má od 17. srpna vedle nočních značek s písmenem b i značky v0.1.0 až v0.1.2. Nová značka vznikne jen tehdy, když se soubory jeho vnitřní kopie knihovny ggml shodují s vydanou…
-
llama.cpp vypnul mapování modelu do paměti na části integrovaných grafik
llama.cpp od 11. srpna 2026 nemapuje soubor s váhami do paměti všude, kde to jde. Nový výchozí režim mapování vypne, jakmile některé ze zapojených zařízení ohlásí, že ho nepodporuje. Ve…
-
Ollama vypnula výchozí postih za opakování u modelů, které si ho samy nenastaví
Verze 0.32.10 z 12. srpna mění jednu výchozí hodnotu serveru: model, který si postih za opakování sám neurčí, dostane napříště 1,0 místo 1,1, tedy vypnuto. Ollama to zdůvodňuje tím, že…