U sebe doma
Přehled článků v rubrice u sebe doma. Nejnovější nahoře.
-
ONNX Runtime 1.29.0 sbírá data i na Linuxu, macOS, Androidu a iOS
Vydání z 12. srpna přidalo do knihovny sběr telemetrie pro Linux, macOS, Android a iOS; dosud běžel jen na Windows. V oficiálních balíčcích je zapnutý ve výchozím stavu a vypne ho proměnná…
-
Návod k modelu Ling-3.0-tiny radí zapnout zrychlení, které ten model nemá
Karta modelu Ling-3.0-tiny radí spustit ho příkazem, který zapíná spekulativní dekódování NEXTN. V konfiguraci téhož modelu ale stojí, že pomocnou vrstvu pro ně nemá, a dokumentace SGLangu…
-
vLLM 0.27.0 přeskočil PyTorch 2.12 a přechod na 2.13 stál čtyři ústupky v testech
Vydání vLLM 0.27.0 z 10. srpna 2026 má v závislostech pevně zadaný torch 2.13.0 místo dosavadního 2.11.0. Mezi těmi dvěma čísly leží dvě vydání PyTorche, která projekt přeskočil. V…
-
Muse Glimmer v Ollamě má 21 GB a zatím běží jen na Apple Silicon
Ollama 0.32.7 přidala třicetimiliardový multimodální model od Mety. Varianta pro MLX stahuje 21,2 GB dat, Meta nejmenší kvantizaci míří do 24GB paměťového rozpočtu a podporu Nvidie či AMD…
-
Ollama přestala opisovat otisky všech vrstev do konfigurace modelu
Ollama 9. srpna odstranila z hlavní vývojové větve pole rootfs.diff_ids, které do konfigurace modelu podruhé zapisovalo otisky všech vrstev. U modelů tvořených soubory pro jednotlivé…
-
Server llama.cpp umí nástroje oddělit do Dockeru, výchozí kontejner jim ale nechává síť
Nový parametr serveru llama.cpp posílá vestavěné nástroje agenta do nového nebo už běžícího kontejneru Docker. Bez něj nástroje dál běží přímo na hostitelském systému. Automaticky založený…
-
Ollama v 0.32.6 odstranila generování obrázků a odkazuje na starší verzi
Vydání Ollamy 0.32.6 ze 4. srpna 2026 smazalo ze zdrojového kódu celou část, která uměla generovat obrázky. Poznámky k vydání radí zůstat na verzi 0.32.5. Katalog modelů na ollama.com…
-
llama.cpp ohlásil změnu portu serveru z 8080 na 9931, termín neuvedl
Kdo si pouští model doma přes llama-server, najde ve výpisu novou hlášku: výchozí port se má změnit z 8080 na 9931. Kdy k tomu dojde, projekt neuvádí, a v kódu zatím zůstává osmička. Nové…
-
Nanbeige 4.2 se vejde do telefonu na 2,58 GB, kontext v něm spadl na 4 096 tokenů
Na Hugging Face přibyl převod čínského modelu Nanbeige 4.2 do formátu běhového prostředí LiteRT-LM: jediný soubor o velikosti 2,58 GB, čtyřbitové váhy a kontext 4 096 tokenů místo 262 144,…
-
Laguna S 2.1 uvádí milion tokenů kontextu, vlastní GGUF od výrobce má 256 tisíc
Firma poolside vydala 21. července otevřené váhy modelu Laguna S 2.1 se 118 miliardami parametrů a kontextovým oknem 1 048 576 tokenů. Balíčky GGUF, které k němu sama nabízí, jsou ale…
-
llama.cpp ve Windows zapíná rychlé jádro na Intel Xe2 a Xe3 od verze 8860
Vydání b10215 z 31. července zrušilo plošné vypnutí rychlé Walshovy-Hadamardovy transformace na grafikách Intel ve Windows. Na architekturách Xe2 a Xe3 ji povolí až s ovladačem 32.0.101…
-
Llama.cpp umí dvoubitový Q2_0 i na kartách NVIDIA a ternární model 8B má 2,15 GiB.
Do hlavní větve llama.cpp přibyla 30. července 2026 podpora formátu Q2_0 pro karty NVIDIA, o den později i pro rozhraní SYCL. Formát ukládá váhu do dvou bitů a s jedním měřítkem na každých…
-
vLLM vyřadil Fuyu, Persimmon a první TeleChat kvůli malému využití
Vydání vLLM 0.26.0 z 27. července přestalo podporovat architektury Fuyu, Persimmon a první generaci TeleChatu. Oba návrhy změn uvádějí jako důvod nízké využití, psané pravidlo projektu…
-
Kimi K3 má i v jednobitové verzi 594 GB a chce 610 GB paměti
Moonshot vydal 27. července váhy modelu Kimi K3 o velikosti 1,56 TB. Firma Unsloth k nim během dvou dnů dodala zmenšené verze; nejmenší má 594 GB a podle jejího vlastního měření se v 78,9 %…