Všechny články
Kompletní výpis, od nejnovějšího.
-
Nová cesta v llama.cpp zrychluje dávkové zpracování IQ vah na procesoru
Sestavení b10726 přidalo procesorový panel, který u IQ kvantizací dekóduje osm řádků vah najednou. Autor změny naměřil při dávce 512 na AMD EPYC 9654 podle modelu a formátu 1,9násobnou až 8…
-
Váhy modelu Hy4 preview se ani ve verzi FP8 nevejdou na osm karet po 80 GB
Tencent nahrál na Hugging Face váhy vlajkového modelu Hy4 preview a dal je pod licenci Apache 2.0. Součet 131 souborů v repozitáři dá 1 560 GB, kvantizovaná verze FP8 zabere 813,8 GB. Návod…
-
Superwhisper přidal do licence S1-mini povinnost uvádět model původním jménem
Superwhisper zveřejnil 12. srpna 2026 model S1-mini pro čištění přepisů řeči a přiložil k němu čistý text licence Apache 2.0. Pátý den po vydání do souboru přibyla podmínka navíc: model se…
-
Vazba NIXL pro Rust běžela ve dvou obrazech Dynama na náhradních funkcích
NVIDIA vydala 29. srpna opravu Dynama 1.4.2. Ve dvou jeho kontejnerových obrazech ležela knihovna NIXL v adresáři, kam dynamický zavaděč nedohlédne; přitom je to ona, kdo při rozděleném…
-
Na vlastním testu Pipecatu vyskočil doladěný Nemotron 3 Nano z 28,6 na 72,3 procenta
Tým Pipecat vydal PhoneLLM Alpha 1, plné doladění modelu NVIDIA Nemotron 3 Nano 30B-A3B na telefonní hovory. Na vlastním žebříčku PhoneBench mu skóre stouplo z 28,6 na 72,3 %, tedy z…
-
MLflow ve verzích 2.1.0 až 3.14.x ignoroval zákaz pickle u modelů statsmodels
Bezpečnostní volba v MLflow měla zastavit načítání modelů uložených pomocí pickle, integrace statsmodels ji ale nekontrolovala. Upravený modelový artefakt proto mohl při načtení spustit kód…
-
NVIDIA přesouvá řadič paměti z akcelerátoru do základního čipu NVHBM
NVIDIA oznámila NVHBM, která přesouvá řadič paměti z akcelerátoru do základního čipu v HBM. Proti HBM4E slibuje až o 30 % vyšší propustnost a o 15 % nižší spotřebu, u uvolněné plochy ale…
-
Triton 3.8.0 překládá jádra pro Rubin, který je zatím jen v náhledu dokumentace PTX
Vydání z 28. srpna přidalo do překladače Triton cíl „cuda:107“ pro architekturu, kterou NVIDIA popisuje zatím jen ve vývojářském náhledu dokumentace PTX. Z Tritonu i z toho náhledu se dá…
-
Záznamy CVE k platformě Cohere North neříkají, která verze je opravená
Databáze NVD zveřejnila 26. srpna čtyři záznamy o podnikové agentní platformě Cohere North ve verzi 1.1.5. Jméno produktu je v nich jen ve větě popisu; v polích pro výrobce, produkt a verzi…
-
Nanbeige 4.2 pouští svých dvaadvacet vrstev dvakrát za sebou
Model Nanbeige4.2-3B předčí v agentních testech podstatně větší modely a přitom má jen tři miliardy parametrů mimo vloženiny. Konfigurace prozrazuje proč: dvaadvacet vrstev vah se na každém…
-
Záznam CVE popsal chybu FaceFusionu až dva měsíce po její opravě
FaceFusion do verze 3.6.1 skládal cestu k souboru úlohy přímo z názvu, který přijalo rozhraní Gradio bez přihlášení. Cizí klient tak mohl zapsat JSON mimo pracovní adresář. Verze 3.7.0…
-
llama-quantize si na velký tenzor bere nejvýš osm gigabajtů operační paměti
Kvantizační nástroj z llama.cpp si na každý tenzor alokoval dva pomocné bloky po čtyřech bajtech na parametr, takže u opravdu velké vkládací tabulky šly nároky do stovek gigabajtů. Od 27.…
-
Pydantic AI 2.37 už váže volání nástroje k oznámené zprávě
Pydantic AI při odpovědi tvořené jen voláním nástroje posílala odkaz na zprávu, kterou proud AG-UI nikdy nezahájil. Verze 2.37.0 přidává prázdný pár začátku a konce zprávy; assistant-ui 0.0…
-
Modul mcp.server.fastmcp se do SDK vrátil jen proto, aby spadl s odkazem na návod
Přejmenování třídy FastMCP na MCPServer nechalo ve druhé verzi knihovny mcp starý import padat na holé hlášce, ze které se nedalo poznat, že je nainstalovaná jiná hlavní verze. Vydání 2.1.1…
-
Projekt llama.cpp přestal převádět pět vah Qwen3-TTS 0,6B na 16 bitů
Sestavení b10760 mění převod pomocného souboru pro model Qwen3-TTS 0,6B. Pět vah zůstane ve 32 bitech, protože mezivýsledek o hodnotě kolem 145 tisíc překračoval limit F16 a výpočet končil…
-
Dohled v PILOTu umí přesměrovat běžícího agenta
Preprint týmu AllSpark z 27. srpna popisuje agenta, jehož práci za běhu sleduje a směruje druhý agent. PILOT v Terminal-Bench 2.0 překonal nejlepší srovnávaný nástroj o 4,4 až 5,0…
-
GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev
Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne rozměrů. Levný je proto,…
-
Nová licence Qwenu chce zvláštní smlouvu i po malém poskytovateli inference
Qwen dal 24. srpna 2026 váhám modelu Qwen3.8-Flash-Next licenci Qwen Community License 1.0. Od licence svého největšího modelu, která vyšla o šestnáct dní dřív, se liší jedinou větou: chybí…
-
CowAgent má dvě nová CVE kvůli výstupu příkazů a sdílenému prohlížeči
Dva záznamy CVE zveřejněné 2. září popisují odmítnutí služby v agentním nástroji CowAgent. Nástroj Bash hromadí celý výstup příkazu před jeho zkrácením, zatímco prohlížeč nechá dlouhou…
-
Tři servery MCP dostaly týž den záznam CVE za to, že si neověřovaly volajícího
Dropbox, Timescale a ByteDance mají od 27. srpna 2026 každý svůj záznam CVE k serveru protokolu MCP a příčiny se překrývají. Obě oficiální sady MCP umí odmítnout požadavek, jehož hlavička…