Přeskočit na obsah

Všechny články

Kompletní výpis, od nejnovějšího.

  1. U sebe doma

    Nová cesta v llama.cpp zrychluje dávkové zpracování IQ vah na procesoru

    Sestavení b10726 přidalo procesorový panel, který u IQ kvantizací dekóduje osm řádků vah najednou. Autor změny naměřil při dávce 512 na AMD EPYC 9654 podle modelu a formátu 1,9násobnou až 8…

  2. Čísla

    Váhy modelu Hy4 preview se ani ve verzi FP8 nevejdou na osm karet po 80 GB

    Tencent nahrál na Hugging Face váhy vlajkového modelu Hy4 preview a dal je pod licenci Apache 2.0. Součet 131 souborů v repozitáři dá 1 560 GB, kvantizovaná verze FP8 zabere 813,8 GB. Návod…

  3. Licence a podmínky

    Superwhisper přidal do licence S1-mini povinnost uvádět model původním jménem

    Superwhisper zveřejnil 12. srpna 2026 model S1-mini pro čištění přepisů řeči a přiložil k němu čistý text licence Apache 2.0. Pátý den po vydání do souboru přibyla podmínka navíc: model se…

  4. Infrastruktura

    Vazba NIXL pro Rust běžela ve dvou obrazech Dynama na náhradních funkcích

    NVIDIA vydala 29. srpna opravu Dynama 1.4.2. Ve dvou jeho kontejnerových obrazech ležela knihovna NIXL v adresáři, kam dynamický zavaděč nedohlédne; přitom je to ona, kdo při rozděleném…

  5. Modely

    Na vlastním testu Pipecatu vyskočil doladěný Nemotron 3 Nano z 28,6 na 72,3 procenta

    Tým Pipecat vydal PhoneLLM Alpha 1, plné doladění modelu NVIDIA Nemotron 3 Nano 30B-A3B na telefonní hovory. Na vlastním žebříčku PhoneBench mu skóre stouplo z 28,6 na 72,3 %, tedy z…

  6. Bezpečnost

    MLflow ve verzích 2.1.0 až 3.14.x ignoroval zákaz pickle u modelů statsmodels

    Bezpečnostní volba v MLflow měla zastavit načítání modelů uložených pomocí pickle, integrace statsmodels ji ale nekontrolovala. Upravený modelový artefakt proto mohl při načtení spustit kód…

  7. Infrastruktura

    NVIDIA přesouvá řadič paměti z akcelerátoru do základního čipu NVHBM

    NVIDIA oznámila NVHBM, která přesouvá řadič paměti z akcelerátoru do základního čipu v HBM. Proti HBM4E slibuje až o 30 % vyšší propustnost a o 15 % nižší spotřebu, u uvolněné plochy ale…

  8. Infrastruktura

    Triton 3.8.0 překládá jádra pro Rubin, který je zatím jen v náhledu dokumentace PTX

    Vydání z 28. srpna přidalo do překladače Triton cíl „cuda:107“ pro architekturu, kterou NVIDIA popisuje zatím jen ve vývojářském náhledu dokumentace PTX. Z Tritonu i z toho náhledu se dá…

  9. Bezpečnost

    Záznamy CVE k platformě Cohere North neříkají, která verze je opravená

    Databáze NVD zveřejnila 26. srpna čtyři záznamy o podnikové agentní platformě Cohere North ve verzi 1.1.5. Jméno produktu je v nich jen ve větě popisu; v polích pro výrobce, produkt a verzi…

  10. Modely

    Nanbeige 4.2 pouští svých dvaadvacet vrstev dvakrát za sebou

    Model Nanbeige4.2-3B předčí v agentních testech podstatně větší modely a přitom má jen tři miliardy parametrů mimo vloženiny. Konfigurace prozrazuje proč: dvaadvacet vrstev vah se na každém…

  11. Bezpečnost

    Záznam CVE popsal chybu FaceFusionu až dva měsíce po její opravě

    FaceFusion do verze 3.6.1 skládal cestu k souboru úlohy přímo z názvu, který přijalo rozhraní Gradio bez přihlášení. Cizí klient tak mohl zapsat JSON mimo pracovní adresář. Verze 3.7.0…

  12. U sebe doma

    llama-quantize si na velký tenzor bere nejvýš osm gigabajtů operační paměti

    Kvantizační nástroj z llama.cpp si na každý tenzor alokoval dva pomocné bloky po čtyřech bajtech na parametr, takže u opravdu velké vkládací tabulky šly nároky do stovek gigabajtů. Od 27.…

  13. Nástroje

    Pydantic AI 2.37 už váže volání nástroje k oznámené zprávě

    Pydantic AI při odpovědi tvořené jen voláním nástroje posílala odkaz na zprávu, kterou proud AG-UI nikdy nezahájil. Verze 2.37.0 přidává prázdný pár začátku a konce zprávy; assistant-ui 0.0…

  14. Nástroje

    Modul mcp.server.fastmcp se do SDK vrátil jen proto, aby spadl s odkazem na návod

    Přejmenování třídy FastMCP na MCPServer nechalo ve druhé verzi knihovny mcp starý import padat na holé hlášce, ze které se nedalo poznat, že je nainstalovaná jiná hlavní verze. Vydání 2.1.1…

  15. U sebe doma

    Projekt llama.cpp přestal převádět pět vah Qwen3-TTS 0,6B na 16 bitů

    Sestavení b10760 mění převod pomocného souboru pro model Qwen3-TTS 0,6B. Pět vah zůstane ve 32 bitech, protože mezivýsledek o hodnotě kolem 145 tisíc překračoval limit F16 a výpočet končil…

  16. Nástroje

    Dohled v PILOTu umí přesměrovat běžícího agenta

    Preprint týmu AllSpark z 27. srpna popisuje agenta, jehož práci za běhu sleduje a směruje druhý agent. PILOT v Terminal-Bench 2.0 překonal nejlepší srovnávaný nástroj o 4,4 až 5,0…

  17. Modely

    GLM-5.3-Flash si drží KV cache jen v jedenácti ze 45 vrstev

    Váhy modelu GLM-5.3-Flash jsou na Hugging Face pod licencí MIT: 321,3 miliardy parametrů v 62 souborech, dohromady 328,3 GB. Slovo „Flash“ se týká ceny provozu, ne rozměrů. Levný je proto,…

  18. Licence a podmínky

    Nová licence Qwenu chce zvláštní smlouvu i po malém poskytovateli inference

    Qwen dal 24. srpna 2026 váhám modelu Qwen3.8-Flash-Next licenci Qwen Community License 1.0. Od licence svého největšího modelu, která vyšla o šestnáct dní dřív, se liší jedinou větou: chybí…

  19. Bezpečnost

    CowAgent má dvě nová CVE kvůli výstupu příkazů a sdílenému prohlížeči

    Dva záznamy CVE zveřejněné 2. září popisují odmítnutí služby v agentním nástroji CowAgent. Nástroj Bash hromadí celý výstup příkazu před jeho zkrácením, zatímco prohlížeč nechá dlouhou…

  20. Bezpečnost

    Tři servery MCP dostaly týž den záznam CVE za to, že si neověřovaly volajícího

    Dropbox, Timescale a ByteDance mají od 27. srpna 2026 každý svůj záznam CVE k serveru protokolu MCP a příčiny se překrývají. Obě oficiální sady MCP umí odmítnout požadavek, jehož hlavička…