Přeskočit na obsah
U sebe doma 3 min čtení

vLLM 0.27.0 přeskočil PyTorch 2.12 a přechod na 2.13 stál čtyři ústupky v testech

Vydání vLLM 0.27.0 z 10. srpna 2026 má v závislostech pevně zadaný torch 2.13.0 místo dosavadního 2.11.0. Mezi těmi dvěma čísly leží dvě vydání PyTorche, která projekt přeskočil. V poznámkách je z toho jeden řádek, v samotné změně čtyři místa, kde se testům muselo ulevit.

Řady serverových skříní ve strojovně
vLLM se instaluje tam, kde vedle něj v témže prostředí běží další knihovny. Foto: The National Archives (UK), Wikimedia Commons (CC BY 3.0)

Vydání vLLM 0.27.0 vyšlo 10. srpna 2026 a v jeho závislostech přibyla jedna položka, kterou nejde odložit na jindy: nástroj žádá torch==2.13.0. Předchozí vydání 0.26.0 z 27. července žádalo torch==2.11.0. Obě čísla stojí v metadatech balíčku na PyPI, tedy v tom, co instalátor při aktualizaci opravdu čte.

Mezi oběma verzemi PyTorche leží další dvě. Verze 2.11.0 vyšla 23. března 2026, 2.12.0 pak 13. května, 2.12.1 18. června a 2.13.0 8. července. vLLM tedy obě dvanáctky vynechal a jde rovnou na třináctku. Vlastní poznámky k vydání to odbývají jednou půlvětou: je to změna, která rozbije prostředí.

Pin je přesná rovnost, ne dolní mez

Zápis torch==2.13.0 nedovoluje nic jiného. Kdo si vLLM aktualizuje v prostředí, kde už nějaký PyTorch je, dostane tenhle místo něj – a s ním torchvision 0.28.0, protože i ta má v metadatech torch==2.13.0. Obě knihovny se drží navzájem, takže vycouvat jen z jedné nejde.

Stažení není zanedbatelné. Balíček torch 2.13.0 pro Linux na x86_64 má podle PyPI 502,2 MB, a to je jen on sám, bez knihoven NVIDIA, které si přitáhne.

Triton, který poznámky k vydání jmenují taky, v seznamu vLLM vůbec nestojí. Přichází přes PyTorch: torch 2.13.0 si žádá triton==3.7.1, ale jen na Linuxu a jen pro Python nižší než 3.15. Na Windows a macOS se tedy neinstaluje vůbec.

Čtyři místa, kde se testům muselo ulevit

Přechod zařídil návrh změny #48155, sloučený 23. července. Je malý: patnáct souborů, 69 přidaných a 37 odebraných řádků. Tři z těch souborů jsou ale testy a čtvrtý je zkušební skript pro procesory, a ve všech čtyřech se něco povolilo.

  • Zkouška shody na procesorech přestala vypínat torch.compile proměnnou TORCH_COMPILE_DISABLE=1 a dělá to přepínačem --enforce-eager. Proč, stojí v komentáři přímo ve skriptu: torch od verze 2.12 tu proměnnou při požadavku na úplný graf už nebere jako tichý vypínač.
  • U modelu Qwen2-Audio dostalo pořadí „nejdřív text, potom zvuk“ značku xfail, tedy očekávané selhání. Komentář odkazuje na hlášení pytorch/pytorch#184431: výsledek počítaný z předaných vektorů se rozchází s výsledkem z holého textu.
  • U Qwen2-VL s více obrázky se na procesorech zkrátil počet generovaných tokenů ze 128 na 64 a okno sledovaných pravděpodobností se rozšířilo z deseti na dvacet. Komentář v testu říká, že torch 2.13 v téhle cestě nasčítá numerický posun a že širší okno udělat nejde, protože dvacet je strop. Porovnává se proto jen ta část výstupu, která leží před rozchodem.
  • Import rozšíření nixl_ep padá na nesouladu binárního rozhraní a test to nově bere jako očekávané selhání. Podle komentáře se knihovna musí přestavět proti torch 2.13; do té doby chybí symbol, který si vyžádala.

Návrh výslovně vynechal ROCm a architekturu s390x. Sestavy pro Intel XPU a pro procesory přešly na torch 2.13 zvlášť, jinými změnami.

Co se naopak nemění

torchaudio zůstalo na 2.11.0, protože novější vydané není. Vedle sebe tak v jednom prostředí stojí torch 2.13 a torchaudio o dvě verze pozadu; instalátor si toho nevšimne, protože torchaudio 2.11.0 nemá v metadatech uvedenou ani jednu závislost, takže nemá co porovnat.

Nemění se ani generace CUDA. Torch 2.11.0 už táhl balíčky s příponou cu13 a 2.13.0 v tom pokračuje, posunula se jen čísla uvnitř – cuDNN z 9.19.0.56 na 9.20.0.48, NCCL z 2.28.9 na 2.29.7 a cuSPARSELt z 0.8.0 na 0.8.1.

Beze změny zůstal i požadavek transformers>=5.5.3, tedy dolní mez bez horní. Poznámky k vydání přitom uvádějí, že se vLLM sladilo s knihovnou Transformers 5.14.1 z 16. července. Verze 5.15.0 vyšla 10. srpna, tedy v týž den jako vLLM 0.27.0, a čerstvá instalace si vezme ji.

A stejně tak zůstala horní mez na Pythonu: vLLM dál žádá verzi nižší než 3.15, přesně jako 0.26.0. PyTorch 2.13 přitom mezi svými novinkami vypisuje právě balíčky pro Python 3.15 včetně varianty bez globálního zámku interpretu. Uživatel vLLM se k nim zatím nedostane.

Sledovaná regrese je v samotném PyTorchi

Poznámky k PyTorchi 2.13 mají vlastní oddíl pro chyby, o kterých projekt při vydání věděl. Je v něm jedna a týká se karet AMD: balíček torch==2.13.0+rocm7.2 spuštěný tam, kde žádné GPU není, rozbije torch.compile na procesoru hláškou o nerozpoznané vektorové instrukční sadě. Ve verzi 2.12.1 to ve stejném prostředí fungovalo. Projekt to vede jako hlášení #189194 a radí buď ten balíček pouštět na obrazu s ROCm, nebo pro prostředí bez karty vzít běžnou sestavu.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. U sebe doma

    llama.cpp počítal u sedmi architektur normalizaci jinak než jejich referenční kód

    Vektory dotazů a klíčů v hybridní vrstvě Gated DeltaNet dělil llama.cpp odmocninou ořezanou zdola, kdežto knihovna, ke které se jejich referenční kód hlásí, k té…

  2. U sebe doma

    llama.cpp nechá některé velké vkládací tabulky na disku místo v operační paměti

    Projekt llama.cpp vydal 4. září 2026 verzi 0.4.0 s volbou --lazy-mode: vybraná vkládací tabulka zůstane v souboru na disku a program z ní čte řádky až ve chvíli, kdy je…

  3. U sebe doma

    Ollama 0.33.3 čte doporučené hodnoty vzorkování přímo ze souboru modelu

    Ollama do teď používala vlastní výchozí teplotu a top_p vždycky, když je nepřepsal Modelfile nebo požadavek. Verze 0.33.3 z 2. září 2026 se nejdřív podívá, co si o sobě…

  4. U sebe doma

    Hugging Face zveřejnil 207 WebGPU kernelů pro prohlížeč, loader k nim vyšel jako náhled

    Organizace webgpu-kernels na Hubu nese 207 výpočetních programů pro grafický čip pod licencí Apache 2.0 a balíček @huggingface/kernels je z prohlížeče stáhne a spustí.…