Přeskočit na obsah
Modely 3 min čtení

Anthropic vyjmenoval u Sonnetu 5.5 pět změn, které rozbijí kód psaný pro Sonnet 5

Claude Sonnet 5.5 vyšel 28. září a stojí stejně jako jeho předchůdce, dva dolary za milion vstupních tokenů a deset za výstupní. Kontext zůstal na milionu tokenů, jenže v rozhraní se změnilo pět věcí, po kterých požadavek napsaný pro Sonnet 5 skončí chybou 400. Šestá změna žádnou chybu nevrátí: aplikace jen přestane mezi voláními nástrojů vypisovat text.

Anthropic vydal 28. září model Claude Sonnet 5.5 a v poznámkách k vydání platformy u něj rovnou uvedl, co se po přechodu rozbije. Je to pět změn v rozhraní, po kterých požadavek napsaný pro Sonnet 5 skončí chybou 400. Šestá změna žádnou chybu nevrátí.

Zdrojový kód na obrazovce
Změny se týkají kódu, ne ceníku. Foto: Martin Vorel, Wikimedia Commons (CC BY-SA 4.0)

Ceník zůstal, rozhraní ne

Sazby se nezměnily ani o cent. Stránka modelu uvádí 2 dolary za milion vstupních tokenů a 10 dolarů za milion výstupních; oznámení k tomu přidává 0,20 dolaru za milion tokenů čtených z mezipaměti. Sonnet 5, vydaný 30. června, má stejná čísla. Stejný zůstal i kontext (milion tokenů), strop výstupu (128 tisíc tokenů) i tokenizér, takže týž text vyjde na stejný počet tokenů jako dřív.

Proti Opusu 5.5, který o šest dní dřív sazby snížil o pětinu, je to jiný postup: zlevnit to má tím, že model spotřebuje na tutéž práci méně tokenů. Firma v oznámení píše, že Sonnet 5.5 běží o 30 % a více rychleji a že podle jejího vlastního testování stojí úloha až o 30 % méně. Obojí je zatím tvrzení výrobce; na čem se měřilo, oznámení neuvádí.

Pět požadavků, které skončí chybou 400

Přehled těch změn má Anthropic na samostatné stránce What’s new in Claude Sonnet 5.5:

  • Vypnout uvažování se musí jinak. Dosavadní thinking: {"type": "disabled"} vrací chybu, která odkazuje na nový režim between_tools. Ten navíc neprojde při dvou nejvyšších stupních parametru effort.
  • Vynucené volání nástroje skončilo. Hodnoty any a tool v poli tool_choice model odmítne. Tatáž kontrola platí i pro koncové místo, které jen počítá tokeny.
  • Bloky thinking patří k modelu, který je napsal. Sonnet 5.5 přečte bloky od Sonnetu 5 a starších modelů, ale ne od Opusu 5 a 5.5 ani od řad Fable a Mythos. Jeho vlastní bloky nepřečte žádný jiný model.
  • Starší nástroj pro ovládání počítače neprojde. Na Claude API a na Google Cloudu vrátí computer_20251124 chybu; přijímá se jen novější sada computer_toolset_20260801. Na Amazon Bedrocku přitom starý nástroj dál funguje, takže se tatáž aplikace chová na dvou platformách jinak.
  • Poradní model se musí vyměnit. Nástroj advisor, který si nechá poradit od druhého modelu, odmítne se Sonnetem 5.5 Opus 4.8, Opus 4.7 i Sonnet 5.

Šestá změna nic nenahlásí

Zajímavější než chyby je změna, která žádnou chybu nevyvolá. Delší poznámky, které model píše mezi dvěma voláními nástrojů, se nově nevracejí jako běžný text, ale jako bloky thinking s průběžnou zprávou. A protože výchozí nastavení display má hodnotu omitted, je text takového bloku prázdný.

Aplikace, která ty poznámky průběžně ukazuje uživateli, tedy mezi voláními nástrojů zmlkne. Požadavek projde, odpověď dorazí, do logu se nic nezapíše. Napravit se to dá buď nastavením display, nebo přepnutím na between_tools. Kratší poznámky, delší nanejvýš o větu či dvě, se dál vracejí jako text – závada se tedy projeví jen někdy.

Uvažování drží účet, který ho vytvořil

Druhá tichá změna se týká sdílení mezi účty. Bloky thinking, které vyrobí Sonnet 5.5, platí jen v účtu, kde vznikly, nebo v účtu s ním propojeném. Když je pošle někdo jiný, rozhraní blok zahodí dřív, než ho model uvidí – a požadavek uspěje. U starších modelů to neplatilo.

Že k zahození došlo, se zjistit dá, ale musí se o to požádat: s hlavičkou thinking-binding-controls-2026-08-01 vypíše odpověď každý zahozený blok v poli input_transformations s důvodem organization_binding_mismatch. Bez té hlavičky se model prostě zamyslí znovu – a zaplatí se to.

Co naměřil někdo jiný

Vlastní čísla k modelu zveřejnil Cursor, který ho zařadil do nabídky. Ve své dokumentaci uvádí výsledek 55,5 % ve vlastním testu CursorBench při nejvyšším stupni effort a 35,8 % při nejnižším. K tomu dodává, že nejvyšší stupeň stojí na jednu úlohu zhruba šestkrát víc než výchozí. Je to měření jednoho provozovatele na vlastní sadě úloh, ne nezávislé ověření toho, co tvrdí Anthropic – ale aspoň říká, čím se za lepší skóre platí.

Vývojář Simon Willison, který nové modely zkouší toutož úlohou už roky, popsal i jednu poruchu: při stupni max model prouvažoval 128 tisíc tokenů za 1,28 dolaru, došly mu tokeny a zadaný obrázek nevznikl. Totéž se mu stalo u Opusu 5.5. O stupeň níž úloha doběhla za 41 sekund a necelých šest centů.

Co z toho plyne pro toho, kdo na Claudovi staví

Vydání, které nemění ceník ani velikost kontextu, vypadá jako aktualizace, kterou stačí přepnout v nastavení. Tady to neplatí: pět změn se ohlásí chybou hned, jedna se projeví až tím, že uživateli přestane přibývat text, a jedna tím, že se uvažování zaplatí podruhé. Anthropic k tomu vydal průvodce přechodem s porovnáním požadavků před změnou a po ní.

Firma zároveň upozorňuje, že se překalibrovaly stupně parametru effort: táž hodnota na Sonnetu 5.5 neznamená tolik uvažování jako na Sonnetu 5. Doporučení zní změřit si to znovu, ne nastavení přenést. Poslední člen řady, Haiku 5.5, má podle oznámení přijít v nadcházejících týdnech – přesné datum v něm není.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    NVIDIA měřila nový diarizační model u šesti z osmi sad proti jiným referenčním štítkům

    NVIDIA vydala 23. září model Nemotron 3 Diarization, který v nahrávce rozliší až osm mluvčích a zvládne to i za běhu. Proti předchozí verzi klesla chybovost v průměru o…

  2. Modely

    Gemini 3.8 Live dostal avatar pro firemní agenty

    Google přidal k modelu Gemini 3.8 Live obrazový výstup, který mluvenou odpověď převádí do pohybu přednastavené nebo vlastní postavy. Live Avatar od 24. září běží v…

  3. Modely

    Firma Aikido vydala Altar, zmenšenou verzi GLM-5.3 o velikosti 328 GB

    Firma Aikido odstranila z modelu GLM-5.3 88 z 256 směrovaných expertů a stlačila jeho váhy na 328 GB. V interním testu Altar objevil alespoň jednou 23 z 32 známých…

  4. Modely

    Model Venus od Ant Group odkládá úkoly na pozadí čtyřmi novými tokeny

    Skupina inclusionAI zveřejnila dvojici devítimiliardových modelů, které poslouchají i během vlastní řeči a umějí si uprostřed hovoru zadat úkol na pozadí. Ve vahách po…