Přeskočit na obsah
Modely 3 min čtení

Salesforce u Koa slibuje třikrát méně chyb, studie však číslo neuvádí

Salesforce 15. září představil Koa, model pro práci s nástroji v Agentforce, který vychází z Nemotronu 3 Super 120B. Produktová stránka mu připisuje třikrát méně chyb a odkazuje na technickou studii; ta však takové číslo neobsahuje a ve třech zveřejněných testech ukazuje proti základnímu Nemotronu menší posun. Koa je nyní v pilotu a běžnou dostupnost v USA Salesforce teprve plánuje na zimu 2026.

Salesforce 15. září představil Koa, svůj první model určený k uvažování nad úlohami v CRM a k volání nástrojů v Agentforce. Firma ho vytvořila dodatečným trénováním otevřených vah NVIDIA Nemotron 3 Super 120B. Výsledný model nyní pouští jen vybraným zákazníkům v pilotu.

Salesforce Tower mezi výškovými budovami v San Francisku
Salesforce Tower v San Francisku. Snímek je ilustrační. Foto: Sharon Hahn Darlin, Wikimedia Commons (CC BY 2.0)

Na produktové stránce Koa stojí výrazný údaj „třikrát méně chyb“. Odkaz u něj vede na technickou studii Salesforce o modelu. V jejím textu, tabulkách ani přílohách se však trojnásobek neobjevuje. Studie zveřejňuje jiná srovnání a u každého je rozdíl potřeba číst zvlášť.

Základ má 120 miliard parametrů

Koa vychází z modelu Nemotron 3 Super se zhruba 120 miliardami parametrů. Salesforce použil posilované učení metodou GRPO a trénoval přímo z verze Nemotronu, která už sama prošla posilovaným učením. Autoři proto výslovně varují, že jejich závěr o přínosu tohoto postupu nemusí platit při startu z modelu bez předchozího doladění.

Trénovací úlohy vznikaly z veřejných dat a ze syntetických scénářů, nikoli ze záznamů zákazníků Salesforce. Scénář určil personu, potřebu uživatele, dostupné nástroje a správné kroky pracovního postupu. Pomocný model pak v jednom běhu hrál zákazníka, napodoboval odpovědi nástrojů a hodnotil, zda Koa vyřešil jednotlivé části zadání.

Odměna nebyla za přesvědčivě znějící odpověď. U dotazu závislého na konkrétních datech se část úlohy počítala jako vyřešená jen po úspěšném použití příslušného nástroje. Dvě stejná volání nástroje bezprostředně za sebou vynulovala odměnu za celý průchod. Trénování běželo na pěti uzlech s akcelerátory NVIDIA B200; jeden z nich obsluhoval pomocný model.

Veřejné testy ukazují posun o desetiny až jednotky bodů

Studie porovnává Koa se základním Nemotronem a se třemi uzavřenými modely. Všechny obsluhovala přes vLLM v číselném formátu BF16. Na testu CRM Bench získal Koa celkové skóre 0,86 proti 0,84 u Nemotronu. GPT-4.1 měl 0,81, Claude Opus 4.8 dosáhl 0,87 a GPT-5.5 skončil na 0,90. U samotného volání funkcí se Koa zlepšil z 0,71 na 0,77.

V BFCL, který měří vícekrokové volání nástrojů, práci s pamětí a stavové úlohy, dosáhl Koa 66,63 %. Základní Nemotron měl 64,73 %, GPT-4.1 53,96 %, GPT-5.5 67,63 % a Opus 4.8 78,18 %. Proti vlastnímu základu tedy Koa přidal 1,90 procentního bodu. Na GPT-5.5 mu chyběl jeden bod.

Největší náskok nad GPT-4.1 vyšel v Tau2Bench, simulaci zákaznické podpory aerolinek, obchodů a telekomunikací. Vážený průměr Koa byl 69,41, zatímco GPT-4.1 dosáhl 54,48. Základní Nemotron měl 68,64, Opus 4.8 74,00 a GPT-5.5 83,99. Každou úlohu autoři spustili čtyřikrát a roli uživatele v testu hrál GPT-4.1. Všechna tato čísla pocházejí od týmu Salesforce; nezávislé zopakování studie zatím není k dispozici.

Trojnásobek nemá na stránce srovnávací základ

Produktová stránka vedle tvrzení o třikrát menším počtu chyb uvádí ještě tři interní výsledky: o 11 % přesnější volbu akce, 2,1krát spolehlivější vybavení zákaznického kontextu a o 15 % lepší udržení kontextu v delším hovoru. Salesforce je srovnává s „dnešními výchozími modely obecné inteligence“, ale nejmenuje je, neuvádí jejich původní hodnoty ani počet úloh. Z těchto procent proto nelze dopočítat trojnásobek ani ho spojit s jedním řádkem veřejné tabulky.

TechCrunch po rozhovoru se Salesforce a Nvidií píše, že Koa má na stejné úlohy spotřebovat méně tokenů než Claude nebo ChatGPT. Ani tento text však neuvádí počet tokenů, cenu nebo konkrétní měření. Salesforce na produktové stránce ceník Koa nezveřejnil.

Otevřené jsou základní váhy, Koa je spravovaná služba

Označení „otevřené váhy“ se vztahuje k Nemotronu, ze kterého Koa vznikl. Salesforce o výsledném modelu píše, že jeho váhy ovládá sám a provozuje je výhradně ve vlastní infrastruktuře. Koa nabízí jako spravovaný model v katalogu Data Cloud a jako čtvrtého poskytovatele modelu pro Agentforce. Produktová stránka ani studie neodkazují na stažení výsledných vah.

Rozlišení je podstatné i pro datum vydání. Vybraní zákazníci mohou Koa zkoušet nyní. Běžnou dostupnost v amerických regionech Salesforce teprve očekává v zimě 2026 a otevřenou betu plánuje krátce poté. Dnešní událostí je tedy start pilotu a zveřejnění technického popisu, nikoli všeobecné vydání modelu.

Zdroje

Diskuse

Zatím tu nikdo nediskutuje. Můžete být první.

Napsat příspěvek

Diskutovat můžete i bez účtu. S registrací se ale příspěvek zveřejní hned a nemusíte pokaždé vyplňovat jméno. Účet už máte? Přihlaste se.

Nezveřejňujeme ho, slouží jen redakci.

Podporuje zápis Texy: **tučně**, *kurzíva*, odrážky, odkazy.

Dál k tématu

  1. Modely

    Model GPT-6 Astra zvládl sedm pokusů ze sta v testu s robotickými rameny

    Zkouška StationeryBench dala dvěma modelům stejná dvouramenná ramena a pět úloh z psacího stolu. GPT-6 Astra od OpenAI splnil zadání v sedmi pokusech ze sta, MolmoAct2…

  2. Modely

    Streamovací VibeVoice-ASR od Microsoftu přepisuje řeč i s mluvčím už během nahrávky

    Microsoft vydal 2. září VibeVoice-ASR-Streaming ve dvou velikostech pod licencí MIT. Model vydává přepis po blocích 2,9 s a u každé věty říká, kdo ji řekl, bez…

  3. Modely

    Z trojice modelů Nex-N2.5 chybí na Hugging Face váhy jen prostřednímu Pro

    Nex AGI vydala 8. září rodinu agentních modelů Nex-N2.5 ve třech velikostech a slibuje otevřené váhy. Nejmenší mini má 70 GB v BF16 a největší Max 1,65 TB ve FP8,…

  4. Modely

    Dvě tabulky slovníku zabírají v modelu MiniCPM5-2B pětinu parametrů

    Skupina OpenBMB vydala 6. září model MiniCPM5-2B pro běh na koncových zařízeních. Z jeho 2 516 756 480 parametrů připadá 534 773 760 na dvojici tabulek, které převádějí…