
Anthropic tõi välja Claude Fable 5.1, pikad agentülesanded muutuvad odavamaks
Fable 5.1 ja Mythos 5.1 põhinevad samal alusmudelil. Erinevus seisneb turvapiirangutes: Fable 5.1 on laialt kättesaadav, Mythos 5.1 jääb kontrollitud ligipääsuga versiooniks, mida Anthropic pakub valitud küberturbe- ja bioloogiauuringute organisatsioonidele.
Suurim areng tuleb pikkades ülesannetes
Anthropic positsioneerib Fable 5.1 eelkõige mudelina, mis suudab töötada keeruliste ülesannete kallal pikalt ilma protsessi käigus suunda kaotamata.
Kontekstiaken ulatub miljoni tokenini ja maksimaalne väljund 128 000 tokenini. Mudel kasutab adaptiivset mõtlemist ning saab vastavalt ülesandele muuta arvutustöö intensiivsust.
Anthropic'u enda Terminal-Bench-Science 0.1 katses tõusis Fable 5.1 tulemus Fable 5 24,7 protsendilt 52,6 protsendini.
Terminal-Bench 4.0 agentprogrammeerimise katses saavutas Fable 5.1 55,8%, eelkäija 42%. Vähemate turvapiirangutega Mythos 5.1 jõudis samas katses 60,9 protsendini.
Professionaalseid tööülesandeid hindavas GDPval-AA v2 testis kogus Fable 5.1 1853 punkti, Fable 5 1723 ja Opus 5 1824 punkti.
Need on Anthropic'u enda avaldatud mõõtmised ning neid ei tasu käsitleda sõltumatu tõendina ühe mudeli üldisest paremusest. Agentide tulemused sõltuvad tugevalt testikeskkonnast, tööriistadest, kasutatud mõtlemistasemest ja hinnapiirist.
Tokenihind ei langenud
Fable 5.1 maksab API kaudu endiselt 10 dollarit miljoni sisendtokeni ja 50 dollarit miljoni väljundtokeni kohta.
See on sama põhihind nagu Fable 5-l.
Oluline muudatus puudutab vahemälu. Juba töödeldud konteksti lugemine maksab nüüd 0,25 dollarit miljoni tokeni kohta, mis on 75% vähem kui Fable 5 puhul.
Anthropic hindab, et tüüpilise töökoormuse kogukulu võib seetõttu väheneda umbes 25%. Pikkades agenttöövoogudes, kus mudel loeb korduvalt sama suurt konteksti, võib sääst ulatuda ligikaudu 45 protsendini.
See tähendab, et Fable 5.1 pole automaatselt odavam iga päringu puhul. Ühekordse suure sisendi ja väljundi korral jääb põhihind samaks ning Fable 5.1 on tokenihinna järgi endiselt kallim kui Claude Opus 5, mille sisend maksab 5 ja väljund 25 dollarit miljoni tokeni kohta.
Mudel leidis Veenuselt rohkem detaile
Anthropic katsetas uusi mudeleid ka teadusülesannetes.
Fable 5.1 kasutas NASA Magellani missiooni enam kui 30 aasta vanuseid radarandmeid ja treenis närvivõrgu, koostamaks ligikaudu kolmandikust Veenusest uue kõrgusmudeli.
Varasemates andmetes eristus pinnareljeef umbes 10-20 km mõõtkavas. Uus kaart võimaldab Anthropic'u järgi eristada 2-3 km suurusi struktuure ning parandab kõrguste määramise täpsust kohati kuni 25%.
Ettevõte avaldas kaardi Creative Commonsi litsentsiga, võimaldamaks seda kasutada muu hulgas tulevaste NASA VERITAS ja ESA EnVision missioonide planeerimisel.
Mythos 5.1 projekteeris laboris töötavaid valgusidujaid
Veel tähelepanuväärsem katse puudutas valgudisaini.
Mythos 5.1 sai ligipääsu avatud lähtekoodiga valkude modelleerimise ja voltimise tööriistadele ning projekteeris siduvaid valke 12 sihtmärgi jaoks. Katselaborid kontrollisid tulemusi füüsiliselt.
Anthropic'u järgi töötas peaaegu pool projekteeritud variantidest. Kolme sihtmärgi puhul saavutas mudel umbes kümme korda tugevama seondumise kui varasemates Adaptyv Bio võistlustes esitatud parimad lahendused.
See ei tähenda, et mudel oleks iseseisvalt ravimi loonud. Valgusiduja projekteerimine on üks varane etapp palju pikemas ravimite arendusprotsessis ning tulemuste kinnitamiseks on endiselt vaja laborikatseid.
Teadustarkvara muutus kuni 2,5 korda kiiremaks
Mythos 5.1 kasutas programmeerimisvõimekust ka arvutusbioloogias.
Mudel kirjutas seitsmele avatud lähtekoodiga süvaõppemudelile oma GPU tuumad ning optimeeris vahetulemuste salvestamist. Anthropic mõõtis NVIDIA H100 kiirendil kuni 2,5-kordset jõudluse kasvu, säilitades samad arvutustulemused.
Suuremahuliste genoomianalüüside puhul hindab ettevõte GPU kulude vähenemiseks 30-60%.
Just sellised ülesanded näitavad hästi, milleks Fable ja Mythos klassi mudelid mõeldud on. Eesmärk pole ainult kiiremini küsimustele vastata, vaid töötada tundide või päevade pikkuste protsessidega, kasutada tööriistu, kirjutada ja testida koodi ning kontrollida vahetulemusi.
Mythos jääb piiratud ligipääsuga
Mythos 5.1 paremad bioloogia- ja küberturbevõimed tähendavad samal ajal suuremat väärkasutuse riski.
Anthropic ei paku mudelit vabalt kõigile kasutajatele. Ligipääsu saavad kontrollitud organisatsioonid spetsiaalsete programmide kaudu.
Fable 5.1 kasutab rangemaid piiranguid, kuid Anthropic on neid võrreldes varasema versiooniga täpsustanud. Mudel võib nüüd otsida lähtekoodist turvanõrkusi, kuid exploit'ide loomine, penetratsioonitestimine ja osa binaarfailide turbeanalüüsist suunatakse endiselt teistele mudelitele või blokeeritakse.
Anthropic väidab, et uued küberturbefiltrid sekkuvad Claude Code'is ligikaudu 60% harvemini kui Fable 5 ajal. Bioloogia tavapäraste ohutute küsimuste valepositiivseid blokeeringuid on ettevõtte järgi vähendatud 85%.
Agentmudelite konkurents liigub hinnalt töö maksumusele
Fable 5.1 tähtsaim muudatus pole seega üks benchmark'i rekord.
AI mudelite konkurents liigub järjest enam tokenihinnalt terve ülesande maksumusele. Kui tugevam mudel kasutab vähem samme, taastub vigadest paremini ja saab sama konteksti odavalt uuesti kasutada, võib kallim token lõppkokkuvõttes tähendada odavamat töövoogu.
Anthropic panustab Fable 5.1-ga just sellele.
Paberil jääb mudeli 10/50 dollari tokenihind kõrgeks. Pika programmiarenduse, uurimisprojekti või suure dokumendikogumiga töötava agendi puhul võib neljakordselt odavam vahemälulugemine aga kogukulu märgatavalt vähendada.
See on ka põhjus, miks väide „mudel muutus odavamaks” vajab täpsustust. Fable 5.1 pole odavam mudel, vaid võib olla odavam tööriist teatud tüüpi pikaajalise töö tegemiseks.
