„Anthropic“ pristatė atsargesnį Claude Opus 4.8, kuris rečiau klysta užtikrintai
„Anthropic“ išleido Claude Opus 4.8, naują flagmaną, kurio pagrindinis argumentas yra ne tik geresnis kodo generavimas ar ilgesnė atmintis, bet ir elgsena. Modelis sukurtas taip, kad dažniau pripažintų neapibrėžtumą ir rečiau nepastebėtų savo klaidų. Pasak „Anthropic“, Opus 4.8 maždaug keturis kartus rečiau nei pirmtakas tyliai praleidžia klaidas savo parašytame kode.
„Sąžiningas DI“ reiškia mažiau blefavimo, o ne moralinę sąžinę
„Anthropic“ Claude Opus 4.8 apibūdina stipriu žodžiu: sąžiningumas. Technine prasme tai nereiškia moralinius sprendimus priimančios sistemos. Kalbama apie modelį, kuris turėtų rečiau teikti nepagrįstus teiginius, dažniau pastebėti savo darbo silpnąsias vietas ir aiškiau pažymėti neapibrėžtumą.
Tai reikšmingas pokytis. Didieji kalbos modeliai pavojingiausi dažnai būna tada, kai skamba labiausiai užtikrintai. Jie nesako „nežinau“, o sukonstruoja įtikinamą atsakymą ant menko įrodymų pagrindo. „Anthropic“ dabar teigia, kad Opus 4.8 šią problemą sprendžia tiesiau nei Opus 4.7.
Konkrečiausias rodiklis susijęs su kodu. Savo vertinimuose „Anthropic“ teigia, kad Opus 4.8 maždaug keturis kartus rečiau nei jo pirmtakas nepastebi klaidų savo paties kode. To nereikėtų automatiškai taikyti visoms sritims, pavyzdžiui, teisei, medicinai ar finansinei analizei, tačiau programuotojams tai stiprus signalas.
Opus 4.8 sukurtas ilgam darbui, ne tik greitiems atsakymams
„Anthropic“ Claude Opus 4.8 vadina pajėgiausiu plačiai prieinamu Claude sudėtingam samprotavimui, ilgalaikiam agentiniam darbui ir autonomiškesnėms darbo eigoms. Modelio ID yra claude-opus-4-8, o konteksto langas per Claude API, Amazon Bedrock ir Vertex AI siekia 1 mln. žetonų. Didžiausia išvestis yra 128 000 žetonų. Microsoft Foundry konteksto langas ribojamas iki 200 000 žetonų.
Kainodaroje „Anthropic“ nesirenka pigesnio kelio. Opus 4.8 kainuoja 5 JAV dolerius už milijoną įvesties žetonų ir 25 JAV dolerius už milijoną išvesties žetonų. Tai vis dar brangiau nei Sonnet 4.6, kurio kainos yra 3 ir 15 JAV dolerių, tačiau Opus taikomas į sudėtingesnes užduotis, kur vienas klaidingas sprendimas gali kainuoti daugiau nei pats modelio naudojimas.
Čia ir slypi praktinė Opus 4.8 vertė. Modelis, kuris geriau supranta, kada sustoti, iškviesti įrankį, patikrinti abejonę ar paprieštarauti naudotojo įvesčiai, kūrimo aplinkoje tampa patikimesniu partneriu. Nebūtinai protingesniu, bet mažiau pavojingai perdėtai pasitikinčiu savimi.
Dynamic Workflows paverčia Claude agentų komanda
Kartu su Opus 4.8 „Anthropic“ pristatė Claude Code skirtą Dynamic Workflows funkciją. Ji leidžia Claude suskaidyti didelę užduotį į dešimtis ar šimtus lygiagrečių subagentų darbų, patikrinti jų rezultatus ir naudotojui pateikti apibendrintą atsakymą. Funkcija prieinama tyrimų peržiūros režimu per Claude Code CLI, darbalaukio programą, VS Code plėtinį, taip pat per API, Amazon Bedrock, Vertex AI ir Microsoft Foundry.
Tai nėra smulki patogumo funkcija. Programinės įrangos kūrime ji perkelia Claude iš vieno pokalbio lango į agentinį darbo eigos variklį. „Anthropic“ mini klaidų paiešką keliose kodų bazėse, saugumo auditus, didelio masto migracijas ir kritines užduotis, kuriose nepriklausomi agentai taip pat bando paneigti rezultatus.
Ta pati kryptis paaiškina ir akcentą modelio „sąžiningumui“. Kai suklysta vienas pokalbių robotas, naudotojas dažnai tai greitai pastebi. Tačiau kai šimtai subagentų dirba didelėje kodų bazėje, klaidingas pasitikėjimas gali išaugti į labai brangią klaidą. Todėl Opus 4.8 turi ne tik spręsti užduotis, bet ir žinoti, kada sustoti.
Pastangų valdymas suteikia naudotojams svertą kainai ir kokybei reguliuoti
Pagal numatytuosius nustatymus Opus 4.8 veikia aukštu pastangų lygiu, kurį „Anthropic“ vadina geriausiu kokybės ir naudojimo patogumo balansu. Naujas pastangų valdymas leidžia naudotojams pasirinkti, kiek modelis „mąsto“ prieš atsakydamas: aukštesnis nustatymas duoda geresnius rezultatus sudėtingesnėse užduotyse, o žemesnis taupo laiką ir žetonų limitą.
Programuotojams svarbios dar dvi detalės. Pirma, Opus 4.8 palaiko sistemos instrukcijų įterpimą pokalbio viduryje, todėl per ilgus agentinius vykdymus instrukcijas galima atnaujinti nesiunčiant visos sistemos instrukcijos iš naujo. Antra, greitasis režimas, šiuo metu prieinamas tyrimų peržiūros režimu, leidžia iki 2,5 karto greičiau generuoti išvesties žetonus, tačiau taikoma premium kainodara.
Europos verslui tai ypač svarbu dėl sąnaudų modelio. DI pereinant nuo teksto generatoriaus prie darbo eigos valdytojo, kiekvienas žetonas įgyja ekonominį svorį. Opus 4.8 bando pasiūlyti flagmano lygio samprotavimą ir kartu leisti naudotojams spręsti, kada mokėti už gilesnę analizę, o kada rinktis greitesnį atsakymą.
Mythos lieka fone kaip platesnis signalas
„Reuters“ duomenimis, Opus 4.8 pasirodo tuo metu, kai „Anthropic“ rengia platesnį galingesnio Claude Mythos išleidimą. Mythos siejamas su pažangiomis kibernetinio saugumo galimybėmis ir per Project Glasswing prieinamas atrinktiems partneriams, įskaitant Amazon, Microsoft ir Apple.
Tai Opus 4.8 pastato į įdomią poziciją. Jis nėra galingiausias „Anthropic“ modelis, tačiau yra pajėgiausias bendram naudojimui plačiai prieinamas Claude. API dokumentacija patvirtina, kad Claude Mythos Preview išlieka atskira tyrimų peržiūra gynybinio kibernetinio saugumo darbo eigoms, be savitarnos prieigos.
Todėl „Anthropic“ Opus 4.8 parduoda ne kaip neribotos galios modelį, o kaip kontroliuojamo patikimumo įrankį. Verslo naudotojams tai gali būti svarbiau nei viena pergalė teste, nes teisėje, finansinėje analizėje, programinės įrangos kūrime ir saugumo audite galiausiai svarbu, kaip dažnai modelis atpažįsta, kad dar neturi pakankamo pagrindo daryti tvirtą išvadą.