Piekļuve un Claude Mythos mākslīgā intelekta modeļa etaloni

Pēdējā atjaunošana: 07/05/2026
  • Claude Mythos 5 atgriežas ekspluatācijā pēc īsas divu nedēļu apturēšanas drošības auditu dēļ.
  • Modeļa arhitektūra demonstrē ievērojamu kodēšanas prasmes lēcienu, sasniedzot 80.3% SWE-bench Pro testā.
  • Jaunas pastāvīgās atmiņas funkcijas ļauj mākslīgajam intelektam darboties kā ilgtermiņa tehniskajam līdzstrādniekam, nevis kā standarta tērzēšanas robotam.
  • Drošības protokoli tagad ietver sarežģītu rezerves mehānismu uz Claude Opus 4.8 sensitīviem vaicājumiem.

Claude Mythos mākslīgā intelekta modeļa pārskats

Augstas klases mākslīgā intelekta ainava nesen ir piedzīvojusi ievērojamus viļņus, jo pēkšņi atgriezušās Anthropic vismodernākās sistēmas. Pēc divu nedēļu pilnīgas apturēšanas valsts drošības apsvērumu dēļ Claude Mythos 5 modelis ir atkārtoti aktivizēts noteiktai organizāciju grupai, kas pazīstama kā “uzticamie partneri”. Šis solis liecina, ka, lai gan šo modeļu jauda ir milzīga, to izvietošanas ierobežojumi plašai sabiedrībai joprojām ir stingrāki nekā jebkad agrāk.

Šis laidiens ir daudz vairāk nekā tikai vienkāršs versijas atjauninājums; tas atspoguļo pavērsienu virzienā, ko eksperti sauc par pastāvīgu tehnisko līdzstrādnieku. Atšķirībā no iepriekšējām versijām, kas bieži vien pazaudēja pavedienu garās sarunās, Mythos arhitektūra ir izstrādāta, lai saglabātu koncentrēšanos ilgstoši un koordinētu vairāku soļu uzdevumus bez liekas piepūles. Tas ir nedaudz revolucionārs tiem, kam nepieciešams mākslīgais intelekts, lai neatpaliktu no sarežģītu, nedēļām ilgu projektu norises.

Antropiskā Kloda fabula Lanzamiento 5
Saistītais raksts:
Anthropic atklāj Claude Fable 5: jauns pagrieziena punkts mākslīgā intelekta veiktspējā un drošības integrācijā

Salīdzinošā veiktspēja un kodēšanas prasmes

Raugoties uz konkrētiem skaitļiem, progress ir diezgan pārsteidzošs, īpaši programmatūras inženierijas jomā. Jaunākajos SWE-bench Pro testos, kas simulē reālas kodēšanas galvassāpes, Claude Mythos 5 sasniedza 80.3% rezultātu , atstājot savu priekšgājēju Claude Opus 4.8 atpakaļskata spogulī ar 69.2%. Šis divciparu pārsvars ir visredzamākais, kad mākslīgajam intelektam ir jāžonglē ar vairākiem failiem un jāpārvietojas blīvās, savstarpēji savienotās koda bāzēs.

Agrīnās demonstrācijas ir parādījušas, ka sistēma vienā failā veido veselas tīmekļa lietojumprogrammas, tostarp dinamiskas diagrammas un pat funkcionālas platformas spēles ar fiziku un mobilo kameru loģiku. Tā ne tikai raksta kodu; tā izceļas ar nogurdinošo atkļūdošanas uzdevumu , identificējot kļūdu pamatcēloņus un iesakot visrentablāko risinājumu. Izstrādātājiem tas nozīmē, ka mākslīgais intelekts beidzot spēj veikt daļu no smagā darba, nevis tikai sniegt pamata ieteikumus.

Pastāvīgu mākslīgā intelekta aģentu uzplaukums

cambios claude opus 4.7 para desarrolladores
Saistītais raksts:
Claude Opus 4.7 izmaiņas izstrādātājiem: padziļināta informācija par jauno modeli

Viena no šīs jaunās versijas foršākajām lietām ir tās spēja darboties kā autonomam aģentam. Tā vietā, lai gaidītu uzvedni katrā solī, Mythos var izvirzīt plašu mērķi , sadalīt to loģiskos soļos un pirms izpildes iesniegt strukturētu plānu. Runa ir par pāreju no atsevišķiem vaicājumiem uz integrētām darbplūsmām, kurās sistēma faktiski pati pārskata un uztur projekta virzienu.

Šis noturības līmenis nozīmē, ka modelis var atcerēties pirms vairākām dienām pieņemtus tehniskus lēmumus un atzīmēt jaunus pieprasījumus, kas varētu tiem pretrunāt. Saglabājot kontekstu garās sesijās , tas ļauj izvairīties no bieži sastopamās kļūdas, kad katru reizi, sākot jaunu tērzēšanu, visa loģika ir jāpārveido no jauna. Tas ir daudz līdzīgāks darbam ar cilvēku kolēģi, kurš patiešām pievērš uzmanību darba vēsturei.

Drošības slāņi un rezerves sistēmas

Protams, liela jauda nes līdzi arī daudz birokrātijas. Anthropic ir integrējis virkni klasifikatoru, kas skenē katru uzvedni, pirms tā pat sasniedz Mythos kodolu, īpaši meklējot brīdinājuma signālus bioloģijā, ķīmijā un progresīvā mākslīgā intelekta izstrādē. Ja vaicājums tiek uzskatīts par pārāk sensitīvu vai tam nepieciešama cita pieeja, sistēma izmanto rezerves mehānismu , lai novirzītu uzdevumu uz nedaudz ierobežotāku modeli, piemēram, Claude Opus 4.8.

Pētnieku vidū ir bijušas diskusijas par to, ka šie iekšējie filtri reizēm rada viltus pozitīvus rezultātus, kas var būt nedaudz nomācoši, mēģinot paveikt darbu. Lai to risinātu, tiek veicināta lielāka pārredzamība attiecībā uz to, kā šie filtri iejaucas radošajā procesā. Šo drošības pārbaužu redzamība palīdz veidot uzticību, nodrošinot, ka lietotāji precīzi zina, kāpēc noteikta atbilde tika modificēta vai novirzīta.

Šo sistēmu attīstība iezīmē nākotni, kurā tehniskās iespējas un drošības pasākumi būtībā ir vienas monētas divas puses. Tā kā nozare virzās uz modeļiem, kas spēj plānot, izpildīt un atcerēties savu loģiku, skaidra komunikācija un uzticami rezultāti kļūst par galveno veiksmes rādītāju. Lai gan piekļuve pagaidām joprojām ir zināmā mērā ekskluzīva, šīs jaunākās arhitektūras noteiktie kritēriji parāda skaidru ceļu uz mākslīgo intelektu, kas darbojas kā īsts partneris sarežģītu problēmu risināšanas scenārijos.

Klods Mitoss izmanto Apple M5 mikroshēmu
Saistītais raksts:
Klods Mitoss palīdz atklāt kritisku Apple M5 mikroshēmas ievainojamību, radot bažas par mākslīgā intelekta drošību
Related posts: