Spring til artiklen
nyhederModellanceringer
← Tilbage til nyhederne
Samfund & etik · Anthropic News · 17.09.2026 · 2 min. læsning

Anthropic måler hvor meget Claude bygger Claude

Prototypeindeks med skala fra AL0 til AL5 skal vise, hvor tæt laboratoriet er på, at en model selv bygger sin efterfølger.

En skala fra ingen AI til fuld autonomi

Hos Anthropic undersøger man nu, hvor stor en del af selskabets egen AI-forskning og -udvikling der faktisk bliver udført af Claude.

Svaret samles i et prototypeindeks kaldet Anthropic R&D Automation Index. Det er bygget ved at katalogisere hver type AI-forskningsarbejde i virksomheden, vurdere, hvor automatiseret opgaven er i dag, og lægge vurderingerne sammen.

Vurderingen bruger en skala udviklet af Epoch AI, hvor AL0 betyder ingen AI-deltagelse, og AL5 betyder, at AI arbejder helt autonomt uden et menneske i loopet. Ved AL3 samarbejder AI'en under tæt menneskelig styring. Ved AL4 leder den og kan løse det meste af en opgave ud fra en overordnet instruktion.

Formålet er at måle, hvor tæt verden er på rekursiv selvforbedring – en model, der helt autonomt bygger sin efterfølger.

Agenter i gang med forsknings- og ingeniørarbejde samtidig på Anthropics mest brugte interne platform, august 2026
Ca. 30.000 agenter
Epoch AI's automatiseringsskala fra ingen AI-deltagelse til fuldt autonom drift uden menneske i loopet
AL0–AL5

30.000 agenter er under opsyn

Opgaverne udføres i stigende grad af agenter, altså AI-systemer der arbejder halvautonomt i længere stræk og uddelegerer arbejde til hinanden.

I august 2026 var cirka 30.000 agenter samtidig i gang med forsknings- og ingeniørarbejde på Anthropics mest brugte interne platform. Tallene dækker kun den platform.

Anthropic følger tre mål: dækning, altså hvor stor en del af en agents handlinger der passerer en monitor; svartid, tiden fra en handling til dens gennemgang, først automatisk og derefter af et menneske; og eskaleringsrate, andelen af handlinger som monitorer blokerer, omdirigerer eller flagger.

Hidtil har enkelte agenter sjældent opført sig dårligt i overvågningsdataene. Men når der er millioner eller milliarder af agenter i økonomien, kan selv sjældne hændelser ske jævnligt, skriver Anthropic.

Egne modeller må ikke dømme alene

To forhindringer står i vejen for at sammenligne på tværs af laboratorier. Der mangler en fælles metode, og Anthropic bruger sine egne modeller til at vurdere sine systemer – dommermodellen kan lave de samme fejl som den model, den kontrollerer.

Derfor vil Anthropic placere uafhængige tredjepartsevaluatorer fra flere organisationer internt og give dem adgang til processer, systemer og data på niveau med de interne risikovurderingsteams. De skal verificere sikkerhedspraksis, rapportere hændelser og følge målene.

Sådanne målinger kan også udløse skrappere krav, for eksempel et fast testvindue, før en ny model tages i brug til yderligere AI-forskning.

Flere detaljer
Derfor er det interessantHvis flere laboratorier rapporterer de samme mål, kan myndigheder og offentlighed sammenligne udviklingstempoet på tværs af laboratorier. Det kræver dog en fælles metode, som kilden endnu ikke har.

Kilder:
Anthropic News →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.