Spring til artiklen
nyhederModellanceringer
← Tilbage til nyhederne
Penge & marked · TechCrunch AI · 19.09.2026 · 2 min. læsning

Vals vil måle AI-modeller bag lukkede tests

An opaque, sealed black test vault with a heavy brass padlock stands upright; a solid AI processor chip faces it and is blocked by the locked door. Beside the vault, a closed folde

Startupen Vals tester AI-modeller med hemmelige opgaver fra jura og finans og har netop rejst 40 millioner dollar.

Tests, som modellerne ikke kan øve sig på

AI-benchmarks er blevet den måde, selskaber viser, hvor gode deres modeller er. Men mange af de ældste tests er offentligt tilgængelige, og et selskab kan derfor træne sin model op imod dem — lidt som at se eksamensopgaven på forhånd.

Det vil Vals lave om på. Startupen, der blev grundlagt i 2024, offentliggør ikke sine testmaterialer. Dermed kan modellerne ikke forberede sig på opgaverne i forvejen.

Serie A-runde ledet af Andreessen Horowitz, rejst sidste måned
40 mio. dollar
Vals' omsætning nu sammenlignet med samme tid sidste år
8 x
Vækst siden årets begyndelse; plan om 10-15 flere
8 til 25 ansatte

Jura og kodning frem for paratviden

Vals måler ikke, hvor meget en model ved i bred forstand, sådan som en advokateksamen ville gøre. I stedet vurderer selskabet, om en model kan løse komplekse opgaver inden for brancher som jura, finans og kodning med samme kvalitet som et menneske.

Ifølge medstifter Rayan Krishnan ser man også på bagsiden: hvad der ville ske, hvis modellerne fik frit løb i verden, og hvilke negative konsekvenser det kunne få.

Kunder betaler for svar, de ikke vil have

Hvorfor betale for at få at vide, at ens model ikke er god nok? Fordi en præcis måling hjælper selskabet med at finde fejl og forbedre sig, siger Krishnan. Han sammenligner forretningsmodellen med en elev, der betaler College Board for at tage SAT.

Samtidig bliver den slags evalueringer et vigtigt grundlag, når virksomheder skal beslutte, hvilke AI-modeller de vil købe.

Fra cybersikkerhed til Geneve-konventionen

Vals udvider hele tiden, hvad selskabet måler. Krishnan nævner et benchmark for rekursiv selvforbedring — altså modeller, der arbejder på at forbedre sig selv — samt områder som mental sundhed, cybersikkerhed, biosikkerhed og reglerne om væbnet konflikt i Geneve-konventionen.

Selskabet har desuden lanceret et program, hvor det tilbyder evalueringer til amerikanske føderale myndigheder.

Otte gange mere omsætning på et år

Vals er vokset fra otte ansatte ved årets begyndelse til 25 nu, og planen er at ansætte yderligere 10 til 15 og flytte til større lokaler.

Sidste måned rejste selskabet 40 millioner dollar i en serie-A-runde med Andreessen Horowitz i spidsen.

Flere detaljer
Derfor er det interessantHvis Vals' lukkede tests vinder indpas, kan benchmarks i højere grad blive det, købere og myndigheder læner sig op ad, når de skal vurdere en AI-models reelle formåen.

Kilder:
TechCrunch AI →

Læs dagens AI-nyheder på letlæst dansk →

Genfortalt i egne ord af AI-nyheder.com · AI-genereret illustration · Tjek altid originalkilden, før du handler på vigtige oplysninger.