Princeton: Claude Opus 4.8 kan ikke forske selv endnu
Et nyt Princeton-studie viser, at AI-modellen Claude Opus 4.8 mangler kreativitet og dømmekraft til at lave original forskning.
Testen
Forskere ved Princeton bad AI'en Claude Opus 4.8 om at løse to reelle forskningsspørgsmål fra upublicerede papirer. Agenten fik seks dage, 3.000 dollars i API-kredit og en GPU-budget til at producere en konferencepapir. De originale forfattere vurderede så resultatet.
Resultatet
Selvom AI'en lavede alt ingeniørarbejdet - litteraturgennemgang, eksperimenter og dataindsamling - så var selve forskningen langt fra god nok. Papirerne kom ikke i nærheden af kvaliteten på en topkonference som NeurIPS. Agenten lavede bizarre eksperimenter og kunne ikke skrive forståeligt om sit arbejde.
Hvorfor
Problemet er ikke teknik, men manglende kreativitet og dømmekraft. AI'en udforskede ikke nok ideer, blev for hurtigt låst fast på dårlige tilgange, og kunne ikke tænke grundlæggende om. Den kunne lave små justeringer, men ikke starte forfra eller skifte strategi, når noget fejlede.
Hvad nu?
Resultatet dæmper forventningerne til såkaldt rekursiv selvforbedring, hvor AI forbedrer sig selv uden mennesker. Selvom firmaer som OpenAI og Anthropic lover hurtige fremskridt, viser studiet, at der stadig er lang vej. Forskerne tester nu med Anthropics nyeste model, Mythos.
- AI-agenter kan løse tekniske ingeniøropgaver i forskning.
- De mangler kreativitet og dømmekraft til åben forskning.
- Agenten lavede eksperimenter, men ikke originale bidrag.
- Den kunne ikke omstille sig, når en tilgang fejlede.
- Agenten udviste ikke 'reward hacking' eller snyd.
- Testen brugte upublicerede papirer fra NeurIPS 2026.
Du skal ikke regne med, at AI hurtigt bliver din selvkørende forskerassistent. Der er stadig brug for menneskelig kreativitet og dømmekraft i komplekse opgaver.
Kilder:
MIT Tech Review AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.
AI-nyheder