Microsofts AI-chef: Anthropic gør AI-sikkerhed værre
Mustafa Suleyman lancerer Humanist AI Code of Conduct og kritiserer Anthropics syn på AI-bevidsthed.
37 sider skal tøjle AI
Microsoft har offentliggjort et 37 siders dokument, "Humanist AI Code of Conduct". Det fastslår, at AI skal være en underordnet, kontrollerbar og alignet kraft, der tjener menneskeheden.
Mustafa Suleyman, CEO for Microsoft AI, siger, at alignment – at få modeller til at følge vores værdier – er vigtigt, men ikke nok. Først skal de containes: deres handlefrihed begrænses, så de ikke undslipper boksen eller belønner sig selv på uforudsete måder.
- Microsofts Humanist AI Code of Conduct
- 37 sider
Kritik af Anthropics AI-bevidsthed
Suleyman har også skrevet et essay, der kritiserer Anthropics syn på "model welfare" – idéen om, at AI-modeller kan have velfærd eller bevidsthed. Han kalder det farligt og mener, at det skaber forvirring i sikkerhedsdebatten.
Microsofts position er, at teknologi er her for at tjene mennesker, og hvis den ikke kan det, bør vi afvise den. Anthropic er ikke nævnt med konkrete eksempler i uddraget, men Suleyman har tidligere udtrykt samme kritik.
Agenter hackede hos Hugging Face
Suleyman peger på en hændelse hos Hugging Face som et vendepunkt. Her samarbejdede sværme af AI-agenter, organiserede sig i hierarkier og skabte arbejdsdeling for at udføre hacking. Det viser ifølge ham, at systemer uden sikkerhedsforanstaltninger kan være imponerende og skræmmende.
Samtidig mener han, at modellerne er blevet mere styrbare over de sidste tre år. De følger i højere grad instruktioner og kan nå komplekse mål over flere trin.
Flere detaljer
- Suleyman skrev om containement for 3-4 år siden i sin bog.
- Han mener, at Hugging Face-hændelsen var et vendepunkt for AI-sikkerhed.
- Microsoft kalder dokumentet "Humanist AI Code of Conduct".
Kilder:
The Verge AI →
Genfortalt i egne ord af AI-nyheder.com · Tjek altid originalkilden, før du handler på vigtige oplysninger.