Anthropic och Accenture har inlett ett femårigt samarbete kring oberoende granskning av avancerade AI-modeller. Upplägget bygger på så kallad embedded evaluation, där externa granskare får arbeta närmare modellutvecklingen än i traditionella externa tester.

Samarbetet leds av Faculty, Accentures specialistverksamhet inom AI. Enligt Anthropic ska arbetet omfatta modellutvärdering, red teaming, alignment-bedömningar och tester av skyddsmekanismer. Anthropic och Accenture räknar vardera med att investera minst en miljard dollar i kapacitet för arbetet under de kommande fem åren.

Granskare får större insyn i modellutvecklingen

Det centrala i modellen är att oberoende utvärderare ska få tillgång som ligger närmare en anställds än en vanlig extern revisionspartners. Tanken är att de ska kunna följa hur modeller tar form under träning, se vilka beslut som styr utveckling och driftsättning samt tala direkt med personal som arbetar med systemen.

För AI-branschen är det en förändring från många av dagens tester, som ofta görs på en färdig eller nästan färdig modell. En granskare som kommer in tidigare kan i teorin upptäcka svagheter i processer, övervakning och säkerhetskontroller innan modellen når bred användning.

Red teaming och alignment i fokus

Faculty ska bland annat genomföra red teaming, där modeller utsätts för kontrollerade försök att kringgå skydd eller bete sig på oönskade sätt. Samarbetet omfattar också alignment-bedömningar, alltså tester av hur väl modellernas beteende stämmer överens med avsedda mål och säkerhetskrav.

Anthropic betonar samtidigt att externa granskare inte flyttar säkerhetsansvaret från AI-utvecklaren. Företaget beskriver i stället oberoende utvärdering som ett sätt att göra det lättare att verifiera att interna säkerhetsåtaganden faktiskt följs.

Standarderna är ännu inte färdiga

Embedded evaluation är fortfarande ett nytt arbetssätt. Anthropic skriver att det ännu saknas gemensamma standarder för exakt vilken information utvärderare ska få tillgång till, hur resultaten ska rapporteras och hur oberoendet långsiktigt ska finansieras.

Partnerskapet är därför inte exklusivt. Anthropic uppger att bolaget planerar att samarbeta med fler utvärderingsorganisationer, medan Accenture samtidigt kan arbeta med andra AI-utvecklare. På sikt vill Anthropic se ett bredare ekosystem av granskare med mer gemensamma arbetssätt.

Varför detta är viktigt för företag som använder AI

För företag som bygger verksamhetskritiska tjänster ovanpå stora språkmodeller kan mer oberoende testning ge bättre underlag för riskbedömningar. Det gäller särskilt när AI-agenter får rättigheter att använda verktyg, behandla känsliga data eller utföra fler steg utan ständig mänsklig kontroll.

Samtidigt återstår viktiga frågor om hur oberoende en granskare kan vara när AI-bolaget finansierar arbetet, hur konfidentiell information ska hanteras och vilka delar av resultaten som kan offentliggöras. Anthropic säger att finansieringen på längre sikt helst bör komma från gemensamma eller offentliga strukturer.

Samarbetet visar ändå att säkerhetsgranskning håller på att flytta närmare själva utvecklingsprocessen. Om modellen fungerar som tänkt kan den ge externa aktörer bättre möjlighet att bedöma inte bara hur en färdig AI-modell presterar, utan också hur den har byggts, övervakats och kontrollerats på vägen.