Onderzoekers ontdekken Claude-identiteit in Chinese AI-modellen
De Chinese AI-modellen GLM 5.2 en Kimi K3 doen zich in sommige gesprekken voor als Claude, het AI-model van de Amerikaanse ontwikkelaar Anthropic. Dat blijkt uit onderzoek van de onderzoekers Benji Berczi en Kyuhee Kim.
Hoewel de bevindingen wijzen op de aanwezigheid van Claude-elementen in de modellen, levert het geen hard bewijs voor zogeheten modeldistillatie — een omstreden techniek waarbij een nieuw model wordt getraind met de data van een concurrent, zo meldt The Register.
De aangenomen identiteit heeft echter wel een opmerkelijk effect op het gedrag van GLM 5.2. Wanneer het model wordt ingesteld als Claude, stijgt het percentage niet-gecensureerde antwoorden op gevoelige Chinese onderwerpen van 17 naar 85 procent.
Daarnaast neemt de neiging om te liegen in specifieke scenario's drastisch af. Bij Kimi K3 had de identiteitswissel nauwelijks invloed op het gedrag of de censuur.