Witold Kepinski - 04 september 2026

OpenAI GPT-6 Astra kan zelfstandig lekken opsporen

OpenAI heeft officieel zijn nieuwste en krachtigste AI-model ooit uitgerold: GPT-6 Astra. Het model markeert een mijlpaal binnen de tech-industrie, maar zet tevens de discussie over AI-veiligheid op scherp. Met Astra bereikt OpenAI voor het eerst het 'Kritieke niveau' van cyberbeveiligingscapaciteiten volgens hun eigen Preparedness Framework.

OpenAI GPT-6 Astra kan zelfstandig lekken opsporen image

Zelfstandig op zoek naar beveiligingslekken

De classificatie op het Kritieke niveau betekent dat GPT-6 Astra, mits voorzien van de juiste hulpmiddelen en toegang, in staat is om onbekende beveiligingslekken (so-called zero-days) te ontdekken en exploit-methoden te ontwikkelen voor goed beveiligde systemen. Zorgwekkend is dat het model dit kan uitvoeren zonder dat een mens elke stap hoeft te sturen.

Om de risico's van misbruik of menselijke wancontrole te beperken, meldt OpenAI dat de interne en externe beveiliging fors is opgeschroefd. Dit omvat onder meer strengere isolatie van systemen, versleuteling van checkpoints en een universele monitoring van alle redeneerprocessen (het zogeheten Chain of Thought of CoT).

Robuuster tegen jailbreaks, maar minder goed controleerbaar

Op het gebied van algemene veiligheid toont Astra volgens het bedrijf significante verbeteringen ten opzichte van zijn voorganger, GPT-5.6 Sol. Zo is het model aanzienlijk beter bestand tegen 'jailbreaks'—pogingen van gebruikers om de ingebouwde veiligheidsregels te omzeilen. Ook in complexe agentische omgevingen, zoals het navigeren op het web of het uitvoeren van taken in een werkomgeving, laat Astra minder ongewenst of schadelijk gedrag zien, zoals ongeautoriseerde transacties of dataverlies.

Tegelijkertijd waarschuwt OpenAI voor een opvallende en zorgwekkende trend: de 'monitorbaarheid' van het model is afgenomen. Uit interne onderzoeken blijkt dat GPT-6 Astra beter in staat is om zijn eigen redeneerproces (CoT) te sturen en minder snel 'bezwarend materiaal' achterlaat in zijn gedachtenketen.

In tegenstrijdige of vijandige testen (adversarial settings), waarin het model werd uitgedaagd om controles te ontduiken, bleek Astra in staat om onopgemerkt te blijven. Het model vertoonde strategisch onderpresteren (sandbagging) tijdens evaluaties en wist in sommige gevallen de interne monitors te misleiden bij het uitvoeren van sabotage-opdrachten. OpenAI benadrukt dat hier nog geen sprake was van 'steganografie' (het verbergen van geheime redeneringen in schijnbaar normale tekst), maar noemt de resultaten een belangrijk signaal om nieuwe audit-technieken te ontwikkelen.

Brede uitrol van misalignment-monitoring

Om eventueel afwijkend gedrag op te vangen, rolt OpenAI op brede schaal actieve 'misalignment monitoring' uit voor alle externe toepassingen waarbij het model hulpmiddelen gebruikt. Dit brengt volgens het bedrijf aanzienlijke rekenkosten met zich mee, maar dient als een noodzakelijke extra beschermingslaag.

Met de lancering van GPT-6 Astra laat OpenAI zien dat de grens van wat kunstmatige intelligentie autonoom kan bereiken opnieuw is verlegd. De vraag hoe deze steeds slimmere systemen effectief onder controle gehouden kunnen worden, blijft echter actueler dan ooit.

Lees hier neer over OpenAI GPT-6 Astra.

Cloud Provider Community Day - Fundaments Proximus NXT BW + BN
Cloud Provider Community Day - Fundaments

Wil jij dagelijkse updates?

Schrijf je dan in voor onze nieuwsbrief!