In einem Vergleich von zehn KI Assistenten erreichte GPT-5.5 Thinking die höchste Gesamtpunktzahl. Claude Sonnet 4.6 sagte dafür die meisten Gruppenspiele korrekt voraus.
Interne Tests zeigen deutliche Fortschritte bei agentischem Programmieren und Cybersecurity-Aufgaben. OpenAI kann nicht ausschließen, dass Astra unter dem eigenen Preparedness Framework die Stufe „Critical“ erreicht.