Zurück zur Übersicht
Ein internes Audit von OpenAI stuft rund 30 Prozent der öffentlichen Aufgaben als fehlerhaft ein. Damit verliert der Benchmark seine Aussagekraft als Messlatte für die Leistungsfähigkeit von KI-Coding-Modellen.
OpenAI hat seine frühere Empfehlung für den Coding-Benchmark SWE-Bench Pro zurückgenommen. Nach einem internen Audit sind rund 30 Prozent der öffentlichen Aufgaben fehlerhaft und bilden die Leistungsfähigkeit von KI-Modellen deshalb nicht zuverlässig ab.
Zu den festgestellten Problemen zählen versteckte Anforderungen, widersprüchliche Vorgaben, übermäßig strenge Tests und unvollständige Bewertungskriterien. OpenAI prüfte die Aufgaben mit modellbasierten Prüfagenten und ließ sie zusätzlich von fünf erfahrenen Softwareentwicklern bewerten.
Die Kehrtwende kommt wenige Monate nach OpenAIs Empfehlung von SWE-Bench Pro als belastbarere Alternative zu SWE-bench Verified. Für Anbieter und Käufer von Coding-Agenten ist das ein weiterer Beleg dafür, dass Benchmarkzahlen ohne Prüfung der Aufgabenqualität wenig wert sind. Eine schöne Rangliste ersetzt eben keine saubere Messung.
Weiterlesen
Die Gründer und Teammitglieder von NextSlide sollen künftig an ChatGPT arbeiten. Finanzielle Details der Übernahme wurden nicht veröffentlicht.
In einem Vergleich von zehn KI Assistenten erreichte GPT-5.5 Thinking die höchste Gesamtpunktzahl. Claude Sonnet 4.6 sagte dafür die meisten Gruppenspiele korrekt voraus.
Interne Tests zeigen deutliche Fortschritte bei agentischem Programmieren und Cybersecurity-Aufgaben. OpenAI kann nicht ausschließen, dass Astra unter dem eigenen Preparedness Framework die Stufe „Critical“ erreicht.
Kostenlose und Go Nutzer sollen ab kommender Woche unbegrenzt textbasierte Chats mit GPT 5.6 Luna führen können. Für Dateien, Bilder, Sprache und weitere Werkzeuge gelten weiterhin Grenzen.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.