Zurück zur Übersicht
Ein am 24. März veröffentlichter Benchmark testet agentische KI in turn-basierten Umgebungen statt mit kurzen Einzelantworten. Laut der Arbeit lösen Menschen alle Aufgaben, während Frontier-Modelle unter 1 Prozent bleiben.
ARC-AGI-3 ist ein neuer Benchmark für agentische KI, der am 24. März veröffentlicht wurde. Im Mittelpunkt stehen offene, mehrstufige Aufgaben in turn-basierten Umgebungen.
Die Arbeit zielt damit auf einen anderen Testtyp als klassische Kurzprompt-Benchmarks. Gemessen werden soll, wie gut Systeme Probleme über mehrere Schritte hinweg ausführen und an veränderte Zustände anpassen.
Nach Angaben der Autoren lösen Menschen 100 Prozent der Aufgaben. Frontier-KI-Systeme bleiben demnach unter 1 Prozent.
Die Veröffentlichung setzt damit einen neuen Referenzpunkt für die Bewertung agentischer Systeme. Der Fokus verschiebt sich von punktueller Demo-Leistung auf robuste mehrstufige Problemlösung unter realistischeren Bedingungen.
Weiterlesen
Ein internes Audit von OpenAI stuft rund 30 Prozent der öffentlichen Aufgaben als fehlerhaft ein. Damit verliert der Benchmark seine Aussagekraft als Messlatte für die Leistungsfähigkeit von KI-Coding-Modellen.
Die Gründer und Teammitglieder von NextSlide sollen künftig an ChatGPT arbeiten. Finanzielle Details der Übernahme wurden nicht veröffentlicht.
Der Browser läuft auf Cloudflare Workers und soll Webaufgaben mit deutlich weniger Speicher als Chromium ausführen. In der Beta fehlen jedoch wichtige Funktionen wie Videowiedergabe und dauerhafte Anmeldesitzungen.
In einem Vergleich von zehn KI Assistenten erreichte GPT-5.5 Thinking die höchste Gesamtpunktzahl. Claude Sonnet 4.6 sagte dafür die meisten Gruppenspiele korrekt voraus.
Der Kommentarbereich wird geladen, sobald du ihn erreichst.