Je leerer der Balken, desto weiter ist die KI noch vom Menschen entfernt. ARC-AGI-3 ist der aktuelle Tiefpunkt: Menschen lösen 100 %, das beste Modell 62,71 %.
ARC-AGI-3
steigtInteraktives, neuartiges Schlussfolgern in unbekannten Mini-Umgebungen.
Gezählt werden Läufe im Standard-Testaufbau (Harness) des ARC Prize. Läufe über einen anbieterspezifischen Adapter führt der ARC Prize getrennt; sie zählen hier nicht.
FrontierMath Tier 4 (v2)
fast ausgereiztUngelöste Mathematik auf Forschungsniveau.
Epoch hat am 12.06.2026 FrontierMath v2 veröffentlicht (bereinigte Aufgaben).
Humanity's Last Exam
steigtTausende Expertenfragen am Rand des menschlichen Wissens.
Werte schwanken stark je nach Test-Setup, etwa mit oder ohne Websuche und Werkzeuge.
SWE-bench Verified
steigtEchte Software-Bugs in echten GitHub-Projekten beheben.
GPQA Diamond
fast ausgereiztNaturwissenschaft auf Promotionsniveau, „google-sicher“.
Modelle liegen inzwischen über dem menschlichen Fachniveau – der Test verliert seine Trennschärfe.