Stand der KI

Wie nah ist KI an der menschlichen Spitze?

An den leichten Tests ist nichts mehr zu sehen – jedes Spitzenmodell liegt über 90 %. Spannend wird es nur dort, wo Modelle scheitern. Hier siehst du die härtesten offenen Benchmarks – und wie schnell sich der Abstand zum Menschen schließt.

Kuratiert aus offiziellen Leaderboards. Jede Zahl mit Quelle und Stand.

Die Leistungsgrenze – wo Modelle (noch) scheitern

Je leerer der Balken, desto weiter ist die KI noch vom Menschen entfernt. ARC-AGI-3 ist der aktuelle Tiefpunkt: Menschen lösen 100 %, das beste Modell 62,71 %.

ARC-AGI-3

steigt

Interaktives, neuartiges Schlussfolgern in unbekannten Mini-Umgebungen.

100 % · Mensch
62,71 %
Bestes Modell: GPT-6 AstraMensch löst 100 %Stand 30. September 2026ARC Prize

Gezählt werden Läufe im Standard-Testaufbau (Harness) des ARC Prize. Läufe über einen anbieterspezifischen Adapter führt der ARC Prize getrennt; sie zählen hier nicht.

FrontierMath Tier 4 (v2)

fast ausgereizt

Ungelöste Mathematik auf Forschungsniveau.

97,6 %
Bestes Modell: GPT-6 AstraForschungs-Mathematik (Stunden pro Aufgabe)Stand 30. September 2026Epoch AI

Epoch hat am 12.06.2026 FrontierMath v2 veröffentlicht (bereinigte Aufgaben).

Humanity's Last Exam

steigt

Tausende Experten­fragen am Rand des menschlichen Wissens.

54,8 %
Bestes Modell: GPT-6 AstraFachexperten je FachgebietStand 30. September 2026HLE / Scale AI

Werte schwanken stark je nach Test-Setup, etwa mit oder ohne Websuche und Werkzeuge.

SWE-bench Verified

steigt

Echte Software-Bugs in echten GitHub-Projekten beheben.

83,5 %
Bestes Modell: Claude Opus 4.7Anteil gelöster echter TicketsStand 30. September 2026Epoch AI

GPQA Diamond

fast ausgereizt

Naturwissenschaft auf Promotionsniveau, „google-sicher“.

70 % · Mensch
95,8 %
Bestes Modell: GPT-6 AstraPromovierte Fachleute ≈ 70 %Stand 30. September 2026Epoch AI

Modelle liegen inzwischen über dem menschlichen Fachniveau – der Test verliert seine Trennschärfe.

Die Halbwertszeit von Benchmarks schrumpft

Tests, die jahrelang fordern sollten, sind heute in Monaten ausgereizt. MMLU (2020) hielt rund vier Jahre, GPQA (2023) nur noch zwei. Das ist die eigentliche Geschichte – nicht ein einzelner Wert, sondern das Tempo.

MMLU
4 J.
GPQA
2 J.
Humanity's Last Exam
noch offen
ARC-AGI-3
noch offen
20202021202220232024202520262027
Stanford AI Index 2026

Quellen & Stand

Zuletzt geprüft: 30. September 2026

Benchmark-Werte sind Momentaufnahmen und je nach Test-Setup unterschiedlich. Sie messen einzelne Fähigkeiten, nicht „Intelligenz“ insgesamt.

Häufige Fragen

Heißt „nah am Menschen“, dass KI bald alles kann?

Nein. Diese Tests messen eng umrissene Fähigkeiten. Ein Modell kann GPQA-Fragen über menschlichem Niveau beantworten und bei ARC-AGI-3 noch hinter Menschen zurückbleiben. „Stand der KI“ ist ein Fortschrittsbild, keine AGI-Prognose.

Warum widersprechen sich manche Zahlen?

Verschiedene Leaderboards testen unter leicht anderen Bedingungen (Prompting, Tool-Zugriff, Test-Version). Wir nennen pro Wert Quelle und Datum – und wo es eine Spanne gibt, sagen wir das.

Wie aktuell ist diese Seite?

Ein automatischer Lauf prüft alle sechs Stunden die offiziellen Quellen; ARC-AGI-3 liest er direkt aus den Daten des ARC Prize. Ein neuer Wert gilt erst, wenn zwei Läufe nacheinander dasselbe melden, bei einem Sprung um mehr als 15 Prozentpunkte erst nach drei. Einbrüche um mehr als 15 Punkte nimmt der Lauf nie von selbst an. Einen von Hand nachgeprüften Wert zeigt die Seite sofort. GPQA Diamond, FrontierMath und SWE-bench Verified übernehmen wir aus den Daten von Epoch AI, die auch KI-IQ zeigt. An jeder Karte steht, von wann ihr Wert ist.

KI bewegt sich schneller als dein letzter Plan?

Wir ordnen ein, was für dein Geschäft wirklich relevant ist – und setzen die Anwendungsfälle um, die sich heute lohnen.