KI-Latenz-Index

Wie schnell ist KI aus Deutschland?

Große Latenz-Benchmarks messen aus den USA – für Nutzer in Deutschland sagt das wenig. Wir messen mehrmals täglich direkt aus Frankfurt: Wie schnell die großen KI-Endpunkte antworten, welchen Durchsatz sie schaffen und wie zuverlässig sie sind.

Stand 30. September 2026, 03:20Gemessen aus eu-central-1 (Frankfurt)

Time-to-first-token aus Frankfurt

Zeit bis zum ersten Token (TTFT) ist die Kennzahl, die die Serverentfernung am stärksten spürt – deshalb steht sie im Mittelpunkt. TTFT und Durchsatz sind Mediane der Tageswerte aus den letzten 30 Tagen, die Fehlerquote gilt für denselben Zeitraum. Sortiert nach TTFT; Durchsatz ist ein Näherungswert (~).

30 Tagesmessungen je Endpunkt, seit 2026-09-01. Alle Verläufe stehen auf derselben Skala von 0 bis 2.900 ms — eine höhere Linie ist wirklich langsamer.

EndpunktTTFT (Median)VerlaufDurchsatzFehler
Mistral Smallüber AI-GatewayMistral · AI Gateway322 msMistral Small: 30 Messwerte, 276 bis 384 ms~2501,1%
Claude Haiku 4.5EU-Region · direktAWS Bedrock · eu-central-1 (Frankfurt)701 msClaude Haiku 4.5: 30 Messwerte, 641 bis 749 ms~5861,1%
GPT-5 miniüber AI-GatewayOpenAI · AI Gateway793 msGPT-5 mini: 30 Messwerte, 650 bis 1.019 ms~990%
Claude Haiku 4.5über AI-GatewayAnthropic · AI Gateway803 msClaude Haiku 4.5: 30 Messwerte, 678 bis 1.004 ms~4870%
GPT-5 miniUS-global · direktOpenAI · api.openai.com (US-global)884 msGPT-5 mini: 30 Messwerte, 679 bis 1.247 ms~1050%
Gemini 3 Flashüber AI-GatewayGoogle · AI Gateway1.857 msGemini 3 Flash: 30 Messwerte, 1.668 bis 2.097 ms~774,21,1%
DeepSeek V4 Flashüber AI-GatewayDeepSeek · AI Gateway2.039 msDeepSeek V4 Flash: 30 Messwerte, 1.154 bis 2.878 ms~214,411,2%

Was im Korb liegt und warum er klein ist

Der Index vergleicht keine Modelle, sondern Wege. Deshalb bleibt die Modellklasse absichtlich gleich, nämlich die kleine, schnelle Klasse, und variiert wird der Weg: aus welcher Region er startet und über wie viele Zwischenschritte er läuft. Ein großes gegen ein kleines Modell zu messen würde nur zeigen, dass das große länger denkt.

  • 1
    Direkt, EU-Region

    Bedrock in Frankfurt. Anfrage und Antwort verlassen die EU nicht. Das ist die Referenz, an der sich alles andere misst.

    ModelleClaude Haiku 4.5 (AWS Bedrock)

  • 1
    Direkt, US-global

    OpenAI über api.openai.com. Gleiche Modellklasse, gleicher Prompt, aber der Weg geht über den Atlantik. Der Abstand zur EU-Zeile ist das, was diese Seite eigentlich misst.

    ModelleGPT-5 mini (OpenAI)

  • 5
    Über das AI-Gateway

    Ein verwalteter Zwischenschritt, den viele EU-Teams wirklich nutzen, weil er mehrere Anbieter über einen einzigen Zugang erreichbar macht. Nicht 1:1 mit den direkten Zeilen vergleichbar, und genau deshalb getrennt ausgewiesen.

    ModelleGPT-5 mini (OpenAI) · Claude Haiku 4.5 (Anthropic) · Gemini 3 Flash (Google) · Mistral Small (Mistral) · DeepSeek V4 Flash (DeepSeek)

Der Korb ist klein, weil jeder Endpunkt bei jedem Lauf Geld kostet, alle acht Stunden, dauerhaft. Dazu kommen die Zugänge: Es gibt einen OpenAI-Schlüssel, einen Gateway-Schlüssel und die Bedrock-Rolle. Was darüber nicht erreichbar ist, können wir nicht messen. eu.api.openai.com stand auf der Liste und ist wieder heruntergefallen, weil der Schlüssel nicht für die EU-Datenresidenz freigeschaltet ist und die Anfrage mit 401 endet.

Wie wir messen

Ehrlich und nachvollziehbar – echte Messungen aus einer Lambda-Funktion in Frankfurt, für alle Endpunkte identisch.

  1. 1
    Vantage-Punkt: Frankfurt

    Eine Lambda-Funktion in AWS eu-central-1 (Frankfurt) sendet identische Mini-Anfragen und stoppt die Zeit. So misst der Index Latenz so, wie deutsche Nutzer sie erleben – nicht aus den USA.

  2. 2
    TTFT, Durchsatz, Fehler

    TTFT = Zeit bis zum ersten sichtbaren Token (die serverabstandssensible Kennzahl). Durchsatz = Token/Sekunde (Näherung, ~). Fehlerquote = Anteil fehlgeschlagener Aufrufe.

  3. 3
    Mehrmals täglich, Median

    Alle 8 Stunden, je zwei Messungen pro Endpunkt (die schnellere zählt, um Ausreißer zu dämpfen). Pro Tag bilden wir den Median der Läufe, die TTFT in der Tabelle ist der Median dieser Tageswerte über das 30-Tage-Fenster.

  4. 4
    Nur vorwärts

    Vergangene Latenz aus einem EU-Standort lässt sich nicht nachträglich messen – der Vorsprung ab Tag 1 bleibt. Niemand veröffentlicht eine solche Aus-Deutschland-Zeitreihe.

Vergleiche zwischen „direkt“ und „über AI-Gateway“ sind nicht 1:1 – der Gateway-Weg hat einen zusätzlichen, bewusst ausgewiesenen Zwischenschritt, ist aber ein realer Weg, den viele EU-Entwickler nutzen. Bei Reasoning-Modellen setzen wir minimalen Reasoning-Aufwand, damit die TTFT die Infrastruktur misst, nicht die Denkzeit. Werte schwanken mit der Tageslast; erst der Median über Tage ist belastbar. Der OpenAI-EU-Endpunkt (eu.api.openai.com) fehlt, weil unser Schlüssel dafür nicht freigeschaltet ist.

Häufige Fragen

Was ist TTFT?

Time-to-first-token – die Zeit von der Anfrage bis zum ersten Wort der Antwort. Sie prägt das gefühlte Tempo einer KI am stärksten und reagiert empfindlich auf die Entfernung zum Server. Deshalb ist sie unsere Hauptkennzahl.

Warum aus Frankfurt messen?

Weil der Standort zählt: Ein Endpunkt in den USA ist aus Deutschland spürbar langsamer als einer in der EU. Große Benchmarks messen aus den USA und bilden die deutsche Realität nicht ab – wir messen dort, wo deine Nutzer sind.

Warum kann diese Historie niemand nachbauen?

Vergangene Latenz aus einem EU-Standort lässt sich nicht rückwirkend messen. Wer erst später anfängt, hat die vergangenen Tage für immer verpasst – genau das macht die Zeitreihe wertvoll.

Was heißt „über AI-Gateway“?

Diese Endpunkte laufen über ein Gateway (ein Dienst, der Anfragen an viele Modelle vermittelt). Das ist ein zusätzlicher Zwischenschritt – wir weisen ihn transparent aus. Direkt-Endpunkte (Bedrock Frankfurt, OpenAI) gehen ohne diesen Umweg.

Eigene Messungen aus AWS eu-central-1 (Frankfurt), mehrmals täglich, identische Mini-Anfrage je Endpunkt. TTFT = Zeit bis zum ersten Token; Durchsatz ist ein Näherungswert. Werte schwanken mit der Last; der Median über Tage ist die belastbare Größe. Keine Gewähr; kein Ersatz für eigene Lasttests.

Schnelle, DSGVO-konforme KI-Anbindung

Wir bringen KI performant und rechtssicher auf deine Infrastruktur – von der Endpunkt-Wahl bis zum Monitoring.