Große Latenz-Benchmarks messen aus den USA – für Nutzer in Deutschland sagt das wenig. Wir messen mehrmals täglich direkt aus Frankfurt: Wie schnell die großen KI-Endpunkte antworten, welchen Durchsatz sie schaffen und wie zuverlässig sie sind.
Zeit bis zum ersten Token (TTFT) ist die Kennzahl, die die Serverentfernung am stärksten spürt – deshalb steht sie im Mittelpunkt. TTFT und Durchsatz sind Mediane der Tageswerte aus den letzten 30 Tagen, die Fehlerquote gilt für denselben Zeitraum. Sortiert nach TTFT; Durchsatz ist ein Näherungswert (~).
30 Tagesmessungen je Endpunkt, seit 2026-09-01. Alle Verläufe stehen auf derselben Skala von 0 bis 2.900 ms — eine höhere Linie ist wirklich langsamer.
| Endpunkt | TTFT (Median) | Verlauf | Durchsatz | Fehler |
|---|---|---|---|---|
| Mistral Small | 322 ms | ~250 | 1,1% | |
| Claude Haiku 4.5 | 701 ms | ~586 | 1,1% | |
| GPT-5 mini | 793 ms | ~99 | 0% | |
| Claude Haiku 4.5 | 803 ms | ~487 | 0% | |
| GPT-5 mini | 884 ms | ~105 | 0% | |
| Gemini 3 Flash | 1.857 ms | ~774,2 | 1,1% | |
| DeepSeek V4 Flash | 2.039 ms | ~214,4 | 11,2% |
Der Index vergleicht keine Modelle, sondern Wege. Deshalb bleibt die Modellklasse absichtlich gleich, nämlich die kleine, schnelle Klasse, und variiert wird der Weg: aus welcher Region er startet und über wie viele Zwischenschritte er läuft. Ein großes gegen ein kleines Modell zu messen würde nur zeigen, dass das große länger denkt.
Bedrock in Frankfurt. Anfrage und Antwort verlassen die EU nicht. Das ist die Referenz, an der sich alles andere misst.
ModelleClaude Haiku 4.5 (AWS Bedrock)
OpenAI über api.openai.com. Gleiche Modellklasse, gleicher Prompt, aber der Weg geht über den Atlantik. Der Abstand zur EU-Zeile ist das, was diese Seite eigentlich misst.
ModelleGPT-5 mini (OpenAI)
Ein verwalteter Zwischenschritt, den viele EU-Teams wirklich nutzen, weil er mehrere Anbieter über einen einzigen Zugang erreichbar macht. Nicht 1:1 mit den direkten Zeilen vergleichbar, und genau deshalb getrennt ausgewiesen.
ModelleGPT-5 mini (OpenAI) · Claude Haiku 4.5 (Anthropic) · Gemini 3 Flash (Google) · Mistral Small (Mistral) · DeepSeek V4 Flash (DeepSeek)
Der Korb ist klein, weil jeder Endpunkt bei jedem Lauf Geld kostet, alle acht Stunden, dauerhaft. Dazu kommen die Zugänge: Es gibt einen OpenAI-Schlüssel, einen Gateway-Schlüssel und die Bedrock-Rolle. Was darüber nicht erreichbar ist, können wir nicht messen. eu.api.openai.com stand auf der Liste und ist wieder heruntergefallen, weil der Schlüssel nicht für die EU-Datenresidenz freigeschaltet ist und die Anfrage mit 401 endet.
Ehrlich und nachvollziehbar – echte Messungen aus einer Lambda-Funktion in Frankfurt, für alle Endpunkte identisch.
Eine Lambda-Funktion in AWS eu-central-1 (Frankfurt) sendet identische Mini-Anfragen und stoppt die Zeit. So misst der Index Latenz so, wie deutsche Nutzer sie erleben – nicht aus den USA.
TTFT = Zeit bis zum ersten sichtbaren Token (die serverabstandssensible Kennzahl). Durchsatz = Token/Sekunde (Näherung, ~). Fehlerquote = Anteil fehlgeschlagener Aufrufe.
Alle 8 Stunden, je zwei Messungen pro Endpunkt (die schnellere zählt, um Ausreißer zu dämpfen). Pro Tag bilden wir den Median der Läufe, die TTFT in der Tabelle ist der Median dieser Tageswerte über das 30-Tage-Fenster.
Vergangene Latenz aus einem EU-Standort lässt sich nicht nachträglich messen – der Vorsprung ab Tag 1 bleibt. Niemand veröffentlicht eine solche Aus-Deutschland-Zeitreihe.
Vergleiche zwischen „direkt“ und „über AI-Gateway“ sind nicht 1:1 – der Gateway-Weg hat einen zusätzlichen, bewusst ausgewiesenen Zwischenschritt, ist aber ein realer Weg, den viele EU-Entwickler nutzen. Bei Reasoning-Modellen setzen wir minimalen Reasoning-Aufwand, damit die TTFT die Infrastruktur misst, nicht die Denkzeit. Werte schwanken mit der Tageslast; erst der Median über Tage ist belastbar. Der OpenAI-EU-Endpunkt (eu.api.openai.com) fehlt, weil unser Schlüssel dafür nicht freigeschaltet ist.
Time-to-first-token – die Zeit von der Anfrage bis zum ersten Wort der Antwort. Sie prägt das gefühlte Tempo einer KI am stärksten und reagiert empfindlich auf die Entfernung zum Server. Deshalb ist sie unsere Hauptkennzahl.
Weil der Standort zählt: Ein Endpunkt in den USA ist aus Deutschland spürbar langsamer als einer in der EU. Große Benchmarks messen aus den USA und bilden die deutsche Realität nicht ab – wir messen dort, wo deine Nutzer sind.
Vergangene Latenz aus einem EU-Standort lässt sich nicht rückwirkend messen. Wer erst später anfängt, hat die vergangenen Tage für immer verpasst – genau das macht die Zeitreihe wertvoll.
Diese Endpunkte laufen über ein Gateway (ein Dienst, der Anfragen an viele Modelle vermittelt). Das ist ein zusätzlicher Zwischenschritt – wir weisen ihn transparent aus. Direkt-Endpunkte (Bedrock Frankfurt, OpenAI) gehen ohne diesen Umweg.
Eigene Messungen aus AWS eu-central-1 (Frankfurt), mehrmals täglich, identische Mini-Anfrage je Endpunkt. TTFT = Zeit bis zum ersten Token; Durchsatz ist ein Näherungswert. Werte schwanken mit der Last; der Median über Tage ist die belastbare Größe. Keine Gewähr; kein Ersatz für eigene Lasttests.
Wir bringen KI performant und rechtssicher auf deine Infrastruktur – von der Endpunkt-Wahl bis zum Monitoring.
Diese Tools passen thematisch dazu.