New Horizon No. 233 / 2026-08-21 · Berlin
Interaktiv

Tokens pro Sekunde

Jeder Inferenz-Anbieter nennt diese Zahl. Hier ist, wie sie sich anfühlt.

Modellkarten, GPU-Datenblätter und Serving-Benchmarks nennen alle Tokens pro Sekunde — und kaum jemand weiß, wie sich diese Zahlen im Bauch anfühlen. Vierzig ist gut. Vier ist unbenutzbar. Vierhundert ist von viertausend nicht zu unterscheiden. Bewegen Sie den Regler, und der Text erscheint in exakt der gewählten Rate — mit demselben Akkumulator wie ein echter Streaming-Client, ohne getürkte Schreibmaschinen-Animation.


Rate wählen. Zusehen.

40 Tokens / Sek.
Wörter pro Minute1,800
500-Token-Antwort12.5 s
1101001000
Ausgabe Tokens 0 Absatz 1 / 3

Dieser Simulator braucht JavaScript. Der Text, den er ausgibt, besagt: Ein Token ist ein Fragment, kein Wort — deshalb lassen sich Generierungsraten und Lesegeschwindigkeit nicht eins zu eins umrechnen.

Das hervorgehobene Fragment ist der Token, der gerade ausgegeben wird. Wörter brechen absichtlich mitten im Wort — genau das tut ein Tokenizer, und deshalb sind „Tokens pro Sekunde" nicht „Wörter pro Sekunde".


Zwei davon haben wir selbst gemessen

Die roten Marken am Regler sind die beiden Raten, die wir am 2026-08-19 auf eigenen Maschinen gemessen haben. Die grauen sind Umrechnungen und publizierte Fremdangaben und als solche gekennzeichnet. Wir besitzen keinen Inferenz-ASIC zum Messen — also tun wir nicht so, als wäre die Zahl unsere.

Unsere GPU · gemessen
39.5 t/s
  • 12B-Modell, 3-Bit quantisiert
  • Eine RTX 3060 Ti, 8 GB
  • 3 Läufe, Streuung unter 1 %
  • Nichts hat das Haus verlassen
Cloud-API · gemessen
56.7 t/s
  • Gehostetes Spitzenmodell
  • 11 Läufe, Ende-zu-Ende-Uhrzeit
  • Spanne 6.6 – 76
  • Gleiche Maschine, offenes Internet
Die Streuung
11×
  • Lokal best zu schlechtest: 1,006x
  • Cloud best zu schlechtest: 11,5x
  • Mediane unterscheiden sich um 44 %
  • Nur eines davon ist planbar

Der Median steht im Prospekt. Die Streuung ist das Produkt.

Nach Medianen gewinnt das gehostete Modell: 57 zu 40. Diese Zahl kommt auf die Folie. Aber unser langsamster lokaler Lauf lag bei 39,5 Tokens pro Sekunde und unser langsamster Cloud-Lauf bei 6,6 — unter Sprechtempo, deutlich unter Lesetempo, also genau dort, wo Menschen aufgeben und neu laden. Eine Pipeline, die nachts unbeaufsichtigt läuft, wird nach ihrem schlechtesten Lauf dimensioniert, nicht nach ihrem Median — und planbar ist die Maschine ohne schlechtesten Fall.

Deshalb generieren die Pipelines hinter dieser Seite zuerst lokal und greifen nur dort zu einem gehosteten Modell, wo es sich nachweislich rechnet. Keine Ideologie — ein Elffach-Ausreißer, der um drei Uhr nachts zuschlägt, wenn niemand hinsieht.

→ Was dieselbe Maschine im Betrieb kostet → Inferenz nach Ihrem schlechtesten Fall dimensionieren → Wie der Rest läuft


Die KI-News, die zählen — bis 07:30 Uhr MEZ im Postfach. Kostenlos, kein Spam.