New Horizon No. 243 / 2026-08-31 · Berlin
Referenz

KI-Glossar

Die Begriffe aus der Anbieterpräsentation — erklärt von jemandem, der das Ding betreiben muss.

Die meisten KI-Begriffe sind nicht schwierig. Sie sind unerklärt — ein Kürzel, das genau dann nicht mehr definiert wird, wenn alle im Raum so tun, als kennten sie es. Meist ist das der Moment, in dem über Budgets gesprochen wird. Diese Seite erklärt die Begriffe, die in Anbieterpräsentationen, Modelllizenzen und Rechnungen auftauchen — alphabetisch und ohne vorausgesetztes Vorwissen.

23 der 85 Einträge tragen einen zweiten Absatz mit der Marke Aus dem eigenen Betrieb. Das sind keine Definitionen, sondern Beobachtungen: eine auf unseren eigenen Maschinen gemessene Zahl oder ein Verhalten, dessen Suche uns einen Tag gekostet hat. Dieser Teil steht in keinem Lehrbuch — und lässt sich gegen den Rest der Seite prüfen.


85 Begriffe

A

Agent

Agenten & Werkzeuge #

Ein Modell mit Werkzeugen und einem Ziel, das seinen nächsten Schritt selbst wählt und in Schleife arbeitet, bis es fertig ist. Der Unterschied zum Chatbot ist nicht Intelligenz, sondern Befugnis: Ein Agent führt Handlungen mit Folgen außerhalb des Chats aus.

Siehe auch Werkzeugnutzung · ReAct-Schleife · Mensch in der Schleife

Aktive Parameter

Modelle & Architektur #

Der Anteil eines MoE-Modells, der für ein einzelnes Token tatsächlich genutzt wird. Die aktiven Parameter bestimmen Tempo und Speicherkosten, die Gesamtzahl bestimmt das Wissen. Wer nur eine der beiden Zahlen nennt, verschweigt die Hälfte.

Siehe auch Mixture of Experts

Alignment

Training & Anpassung #

Die Arbeit daran, dass ein Modell sich wie beabsichtigt verhält — hilfreich, ehrlich und nicht bereit zu dem, was der Betreiber ausgeschlossen hat. Es ist eine Eigenschaft aus dem Training, die ein hartnäckiger Prompt zur Laufzeit trotzdem umgehen kann.

Siehe auch Reinforcement Learning mit menschlichem Feedback · Jailbreak · Leitplanke

Attention (Aufmerksamkeit)

Modelle & Architektur #

Der Mechanismus, der für jedes Token entscheidet, welche anderen Tokens dafür zählen. Der Aufwand wächst etwa quadratisch mit der Kontextlänge — lange Eingaben werden also schneller teuer, als sie lang werden.

Siehe auch Kontextfenster · KV-Cache

Autoregressive Generierung

Modelle & Architektur #

Ein Token nach dem anderen erzeugen, jedes bedingt durch alles bisher Geschriebene. Das erklärt zweierlei zugleich: warum die Ausgabegeschwindigkeit pro Token angegeben wird und warum ein Modell einen bereits ausgegebenen Satz nicht mehr überarbeiten kann.

Siehe auch Token · Streaming · Zeit bis zum ersten Token

B

Basismodell

Training & Anpassung #

Das rohe vortrainierte Modell, bevor es gelernt hat, Anweisungen zu befolgen. Es setzt Text fort, statt Fragen zu beantworten; in einer Anwendung will man die „Instruct“- oder „Chat“-Variante derselben Gewichte.

Siehe auch Instruction-Tuning

Batching

Betrieb & Inferenz #

Mehrere Anfragen gemeinsam durch die GPU schicken. Das vervielfacht den Gesamtdurchsatz, ohne eine einzelne Antwort zu beschleunigen — deshalb kann eine gehostete API pro Token günstig sein und sich trotzdem langsam anfühlen.

Siehe auch Tokens pro Sekunde · Ratenlimit

Benchmark

Evaluation & Fehlerbilder #

Ein öffentlicher Testsatz zur Rangfolge von Modellen. Er beantwortet „welches Modell ist allgemein besser“ — selten die Frage, die Sie haben; ein Modell kann eine Rangliste anführen und bei Ihrer Aufgabe verlieren.

Aus dem eigenen BetriebBei unserer eigenen Extraktionsarbeit stimmten ein Modell mit 753 und eines mit 321 Milliarden Parametern in allen zwölf relevanten Feldern überein — das kleinere war fünf- bis siebenmal schneller. Messen Sie an Ihrer eigenen Aufgabe, bevor Sie für das größere zahlen.

Siehe auch Eval · Benchmark-Kontamination · Goldstandard

Benchmark-Kontamination

Evaluation & Fehlerbilder #

Ein öffentlicher Testsatz ist in die Trainingsdaten geraten — die Punktzahl misst dann Erinnerung an die Lösungen statt Können. Einer der Gründe, warum ein Ranglistenergebnis den Kontakt mit den eigenen Daten selten übersteht.

Siehe auch Benchmark · Eval

Break-even

Kosten, Hardware & Recht #

Das Volumen, ab dem eigene Hardware günstiger ist als gemietete Tokens. Er existiert nur gegen einen konkreten gehosteten Preis: Gegen die günstigsten Endpunkte mit offenen Gewichten kann allein der Strom mehr kosten als die Tokens.

Aus dem eigenen BetriebNach unseren eigenen Zahlen überholt eine Mittelklasse-Karte eine gehostete Mittelklasse-API bei etwa 200.000 Output-Tokens pro Tag, ein Spitzenmodell fast sofort — und die günstigsten Endpunkte mit offenen Gewichten preislich nie.

Siehe auch Selbst hosten · Preis pro Million Tokens · GPU

C

Chunking

Agenten & Werkzeuge #

Dokumente in Passagen zerlegen, die klein genug für präzises Auffinden und groß genug sind, um für sich verständlich zu bleiben. Der unscheinbarste Teil eines Retrieval-Systems — und der, der am häufigsten über Erfolg oder Misserfolg entscheidet.

Siehe auch Retrieval-Augmented Generation · Embedding

Context Engineering

Agenten & Werkzeuge #

Entscheiden, was in den begrenzten Kontext gehört und was nicht — die Disziplin, die die Prompt-Formulierung als wichtigsten Hebel abgelöst hat, seit die Modelle gut sind. Die meisten Qualitätsprobleme in Agentensystemen sind Kontextprobleme.

Siehe auch Kontextfenster · Prompt · Gedächtnis

D

Datenresidenz

Kosten, Hardware & Recht #

Wo Ihre Prompts verarbeitet und gespeichert werden und nach welchem Recht. Bei regulierten oder vertraulichen Inhalten entscheidet das über die Architektur, bevor irgendein Qualitätsvergleich beginnt — ein Modell, das die Daten nicht sehen darf, hat keine Punktzahl.

Siehe auch Selbst hosten · Gehostete API

Diffusionsmodell

Modelle & Architektur #

Die Architektur hinter den meisten Bild- und Videogeneratoren. Sie startet mit Rauschen und entfernt es Schritt für Schritt in Richtung des Prompts — deshalb skaliert die Rechenzeit mit der Zahl der Schritte, nicht mit der Länge der Ausgabe.

Siehe auch GPU · VRAM

Distillation

Training & Anpassung #

Ein kleines Modell auf den Ausgaben eines großen trainieren. Das Ergebnis ist im Betrieb weit günstiger und behält viel vom Verhalten für die Aufgaben, für die destilliert wurde — und nur für diese.

Siehe auch Synthetische Daten · Quantisierung

Drift

Evaluation & Fehlerbilder #

Sich verändernde Ausgabequalität, ohne dass sich Ihr Code ändert — ein gehostetes Modell wird aktualisiert, die Eingabeverteilung verschiebt sich, eine Quellseite ändert ihre Struktur. Nur eine wiederholte Eval bemerkt das; einen Fehler wirft nichts.

Siehe auch Eval · Fail-Open / Fail-Closed

E

Embedding

Modelle & Architektur #

Eine Zahlenliste, die ein Textstück nach Bedeutung verortet — Ähnliches liegt nah beieinander. Sie macht semantische Suche, Clustering und Dublettenerkennung ohne gemeinsame Stichwörter möglich.

Aus dem eigenen BetriebUnser Newsletter erkennt Dubletten über Embeddings statt über Überschriften. Eine nahezu wortgleiche Neufassung einer älteren Meldung erreichte 0,982 Kosinus-Ähnlichkeit — für einen Titelabgleich unsichtbar, für die Vektoren offensichtlich.

Siehe auch Semantische Suche · Vektordatenbank · Kosinus-Ähnlichkeit

Eval

Evaluation & Fehlerbilder #

Ein Testsatz aus der eigenen Arbeit, mit einer eigenen Definition der guten Antwort. Das einzige Instrument, das zeigt, ob eine Prompt-Änderung, ein Modellwechsel oder eine Preissenkung tatsächlich geholfen hat.

Siehe auch Benchmark · Goldstandard · LLM als Prüfer

F

Fail-Open / Fail-Closed

Evaluation & Fehlerbilder #

Was eine Komponente tut, wenn ihre Eingabe fehlt oder veraltet ist: trotzdem weiterlaufen (open) oder anhalten (closed). Beides ist irgendwo richtig; wer es dem Zufall überlässt, erhält aus einer defekten Prüfung entweder stille Fehlausgaben oder einen stillen Ausfall.

Aus dem eigenen BetriebDie Richtliniendatei, die unsere Publishing-Pipeline anhalten kann, ist bewusst fail-open: fehlend, unlesbar oder älter als sieben Tage bedeutet jeweils „weiter wie bisher“. Nur ein frischer, ausdrücklicher Halt stoppt sie — ein Ausfall der Überwachung darf das Geschäft nicht stillschweigend anhalten.

Siehe auch Orchestrierung · Leitplanke

Fine-Tuning

Training & Anpassung #

Weitertrainieren mit eigenen Beispielen, um das Verhalten eines Modells zu verändern — Format, Ton, Fachgewohnheiten. Für Verhalten funktioniert es gut, für Faktenwissen schlecht: Dafür ist Retrieval billiger und aktueller.

Siehe auch Low-Rank-Adaption · Retrieval-Augmented Generation · Instruction-Tuning

Foundation-Modell

Modelle & Architektur #

Ein großes Allzweckmodell, das einmal sehr teuer trainiert und anschließend für konkrete Aufgaben angepasst wird. „Frontier“ ist der Marketingbegriff für die jeweils größte und leistungsfähigste Klasse.

Siehe auch Fine-Tuning · Basismodell

G

Gedächtnis

Agenten & Werkzeuge #

Alles, was zwischen Aufrufen überdauert — denn das Modell selbst behält nichts. In der Praxis ist es ein Speicher, den Ihr Code beschreibt und wieder in den Prompt liest. „Was erinnert wird“ ist damit eine Entwurfsentscheidung, kein Modellmerkmal.

Siehe auch Prompt · Context Engineering · Retrieval-Augmented Generation

GedankenketteCoT

Modelle & Architektur #

Der Rechenweg, den ein Modell vor der Antwort schreibt. Manche APIs liefern ihn in einem eigenen Feld, andere schreiben ihn direkt in die Antwort — Code, der eine saubere Antwort erwartet, scheitert am zweiten Fall, ohne dass ein Fehler auftritt.

Aus dem eigenen BetriebZwei bei uns eingesetzte Modelle behandeln dasselbe „nicht nachdenken“-Flag genau entgegengesetzt: Das eine ignoriert es und legt den Rechenweg in ein eigenes Feld, die Antwort bleibt sauber; das andere ignoriert es und schreibt den Rechenweg in die Antwort. Beide melden nichts. Das Flag verdient einen Test, keine Annahme.

Siehe auch Reasoning-Modell · Strukturierte Ausgabe

Gehostete API

Kosten, Hardware & Recht #

Ein anderer betreibt das Modell und rechnet pro Token ab. Keine Investition, sofortiger Zugriff auf die größten Modelle — und drei bleibende Bedingungen: Ihre Daten verlassen das Haus, das Modell kann sich unter Ihnen ändern, und den Preis bestimmt der Anbieter.

Siehe auch Selbst hosten · Preis pro Million Tokens · Datenresidenz

Goldstandard

Evaluation & Fehlerbilder #

Fälle mit bekannter richtiger Antwort, von Menschen gelabelt. Ein paar Dutzend davon anzulegen ist die günstigste Qualitätsinvestition in einem KI-Projekt — und die am häufigsten übersprungene.

Aus dem eigenen BetriebDas Tor unserer Video-Pipeline ist an einem handgelabelten Satz von 70 Clips kalibriert. Er verwandelt „der Prüfer wirkt jetzt besser“ in eine Zahl — und macht eine geänderte Schwelle überprüfbar.

Siehe auch Eval · Präzision und Trefferquote

GPUGPU

Kosten, Hardware & Recht #

Der Prozessor, der Inferenz praktikabel macht, weil er Tausende Multiplikationen gleichzeitig ausführt. Für den Modellbetrieb zählen weit häufiger Speichergröße und Speicherbandbreite als reine Rechenleistung.

Siehe auch VRAM · Selbst hosten · Quantisierung

Großes SprachmodellLLM

Modelle & Architektur #

Ein Modell, das auf sehr großen Textmengen trainiert wurde, um jeweils das nächste Token vorherzusagen. Alles, was es zu tun scheint — antworten, übersetzen, zusammenfassen, Code schreiben —, ist diese eine Operation, immer wieder angewandt.

Siehe auch Token · Transformer · Parameter

H

Halluzination

Evaluation & Fehlerbilder #

Eine flüssige, selbstbewusste, falsche Antwort. Kein Fehler, den man behebt, sondern eine Eigenschaft des Vorhersagens plausiblen Textes; wirksam sind Retrieval, Belege und Verifikation — nicht strengere Anweisungen.

Siehe auch Retrieval-Augmented Generation · Konfidenzwert · Goldstandard

I

Inferenz

Betrieb & Inferenz #

Ein trainiertes Modell laufen lassen, um eine Antwort zu bekommen — im Gegensatz zum Trainieren. Training ist eine einmalige Investition; Inferenz ist die Rechnung, die täglich kommt, und die einzige, die die meisten Unternehmen je bezahlen.

Siehe auch Tokens pro Sekunde · Preis pro Million Tokens

Input- vs. Output-Tokens

Kosten, Hardware & Recht #

Output-Tokens kosten meist ein Vielfaches der Input-Tokens. Ein einmal gesendetes langes Dokument ist oft günstiger als ein geschwätziger Austausch darüber — und ein Reasoning-Modell berechnet sein Nachdenken zum Output-Tarif.

Siehe auch Preis pro Million Tokens · Reasoning-Modell · Prompt-Caching

Instruction-Tuning

Training & Anpassung #

Der Trainingsschritt, der aus einem Textfortsetzer etwas macht, das die gestellte Frage beantwortet. Er ist der Grund, warum ein Modell auf „fasse das zusammen“ überhaupt reagiert — und warum sich dieselben Gewichte davor und danach völlig anders verhalten.

Siehe auch Basismodell · Reinforcement Learning mit menschlichem Feedback

J

Jailbreak

Evaluation & Fehlerbilder #

Ein Prompt, der ein Modell aus seinen eigenen Regeln herausredet. Ein bewegliches Ziel, kein gelöstes Problem — deshalb gehört Durchsetzung, auf die es ankommt, in den Code um das Modell herum und nicht in dessen Anweisungen.

Siehe auch Leitplanke · Alignment · Red Teaming

K

Kaltstart

Betrieb & Inferenz #

Die erste Anfrage nach dem Verdrängen eines Modells aus dem Speicher bezahlt das Laden von zig Gigabyte von der Platte. Ein dauerhaft geladenes Modell kostet ständig VRAM; ein entladenes kostet jedes Mal eine langsame erste Antwort.

Siehe auch VRAM · Zeit bis zum ersten Token

Konfidenzwert

Evaluation & Fehlerbilder #

Eine Zahl, die das Modell über die eigene Sicherheit angibt. Sie ist erzeugter Text wie alles andere, keine kalibrierte Wahrscheinlichkeit — auch eine falsche Antwort kann einen hohen Wert tragen.

Siehe auch Halluzination · Eval

Kontextfenster

Modelle & Architektur #

Wie viel Text ein Modell gleichzeitig im Blick behalten kann — Prompt und Antwort zusammen. Ein großes Fenster ist eine Obergrenze, kein Versprechen: Das Modell sieht genau das, was Ihr Code sendet, nicht das, was in Ihren Dateien steht.

Aus dem eigenen BetriebEiner unserer Extraktionsjobs lieferte wochenlang bei jedem Dokument ein leeres Feld. Das Modell hatte ein Fenster von einer Million Tokens; der Prompt schickte die ersten 12.000 Zeichen — der entscheidende Satz stand an Zeichen 224.283. Wenn ein Feld dauerhaft leer bleibt, prüfen Sie zuerst, ob der Text das Modell überhaupt erreicht hat, bevor Sie den Prompt umschreiben.

Siehe auch Attention (Aufmerksamkeit) · Chunking · Context Engineering

Kosinus-Ähnlichkeit

Agenten & Werkzeuge #

Das übliche Maß für die Nähe zweier Embeddings, von 1 (gleiche Richtung) bis 0. Die Zahl ist nur relativ zu einem kalibrierten Korpus aussagekräftig — einen allgemeingültigen Schwellwert für „dasselbe“ gibt es nicht.

Siehe auch Embedding · Semantische Suche

KV-Cache

Betrieb & Inferenz #

Der Zwischenzustand, den ein Modell für bereits gelesene Tokens behält, damit es sie nicht für jedes neue Token neu berechnen muss. Deshalb ist das erste Token langsam und der Rest schnell — und deshalb fressen lange Kontexte VRAM, selbst wenn das Modell klein ist.

Siehe auch Zeit bis zum ersten Token · VRAM · Prompt-Caching

L

Leitplanke

Agenten & Werkzeuge #

Eine Prüfung außerhalb des Modells, die begrenzt, was es auslösen kann: ein Schema, das erfüllt sein muss, ein Ausgabenlimit, eine Positivliste erlaubter Werkzeuge. Anweisungen im Prompt sind eine Bitte; eine Leitplanke ist Durchsetzung.

Siehe auch Prompt Injection · Werkzeugnutzung · Mensch in der Schleife

LLM als Prüfer

Evaluation & Fehlerbilder #

Ein Modell die Ausgabe eines anderen bewerten lassen. Das skaliert weit über menschliche Prüfung hinaus und trägt die Verzerrungen und die Instabilität des Prüfers mit sich — vor jeder Torfunktion gehört es an gelabelten Fällen kalibriert.

Aus dem eigenen BetriebLieß man unseren Qualitätsrichter erneut über seine eigenen dreizehn früheren Ablehnungen laufen, reproduzierte er sechs davon: rund 46 Prozent Selbstkonsistenz. Ein einzelnes Urteil — und jedes „Modell A schlägt Modell B um drei Punkte“ auf diesem Korpus — liegt im Rauschen.

Siehe auch Selbstkonsistenz · Eval · Vision-Language-Modell

Low-Rank-AdaptionLoRA

Training & Anpassung #

Fine-Tuning, das eine kleine Zusatzschicht statt des ganzen Modells trainiert. Es passt auf eine einzelne Consumer-Karte, erzeugt eine Datei im Megabyte- statt Gigabyte-Bereich und lässt sich zur Laufzeit ein- und aushängen.

Siehe auch Fine-Tuning

M

Mensch in der Schleife

Agenten & Werkzeuge #

Eine verpflichtende menschliche Entscheidung an einer benannten Stelle einer sonst automatischen Kette. Gut platziert kostet sie eine Freigabe und beseitigt die ganze Klasse nicht behebbarer Fehler; überall platziert beseitigt sie die Automatisierung.

Aus dem eigenen BetriebUnsere Video-Pipeline schreibt, rendert, bewertet und betextet selbstständig — und hält dann an: Nichts erreicht den öffentlichen Kanal, bevor ein Mensch freigibt. Dieses Tor wurde bewusst nie wegautomatisiert.

Siehe auch Agent · Leitplanke · Fail-Open / Fail-Closed

Mixture of ExpertsMoE

Modelle & Architektur #

Eine Architektur, die jedes Token nur durch einen kleinen Teil des Modells leitet statt durch das ganze. Ein Modell mit 321 Milliarden Parametern und 18 Milliarden aktiven läuft ungefähr so schnell wie ein 18B-Modell — mit dem Wissen eines weit größeren.

Siehe auch Aktive Parameter · Parameter

Model Context ProtocolMCP

Agenten & Werkzeuge #

Ein offenes Protokoll, das Werkzeuge und Daten über eine einheitliche Schnittstelle für Modelle bereitstellt: Eine einmal geschriebene Fähigkeit steht jedem Client zur Verfügung, der das Protokoll spricht, statt pro Framework neu gebaut zu werden.

Aus dem eigenen BetriebUnser eigener MCP-Server stellt Websuche, Seitenabruf und einen Modellaufruf bereit. Recherche- und Lead-Pipelines teilen ihn sich; eine dort ergänzte Fähigkeit steht sofort überall zur Verfügung.

Siehe auch Werkzeugnutzung · Agent

Modellkollaps

Training & Anpassung #

Der Qualitätsverfall, wenn Modelle überwiegend auf den Ausgaben früherer Modelle trainiert werden. Zuerst verschwinden die seltenen Fälle, die Verteilung verengt sich — das Ergebnis ist flüssig, durchschnittlich und an den Rändern zunehmend falsch.

Siehe auch Synthetische Daten

Multi-Agenten-System

Agenten & Werkzeuge #

Mehrere Modelle an einer Aufgabe, jedes mit einer Rolle, deren Ausgaben ein weiterer Schritt zusammenführt. Das bringt Vielfalt der Ansätze und kostet Latenz, Geld und eine deutlich schwerere Frage: Welches lag falsch?

Siehe auch Orchestrierung · Agent

N

Nicht-kommerzielle Lizenz

Kosten, Hardware & Recht #

Offene Gewichte, mit denen Sie kein Geld verdienen dürfen — CC-BY-NC- und „nur für Forschung“-Bedingungen. Der Download sieht aus wie jeder andere; deshalb fällt diese Einschränkung meist spät auf, an etwas, das bereits läuft.

Aus dem eigenen BetriebEin Baustein unserer eigenen Video-Pipeline steht unter CC-BY-NC. Er wird als bekannte Einschränkung mit benanntem Ersatzpfad geführt — ein Lizenzproblem in einer veröffentlichten Pipeline ist eine Produktentscheidung, keine juristische Fußnote.

Siehe auch Permissive Lizenz · Territoriale Lizenzbeschränkung · Offene Gewichte

Nichtdeterminismus

Evaluation & Fehlerbilder #

Derselbe Prompt kann verschiedene Antworten liefern, selbst bei Temperatur null — durch Batching und Gleitkomma-Reihenfolge auf der Serverseite. Tests über Modellausgaben brauchen deshalb Toleranzen statt Gleichheitsprüfungen.

Siehe auch Temperatur · Selbstkonsistenz

O

Offene Gewichte

Modelle & Architektur #

Die trainierten Gewichte stehen zum Download bereit, das Modell läuft also auf eigener Hardware. Das ist nicht dasselbe wie Open Source: Trainingsdaten und Trainingscode bleiben meist verschlossen, und die Lizenz kann trotzdem einschränken, was Sie mit der Ausgabe tun dürfen.

Siehe auch Permissive Lizenz · Nicht-kommerzielle Lizenz · Selbst hosten

Orchestrierung

Agenten & Werkzeuge #

Die Steuerungsschicht, die entscheidet, welcher Schritt wo und wann läuft, Fehlgeschlagenes wiederholt und den Zustand zwischen den Schritten hält. In jedem unbeaufsichtigt laufenden System bestimmt sie die Zuverlässigkeit — nicht das Modell.

Siehe auch Agent · Fail-Open / Fail-Closed

P

Parameter

Modelle & Architektur #

Eine gelernte Zahl im Modell; angegeben in Milliarden (7B, 70B, 400B). Die Zahl zeigt den Speicherbedarf und grob die Leistungsfähigkeit an — sie ist eine Größe, keine Note.

Siehe auch Aktive Parameter · Quantisierung

Permissive Lizenz

Kosten, Hardware & Recht #

Apache-2.0- oder MIT-Bedingungen für Modellgewichte: kommerzielle Nutzung, Änderung und Weitergabe erlaubt, mit Namensnennung. Der saubere Fall — und pro Modell zu prüfen, nicht pro Anbieter: Innerhalb einer Familie wird gern gemischt.

Siehe auch Offene Gewichte · Nicht-kommerzielle Lizenz

Präzision und Trefferquote

Evaluation & Fehlerbilder #

Präzision ist, wie viel des Gelieferten richtig war; Trefferquote, wie viel des Richtigen geliefert wurde. Man tauscht das eine gegen das andere — in welche Richtung, ist eine geschäftliche Entscheidung, keine technische.

Aus dem eigenen BetriebUnser öffentlicher Wissensgraph ist auf Präzision statt Vollständigkeit ausgelegt: geprüft mit 100, 98,3 und 96,6 Prozent Präzision bei seinen drei Beziehungstypen. Lieber eine Verbindung weglassen als eine falsche zeichnen.

Siehe auch Eval · Goldstandard

Preis pro Million Tokens

Kosten, Hardware & Recht #

Die übliche Preiseinheit gehosteter Inferenz, getrennt nach Ein- und Ausgabe. Ein Vergleich zweier Anbieter darüber gilt nur bei gleicher Kontext- und Ausgabelänge — und sagt nichts über die Latenz.

Siehe auch Input- vs. Output-Tokens · Break-even · Selbst hosten

Prompt

Betrieb & Inferenz #

Alles, was für einen Aufruf an das Modell geht: Anweisungen, Beispiele, gefundene Dokumente und die Nutzerfrage. Das ist der gesamte Zustand, den das Modell hat — zwischen zwei Aufrufen gibt es kein Gedächtnis, das nicht wieder in den Prompt geschrieben wurde.

Siehe auch System-Prompt · Context Engineering · Gedächtnis

Prompt Injection

Agenten & Werkzeuge #

Ein Angriff, bei dem Anweisungen, die in gelesenen Inhalten versteckt sind — Webseite, E-Mail, PDF —, befolgt werden, als kämen sie von Ihnen. Jeder Agent, der zugleich nicht vertrauenswürdigen Text liest und eine missbrauchbare Fähigkeit besitzt, ist konstruktionsbedingt angreifbar.

Siehe auch Leitplanke · Jailbreak · Werkzeugnutzung

Prompt-Caching

Betrieb & Inferenz #

Den berechneten Zustand eines unveränderten Prompt-Anfangs über mehrere Aufrufe hinweg wiederverwenden. Wo ein langer System-Prompt oder ein Dokument wiederholt gesendet wird, senkt das Latenz und Input-Kosten — aber nur, wenn der Anfang jedes Mal byteidentisch ist.

Siehe auch KV-Cache · Input- vs. Output-Tokens

Q

Quantisierung

Betrieb & Inferenz #

Die Gewichte eines Modells mit geringerer Genauigkeit speichern — 4 oder 3 Bit statt 16 —, damit ein größeres Modell in weniger Speicher passt. Die Qualität sinkt zunächst langsam und dann steil; den brauchbaren Bereich findet man durch Testen, nicht durch Lesen der Bezeichnung.

Aus dem eigenen BetriebDer Sprachassistent in diesem Haus ist ein Modell mit 12 Milliarden Parametern, quantisiert auf etwa drei Bit pro Gewicht. Erst das lässt es auf einer einzelnen Mittelklasse-Consumerkarte laufen und im Raum antworten, ohne dass etwas das Haus verlässt.

Siehe auch VRAM · Selbst hosten · Parameter

R

Ratenlimit

Kosten, Hardware & Recht #

Die Obergrenze eines Anbieters für Anfragen oder Tokens pro Minute. Sie ist eine Größe der Kapazitätsplanung, kein Fehlerfall: Jede unbeaufsichtigt laufende Kette muss mit einem 429 rechnen und warten, statt die Arbeit zu verlieren.

Aus dem eigenen BetriebEin von uns gemessener gehosteter Endpunkt erlaubt 2.000 Anfragen pro Minute und antwortet darüber mit 429, bei 30 Sekunden Sperre. Solche Zahlen misst man besser, als sie zu lesen: Veröffentlichter und durchgesetzter Wert weichen voneinander ab.

Siehe auch Batching · Gehostete API

ReAct-Schleife

Agenten & Werkzeuge #

Der Grundzyklus eines Agenten: denken, Werkzeug aufrufen, Ergebnis lesen, erneut entscheiden. Jede produktive Fassung braucht eine harte Iterationsgrenze und einen Rückfallpfad — eine Schleife, die nicht enden kann, ist das voreingestellte Fehlerbild.

Siehe auch Agent · Werkzeugnutzung

Reasoning-Modell

Modelle & Architektur #

Ein Modell, das vor der Antwort einen Rechenweg schreibt und Tokens investiert, um ein besseres Ergebnis zu erzielen. Das Nachdenken teilt sich das Ausgabebudget mit der Antwort — ein unbegrenzter Denkdurchgang kann das ganze Budget aufbrauchen und nichts zurückgeben.

Aus dem eigenen BetriebBei uns gemessen: Ohne gesetzte Grenze schrieb ein Modell noch bei 63.000 Zeichen an seinem Rechenweg und lieferte bei vier von fünf Aufrufen eine leere Antwort. Eine begrenzte Denkstufe löste das Problem — ein höheres Token-Limit hätte es nicht getan.

Siehe auch Gedankenkette · Token-Limit

Red Teaming

Evaluation & Fehlerbilder #

Das eigene System absichtlich angreifen, um zu finden, was es aus der Bahn wirft — bevor es jemand anderes öffentlich tut. Bei allem mit Kundenkontakt gehört das in den Release-Prozess, nicht in ein einmaliges Audit.

Siehe auch Jailbreak · Prompt Injection

Reinforcement Learning mit menschlichem FeedbackRLHF

Training & Anpassung #

Ein Modell gegen menschliche Präferenzurteile trainieren statt gegen eine richtige Antwort. Das macht Assistenten hilfreich und höflich — und zugleich gefällig: So trainierte Modelle neigen dazu, das zu sagen, was Sie hören möchten.

Siehe auch Alignment

Retrieval-Augmented GenerationRAG

Agenten & Werkzeuge #

Zuerst passende Dokumente suchen und in den Prompt legen, damit das Modell aus Ihrem Material antwortet statt aus dem Gedächtnis. Das ist die Standardantwort auf „das Modell kennt unsere Daten nicht“ — günstiger und aktueller als Fine-Tuning.

Siehe auch Chunking · Vektordatenbank · Semantische Suche · Fine-Tuning

S

Selbst hosten

Kosten, Hardware & Recht #

Modelle mit offenen Gewichten auf eigener Hardware betreiben. Das verwandelt eine Rechnung pro Token in Fixkosten plus Strom — und ist die einzige Konstellation, bei der kein Prompt und kein Dokument jemals das eigene Netz verlässt.

Aus dem eigenen BetriebBei uns gemessen: rund 1,47 kWh pro Million Output-Tokens, ermittelt aus der Aufnahme der gesamten Maschine an der Steckdose statt aus der Anzeige der Karte. Der Strom ist der Posten, den die meisten Selbsthosting-Rechnungen weglassen.

Siehe auch Break-even · Offene Gewichte · GPU · Datenresidenz

Selbstkonsistenz

Evaluation & Fehlerbilder #

Wie oft ein Modell bei derselben Eingabe zweimal dasselbe Urteil fällt. Wer das zuerst misst, weiß, wie groß der Unterschied zwischen zwei Modellen sein muss, um überhaupt etwas zu bedeuten.

Siehe auch LLM als Prüfer · Nichtdeterminismus

Streaming

Betrieb & Inferenz #

Tokens an den Client senden, sobald sie entstehen, statt auf die fertige Antwort zu warten. Das beschleunigt die Generierung nicht — es macht das Warten sichtbar, und meist ist genau das der Unterschied, der zählt.

Siehe auch Zeit bis zum ersten Token · Autoregressive Generierung

Strukturierte Ausgabe

Betrieb & Inferenz #

Das Modell zwingen, in einer festen Form zu antworten — JSON nach Schema —, damit ein Programm sie verarbeiten kann. Alles, was Modellausgaben produktiv parst, braucht das und zusätzlich einen Wiederholversuch: Freitext driftet auf Weisen, an denen Parser scheitern.

Aus dem eigenen BetriebBei zwei von sechs ansonsten identischen Aufrufen verlor ein Modell die öffnende Klammer seines JSON — die Trennung zwischen Denk- und Antwortfeld fiel mitten in ein Token. Eine Wiederholschleife fängt das ab; ein Parser ohne sie hätte den Datensatz verloren.

Siehe auch Werkzeugnutzung · Gedankenkette

Synthetische Daten

Training & Anpassung #

Trainingsdaten, die ein Modell erzeugt hat, statt sie in der Welt zu erheben. Das löst Knappheits- und Datenschutzprobleme — und erbt jede Verzerrung und jeden blinden Fleck des erzeugenden Modells.

Siehe auch Distillation · Goldstandard

System-Prompt

Betrieb & Inferenz #

Die stehende Anweisung über dem Gespräch: Rolle, Regeln, Ausgabeformat, was abzulehnen ist. Der günstigste Hebel im ganzen Stack — und meist das Erste, was man korrigiert, wenn die Ausgabe nicht stimmt.

Aus dem eigenen BetriebWenn ein größeres Modell ein kleineres bei einer Aufgabe mit harter Vorgabe schlägt, prüfen Sie zuerst, ob der Prompt diese Vorgabe überhaupt genannt hat. In einem unserer Jobs bestand ein 753B-Modell die Prüfung achtmal von acht, ein 321B-Modell viermal; nachdem die fehlende Regel im Prompt stand, kam auch das kleinere auf acht.

Siehe auch Prompt · Strukturierte Ausgabe

T

Temperatur

Betrieb & Inferenz #

Der Regler dafür, wie viel Zufall in die Wahl des nächsten Tokens einfließt. Nahe null wiederholt das Modell seine wahrscheinlichste Fortsetzung; höhere Werte erkaufen Vielfalt mit Genauigkeit. Extraktion braucht niedrig, Werbetexte nicht.

Siehe auch Top-p-Sampling · Nichtdeterminismus

Territoriale Lizenzbeschränkung

Kosten, Hardware & Recht #

Eine Modelllizenz, die in Ihrer Rechtsordnung schlicht nicht gilt. Mehrere starke Veröffentlichungen mit offenen Gewichten schließen die EU, das Vereinigte Königreich oder Südkorea ausdrücklich aus — für einen europäischen Betreiber unbrauchbar, unabhängig von der Qualität.

Aus dem eigenen BetriebZweimal mussten wir ein in Benchmarks führendes Modell allein aus diesem Grund verwerfen. Wer die Gebietsklausel vor der Benchmark-Tabelle liest, spart sich die Evaluation vollständig.

Siehe auch Nicht-kommerzielle Lizenz · Offene Gewichte

Token

Modelle & Architektur #

Die Einheit, die ein Modell liest und schreibt — etwa drei Viertel eines englischen Wortes, bei deutschen Komposita, Code oder JSON entsprechend weniger Zeichen. Kontextgrenzen, Preise und Geschwindigkeiten zählen immer Tokens, nie Zeichen.

Aus dem eigenen BetriebDeutscher Text kostet spürbar mehr Tokens als derselbe Text auf Englisch, weil die Tokenizer überwiegend auf Englisch angepasst wurden. Eine zweisprachige Seite zahlt diesen Unterschied bei jeder Seite, die sie an ein Modell schickt.

Siehe auch Tokenizer · Tokens pro Sekunde · Preis pro Million Tokens

Token-Limit

Betrieb & Inferenz #

Die Obergrenze dafür, wie viel ein Modell in einem Aufruf schreiben darf. Bei einem Reasoning-Modell umfasst sie das Nachdenken mitsamt der Antwort — ein großzügig wirkendes Budget kann also aufgebraucht sein, bevor die Antwort beginnt.

Aus dem eigenen BetriebEine strengere Bewertungsfrage trieb unseren Qualitätsrichter direkt durch seine 4.096-Token-Grenze: Er lieferte eine leere Antwort, die sich bei zwölf Prozent der Clips als Parse-Fehler zeigte. Erkennbar ist das am Abbruchgrund, nicht an der Fehlermeldung.

Siehe auch Reasoning-Modell · Strukturierte Ausgabe

Tokenizer

Modelle & Architektur #

Die Komponente, die Text in Tokens zerlegt und wieder zusammensetzt. Jede Modellfamilie hat ihre eigene: Derselbe Absatz ergibt je nach Anbieter eine andere Tokenzahl — und einen anderen Preis.

Siehe auch Token

Tokens pro Sekundetok/s

Betrieb & Inferenz #

Das Tempo, mit dem ein Modell Ausgabe erzeugt. Unter etwa 10 Tok/s fühlt sich Lesen wie Warten an; ab rund 30 überholt es bequemes Lesetempo, und mehr Geschwindigkeit zählt nur noch für Maschinen.

Aus dem eigenen BetriebAuf unserer eigenen Maschine am 19.08.2026 gemessen: 38,7 Tokens pro Sekunde dauerhaft aus einem 12B-Modell auf einer RTX 3060 Ti, mit unter einem Prozent Streuung zwischen den Läufen. Ein gehostetes Spitzenmodell schwankte am selben Tag um den Faktor elf.

Siehe auch Zeit bis zum ersten Token · Batching · Inferenz

Top-p-Sampling

Betrieb & Inferenz #

Eine zweite Zufallssteuerung: Nur die wahrscheinlichsten Tokens betrachten, die zusammen den Anteil p der Wahrscheinlichkeitsmasse ausmachen. Wer ihn und die Temperatur gleichzeitig ändert, kann keine Wirkung mehr zuordnen.

Siehe auch Temperatur

Transformer

Modelle & Architektur #

Die Netzarchitektur hinter nahezu jedem aktuellen Sprachmodell. Ihr Kernstück ist die Attention: Jedes Token der Eingabe kann beeinflussen, wie jedes andere gelesen wird.

Siehe auch Attention (Aufmerksamkeit)

V

Vektordatenbank

Agenten & Werkzeuge #

Ein Speicher, der Embeddings indexiert und die nächstgelegenen zu einem Anfragevektor liefert. Für einige tausend Dokumente genügt eine gewöhnliche Datenbank mit Vektorspalte; das Spezialprodukt lohnt sich erst in einer anderen Größenordnung.

Siehe auch Embedding · Semantische Suche · Retrieval-Augmented Generation

Vision-Language-ModellVLM

Modelle & Architektur #

Ein Modell, das neben Text auch Bilder annimmt. Vision ist eine diskrete Fähigkeit: Ein reines Textmodell verarbeitet ein Bild nicht etwas schlechter — es weist die Anfrage ab.

Aus dem eigenen BetriebDas Qualitätstor unserer Video-Pipeline ist ein Vision-Modell, das Frames bewertet, bevor etwas veröffentlicht wird. Bei der Prüfung eines größeren Modells als Ersatz gab nicht dessen Punktzahl den Ausschlag: Es hat überhaupt kein Vision — damit scheidet es für diese Aufgabe aus, was immer es sonst kann.

Siehe auch LLM als Prüfer · Diffusionsmodell

Vortraining

Training & Anpassung #

Die erste und mit Abstand teuerste Trainingsphase, in der ein Modell Sprache aus rohem Text lernt. Sie findet einmal statt, kostet Millionen und wird von Unternehmen außerhalb des Modellgeschäfts nie wiederholt.

Siehe auch Fine-Tuning · Basismodell

VRAMVRAM

Betrieb & Inferenz #

Der Speicher auf der Grafikkarte. Er ist die harte Grenze beim Selbsthosten: Gewichte plus KV-Cache müssen hineinpassen, sonst weicht das Modell in den Systemspeicher aus und wird um eine Größenordnung langsamer.

Siehe auch Quantisierung · KV-Cache · GPU

W

Werkzeugnutzung

Agenten & Werkzeuge #

Einem Modell einen Satz aufrufbarer Funktionen geben — suchen, abrufen, Datenbank abfragen, Auftrag erteilen. Das Modell führt sie nicht aus: Es formuliert einen Wunsch, Ihr Code entscheidet, ob er erfüllt wird — und an dieser Grenze entsteht Sicherheit.

Siehe auch Agent · Model Context Protocol · Leitplanke

Wissensstichtag

Modelle & Architektur #

Das Datum, nach dem das Modell keine Trainingsdaten mehr gesehen hat. Alles Spätere muss über den Prompt hereinkommen — per Retrieval, Werkzeugaufruf oder Web-Abruf —, sonst antwortet das Modell mit voller Überzeugung aus einer veralteten Welt.

Siehe auch Retrieval-Augmented Generation · Werkzeugnutzung · Halluzination

Z

Zeit bis zum ersten TokenTTFT

Betrieb & Inferenz #

Wie lange das Modell braucht, bis es zu antworten beginnt — im Unterschied dazu, wie schnell es danach schreibt. Nutzer beurteilen Reaktionsfreude fast ausschließlich an dieser Zahl, und sie wächst mit der Länge des Prompts, nicht der Antwort.

Siehe auch Tokens pro Sekunde · KV-Cache · Streaming


Wo die Begriffe auf die Rechnung treffen

Vier der obigen Begriffe entscheiden zusammen fast jedes KI-Budget: wie viele Tokens die Arbeit kostet, wie schnell sie eintreffen, ob das Modell auf Ihrer Hardware läuft oder auf fremder — und ob die Lizenz erlaubt, das Ergebnis zu verkaufen. Für diese vier gibt es eigene Seiten, jede auf gemessenen statt zitierten Zahlen.

→ Was es kostet → Wie es sich anfühlt → So läuft es

Fehlt ein Begriff, der Ihnen in einem Angebot begegnet ist? Schicken Sie ihn an info@new-horizon.tech — er wird ergänzt, samt dem, was er für das Angebot tatsächlich bedeutet.


Die KI-News, die zählen — bis 07:30 Uhr MEZ im Postfach. Kostenlos, kein Spam.