A
Agent
Agenten & Werkzeuge
#
Ein Modell mit Werkzeugen und einem Ziel, das seinen nächsten Schritt selbst wählt und in Schleife arbeitet, bis es fertig ist. Der Unterschied zum Chatbot ist nicht Intelligenz, sondern Befugnis: Ein Agent führt Handlungen mit Folgen außerhalb des Chats aus.
Siehe auch
Werkzeugnutzung · ReAct-Schleife · Mensch in der Schleife
Aktive Parameter
Modelle & Architektur
#
Der Anteil eines MoE-Modells, der für ein einzelnes Token tatsächlich genutzt wird. Die aktiven Parameter bestimmen Tempo und Speicherkosten, die Gesamtzahl bestimmt das Wissen. Wer nur eine der beiden Zahlen nennt, verschweigt die Hälfte.
Siehe auch
Mixture of Experts
Alignment
Training & Anpassung
#
Die Arbeit daran, dass ein Modell sich wie beabsichtigt verhält — hilfreich, ehrlich und nicht bereit zu dem, was der Betreiber ausgeschlossen hat. Es ist eine Eigenschaft aus dem Training, die ein hartnäckiger Prompt zur Laufzeit trotzdem umgehen kann.
Siehe auch
Reinforcement Learning mit menschlichem Feedback · Jailbreak · Leitplanke
Attention (Aufmerksamkeit)
Modelle & Architektur
#
Der Mechanismus, der für jedes Token entscheidet, welche anderen Tokens dafür zählen. Der Aufwand wächst etwa quadratisch mit der Kontextlänge — lange Eingaben werden also schneller teuer, als sie lang werden.
Siehe auch
Kontextfenster · KV-Cache
Autoregressive Generierung
Modelle & Architektur
#
Ein Token nach dem anderen erzeugen, jedes bedingt durch alles bisher Geschriebene. Das erklärt zweierlei zugleich: warum die Ausgabegeschwindigkeit pro Token angegeben wird und warum ein Modell einen bereits ausgegebenen Satz nicht mehr überarbeiten kann.
Siehe auch
Token · Streaming · Zeit bis zum ersten Token
B
Basismodell
Training & Anpassung
#
Das rohe vortrainierte Modell, bevor es gelernt hat, Anweisungen zu befolgen. Es setzt Text fort, statt Fragen zu beantworten; in einer Anwendung will man die „Instruct“- oder „Chat“-Variante derselben Gewichte.
Siehe auch
Instruction-Tuning
Batching
Betrieb & Inferenz
#
Mehrere Anfragen gemeinsam durch die GPU schicken. Das vervielfacht den Gesamtdurchsatz, ohne eine einzelne Antwort zu beschleunigen — deshalb kann eine gehostete API pro Token günstig sein und sich trotzdem langsam anfühlen.
Siehe auch
Tokens pro Sekunde · Ratenlimit
Benchmark
Evaluation & Fehlerbilder
#
Ein öffentlicher Testsatz zur Rangfolge von Modellen. Er beantwortet „welches Modell ist allgemein besser“ — selten die Frage, die Sie haben; ein Modell kann eine Rangliste anführen und bei Ihrer Aufgabe verlieren.
Aus dem eigenen BetriebBei unserer eigenen Extraktionsarbeit stimmten ein Modell mit 753 und eines mit 321 Milliarden Parametern in allen zwölf relevanten Feldern überein — das kleinere war fünf- bis siebenmal schneller. Messen Sie an Ihrer eigenen Aufgabe, bevor Sie für das größere zahlen.
Siehe auch
Eval · Benchmark-Kontamination · Goldstandard
Benchmark-Kontamination
Evaluation & Fehlerbilder
#
Ein öffentlicher Testsatz ist in die Trainingsdaten geraten — die Punktzahl misst dann Erinnerung an die Lösungen statt Können. Einer der Gründe, warum ein Ranglistenergebnis den Kontakt mit den eigenen Daten selten übersteht.
Siehe auch
Benchmark · Eval
Break-even
Kosten, Hardware & Recht
#
Das Volumen, ab dem eigene Hardware günstiger ist als gemietete Tokens. Er existiert nur gegen einen konkreten gehosteten Preis: Gegen die günstigsten Endpunkte mit offenen Gewichten kann allein der Strom mehr kosten als die Tokens.
Aus dem eigenen BetriebNach unseren eigenen Zahlen überholt eine Mittelklasse-Karte eine gehostete Mittelklasse-API bei etwa 200.000 Output-Tokens pro Tag, ein Spitzenmodell fast sofort — und die günstigsten Endpunkte mit offenen Gewichten preislich nie.
Siehe auch
Selbst hosten · Preis pro Million Tokens · GPU
C
Chunking
Agenten & Werkzeuge
#
Dokumente in Passagen zerlegen, die klein genug für präzises Auffinden und groß genug sind, um für sich verständlich zu bleiben. Der unscheinbarste Teil eines Retrieval-Systems — und der, der am häufigsten über Erfolg oder Misserfolg entscheidet.
Siehe auch
Retrieval-Augmented Generation · Embedding
Context Engineering
Agenten & Werkzeuge
#
Entscheiden, was in den begrenzten Kontext gehört und was nicht — die Disziplin, die die Prompt-Formulierung als wichtigsten Hebel abgelöst hat, seit die Modelle gut sind. Die meisten Qualitätsprobleme in Agentensystemen sind Kontextprobleme.
Siehe auch
Kontextfenster · Prompt · Gedächtnis
D
Datenresidenz
Kosten, Hardware & Recht
#
Wo Ihre Prompts verarbeitet und gespeichert werden und nach welchem Recht. Bei regulierten oder vertraulichen Inhalten entscheidet das über die Architektur, bevor irgendein Qualitätsvergleich beginnt — ein Modell, das die Daten nicht sehen darf, hat keine Punktzahl.
Siehe auch
Selbst hosten · Gehostete API
Diffusionsmodell
Modelle & Architektur
#
Die Architektur hinter den meisten Bild- und Videogeneratoren. Sie startet mit Rauschen und entfernt es Schritt für Schritt in Richtung des Prompts — deshalb skaliert die Rechenzeit mit der Zahl der Schritte, nicht mit der Länge der Ausgabe.
Siehe auch
GPU · VRAM
Distillation
Training & Anpassung
#
Ein kleines Modell auf den Ausgaben eines großen trainieren. Das Ergebnis ist im Betrieb weit günstiger und behält viel vom Verhalten für die Aufgaben, für die destilliert wurde — und nur für diese.
Siehe auch
Synthetische Daten · Quantisierung
Drift
Evaluation & Fehlerbilder
#
Sich verändernde Ausgabequalität, ohne dass sich Ihr Code ändert — ein gehostetes Modell wird aktualisiert, die Eingabeverteilung verschiebt sich, eine Quellseite ändert ihre Struktur. Nur eine wiederholte Eval bemerkt das; einen Fehler wirft nichts.
Siehe auch
Eval · Fail-Open / Fail-Closed
E
Embedding
Modelle & Architektur
#
Eine Zahlenliste, die ein Textstück nach Bedeutung verortet — Ähnliches liegt nah beieinander. Sie macht semantische Suche, Clustering und Dublettenerkennung ohne gemeinsame Stichwörter möglich.
Aus dem eigenen BetriebUnser Newsletter erkennt Dubletten über Embeddings statt über Überschriften. Eine nahezu wortgleiche Neufassung einer älteren Meldung erreichte 0,982 Kosinus-Ähnlichkeit — für einen Titelabgleich unsichtbar, für die Vektoren offensichtlich.
Siehe auch
Semantische Suche · Vektordatenbank · Kosinus-Ähnlichkeit
Eval
Evaluation & Fehlerbilder
#
Ein Testsatz aus der eigenen Arbeit, mit einer eigenen Definition der guten Antwort. Das einzige Instrument, das zeigt, ob eine Prompt-Änderung, ein Modellwechsel oder eine Preissenkung tatsächlich geholfen hat.
Siehe auch
Benchmark · Goldstandard · LLM als Prüfer
F
Fail-Open / Fail-Closed
Evaluation & Fehlerbilder
#
Was eine Komponente tut, wenn ihre Eingabe fehlt oder veraltet ist: trotzdem weiterlaufen (open) oder anhalten (closed). Beides ist irgendwo richtig; wer es dem Zufall überlässt, erhält aus einer defekten Prüfung entweder stille Fehlausgaben oder einen stillen Ausfall.
Aus dem eigenen BetriebDie Richtliniendatei, die unsere Publishing-Pipeline anhalten kann, ist bewusst fail-open: fehlend, unlesbar oder älter als sieben Tage bedeutet jeweils „weiter wie bisher“. Nur ein frischer, ausdrücklicher Halt stoppt sie — ein Ausfall der Überwachung darf das Geschäft nicht stillschweigend anhalten.
Siehe auch
Orchestrierung · Leitplanke
Fine-Tuning
Training & Anpassung
#
Weitertrainieren mit eigenen Beispielen, um das Verhalten eines Modells zu verändern — Format, Ton, Fachgewohnheiten. Für Verhalten funktioniert es gut, für Faktenwissen schlecht: Dafür ist Retrieval billiger und aktueller.
Siehe auch
Low-Rank-Adaption · Retrieval-Augmented Generation · Instruction-Tuning
Foundation-Modell
Modelle & Architektur
#
Ein großes Allzweckmodell, das einmal sehr teuer trainiert und anschließend für konkrete Aufgaben angepasst wird. „Frontier“ ist der Marketingbegriff für die jeweils größte und leistungsfähigste Klasse.
Siehe auch
Fine-Tuning · Basismodell
G
Gedächtnis
Agenten & Werkzeuge
#
Alles, was zwischen Aufrufen überdauert — denn das Modell selbst behält nichts. In der Praxis ist es ein Speicher, den Ihr Code beschreibt und wieder in den Prompt liest. „Was erinnert wird“ ist damit eine Entwurfsentscheidung, kein Modellmerkmal.
Siehe auch
Prompt · Context Engineering · Retrieval-Augmented Generation
GedankenketteCoT
Modelle & Architektur
#
Der Rechenweg, den ein Modell vor der Antwort schreibt. Manche APIs liefern ihn in einem eigenen Feld, andere schreiben ihn direkt in die Antwort — Code, der eine saubere Antwort erwartet, scheitert am zweiten Fall, ohne dass ein Fehler auftritt.
Aus dem eigenen BetriebZwei bei uns eingesetzte Modelle behandeln dasselbe „nicht nachdenken“-Flag genau entgegengesetzt: Das eine ignoriert es und legt den Rechenweg in ein eigenes Feld, die Antwort bleibt sauber; das andere ignoriert es und schreibt den Rechenweg in die Antwort. Beide melden nichts. Das Flag verdient einen Test, keine Annahme.
Siehe auch
Reasoning-Modell · Strukturierte Ausgabe
Gehostete API
Kosten, Hardware & Recht
#
Ein anderer betreibt das Modell und rechnet pro Token ab. Keine Investition, sofortiger Zugriff auf die größten Modelle — und drei bleibende Bedingungen: Ihre Daten verlassen das Haus, das Modell kann sich unter Ihnen ändern, und den Preis bestimmt der Anbieter.
Siehe auch
Selbst hosten · Preis pro Million Tokens · Datenresidenz
Goldstandard
Evaluation & Fehlerbilder
#
Fälle mit bekannter richtiger Antwort, von Menschen gelabelt. Ein paar Dutzend davon anzulegen ist die günstigste Qualitätsinvestition in einem KI-Projekt — und die am häufigsten übersprungene.
Aus dem eigenen BetriebDas Tor unserer Video-Pipeline ist an einem handgelabelten Satz von 70 Clips kalibriert. Er verwandelt „der Prüfer wirkt jetzt besser“ in eine Zahl — und macht eine geänderte Schwelle überprüfbar.
Siehe auch
Eval · Präzision und Trefferquote
GPUGPU
Kosten, Hardware & Recht
#
Der Prozessor, der Inferenz praktikabel macht, weil er Tausende Multiplikationen gleichzeitig ausführt. Für den Modellbetrieb zählen weit häufiger Speichergröße und Speicherbandbreite als reine Rechenleistung.
Siehe auch
VRAM · Selbst hosten · Quantisierung
Großes SprachmodellLLM
Modelle & Architektur
#
Ein Modell, das auf sehr großen Textmengen trainiert wurde, um jeweils das nächste Token vorherzusagen. Alles, was es zu tun scheint — antworten, übersetzen, zusammenfassen, Code schreiben —, ist diese eine Operation, immer wieder angewandt.
Siehe auch
Token · Transformer · Parameter
I
Inferenz
Betrieb & Inferenz
#
Ein trainiertes Modell laufen lassen, um eine Antwort zu bekommen — im Gegensatz zum Trainieren. Training ist eine einmalige Investition; Inferenz ist die Rechnung, die täglich kommt, und die einzige, die die meisten Unternehmen je bezahlen.
Siehe auch
Tokens pro Sekunde · Preis pro Million Tokens
Input- vs. Output-Tokens
Kosten, Hardware & Recht
#
Output-Tokens kosten meist ein Vielfaches der Input-Tokens. Ein einmal gesendetes langes Dokument ist oft günstiger als ein geschwätziger Austausch darüber — und ein Reasoning-Modell berechnet sein Nachdenken zum Output-Tarif.
Siehe auch
Preis pro Million Tokens · Reasoning-Modell · Prompt-Caching
Instruction-Tuning
Training & Anpassung
#
Der Trainingsschritt, der aus einem Textfortsetzer etwas macht, das die gestellte Frage beantwortet. Er ist der Grund, warum ein Modell auf „fasse das zusammen“ überhaupt reagiert — und warum sich dieselben Gewichte davor und danach völlig anders verhalten.
Siehe auch
Basismodell · Reinforcement Learning mit menschlichem Feedback
K
Kaltstart
Betrieb & Inferenz
#
Die erste Anfrage nach dem Verdrängen eines Modells aus dem Speicher bezahlt das Laden von zig Gigabyte von der Platte. Ein dauerhaft geladenes Modell kostet ständig VRAM; ein entladenes kostet jedes Mal eine langsame erste Antwort.
Siehe auch
VRAM · Zeit bis zum ersten Token
Konfidenzwert
Evaluation & Fehlerbilder
#
Eine Zahl, die das Modell über die eigene Sicherheit angibt. Sie ist erzeugter Text wie alles andere, keine kalibrierte Wahrscheinlichkeit — auch eine falsche Antwort kann einen hohen Wert tragen.
Siehe auch
Halluzination · Eval
Kontextfenster
Modelle & Architektur
#
Wie viel Text ein Modell gleichzeitig im Blick behalten kann — Prompt und Antwort zusammen. Ein großes Fenster ist eine Obergrenze, kein Versprechen: Das Modell sieht genau das, was Ihr Code sendet, nicht das, was in Ihren Dateien steht.
Aus dem eigenen BetriebEiner unserer Extraktionsjobs lieferte wochenlang bei jedem Dokument ein leeres Feld. Das Modell hatte ein Fenster von einer Million Tokens; der Prompt schickte die ersten 12.000 Zeichen — der entscheidende Satz stand an Zeichen 224.283. Wenn ein Feld dauerhaft leer bleibt, prüfen Sie zuerst, ob der Text das Modell überhaupt erreicht hat, bevor Sie den Prompt umschreiben.
Siehe auch
Attention (Aufmerksamkeit) · Chunking · Context Engineering
Kosinus-Ähnlichkeit
Agenten & Werkzeuge
#
Das übliche Maß für die Nähe zweier Embeddings, von 1 (gleiche Richtung) bis 0. Die Zahl ist nur relativ zu einem kalibrierten Korpus aussagekräftig — einen allgemeingültigen Schwellwert für „dasselbe“ gibt es nicht.
Siehe auch
Embedding · Semantische Suche
KV-Cache
Betrieb & Inferenz
#
Der Zwischenzustand, den ein Modell für bereits gelesene Tokens behält, damit es sie nicht für jedes neue Token neu berechnen muss. Deshalb ist das erste Token langsam und der Rest schnell — und deshalb fressen lange Kontexte VRAM, selbst wenn das Modell klein ist.
Siehe auch
Zeit bis zum ersten Token · VRAM · Prompt-Caching
L
Leitplanke
Agenten & Werkzeuge
#
Eine Prüfung außerhalb des Modells, die begrenzt, was es auslösen kann: ein Schema, das erfüllt sein muss, ein Ausgabenlimit, eine Positivliste erlaubter Werkzeuge. Anweisungen im Prompt sind eine Bitte; eine Leitplanke ist Durchsetzung.
Siehe auch
Prompt Injection · Werkzeugnutzung · Mensch in der Schleife
LLM als Prüfer
Evaluation & Fehlerbilder
#
Ein Modell die Ausgabe eines anderen bewerten lassen. Das skaliert weit über menschliche Prüfung hinaus und trägt die Verzerrungen und die Instabilität des Prüfers mit sich — vor jeder Torfunktion gehört es an gelabelten Fällen kalibriert.
Aus dem eigenen BetriebLieß man unseren Qualitätsrichter erneut über seine eigenen dreizehn früheren Ablehnungen laufen, reproduzierte er sechs davon: rund 46 Prozent Selbstkonsistenz. Ein einzelnes Urteil — und jedes „Modell A schlägt Modell B um drei Punkte“ auf diesem Korpus — liegt im Rauschen.
Siehe auch
Selbstkonsistenz · Eval · Vision-Language-Modell
Low-Rank-AdaptionLoRA
Training & Anpassung
#
Fine-Tuning, das eine kleine Zusatzschicht statt des ganzen Modells trainiert. Es passt auf eine einzelne Consumer-Karte, erzeugt eine Datei im Megabyte- statt Gigabyte-Bereich und lässt sich zur Laufzeit ein- und aushängen.
Siehe auch
Fine-Tuning
M
Mensch in der Schleife
Agenten & Werkzeuge
#
Eine verpflichtende menschliche Entscheidung an einer benannten Stelle einer sonst automatischen Kette. Gut platziert kostet sie eine Freigabe und beseitigt die ganze Klasse nicht behebbarer Fehler; überall platziert beseitigt sie die Automatisierung.
Aus dem eigenen BetriebUnsere Video-Pipeline schreibt, rendert, bewertet und betextet selbstständig — und hält dann an: Nichts erreicht den öffentlichen Kanal, bevor ein Mensch freigibt. Dieses Tor wurde bewusst nie wegautomatisiert.
Siehe auch
Agent · Leitplanke · Fail-Open / Fail-Closed
Mixture of ExpertsMoE
Modelle & Architektur
#
Eine Architektur, die jedes Token nur durch einen kleinen Teil des Modells leitet statt durch das ganze. Ein Modell mit 321 Milliarden Parametern und 18 Milliarden aktiven läuft ungefähr so schnell wie ein 18B-Modell — mit dem Wissen eines weit größeren.
Siehe auch
Aktive Parameter · Parameter
Model Context ProtocolMCP
Agenten & Werkzeuge
#
Ein offenes Protokoll, das Werkzeuge und Daten über eine einheitliche Schnittstelle für Modelle bereitstellt: Eine einmal geschriebene Fähigkeit steht jedem Client zur Verfügung, der das Protokoll spricht, statt pro Framework neu gebaut zu werden.
Aus dem eigenen BetriebUnser eigener MCP-Server stellt Websuche, Seitenabruf und einen Modellaufruf bereit. Recherche- und Lead-Pipelines teilen ihn sich; eine dort ergänzte Fähigkeit steht sofort überall zur Verfügung.
Siehe auch
Werkzeugnutzung · Agent
Modellkollaps
Training & Anpassung
#
Der Qualitätsverfall, wenn Modelle überwiegend auf den Ausgaben früherer Modelle trainiert werden. Zuerst verschwinden die seltenen Fälle, die Verteilung verengt sich — das Ergebnis ist flüssig, durchschnittlich und an den Rändern zunehmend falsch.
Siehe auch
Synthetische Daten
Multi-Agenten-System
Agenten & Werkzeuge
#
Mehrere Modelle an einer Aufgabe, jedes mit einer Rolle, deren Ausgaben ein weiterer Schritt zusammenführt. Das bringt Vielfalt der Ansätze und kostet Latenz, Geld und eine deutlich schwerere Frage: Welches lag falsch?
Siehe auch
Orchestrierung · Agent
N
Nicht-kommerzielle Lizenz
Kosten, Hardware & Recht
#
Offene Gewichte, mit denen Sie kein Geld verdienen dürfen — CC-BY-NC- und „nur für Forschung“-Bedingungen. Der Download sieht aus wie jeder andere; deshalb fällt diese Einschränkung meist spät auf, an etwas, das bereits läuft.
Aus dem eigenen BetriebEin Baustein unserer eigenen Video-Pipeline steht unter CC-BY-NC. Er wird als bekannte Einschränkung mit benanntem Ersatzpfad geführt — ein Lizenzproblem in einer veröffentlichten Pipeline ist eine Produktentscheidung, keine juristische Fußnote.
Siehe auch
Permissive Lizenz · Territoriale Lizenzbeschränkung · Offene Gewichte
Nichtdeterminismus
Evaluation & Fehlerbilder
#
Derselbe Prompt kann verschiedene Antworten liefern, selbst bei Temperatur null — durch Batching und Gleitkomma-Reihenfolge auf der Serverseite. Tests über Modellausgaben brauchen deshalb Toleranzen statt Gleichheitsprüfungen.
Siehe auch
Temperatur · Selbstkonsistenz
O
Offene Gewichte
Modelle & Architektur
#
Die trainierten Gewichte stehen zum Download bereit, das Modell läuft also auf eigener Hardware. Das ist nicht dasselbe wie Open Source: Trainingsdaten und Trainingscode bleiben meist verschlossen, und die Lizenz kann trotzdem einschränken, was Sie mit der Ausgabe tun dürfen.
Siehe auch
Permissive Lizenz · Nicht-kommerzielle Lizenz · Selbst hosten
Orchestrierung
Agenten & Werkzeuge
#
Die Steuerungsschicht, die entscheidet, welcher Schritt wo und wann läuft, Fehlgeschlagenes wiederholt und den Zustand zwischen den Schritten hält. In jedem unbeaufsichtigt laufenden System bestimmt sie die Zuverlässigkeit — nicht das Modell.
Siehe auch
Agent · Fail-Open / Fail-Closed
P
Parameter
Modelle & Architektur
#
Eine gelernte Zahl im Modell; angegeben in Milliarden (7B, 70B, 400B). Die Zahl zeigt den Speicherbedarf und grob die Leistungsfähigkeit an — sie ist eine Größe, keine Note.
Siehe auch
Aktive Parameter · Quantisierung
Permissive Lizenz
Kosten, Hardware & Recht
#
Apache-2.0- oder MIT-Bedingungen für Modellgewichte: kommerzielle Nutzung, Änderung und Weitergabe erlaubt, mit Namensnennung. Der saubere Fall — und pro Modell zu prüfen, nicht pro Anbieter: Innerhalb einer Familie wird gern gemischt.
Siehe auch
Offene Gewichte · Nicht-kommerzielle Lizenz
Präzision und Trefferquote
Evaluation & Fehlerbilder
#
Präzision ist, wie viel des Gelieferten richtig war; Trefferquote, wie viel des Richtigen geliefert wurde. Man tauscht das eine gegen das andere — in welche Richtung, ist eine geschäftliche Entscheidung, keine technische.
Aus dem eigenen BetriebUnser öffentlicher Wissensgraph ist auf Präzision statt Vollständigkeit ausgelegt: geprüft mit 100, 98,3 und 96,6 Prozent Präzision bei seinen drei Beziehungstypen. Lieber eine Verbindung weglassen als eine falsche zeichnen.
Siehe auch
Eval · Goldstandard
Preis pro Million Tokens
Kosten, Hardware & Recht
#
Die übliche Preiseinheit gehosteter Inferenz, getrennt nach Ein- und Ausgabe. Ein Vergleich zweier Anbieter darüber gilt nur bei gleicher Kontext- und Ausgabelänge — und sagt nichts über die Latenz.
Siehe auch
Input- vs. Output-Tokens · Break-even · Selbst hosten
Prompt
Betrieb & Inferenz
#
Alles, was für einen Aufruf an das Modell geht: Anweisungen, Beispiele, gefundene Dokumente und die Nutzerfrage. Das ist der gesamte Zustand, den das Modell hat — zwischen zwei Aufrufen gibt es kein Gedächtnis, das nicht wieder in den Prompt geschrieben wurde.
Siehe auch
System-Prompt · Context Engineering · Gedächtnis
Prompt Injection
Agenten & Werkzeuge
#
Ein Angriff, bei dem Anweisungen, die in gelesenen Inhalten versteckt sind — Webseite, E-Mail, PDF —, befolgt werden, als kämen sie von Ihnen. Jeder Agent, der zugleich nicht vertrauenswürdigen Text liest und eine missbrauchbare Fähigkeit besitzt, ist konstruktionsbedingt angreifbar.
Siehe auch
Leitplanke · Jailbreak · Werkzeugnutzung
Prompt-Caching
Betrieb & Inferenz
#
Den berechneten Zustand eines unveränderten Prompt-Anfangs über mehrere Aufrufe hinweg wiederverwenden. Wo ein langer System-Prompt oder ein Dokument wiederholt gesendet wird, senkt das Latenz und Input-Kosten — aber nur, wenn der Anfang jedes Mal byteidentisch ist.
Siehe auch
KV-Cache · Input- vs. Output-Tokens
Q
Quantisierung
Betrieb & Inferenz
#
Die Gewichte eines Modells mit geringerer Genauigkeit speichern — 4 oder 3 Bit statt 16 —, damit ein größeres Modell in weniger Speicher passt. Die Qualität sinkt zunächst langsam und dann steil; den brauchbaren Bereich findet man durch Testen, nicht durch Lesen der Bezeichnung.
Aus dem eigenen BetriebDer Sprachassistent in diesem Haus ist ein Modell mit 12 Milliarden Parametern, quantisiert auf etwa drei Bit pro Gewicht. Erst das lässt es auf einer einzelnen Mittelklasse-Consumerkarte laufen und im Raum antworten, ohne dass etwas das Haus verlässt.
Siehe auch
VRAM · Selbst hosten · Parameter
R
Ratenlimit
Kosten, Hardware & Recht
#
Die Obergrenze eines Anbieters für Anfragen oder Tokens pro Minute. Sie ist eine Größe der Kapazitätsplanung, kein Fehlerfall: Jede unbeaufsichtigt laufende Kette muss mit einem 429 rechnen und warten, statt die Arbeit zu verlieren.
Aus dem eigenen BetriebEin von uns gemessener gehosteter Endpunkt erlaubt 2.000 Anfragen pro Minute und antwortet darüber mit 429, bei 30 Sekunden Sperre. Solche Zahlen misst man besser, als sie zu lesen: Veröffentlichter und durchgesetzter Wert weichen voneinander ab.
Siehe auch
Batching · Gehostete API
ReAct-Schleife
Agenten & Werkzeuge
#
Der Grundzyklus eines Agenten: denken, Werkzeug aufrufen, Ergebnis lesen, erneut entscheiden. Jede produktive Fassung braucht eine harte Iterationsgrenze und einen Rückfallpfad — eine Schleife, die nicht enden kann, ist das voreingestellte Fehlerbild.
Siehe auch
Agent · Werkzeugnutzung
Reasoning-Modell
Modelle & Architektur
#
Ein Modell, das vor der Antwort einen Rechenweg schreibt und Tokens investiert, um ein besseres Ergebnis zu erzielen. Das Nachdenken teilt sich das Ausgabebudget mit der Antwort — ein unbegrenzter Denkdurchgang kann das ganze Budget aufbrauchen und nichts zurückgeben.
Aus dem eigenen BetriebBei uns gemessen: Ohne gesetzte Grenze schrieb ein Modell noch bei 63.000 Zeichen an seinem Rechenweg und lieferte bei vier von fünf Aufrufen eine leere Antwort. Eine begrenzte Denkstufe löste das Problem — ein höheres Token-Limit hätte es nicht getan.
Siehe auch
Gedankenkette · Token-Limit
Red Teaming
Evaluation & Fehlerbilder
#
Das eigene System absichtlich angreifen, um zu finden, was es aus der Bahn wirft — bevor es jemand anderes öffentlich tut. Bei allem mit Kundenkontakt gehört das in den Release-Prozess, nicht in ein einmaliges Audit.
Siehe auch
Jailbreak · Prompt Injection
Reinforcement Learning mit menschlichem FeedbackRLHF
Training & Anpassung
#
Ein Modell gegen menschliche Präferenzurteile trainieren statt gegen eine richtige Antwort. Das macht Assistenten hilfreich und höflich — und zugleich gefällig: So trainierte Modelle neigen dazu, das zu sagen, was Sie hören möchten.
Siehe auch
Alignment
Retrieval-Augmented GenerationRAG
Agenten & Werkzeuge
#
Zuerst passende Dokumente suchen und in den Prompt legen, damit das Modell aus Ihrem Material antwortet statt aus dem Gedächtnis. Das ist die Standardantwort auf „das Modell kennt unsere Daten nicht“ — günstiger und aktueller als Fine-Tuning.
Siehe auch
Chunking · Vektordatenbank · Semantische Suche · Fine-Tuning
S
Selbst hosten
Kosten, Hardware & Recht
#
Modelle mit offenen Gewichten auf eigener Hardware betreiben. Das verwandelt eine Rechnung pro Token in Fixkosten plus Strom — und ist die einzige Konstellation, bei der kein Prompt und kein Dokument jemals das eigene Netz verlässt.
Aus dem eigenen BetriebBei uns gemessen: rund 1,47 kWh pro Million Output-Tokens, ermittelt aus der Aufnahme der gesamten Maschine an der Steckdose statt aus der Anzeige der Karte. Der Strom ist der Posten, den die meisten Selbsthosting-Rechnungen weglassen.
Siehe auch
Break-even · Offene Gewichte · GPU · Datenresidenz
Selbstkonsistenz
Evaluation & Fehlerbilder
#
Wie oft ein Modell bei derselben Eingabe zweimal dasselbe Urteil fällt. Wer das zuerst misst, weiß, wie groß der Unterschied zwischen zwei Modellen sein muss, um überhaupt etwas zu bedeuten.
Siehe auch
LLM als Prüfer · Nichtdeterminismus
Semantische Suche
Agenten & Werkzeuge
#
Nach Bedeutung suchen statt nach übereinstimmenden Wörtern, sodass „wie kündige ich“ eine Seite mit dem Titel „Abo beenden“ findet. Sie ergänzt die Stichwortsuche, ersetzt sie aber nicht: Exakte Kennungen brauchen weiterhin exakten Abgleich.
Siehe auch
Embedding · Kosinus-Ähnlichkeit · Retrieval-Augmented Generation
Streaming
Betrieb & Inferenz
#
Tokens an den Client senden, sobald sie entstehen, statt auf die fertige Antwort zu warten. Das beschleunigt die Generierung nicht — es macht das Warten sichtbar, und meist ist genau das der Unterschied, der zählt.
Siehe auch
Zeit bis zum ersten Token · Autoregressive Generierung
Strukturierte Ausgabe
Betrieb & Inferenz
#
Das Modell zwingen, in einer festen Form zu antworten — JSON nach Schema —, damit ein Programm sie verarbeiten kann. Alles, was Modellausgaben produktiv parst, braucht das und zusätzlich einen Wiederholversuch: Freitext driftet auf Weisen, an denen Parser scheitern.
Aus dem eigenen BetriebBei zwei von sechs ansonsten identischen Aufrufen verlor ein Modell die öffnende Klammer seines JSON — die Trennung zwischen Denk- und Antwortfeld fiel mitten in ein Token. Eine Wiederholschleife fängt das ab; ein Parser ohne sie hätte den Datensatz verloren.
Siehe auch
Werkzeugnutzung · Gedankenkette
Synthetische Daten
Training & Anpassung
#
Trainingsdaten, die ein Modell erzeugt hat, statt sie in der Welt zu erheben. Das löst Knappheits- und Datenschutzprobleme — und erbt jede Verzerrung und jeden blinden Fleck des erzeugenden Modells.
Siehe auch
Distillation · Goldstandard
System-Prompt
Betrieb & Inferenz
#
Die stehende Anweisung über dem Gespräch: Rolle, Regeln, Ausgabeformat, was abzulehnen ist. Der günstigste Hebel im ganzen Stack — und meist das Erste, was man korrigiert, wenn die Ausgabe nicht stimmt.
Aus dem eigenen BetriebWenn ein größeres Modell ein kleineres bei einer Aufgabe mit harter Vorgabe schlägt, prüfen Sie zuerst, ob der Prompt diese Vorgabe überhaupt genannt hat. In einem unserer Jobs bestand ein 753B-Modell die Prüfung achtmal von acht, ein 321B-Modell viermal; nachdem die fehlende Regel im Prompt stand, kam auch das kleinere auf acht.
Siehe auch
Prompt · Strukturierte Ausgabe
T
Temperatur
Betrieb & Inferenz
#
Der Regler dafür, wie viel Zufall in die Wahl des nächsten Tokens einfließt. Nahe null wiederholt das Modell seine wahrscheinlichste Fortsetzung; höhere Werte erkaufen Vielfalt mit Genauigkeit. Extraktion braucht niedrig, Werbetexte nicht.
Siehe auch
Top-p-Sampling · Nichtdeterminismus
Territoriale Lizenzbeschränkung
Kosten, Hardware & Recht
#
Eine Modelllizenz, die in Ihrer Rechtsordnung schlicht nicht gilt. Mehrere starke Veröffentlichungen mit offenen Gewichten schließen die EU, das Vereinigte Königreich oder Südkorea ausdrücklich aus — für einen europäischen Betreiber unbrauchbar, unabhängig von der Qualität.
Aus dem eigenen BetriebZweimal mussten wir ein in Benchmarks führendes Modell allein aus diesem Grund verwerfen. Wer die Gebietsklausel vor der Benchmark-Tabelle liest, spart sich die Evaluation vollständig.
Siehe auch
Nicht-kommerzielle Lizenz · Offene Gewichte
Token
Modelle & Architektur
#
Die Einheit, die ein Modell liest und schreibt — etwa drei Viertel eines englischen Wortes, bei deutschen Komposita, Code oder JSON entsprechend weniger Zeichen. Kontextgrenzen, Preise und Geschwindigkeiten zählen immer Tokens, nie Zeichen.
Aus dem eigenen BetriebDeutscher Text kostet spürbar mehr Tokens als derselbe Text auf Englisch, weil die Tokenizer überwiegend auf Englisch angepasst wurden. Eine zweisprachige Seite zahlt diesen Unterschied bei jeder Seite, die sie an ein Modell schickt.
Siehe auch
Tokenizer · Tokens pro Sekunde · Preis pro Million Tokens
Token-Limit
Betrieb & Inferenz
#
Die Obergrenze dafür, wie viel ein Modell in einem Aufruf schreiben darf. Bei einem Reasoning-Modell umfasst sie das Nachdenken mitsamt der Antwort — ein großzügig wirkendes Budget kann also aufgebraucht sein, bevor die Antwort beginnt.
Aus dem eigenen BetriebEine strengere Bewertungsfrage trieb unseren Qualitätsrichter direkt durch seine 4.096-Token-Grenze: Er lieferte eine leere Antwort, die sich bei zwölf Prozent der Clips als Parse-Fehler zeigte. Erkennbar ist das am Abbruchgrund, nicht an der Fehlermeldung.
Siehe auch
Reasoning-Modell · Strukturierte Ausgabe
Tokenizer
Modelle & Architektur
#
Die Komponente, die Text in Tokens zerlegt und wieder zusammensetzt. Jede Modellfamilie hat ihre eigene: Derselbe Absatz ergibt je nach Anbieter eine andere Tokenzahl — und einen anderen Preis.
Siehe auch
Token
Tokens pro Sekundetok/s
Betrieb & Inferenz
#
Das Tempo, mit dem ein Modell Ausgabe erzeugt. Unter etwa 10 Tok/s fühlt sich Lesen wie Warten an; ab rund 30 überholt es bequemes Lesetempo, und mehr Geschwindigkeit zählt nur noch für Maschinen.
Aus dem eigenen BetriebAuf unserer eigenen Maschine am 19.08.2026 gemessen: 38,7 Tokens pro Sekunde dauerhaft aus einem 12B-Modell auf einer RTX 3060 Ti, mit unter einem Prozent Streuung zwischen den Läufen. Ein gehostetes Spitzenmodell schwankte am selben Tag um den Faktor elf.
Siehe auch
Zeit bis zum ersten Token · Batching · Inferenz
Top-p-Sampling
Betrieb & Inferenz
#
Eine zweite Zufallssteuerung: Nur die wahrscheinlichsten Tokens betrachten, die zusammen den Anteil p der Wahrscheinlichkeitsmasse ausmachen. Wer ihn und die Temperatur gleichzeitig ändert, kann keine Wirkung mehr zuordnen.
Siehe auch
Temperatur
Transformer
Modelle & Architektur
#
Die Netzarchitektur hinter nahezu jedem aktuellen Sprachmodell. Ihr Kernstück ist die Attention: Jedes Token der Eingabe kann beeinflussen, wie jedes andere gelesen wird.
Siehe auch
Attention (Aufmerksamkeit)
V
Vektordatenbank
Agenten & Werkzeuge
#
Ein Speicher, der Embeddings indexiert und die nächstgelegenen zu einem Anfragevektor liefert. Für einige tausend Dokumente genügt eine gewöhnliche Datenbank mit Vektorspalte; das Spezialprodukt lohnt sich erst in einer anderen Größenordnung.
Siehe auch
Embedding · Semantische Suche · Retrieval-Augmented Generation
Vision-Language-ModellVLM
Modelle & Architektur
#
Ein Modell, das neben Text auch Bilder annimmt. Vision ist eine diskrete Fähigkeit: Ein reines Textmodell verarbeitet ein Bild nicht etwas schlechter — es weist die Anfrage ab.
Aus dem eigenen BetriebDas Qualitätstor unserer Video-Pipeline ist ein Vision-Modell, das Frames bewertet, bevor etwas veröffentlicht wird. Bei der Prüfung eines größeren Modells als Ersatz gab nicht dessen Punktzahl den Ausschlag: Es hat überhaupt kein Vision — damit scheidet es für diese Aufgabe aus, was immer es sonst kann.
Siehe auch
LLM als Prüfer · Diffusionsmodell
Vortraining
Training & Anpassung
#
Die erste und mit Abstand teuerste Trainingsphase, in der ein Modell Sprache aus rohem Text lernt. Sie findet einmal statt, kostet Millionen und wird von Unternehmen außerhalb des Modellgeschäfts nie wiederholt.
Siehe auch
Fine-Tuning · Basismodell
VRAMVRAM
Betrieb & Inferenz
#
Der Speicher auf der Grafikkarte. Er ist die harte Grenze beim Selbsthosten: Gewichte plus KV-Cache müssen hineinpassen, sonst weicht das Modell in den Systemspeicher aus und wird um eine Größenordnung langsamer.
Siehe auch
Quantisierung · KV-Cache · GPU
W
Werkzeugnutzung
Agenten & Werkzeuge
#
Einem Modell einen Satz aufrufbarer Funktionen geben — suchen, abrufen, Datenbank abfragen, Auftrag erteilen. Das Modell führt sie nicht aus: Es formuliert einen Wunsch, Ihr Code entscheidet, ob er erfüllt wird — und an dieser Grenze entsteht Sicherheit.
Siehe auch
Agent · Model Context Protocol · Leitplanke
Wissensstichtag
Modelle & Architektur
#
Das Datum, nach dem das Modell keine Trainingsdaten mehr gesehen hat. Alles Spätere muss über den Prompt hereinkommen — per Retrieval, Werkzeugaufruf oder Web-Abruf —, sonst antwortet das Modell mit voller Überzeugung aus einer veralteten Welt.
Siehe auch
Retrieval-Augmented Generation · Werkzeugnutzung · Halluzination