Die Entscheidung, ein Sprachmodell selbst zu betreiben, hängt an drei Zahlen: ob es passt, ob es schnell genug ist und ob es günstiger ist. Jedes dieser Werkzeuge beantwortet eine davon mit gemessenen Werten statt mit Hersteller-Arithmetik. Alle drei laufen vollständig im Browser — nichts wird hochgeladen, und es gibt nichts anzumelden.
Ein HuggingFace-Modell einfügen und sehen, was es wirklich braucht — Gewichte, KV-Cache und Laufzeit-Overhead — gemessen an Maschinen, die man tatsächlich besitzt. Liest echte Dateigrößen, statt aus einer Tabelle zu schätzen.
Jeder Inferenz-Anbieter nennt Tokens pro Sekunde, und kaum jemand weiß, wie sich die Zahl anfühlt. Regler bewegen und Text in genau diesem Tempo ankommen sehen — mit Referenzwerten, gemessen auf eigener Hardware.
Ein Break-even-Rechner für den Eigenbetrieb, auf Basis von Durchsatz und Wandleistung, gemessen an der eigenen Maschine, gegen veröffentlichte Listenpreise. Er nennt die Seite, die bei Ihrem Volumen tatsächlich günstiger ist.
Dieses Unternehmen betreibt eigene Modelle auf eigener Hardware, und jedes dieser Werkzeuge begann als Frage, die wir vor der Entscheidung für eine Maschine oder ein Modell selbst beantworten mussten. Sie zu veröffentlichen kostet nichts und erspart jemand anderem denselben Nachmittag.
Die KI-News, die zählen — bis 07:30 Uhr MEZ im Postfach. Kostenlos, kein Spam.