LLM-Anbieter rechnen nach Token ab, und die Rechnung ist einfach, wenn Sie die vier Hebel kennen: welches Modell Sie verwenden, wie viele Eingabe- und Ausgabe-Tokens jede Anfrage benötigt, wie viel Ihrer Eingaben Sie zwischenspeichern können und ob der Job im Batch ausgeführt werden kann. Dieser Rechner wandelt diese Hebel in echte Monats- und Jahreszahlen um und ermöglicht den Vergleich von Modellen mit derselben Arbeitslast. Dieser Leitfaden erklärt, wie jeder Hebel funktioniert und wo sich die Einsparungen verbergen.

So funktioniert die Token-Preisgestaltung

Jede Anfrage wird in Tokens berechnet – Unterwortblöcke mit einer Länge von etwa vier Zeichen. Anbieter veröffentlichen zwei Hauptpreise pro Modell: einen Preis pro Million Input-Tokens (alles, was Sie senden) und einen Preis pro Million Output-Tokens (alles, was das Modell generiert). Die Kosten einer Anfrage sind einfach die Anzahl der einzelnen Token dividiert durch eine Million, multipliziert mit ihrer Rate, summiert.

Das Wichtigste, was es zu verinnerlichen gilt, ist, dass die Ausgabe weitaus teurer ist als die Eingabe – normalerweise das Drei- bis Sechsfache der Rate. Bei Claude Sonnet 4.6 beträgt der Input 3 $/1 Mio. und der Output 15 $/1 Mio.; Bei GPT-5.5 sind es 5 US-Dollar gegenüber 30 US-Dollar. Das bedeutet, dass ein gesprächiges Modell, das die Antworten auffüllt, mehr kosten kann als ein teureres Modell, das knapp antwortet. Wenn Sie eine Rechnung überrascht, schauen Sie sich zuerst die Ausgabelänge an.

Input- vs. Output-Kosten – und warum die Modellauswahl wichtig ist

Da sich die beiden Tarife stark unterscheiden, ist das günstigste Modell nicht immer das günstigste für Ihr Arbeitspensum. Bei einer Arbeitslast, die große Eingabeaufforderungen sendet, aber kurze Antworten erwartet, dominieren die Eingabekosten, bei denen ein Mittelklassemodell ein Schnäppchen sein kann. Bei einer Arbeitslast, die lange Dokumente generiert, dominieren die Ausgabekosten, während ein kleineres, schnelleres Modell weit mehr einsparen kann, als Eingaben einzusparen.

Dazu dient die Registerkarte „Modelle vergleichen“: Sie hält Ihre Token-Anzahl und Ihr Volumen fest und berechnet sie gleichzeitig über drei Modelle hinweg neu, wobei jeder Balken in Eingabe, zwischengespeicherte Eingabe und Ausgabe aufgeteilt wird, sodass Sie genau sehen können, wohin das Geld fließt. Oft erledigt ein Modell mit einer niedrigeren Stufe die Aufgabe zu einem Bruchteil der Kosten – der einzige Weg, dies herauszufinden, besteht darin, Ihre tatsächlichen Zahlen zu vergleichen.

Sofortiges Caching und Batch-Rabatte

Zwei Anbieterfunktionen senken die Kosten, ohne Ihr Modell oder Ihre Eingabeaufforderungen zu ändern. Beim Prompt-Caching wird das stabile Präfix einer Anfrage – ein System-Prompt, ein langer Anweisungsblock, ein abgerufener Kontext – gespeichert, sodass es bei wiederholten Anfragen nicht erneut verarbeitet wird. Zwischengespeicherte Token werden zu etwa 10 % des Eingabepreises zurückgelesen. Der Haken ist ein einmaliger Cache-Schreibaufschlag (ca. 1,25-fache Eingabe bei Anthropic) bei der ersten Anfrage, sodass sich das Caching auszahlt, wenn das gleiche Präfix viele Male innerhalb des Cache-Fensters wiederverwendet wird.

Die Batch-API führt Anfragen asynchron unter Verwendung der vom Anbieter veröffentlichten Batch-Raten aus. Viele Token-Preise betragen 50 % des Standardpreises, Komponenten wie Cache-Lesevorgänge können jedoch je nach Anbieter unterschiedlich sein. Wenn Ihr Job Latenzzeiten von Minuten bis Stunden verträgt – Massenzusammenfassung, Klassifizierung, Auswertungen, Datenanreicherung – vergleichen Sie die angezeigten Raten vor der Stapelverarbeitung. Die beiden Funktionen können kombiniert werden: Eine zwischengespeicherte, gestapelte Arbeitslast in der richtigen Größe kann einen kleinen Bruchteil der naiven Schätzung kosten.

Schätzen Sie Token und vermeiden Sie Überraschungen

Für die Budgetierung vor dem Bau benötigen Sie einen Kostenvoranschlag. Englischer Text umfasst etwa vier Zeichen oder 0,75 Wörter pro Token, sodass ein Dokument mit 2.000 Wörtern etwa 2.700 Token umfasst. Die Registerkarte „Token-Schätzer“ führt diese Konvertierung aus eingefügtem Text oder einer Rohzählung durch. Betrachten Sie es als einen groben Leitfaden – Code, JSON, nicht-englischer Text und ungewöhnliches Vokabular werden unterschiedlich tokenisiert, und für genaue Zahlen sollten Sie den Tokenizer oder den Token-Counting-Endpunkt des Anbieters verwenden.

Zwei häufige Überraschungen: Der Konversationsverlauf wird bei jeder Runde erneut gesendet (und neu in Rechnung gestellt), sofern Sie ihn nicht zwischenspeichern oder kürzen. Daher werden Chats mit mehreren Runden mit zunehmender Länge teurer; und abgerufener Kontext zählt jedes Mal als Eingabe, auch wenn die Frage des Benutzers winzig ist. Das Modell und die Preise in diesem Tool wurden am 29. August 2026 überprüft und sind in einer einzigen datierten Tabelle im Code isoliert. Überprüfen Sie immer anhand der Preisseite des Anbieters, bevor Sie ein Budget festlegen, da sich die Preise ändern.