Zum Inhalt springen

KI-Agenten Kosten kontrollieren: Tokenverbrauch messen und begrenzen

Kurz gesagt

Agenten verbrennen Tokens in Schleifen, und der teuerste Posten ist nicht die Modellrechnung, sondern die Nacharbeit. Wie Sie Kosten je Vorgang messen, vier Regler setzen und einen Deckel einziehen, der hält.

13 Min. Lesezeit
KI-Agenten Kostenkontrolle Token-Budget n8n Automatisierung
KI-Agenten Kosten kontrollieren: Tokenverbrauch messen und begrenzen

Ihr Kundenservice-Agent läuft seit sechs Wochen, das Team ist zufrieden, die Antwortzeiten sind kürzer. Dann kommt die Rechnung des Modellanbieters: statt der kalkulierten 90 Euro stehen 1.400 Euro auf dem Beleg. Kein Ausfall, kein Fehler im Protokoll, keine rote Warnung. Der Agent hat einfach mehr gearbeitet als geplant, an Stellen, die niemand beobachtet hat.

Genau darin steckt das Problem. Bei einem Chatfenster kennen Sie die Kosten, weil ein Klick eine Anfrage ist. Bei einem Agenten ist ein Vorgang kein Aufruf, sondern eine Schleife aus Aufrufen, Werkzeugen und neuen Entscheidungen. Die Kosten entstehen dort, wo niemand hinsieht.

In diesem Artikel erfahren Sie, warum Agentenkosten anders funktionieren als Chatkosten, was ein Vorgang in vier Kostenblöcken wirklich kostet, wie Sie Kosten je Vorgang messbar machen und mit welchen vier Reglern Sie in einer Woche einen Deckel einziehen, der auch im Betrieb hält.


Inhaltsverzeichnis

  1. Warum Agentenkosten aus dem Ruder laufen
  2. Was ein Agent wirklich kostet
  3. Kosten pro Vorgang sichtbar machen
  4. Vier Regler, die Kosten begrenzen
  5. In einer Woche zum Kosten-Deckel
  6. Fazit

Warum Agentenkosten aus dem Ruder laufen

Der Unterschied zwischen einem Chatfenster und einem Agenten ist kein Detail, sondern der Kern des Kostenproblems. Bei einem Chat ist die Eingabe so groß wie Ihre Frage und die Ausgabe so groß wie die Antwort. Bei einem Agenten entscheidet das System selbst, wie viele Schritte es braucht: Es liest Daten, ruft Werkzeuge auf, bewertet Zwischenergebnisse, korrigiert sich und beginnt gelegentlich von vorn. Jeder dieser Schritte ist ein eigener Modellaufruf mit Tokenverbrauch. Anthropic hat diesen Effekt im Juni 2025 öffentlich beziffert: Agenten verbrauchen typischerweise etwa viermal so viele Tokens wie ein Chatvorgang, Multi-Agenten-Systeme etwa fünfzehnmal so viele. Die vierfache Menge ist kein Ausreißer, sondern der Normalfall, und sie fällt in keiner Statistik auf, die nur Anfragen zählt.

Die häufigste Ursache für entgleiste Kosten ist deshalb auch nicht ein teures Modell, sondern eine Schleife ohne Ende. Drei Muster treffen wir in fast jedem Projekt, das wir übernehmen. Erstens der Wiederholungsversuch: Ein Werkzeug liefert eine Fehlermeldung, der Agent versucht es erneut, dann ein drittes Mal, und die drei Fehlversuche kosten mehr als der ursprüngliche Auftrag. Zweitens der wachsende Kontext: Jede Stufe bekommt den bisherigen Verlauf erneut mitgeschickt, deshalb wächst der Input-Token-Verbrauch mit jedem Schritt überproportional. Drittens die Modellwahl ohne Differenzierung: Dasselbe große Modell entscheidet, ob ein Formularfeld leer ist, formuliert die Kundenantwort und prüft gleichzeitig die Rechnung.

Dass dieses Thema gerade an Relevanz gewinnt, zeigt eine Meldung vom 21. September 2026. Auf der Hausmesse .conf in Denver hat Splunk vier Entwicklungen beschrieben, die den Betrieb von KI-Systemen derzeit prägen: Inferenz hat das Training als dominierende Arbeitslast abgelöst, Agenten werden zu eigenständigen Anwendungen und digitalen Mitarbeitern, Tokens haben nach Einschätzung des Unternehmens inzwischen den Charakter einer Währung, und Kontrolle wird zum eigentlichen Burggraben. Als Antwort darauf bringt Splunk Funktionen für Agent Observability auf den Markt, mit denen sich nicht nur das Verhalten eines Agenten zur Laufzeit und im Nachhinein beobachten lässt, sondern über eine Tokenwirtschaft auch die Kosten in Euro ausdrücken. Das Werkzeug soll zusätzlich gleichwertige, aber günstigere Modelle vorschlagen. Wenn ein Monitoring-Anbieter dieser Größe Kostenkontrolle zur Kernfunktion macht, ist die Frage nicht mehr, ob Sie Ihre Agentenkosten messen sollten, sondern nur noch, wie Sie es diese Woche anfangen.

Bemerkenswert ist dabei ein zweiter Punkt aus derselben Meldung: Splunk verweist darauf, dass sich ein Teil dieser Sicherheitsfunktionen erst im Nachhinein bewährt. Ein Schadensmuster wird oft erst nach dem Vorfall erkannt. Für Kosten gilt dasselbe Muster. Der teuerste Monat ist der, in dem niemand mitgeschrieben hat, und nachträglich lässt sich dann nicht mehr rekonstruieren, welcher Vorgang welche Menge verbraucht hat. Sie brauchen keine Enterprise-Plattform, um das zu verhindern. Sie brauchen eine Zahl pro Vorgang, und die lässt sich mit Hausmitteln erheben.

Was ein Agent wirklich kostet

Wer über Agentenkosten spricht, meint fast immer die Modellrechnung. Das ist der kleinste Teil. In der Praxis besteht der Aufwand aus vier Blöcken, die alle gemessen werden sollten, weil sie sich unterschiedlich verhalten.

Block 1: Modell-Tokens. Der Verbrauch für alle Aufrufe eines Vorgangs, also Prompt, Zwischenschritte, Werkzeugbeschreibungen und die fertige Antwort. Dies ist der einzige Block, der variiert, wenn ein Modell ausfällt und der Agent in eine Schleife läuft.

Block 2: Werkzeuge und Infrastruktur. Die n8n-Instanz oder der Server, auf dem der Ablauf läuft, eine Vektordatenbank oder ein Wissensspeicher, kostenpflichtige Schnittstellen von Drittanbietern, etwa für Adressprüfung, Versanddaten oder Zahlungsdaten. Diese Posten sind weitgehend fix und werden deshalb selten auf den Vorgang umgerechnet.

Block 3: Betrieb und Überwachung. Der Zeitaufwand für Protokolle, Prüfungen, Updates und die Auswertung der Qualitätsmessung. Auch das ist meistens ein fester Block, aber einer, den viele Projekte unterschätzen, weil er nie in einem Angebot steht.

Block 4: Nacharbeit durch Menschen. Jeder eskalierte Vorgang kostet Arbeitszeit. Dies ist der Block, der in Gesprächen am seltensten vorkommt und in der Rechnung am stärksten ausschlägt.

Ein Rechenbeispiel mit offengelegten Annahmen macht den Unterschied klar. Angenommen werden 40 Vorgänge pro Tag, je Vorgang 60.000 Input-Tokens und 6.000 Output-Tokens inklusive Agentenschleife sowie Preise von 1,50 Euro je Million Input-Tokens und 6,00 Euro je Million Output-Tokens für ein Mittelklasse-Modell.

  • Input: 40 Vorgänge mal 60.000 Tokens, also 2,4 Millionen Tokens pro Tag, ergibt 3,60 Euro.
  • Output: 40 Vorgänge mal 6.000 Tokens, also 240.000 Tokens pro Tag, ergibt 1,44 Euro.
  • Modellkosten gesamt: 5,04 Euro pro Tag, bei 21 Arbeitstagen rund 105,84 Euro pro Monat.

Dieselben 40 Vorgänge als einfache Chat-Anfragen (Faktor vier aus dem genannten Anthropic-Wert) kosten etwa 1,26 Euro pro Tag, also 26,46 Euro pro Monat. Als Multi-Agenten-System mit parallelen Teilagenten (Faktor fünfzehn) sind es 75,60 Euro pro Tag und etwa 1.587,60 Euro pro Monat. Allein diese drei Zahlen erklären, warum das Thema Aufmerksamkeit braucht: Die Architektur, nicht das Modell, entscheidet über den Faktor 15.

Jetzt kommt der Block, der die Rechnung dreht. Unterstellen Sie eine Eskalationsquote von 8 Prozent, eine Nachbearbeitung von sechs Minuten je Fall und Vollkosten von 45 Euro pro Arbeitsstunde. Das sind 3,2 Eskalationen pro Tag, also 14,40 Euro Nacharbeit täglich. Die Nacharbeit ist damit fast dreimal so teuer wie die gesamte Modellrechnung. Wer nur die Modellkosten optimiert, arbeitet am kleineren Hebel.

Zum Vergleich der Ausgangszustand: Dieselben 40 Vorgänge in Handarbeit, acht Minuten pro Vorgang, kosten 240 Euro pro Tag. Der Agent liegt mit Modell und Nacharbeit zusammen bei 19,44 Euro, die Ersparnis beträgt rund 220 Euro pro Tag oder etwa 4.632 Euro im Monat. Der Agent ist also wirtschaftlich, aber nur solange die Eskalationsquote nicht kippt. Steigt sie von 8 auf 20 Prozent, wächst allein die Nacharbeit auf 36 Euro pro Tag, und die Ersparnis schmilzt deutlich. Der Agent ist damit weniger ein Technologieprojekt als eine Frage der Quote.

Praxistipp: Rechnen Sie Ihre Agenten nicht in Tokens, sondern in Kosten je erfolgreichem Vorgang. Diese eine Zahl macht Ausfälle, Modellwechsel und Ausbauvorhaben vergleichbar und ist die einzige Kennzahl, die ein Kaufmann ohne Erklärung versteht.

Kosten pro Vorgang sichtbar machen

Ohne Messung gibt es keinen Deckel. Die gute Nachricht: Fast alle Daten, die Sie brauchen, fallen im Betrieb bereits an, sie werden nur nicht aufgezeichnet. Für jeden Vorgang gehören acht Werte in eine Zeile: Vorgangsnummer, Zweck, verwendetes Modell, Input-Tokens, Output-Tokens, Zahl der Werkzeugaufrufe, Ergebnis (erfolgreich oder eskaliert) und Kosten in Euro. Zusätzlich lohnt sich ein Zeitstempel, damit Sie Tages- und Wochenschwankungen erkennen.

Die Token-Zahlen liefern die meisten Modellanbieter direkt mit der Antwort mit, in n8n finden Sie sie im Antwortobjekt unter dem Verbrauchsfeld. Die Zahl der Werkzeugaufrufe und die Zahl der Schleifenstufen stehen im Ausführungsprotokoll, in n8n in der Ausführungsansicht. Kosten rechnen Sie nicht in die Datenbank hinein, sondern immer aus Tokens und dem aktuell hinterlegten Preis. Ein hart eingetragener Euro-Betrag veraltet beim nächsten Modellwechsel, eine Formel nicht.

Aus diesen Rohdaten entstehen dann vier Auswertungen, die den Betrieb tragen:

  1. Kosten je erfolgreichem Vorgang. Der Nenner zählt nur die Fälle, die ohne Mensch abgeschlossen wurden. Diese Zahl steigt, wenn die Qualität sinkt, und sinkt, wenn ein Regler greift. Sie ist Ihre Leitkennzahl.
  2. Anteil Eskalationen. Sie verbindet Kosten und Qualität, weil jeder eskalierte Vorgang Arbeitszeit kostet. Eine Messung der Antwortqualität haben wir im Beitrag zu den stillen Ausfällen im Produktivbetrieb beschrieben, und genau dort passt der Kostenwert als zweite Zahl dazu.
  3. Tokens je Vorgang als Verteilung, nicht als Durchschnitt. Der Durchschnitt verdeckt die Ausreißer. Die fünf teuersten Vorgänge einer Woche zeigen fast immer die Ursache: eine Endlosschleife, ein Dokument mit 200 Seiten, ein Werkzeug, das wiederholt Fehler liefert.
  4. Kosten je Vorgangsart. Reklamation, Neuanfrage, Bestellstatus: Die Vorgangsarten unterscheiden sich erheblich. Manche lohnen sich, manche sollten ganz ohne Modell laufen.

Für die Ablage genügt eine Tabelle in einer Datenbank oder ein Tabellenblatt. Bei einem Agenten, der Kundenservice übernimmt, gibt es dazu passende Muster in unserem Leitfaden zur Kundenservice-Automatisierung mit n8n, inklusive der Frage, welche Vorgänge überhaupt automatisiert werden sollten. Und falls Sie über mehrere Automatisierungen hinweg vergleichen wollen, finden Sie in den sieben KI-Automationen für den Mittelstand genug Kandidaten für einen sauberen Quervergleich der Kosten je Vorgang.

Vier Regler, die Kosten begrenzen

Messen allein senkt keine Kosten. Es macht sie nur sichtbar. Was die Rechnung tatsächlich klein hält, sind vier Regler, die Sie in jedem Agenten setzen sollten, unabhängig von der Plattform.

Regler 1: Schleifenlimit. Definieren Sie eine harte Obergrenze für Schritte, etwa acht Werkzeugaufrufe pro Vorgang. Bei Erreichen wird nicht weiter versucht, sondern eskaliert. Das verhindert genau das Muster, das Rechnungen sprengt: einen Agenten, der dreimal gegen dieselbe Fehlermeldung läuft. Ein Schleifenlimit ist die billigste Versicherung, die es im Agentenbetrieb gibt.

Regler 2: Modell je Schritt. Nicht jeder Schritt braucht das größte Modell. Klassifikation, Feldextraktion und Formatprüfung erledigt ein kleines, schnelles Modell zu einem Bruchteil der Kosten. Das große Modell kommt nur dort zum Einsatz, wo formuliert oder abgewogen wird. Splunk liefert mit seiner Agent Observability genau dafür Vorschläge für gleichwertige, aber preiswertere Modelle, was zeigt, wie viel Sparpotenzial im Betrieb allein durch die Zuordnung von Aufgabe zu Modell liegt.

Regler 3: Kontext-Deckel. Schicken Sie nicht den gesamten Gesprächsverlauf mit, sondern nur die letzten Nachrichten und die tatsächlich relevanten Abschnitte aus dem Wissensspeicher. Zwei Techniken helfen sofort: Zwischenergebnisse in Dateien oder Datenbankfelder schreiben statt in den Verlauf, und lange Verläufe zusammenfassen statt anhängen. Wer den Verlauf unbegrenzt mitwachsen lässt, zahlt denselben Satz mehrfach, mit jedem Schritt ein weiteres Mal.

Regler 4: Budget, Rechte und Identität. Legen Sie ein Tagesbudget und ein Monatsbudget fest, mit einer Warnung bei 80 Prozent Verbrauch. Vergeben Sie Rollen statt Vollzugriff: Der Agent darf lesen, was er braucht, und schreiben, wozu er berechtigt ist. Und geben Sie jedem Agenten eine eigene Identität statt der Zugangsdaten eines Mitarbeiters. Warum dieser letzte Punkt kein Detail ist, zeigt ein Fall vom 20. September 2026. Amazon hat den persönlichen KI-Agenten Muse von Meta aus seinem Shop ausgeschlossen und Nutzern ein Fenster angezeigt, in dem es hieß, weiterer Zugriff durch einen nicht autorisierten KI-Agenten verstoße gegen die Nutzungsbedingungen. Amazon begründet den Schritt damit, dass der Agent sich beim Browsen nicht zu erkennen gibt und Zugangsdaten erfasst, was Meta bestreitet. Unabhängig davon, wer in diesem Streit recht hat, ist die Lehre für jeden Betrieb dieselbe: Ein Agent, der sich nicht ausweist und keine definierten Rechte hat, verliert den Zugang. Zahlungsnetzwerke arbeiten derzeit an Standards zur Identifikation von Agenten, und derselbe Maßstab wird bald auch für interne Systeme gelten.

Dazu kommt eine Sicherheitsdimension, die am 21. September 2026 gemeldet wurde: Angreifer können über eine kritische Lücke in mehreren verbreiteten Coding-Agenten und Kommandozeilen-Werkzeugen Zugriff erlangen. Jeder Agent ist ein Zugang zu Ihren Systemen, und ein Agent mit Vollzugriff auf alle Werkzeuge ist im Zweifel der bequemste Weg hinein. Ein begrenzter Werkzeug-Scope ist deshalb gleichzeitig Kostenschutz und Angriffsflächenschutz.

Ein kompakter Baustein für den Budget-Regler, direkt als Code-Node in n8n einsetzbar:

// n8n Code-Node: Vorgang abbrechen, wenn Kosten- oder Schrittgrenze erreicht ist
const item = $input.first().json;

// Preise je 1 Mio Tokens, zentral pflegen und nicht im Prompt
const PRICE_IN = 1.5;
const PRICE_OUT = 6.0;

const MAX_STEPS = 8;
const MAX_COST_PER_RUN = 0.35;
const DAILY_BUDGET = 12.0;

const steps = Number(item.steps || 1);
const tokensIn = Number(item.usage?.input_tokens || 0);
const tokensOut = Number(item.usage?.output_tokens || 0);

const cost =
  (tokensIn / 1000000) * PRICE_IN + (tokensOut / 1000000) * PRICE_OUT;

const todayCost = Number(item.budget?.spentToday || 0) + cost;

const reasons = [];
if (steps > MAX_STEPS) reasons.push("Schleifenlimit erreicht (" + steps + ")");
if (cost > MAX_COST_PER_RUN) reasons.push("Kosten je Vorgang ueberschritten");
if (todayCost > DAILY_BUDGET) reasons.push("Tagesbudget ausgeschoepft");

const escalate = reasons.length > 0;

// Bei Eskalation: Vorgang an einen Menschen uebergeben, nicht weiterlaufen lassen
return [
  {
    json: {
      ...item,
      cost: Number(cost.toFixed(4)),
      spentToday: Number(todayCost.toFixed(4)),
      escalate,
      escalateReason: reasons.join("; "),
    },
  },
];

Praxistipp: Setzen Sie den Werkzeug-Scope enger, als es sich richtig anfühlt. Ein Agent, der nicht an die Lohnbuchhaltung kommt, kann dort auch keine Kosten verursachen und keine Daten verlieren. Erweitern lässt sich ein Recht in fünf Minuten, ein Vorfall braucht Wochen.

In einer Woche zum Kosten-Deckel

Sie brauchen dafür keine Plattform und kein Budget. Fünf Schritte, verteilt auf eine Arbeitswoche, bringen einen Agenten von Blindflug auf belastbare Zahlen.

Schritt 1: Kosten je Vorgang erfassen, für sieben Tage. Nehmen Sie den Agenten mit dem größten Verbrauch. Schreiben Sie für jeden Vorgang die Token-Zahlen aus der Antwort, die Zahl der Werkzeugaufrufe und das Ergebnis in eine Tabelle. Mehr nicht. Diese eine Woche liefert die Grundlage für alles Weitere.

Schritt 2: Ausreißer suchen, nicht Durchschnitte. Öffnen Sie die fünf teuersten Vorgänge. In fast jedem Fall finden Sie dort eine Schleife, ein übergroßes Dokument oder ein Werkzeug mit Fehlern. Beheben Sie zuerst diese Ursache. Erfahrungsgemäß liegt darin der größte Einzeleffekt auf die Monatsrechnung.

Schritt 3: Zwei Regler setzen. Beginnen Sie mit Schleifenlimit und Modell je Schritt. Diese beiden ändern nichts an der Qualität für normale Vorgänge, senken aber die Ausreißer nach oben. Prüfen Sie nach drei Tagen die Kosten je erfolgreichem Vorgang und die Eskalationsquote.

Schritt 4: Ein Deckel mit Alarm. Legen Sie ein Tagesbudget fest und lassen Sie sich bei 80 Prozent Verbrauch benachrichtigen, nicht erst beim Überschreiten. Ein Alarm, der vor der Grenze kommt, erlaubt eine Entscheidung. Ein Alarm danach liefert nur eine Erklärung.

Schritt 5: Eine Zahl in den Wochenbericht. Nehmen Sie die Kosten je erfolgreichem Vorgang und die Eskalationsquote in Ihren bestehenden Bericht auf. Sobald diese Zahl sichtbar ist, wird jede Diskussion über Modellwechsel, Promptänderungen und Ausbau eine Diskussion über Wirkung statt über Gefühl.

Fazit

Die Modellrechnung ist bei KI-Agenten der kleinste Kostenblock, nicht der größte. Die entscheidenden Posten entstehen in der Schleife, in der Nacharbeit und in den Werkzeugaufrufen, die niemand zählt. Gleichzeitig beruht die Vorstellung, dass ein Agent unkontrolliert Tokens verbrennt, auf einer vermeidbaren Ursache: fehlenden Reglern. Schleifenlimit, Modell je Schritt, Kontext-Deckel und ein Budget mit Rechten und Identität sind zusammen an einem Tag eingebaut.

Der Gewinn dieser Arbeit ist nicht nur die gesenkte Rechnung. Wer Kosten je Vorgang kennt, kann jederzeit begründen, warum ein Agent wirtschaftlich ist, und bei steigender Eskalationsquote gegensteuern, bevor die Ersparnis kippt. Genau dieser Nachweis unterscheidet im Mittelstand ein Automatisierungsprojekt, das bleibt, von einem, das nach dem ersten teuren Monat eingestellt wird.

Der Markt signalisiert dieselbe Richtung. Beobachter wie Splunk erklären Kontrolle zum Burggraben, Zahlungsnetzwerke arbeiten an Standards zur Identifikation von Agenten, und Plattformen entscheiden, welche Agenten Zugang bekommen. Sichtbarkeit und Begrenzung werden zur Voraussetzung, um überhaupt teilnehmen zu dürfen. Wie viele Ihrer automatisierten Vorgänge könnten Sie heute in Euro beziffern?

Über MadeByBrain: Wir bauen KI-Automatisierung für den Mittelstand – eigene AI-Agenten, n8n-Workflows und GEO-Strategien, live im Einsatz. Von der ersten Idee bis zur produktiven Automatisierung.

Jetzt kostenloses Strategiegespräch vereinbaren →

Dieser Beitrag ist auch verfügbar in:

Ähnliche Beiträge