Zum Inhalt springen

Token-Nutzung und Kosten in OpenClaw verstehen

Du kennst das Problem: Du arbeitest intensiv mit LLMs und plötzlich ist das Context-Limit erreicht oder die API-Rechnung am Ende des Monats überrascht dich negativ. Es ist oft schwer nachzuvollziehen, welche Teile deines Prompts eigentlich den meisten Platz einnehmen und wie viel eine einzelne Interaktion gerade gekostet hat.

OpenClaw hilft dir dabei, diese Blackbox zu öffnen. Das System trackt Tokens statt Zeichen, wobei ein Token bei englischen Texten im OpenAI-Stil etwa vier Zeichen entspricht.

  • Eine laufende OpenClaw-Instanz
  • API-Zugriff (API Key für Kostenschätzungen oder OAuth)
  • Konfigurierte Provider in der models.providers Sektion

In nur 5 Minuten hast du den vollen Überblick über deinen Verbrauch. Nutze diese Chat-Befehle direkt im Interface:

  1. Status prüfen: Tippe /status, um eine Card mit dem aktuellen Modell, der Context-Nutzung und den geschätzten Kosten der letzten Antwort zu sehen.
  2. Footer aktivieren: Nutze /usage tokens oder /usage full, damit OpenClaw unter jeder Antwort automatisch den Verbrauch einblendet.
  3. Context analysieren: Mit /context list oder /context detail siehst du genau, wie viele Tokens für den System-Prompt, Tools oder Anhänge verbraucht werden.
  4. Kosten-Check: Tippe /usage cost, um eine Zusammenfassung der Kosten aus deinen lokalen Session-Logs abzurufen.

Alles, was an das Modell gesendet wird, belegt Platz im Context-Window. OpenClaw baut den System-Prompt bei jedem Durchlauf dynamisch zusammen. Dazu gehören die Tool-Liste, Metadaten deiner Skills, Workspace-Dateien wie AGENTS.md oder USER.md sowie Runtime-Metadaten (OS, Zeit, Modell).

Zusätzlich zählen diese Elemente zum Limit:

  • Der gesamte Gesprächsverlauf
  • Tool-Aufrufe und deren Ergebnisse
  • Anhänge wie Bilder, Audio oder Transkripte
  • Zusammenfassungen aus der Compaction

Provider wie Anthropic bieten Prompt Caching an, was die Kosten für wiederkehrende Inhalte massiv senkt. OpenClaw nutzt dies durch Cache-TTL Pruning. Wenn die Cache-TTL abläuft, wird die Session bereinigt und das Fenster zurückgesetzt, damit der nächste Request den Context frisch cachen kann.

Mit einem Heartbeat kannst du den Cache “warm” halten. Wenn dein Modell eine Cache-TTL von 60 Minuten hat, sorgt ein Heartbeat alle 55 Minuten dafür, dass der Cache nicht verfällt.

Hier ist ein Beispiel für die Konfiguration in deiner YAML-Datei:

agents:
defaults:
model:
primary: "anthropic/claude-opus-4-6"
models:
"anthropic/claude-opus-4-6":
params:
cacheRetention: "long"
heartbeat:
every: "55m"
  • Kosten werden nicht angezeigt: Wenn du OAuth nutzt, versteckt OpenClaw die Dollar-Beträge und zeigt nur Tokens an. Prüfe zudem, ob in deiner Konfig unter models.providers.<provider>.models[].cost die Preise für input und output (pro 1M Tokens) hinterlegt sind.
  • Hohe Cache-Kosten: Cache-Writes sind oft teurer als normale Input-Tokens. Wenn deine Sessions oft lange inaktiv sind und dann die TTL ablaufen lassen, entstehen hohe Schreibkosten. Nutze den Heartbeat oder passe die Pruning-Einstellungen im Gateway an.
  • Nutze /compact, um lange Konversationen zusammenzufassen.
  • Halte Skill-Beschreibungen kurz, da die gesamte Skill-Liste in den Prompt injiziert wird.
  • Kürze große Tool-Outputs in deinen Workflows.
  • Verwende für einfache Aufgaben kleinere Modelle.

Hast du Fragen zur Einrichtung? Nutze den AI Setup Assistant.

OpenClaw

OpenClaw Expert

Noch festgefahren?

Wenn diese Seite nicht hilft, frage OpenClaw Expert nach Schritt-fuer-Schritt-Loesungen.