AX Optimize.
LLM-Token-Kosten messbar senken — Kontext-Kompression auf Open-Source-Basis, plus Kosten-Governance.
Agenten-Läufe blähen sich auf: Tool-Outputs, Logs, RAG-Chunks und lange Konversationen fließen Runde für Runde in den Kontext — und jeder Token kostet. AX Optimize senkt diese Kosten messbar, indem es den Kontext-Ballast komprimiert, bevor er ans Modell geht. Im realen Lauf oben: 66,8 % weniger Tokens bei erhaltener Antwortqualität.
$ ax-optimize --file agent-session.json --price-per-mtok 3 --monthly-runs 5000 AX Optimize — Token-Reduktion Tokens: 16.049 → 5.321 (−66,8 %) Gespart: 10.728 Tokens pro Lauf Transforms: log, smart_crusher (User-Nachrichten geschützt) Kostenschätzung (Input-Tokens): bei 3,00 €/1M Tokens, 5.000 Läufen/Monat: ~160,92 €/Monat · ~1.931,04 €/Jahr # Reduktion ist input-abhängig: Tool-Outputs/Logs hoch, dichte Prosa gering.
Ehrlich eingeordnet: Die Kompressions-Engine ist Headroom (Open Source, Apache 2.0) — wir haben sie nicht erfunden, wir integrieren und betreiben sie. Sie schützt Ihre eigentlichen Nutzer-Nachrichten und komprimiert vor allem den maschinellen Ballast. Unser Beitrag (das AX-Delta) ist die Kosten-Story: Tokens gespart in Euro übersetzt und auf Ihr Volumen hochgerechnet — plus Modell-Routing und Kosten-Caps für eine echte Budget-Governance. Lokal-first: der Kontext verlässt Ihre Maschine nicht über uns.
Kontext-Kompression
Tool-Outputs, Logs und RAG-Inhalte werden über die Headroom-Engine verdichtet — User-Nachrichten bleiben geschützt.
Kosten-Hochrechnung
Gesparte Tokens werden in Euro übersetzt und auf Ihre Läufe pro Monat hochgerechnet — transparent als Schätzung gekennzeichnet.
Modell-Routing & Caps
Günstigere Modelle für einfache Schritte, harte Kosten-Caps pro Tag/Task — Budget-Governance statt Überraschung auf der Rechnung.
Lokal-first
Kompression läuft auf Ihrer Maschine. Der Kontext fließt nicht über uns ab — relevant bei sensiblen Daten.
- Messbare Token-Reduktion pro Lauf — typisch 60–95 % bei tool-/log-lastigem Kontext
- Euro-Hochrechnung auf Ihr Volumen (Monat/Jahr), transparent als Schätzung
- Einbindung via MCP-Tool oder als Proxy/Library in Ihre Agenten-Pipeline
- Lokal-first: Kontext bleibt auf Ihrer Infrastruktur
- Ehrliche OSS-Basis: Engine ist Headroom (Apache 2.0), Attribution inklusive — unser Wert ist Integration, Routing, Kosten-Governance
Leidet die Antwortqualität unter der Kompression?
Wie viel spart das real?
Verlässt unser Kontext die eigene Infrastruktur?
Was ist Ihr Anteil gegenüber dem Open-Source-Projekt?
Verwandte Rollen & Lösungen
Passt zusammen
AX Optimize — passt das zu Ihrer Situation?
Im kostenlosen Erstgespräch klären wir, ob diese Leistung Ihr Problem trifft — oder ob ein anderer Weg schneller zum Ziel führt. Ehrliche Einschätzung inklusive.
Erstgespräch vereinbaren