Unsere letzte monatliche Rechnung eines gehosteten Modellanbieters belief sich auf $4,200, und fast die Hälfte davon entfiel auf Ausgaben, die wir nicht auf ein Kundenergebnis zurückführen konnten. Dieser eine Posten zwang uns dazu, neu aufzubauen, wie unsere internen Agents denken, weiterleiten und für Intelligenz bezahlen. Drei Monate später arbeiten wir schlanker, schneller und günstiger — und der Ansatz ist einfacher, als es der Konferenzzirkus klingen lässt.
Der erste Schritt war anzuerkennen, dass nicht jede Aufgabe ein Frontier-Modell verdient. Ein kleines lokales Modell für einfache Klassifizierung, Formatierung und Schema-Prüfungen übernahm den Großteil unseres Volumens, ohne bei den entscheidenden Punkten an Genauigkeit zu verlieren. Die teuren gehosteten Aufrufe reservierten wir für die wirklich schwierige Denkarbeit — strategische Einordnung, nuancierte Synthese und Sonderfälle. Das Prinzip ist unspektakulär, aber wirkungsvoll: Die Kosten des Aufrufs sollten dem Wert der Antwort entsprechen.
Der zweite Schritt war, Agent-Skills als Code zu behandeln, nicht als Chat. Jeder Skill ist eine kleine, testbare Funktion mit klar definierten Eingaben und Ausgaben. Wenn ein Skill sauber definiert ist, kann ein winziges lokales Modell ihn zuverlässig ausführen, und wir können das Ergebnis zwischenspeichern. Über eine Woche hinweg sind es genau diese gecachten und lokal bereitgestellten Aufrufe, bei denen sich die Einsparungen summieren. Das gehostete Modell wird zum Fallback, nicht zum Standard.
Drittens haben wir Token wie ein Budget gemessen, nicht wie eine Eitelkeitskennzahl. Wir verfolgten die Kosten pro gelöstem Task über jeden Workflow hinweg und weigerten uns, irgendetwas auszurollen, das nicht besser als eine Baseline abschnitt. Das zwang zu ehrlichen Gesprächen darüber, welche Prompts tatsächlich ihren Beitrag leisteten und welche Premiumpreise für Füllmaterial zahlten. Erstaunlich viel der „Intelligenz“ in unserer Pipeline war repetitive Standardprosa, die ein 7B-Parameter-Modell problemlos bewältigt.
Viertens gaben wir jedem Agent die Möglichkeit, bewusst zu eskalieren. Local-first mit einem klar dokumentierten Weg zu einem stärkeren Modell, wenn die Zuversicht gering ist. Das Team vertraut dem System, weil die Notfalloption real ist, und das Budget vertraut dem System, weil die meisten Aufrufe sie nie erreichen.
Schließlich hörten wir auf, für die Demo zu optimieren, und begannen, für den Dienstag um 14 Uhr zu optimieren. Echte Workflows, echte Latenzbudgets, echte Kostengrenzen. Dort zahlen sich lokale Modelle und diszipliniertes Skill-Design wirklich aus.
Wenn Sie auf ein Nutzungs-Dashboard starren, das sich nicht mit dem Wert deckt, den Ihr Team liefert, ist der Weg nach vorn nicht der nächste Vertragsnachtrag. Beginnen Sie damit, Ihre Aufrufe mit dem höchsten Volumen zu kartieren, leiten Sie die einfachen lokal weiter, formalisieren Sie den Rest als wiederverwendbare Skills und setzen Sie für jeden Workflow eine echte Kosten-pro-Task-Zahl an. Die Reduzierung um 90% ist kein Marketingversprechen — sie ergibt sich, wenn man aufhört, Frontier-Preise für Routineaufgaben zu zahlen.
Möchten Sie eine Checkliste für den ersten Audit, die wir nutzen, um die einfachen Erfolge zu finden, bevor wir in Infrastruktur investieren? Abonnieren Sie, und wir senden Ihnen am Freitag das einseitige Arbeitsblatt.
