2026年6月22日

ローカルAIモデルとカスタムスキルでトークンコストを90%削減した方法(そして私たちが乗り換えた理由)

Andrea Borghiによる
ローカルAIモデルとカスタムスキルでトークンコストを90%削減した方法(そして私たちが乗り換えた理由)

ホスト型モデル提供元から届いた前回の月額請求額は$4,200で、そのほぼ半分は顧客成果に結びついていると追跡できない支出でした。その1件だけで、社内エージェントが情報をどのように考え、振り分け、知能に対価を支払うのかを再構築することになりました。3か月経った今、私たちはより軽く、より速く、より安く運用できています。そして、その実践法はカンファレンスの場で語られるほど複雑ではありません。

最初の変化は、すべてのタスクにフロンティアモデルが必要なわけではないと認めたことでした。単純な分類、フォーマット、スキーマチェックを小さなローカルモデルに振り分けることで、重要な精度を落とすことなく、大半の処理量をさばけました。高価なホスト型呼び出しは、本当に難しい推論作業、つまり戦略の構成、ニュアンスのある統合、エッジケースに限定しました。原則は地味ですが強力です。呼び出しのコストを回答の価値に見合ったものにすることです。

2つ目の変化は、エージェントのスキルをチャットではなくコードとして扱ったことでした。各スキルは、入力と出力が明確な、小さくテスト可能な関数です。スキルが明確に定義されていれば、小さなローカルモデルでも確実に実行でき、その結果をキャッシュできます。1週間単位で見ると、こうしたキャッシュ済みの呼び出しとローカル提供の呼び出しが節約を積み上げます。ホスト型モデルは既定ではなく、フォールバックになります。

3つ目に、トークンを見栄えの指標ではなく予算として測定しました。すべてのワークフローで解決済みタスクあたりのコストを追跡し、ベースラインを上回れないものは一切リリースしませんでした。これにより、どのプロンプトが本当に成果を出しているのか、どれが付け足しのために高額な料金を払っているだけなのかについて、率直な議論をせざるを得なくなりました。私たちのパイプラインにある「知能」の驚くほど多くは、7Bパラメータのモデルで十分に処理できる反復的な定型文でした。

4つ目に、すべてのエージェントに、意図的にエスカレーションできる能力を持たせました。信頼度が低いときは、より強力なモデルへ移行できる、明確で文書化された経路を持つローカルファーストです。チームがこのシステムを信頼しているのは、逃げ道が本当にあるからであり、予算がこのシステムを信頼しているのは、ほとんどの呼び出しがそこに到達しないからです。

最後に、私たちはデモ向けの最適化をやめ、Tuesday at 2pm の実運用に最適化するようになりました。実際のワークフロー、実際のレイテンシ予算、実際のコスト上限。そこにこそ、ローカルモデルと規律あるスキル設計の価値があります。

自分たちが出している価値と使用状況ダッシュボードが噛み合っていないなら、次に取るべき道は別の契約交渉ではありません。まずは最も件数の多い呼び出しを洗い出し、単純なものはローカルに振り分け、残りは再利用可能なスキルとして形式化し、すべてのワークフローに実際のタスク単価を設定してください。90%削減はマーケティング上の主張ではありません。雑務にフロンティア価格を払い続けるのをやめたときに、自然と生まれる結果です。

インフラに投資する前に、簡単な改善ポイントを見つけるために私たちが使っている初回監査チェックリストをご希望ですか?購読すると、金曜日に1ページのワークシートをお送りします。