2026年6月22日

ローカルAIモデルとカスタムスキルでトークンコストを90%削減した方法(そしてなぜ切り替えたのか)

Andrea Borghi による
ローカルAIモデルとカスタムスキルでトークンコストを90%削減した方法(そしてなぜ切り替えたのか)

ホスティング型モデルプロバイダーからの前月の請求書は4,200ドルで、その約半分は顧客の成果に紐づけられない支出でした。その一つの項目が、私たちに社内エージェントの思考方法・ルーティング・知能への支払い方を再構築させるきっかけとなりました。3ヶ月が経ち、私たちはよりスリムに、より速く、より安価に運用できています。そしてその手順は、カンファレンスで語られるほど難しいものではありません。

最初の一歩は、すべてのタスクが最上位モデルに値するわけではないと認めることでした。単純な分類・整形・スキーマチェックを小型のローカルモデルに振り向けたことで、精度が重要な場面を失うことなく、処理量の大半を捌けるようになりました。高価なホスティング型呼び出しは、本当に難しい推論作業——戦略のフレーミング、ニュアンスのある統合、例外ケース——にだけ温存しました。原則は地味ですが強力です。コストを、その答えの価値に合わせましょう。

二つ目の転換点は、エージェントのスキルをチャットではなくコードとして扱うことでした。各スキルは明示的な入力と出力を持つ小さくてテスト可能な関数です。スキルがきちんと定義されていれば、超小型のローカルモデルでも安定して実行でき、その結果をキャッシュできます。1週間も経つと、そのキャッシュされた呼び出しとローカルで処理された呼び出しが、節約効果を複利のように積み上げます。ホスティング型モデルは「既定」から「フォールバック」へと立場を下げました。

三つ目に、私たちはトークンを単なる見栄えの指標ではなく予算のように計測しました。すべてのワークフローにおける「解決済みタスクごとのコスト」を追跡し、ベースラインを上回らないものは出荷しないと決めました。これにより、どのプロンプトが実際に成果を上げ、どのプロンプトが空虚な内容をプレミアム価格で買っているのかについて、率直な対話が生まれました。パイプライン内の驚くほど多くの「知的な処理」が、7Bパラメータのモデルが楽にこなせる反復的な boilerplate でした。

四つ目に、すべてのエージェントに「意図的にエスカレーションする」能力を与えました。ローカル優先を基本としつつ、確信度が低いときにはより強力なモデルへ明確に文書化されたパスでエスカレートできるようにしました。エスケープハッチが本物だからこそチームはこのシステムを信頼し、ほとんどの呼び出しがそこに到達しないからこそ予算も信頼しています。

最後に、私たちはデモのための最適化を止め、火曜日の午後2時のための最適化を始めました。現実のワークフロー、現実のレイテンシ予算、現実のコスト上限。ローカルモデルと規律あるスキル設計が真価を発揮するのは、まさにそこです。

もしチームの成果と整合しない利用ダッシュボードを前にしているなら、その解決策は別の契約交渉ではありません。最も呼び出し量の多い処理をマッピングし、単純なものはローカルへルーティングし、残りは再利用可能なスキルとして形式化し、すべてのワークフローにタスクごとのリアルなコスト数値を載せるところから始めてください。90%の削減はマーケティング的な主張ではなく、雑用に最上位モデルの価格を払い続けるのをやめたときに自然に出てくる結果です。

インフラにコミットする前に「取り組みやすい成果」を見つけるために私たちが使っている、1ページの簡易監査チェックリストをご希望ですか?購読いただければ、金曜日にそのワークシートをお送りします。