2026年6月24日

AIトークンへの過払いをやめる: 請求額を90%削減したローカルモデルスタック

Andrea Borghiによる
AIトークンへの過払いをやめる: 請求額を90%削減したローカルモデルスタック

6か月前、ホスト型言語モデルの月額請求は、経理が思わず確認したくなるような金額でした。今ではその10分の1ですし、モデルは公開インターネット経由だった頃よりも自社ハードウェア上で高速に動いています。値引き交渉をしたわけではありません。より安いプランに切り替えたわけでもありません。モデルを自分たちの手元に戻したのです。

この変化は実験として始まり、やがてスタックへと育ちました。ネットワークのエッジにある1台の一般向けマシンで動く、厳選した少数のオープンウェイトモデルが、今では推論トラフィックの大半を処理しています。クラウドモデルは今も使っていますが、本当に必要な作業だけです。それ以外はすべてローカルで動作し、削減分はそのまま利益に反映されます。

最初の教訓は、すべてのプロンプトにおいて大きいことが優れているわけではない、ということでした。700億パラメータのモデルは印象的ですが、日常的な要約、分類、構造化抽出には明らかに過剰です。実際のトラフィックを分析したところ、リクエストの約10件中7件は定型的なものでした。ファインチューニングした70億パラメータモデルで、それらを低遅延かつトークン単価ゼロで処理できました。慣習ではなくタスクでルーティングすることが、突破口でした。

2つ目の教訓はハードウェアについてです。私たちは加速器のラックが必要になると考えていました。しかし実際には、十分なVRAMを備えた最新GPU 1枚で、量子化したモデルを2〜3個同時に保持でき、ピーク負荷を十分にさばけました。4ビット重みへの量子化により、品質は測定可能だが許容範囲内の低下にとどまり、その代わりに莫大なメモリとスループットを取り戻せました。優先度の低い長い尻尾のジョブには、より小さなモデルを使うCPU専用のフォールバックを用意し、GPUが使用中でもシステムの応答性を保ちました。

3つ目の教訓はキャッシュでした。同じコンテキストウィンドウを何度も再評価すると、トークンコストは雪だるま式に増えます。推論層の前にセマンティックキャッシュを追加し、ほぼ重複するプロンプトにはモデルに触れることなく保存済みレスポンスを返せるようにしました。不要な履歴を削るプロンプトテンプレートと組み合わせることで、キャッシュヒット率は数週間で40%を超えました。

4つ目の教訓は可観測性でした。モデル別のレイテンシ、100万トークンあたりのコスト、品質のスポットチェック用ダッシュボードがなければ、最適化は推測にすぎません。すべての呼び出しを計測し、どのルートが利益を生み、どのルートが静かに予算を食い潰しているのかを正確に見えるようにしました。

得られる価値と合わなくなったモデル請求書を前にしているなら、道筋は明快です。実際に送っているものを分析し、タスクに合わせてモデルサイズを適正化し、積極的に量子化し、重複をキャッシュし、徹底的に測定することです。クラウドは難しいケースのために残します。それ以外はすべて自分のデスクで動かせます。

このやり方であなたのトラフィックがどう見えるか気になりますか?上位3つのモデル用途を返信してください。私たちが最初に使うルーティングの内訳を共有します。