LLMコストを抑えるダッシュボードを作ったら、私たちの実践のあり方まで変わった
ヨガのクラスでは、ポーズを無理に形づくろうとするのをやめて、ただ身体が何をしているかを気づく瞬間があります。股関節が硬い。呼吸が浅い。肩で代償している。その気づきの瞬間 — বিচারなく、正確に — こそが変化の始まりです。力づくではなく、気づくことから。
私たちが AI Model Pricing Dashboard を作った理由も、まったく同じです。Large Language Models にもっとお金を使いたかったからではありません。むしろ、私たちがすでに何にどれだけ使っているのかを、正直に、正確に言えなかったからです。チームの誰も把握していませんでした。請求書は届くのに、単純な問いに誰も答えられなかったのです。実際にどのモデルを使っていて、プロバイダーごとのコストはいくらなのか?
その裏にある混乱
複数のプロバイダーにまたがって AI ワークロードを運用したことがあるなら、その大変さはよくわかるはずです。OpenRouter はトークン単位で独自の料金を課し、OpenAI は入力トークンと出力トークンを別々の価格に分けています。Anthropic には独自の構成があります。Kilo AI Gateway は、超過分の計算を含むサブスクリプションプランを重ねています。各プロバイダーはトークンの数え方が異なり、各プロバイダーはリリースノートもなしに価格表を変更します。
これは、5つの異なる言語で書かれた5冊の本を読みながらヨガを練習しようとしているようなものです。そのどれもが "Downward Dog" の意味に同意していません。どうにか進めることはできます。ですが、身体は代償します。そして代償にはコストがあります。インフラ側ではお金として支払い、マットの上ではアライメントとして支払うのです。
ダッシュボードができること
AI Model Pricing Dashboard はオープンソースのツールです — BSD 3-Clause、MIT にも親和性があります — FastAPI のバックエンドと Next.js のフロントエンドで構築されています。10以上の LLM プロバイダーにまたがる価格を集約し、すべてを百万トークンあたりのドルに正規化し、比較を簡単にする単一のフィルタ可能で並べ替え可能な表を提供します。
しかし本当の価値は表そのものではありません。本当の価値は、その表が何を明らかにするかです。
入力トークンと出力トークンの計算。 ほとんどのチームは "1回あたりのコスト" で考えます。しかし、現代の LLM 利用では出力トークン — モデルの応答 — が支配的です。入力トークン100万あたり $2 で、出力トークン100万あたり $15 のモデルは、それぞれ $5 と $6 のモデルとはまったく異なるコスト構造を持っています。ダッシュボードはそれを即座に可視化します。
コンテキストウィンドウの意味。 128K のコンテキストウィンドウを持つモデルは、4K のモデルよりトークン単価が高く見えるかもしれません。ですが、長いプロンプトを処理するために安価なモデルへ複数回の呼び出しをつないでいるなら、大きなコンテキストウィンドウを持つ高価なモデルのほうが実際には安く、しかもより良い結果を出します。
トレンドの追跡。 価格は変わります。ダッシュボードは30日間の価格履歴を保存します。つまり、次の請求書に反映される前にプロバイダーの価格変更を把握できるということです。
Kilo プランの予測。 Kilo AI Gateway のユーザーなら、ダッシュボードは実際の利用状況を各ティアに照らし合わせ、超過分を含めた総コストを最小化するプランを示します。
その下のアーキテクチャ
このシステムは Postgres と Redis 上で動作し、本番デプロイには Kubernetes のマニフェストを使っています。FastAPI のバックエンドは 900 秒の Redis キャッシュで価格集約を処理します。これはリアルタイムのダッシュボード利用には十分高速で、プロバイダー API にはやさしい設計です。CronJob は15分ごとに価格を更新し、毎日 9 AM UTC にメールレポートを送信します。
ローカル開発では、docker-compose.yaml ひとつでスタック全体 — Postgres、Redis、API、Next.js フロントエンド — を2分以内で起動できます。
私たちが Kubernetes を選んだのは、ダッシュボードに巨大なスケールが必要だからではありません。デプロイのパターンが退屈であるべきだからです。Ingress には Traefik、TLS には cert-manager、API と web のレプリカには水平ポッドオートスケーリング。退屈なのは信頼できるからです。予算判断にこのツールを使うなら、必要なのはまさにその信頼性です。
ヨガとダッシュボードが交わるところ
ここは、どんなアーキテクチャブログも教えてくれない部分です。コスト最適化とヨガは、同じ最初の一歩を共有しています。
ヨガでは、気づきが変化に先立つ と言います。アライメントが崩れた股関節に気づいていなければ、修正はできません。慢性的に食いしばった顎に気づいたことがなければ、ゆるめることもできません。気づくことが練習です。気づくことから主体性が始まります。
このダッシュボードは、私たちが気づいたからこそ存在します。初めて、AI ワークロードの実際のコストを、正確に、正直に把握できました。推定でもなく、「なんだか高そうだ」という曖昧な感覚でもなく、数字として。そして、数字があれば意思決定ができます。このワークロードにはプロバイダーを切り替えるべきか? 重要でないタスクにはもっと安いモデルを使うべきか? もっと積極的にキャッシュすべきか? より大きなコンテキストウィンドウを持つモデルを選んで、呼び出しの連鎖をなくすべきか?
そうした判断のどれも、以前は見えていませんでした。データが存在しなかったからではありません。それが5つのプロバイダーダッシュボード、3つの請求ページ、そして誰も更新しないスプレッドシートに散らばっていたからです。
私たちはスクレイパーを作りました。正規化処理を作りました。ダッシュボードを作りました。そして最初の1週間で、4か月間続いていた $40/月 の非効率を見つけました。見ていなかっただけで、$160 を使っていたのです。ダッシュボードのセットアップ費用は、夕方の数時間よりも安く済みました。
データから学んでいること
ダッシュボードを導入して以来、私たちの運用は3つの点で変わりました。
タスクに応じた適正化。 今では、ブランドの好みではなく、実際のタスク単価に基づいて、特定のモデルを特定のタスクに割り当てています。繰り返しが多く複雑さの低いタスクは、より安く速いモデルへ。複雑な推論タスクは、品質が価格に見合う先へ。これは新しい考えではありません。身体がその日に本当に必要としているものに応じて、リストラティブな練習を選ぶか、パワーフローを選ぶかを決めるのと同じ原理です。
プラーナーヤーマとしてのキャッシュ。 ヨガでは、プラーナーヤーマ(呼吸法)は、ひと息ひと息を意味あるものにする実践です。量は少なく、意図は深く、酸素交換はより良く。LLM の応答をキャッシュするのも同じ考え方です。同じプロンプトが同じ出力を生むなら、それを保存します。同じ計算に二度お金を払う必要はありません。900 秒 TTL の Redis キャッシュにより、同じトークンの再利用コストはおよそ30%削減されました。より少なく呼吸して、より多く得る。
トレンドへの気づき。 30日間の価格トレンドを追跡することで、プロバイダーの価格引き下げを、そのニュースに関するブログ記事より先に把握できます。あるプロバイダーが料金を20%下げれば、1時間以内にわかります。料金を上げた場合も、次の請求サイクルの前に見直せます。気づき。主体性。決断。
オープンソースにする理由、それは道具の囲い込みがよくないヨガだから
このプロジェクトは GitHub 上で MIT ライセンスです: github.com/andreab67/ai-models-pricing。Kubernetes のマニフェストも含まれています。API ドキュメントは FUNCTIONAL.md にあります。SBOM — すべての依存関係、そのライセンス、セキュリティメモ — は SBOM.md にあります。
これをオープンソースにしたのは、この問題が私たちだけのものではないからです。複数プロバイダーの AI ワークロードを運用するすべてのチームが、この問題を抱えています。そして、有用なツールを囲い込むのは、ヨガの比喩で言えば、役に立つポーズを学生に教えるのを拒むようなものです。共有しても練習は損なわれません。むしろ深まります。
今週のひとつの行動
もしあなたのチームが LLM ワークロードを運用していて、「プロバイダーごと、タスクごとに何にいくら使っているのか」にすぐ答えられないなら — それは代償しているということです。悪くではなく、ただ高くついているだけです。
ダッシュボードをローカルで立ち上げてください。Docker なら2分です。実行して、数値を見てください。そして、その数値に、まだ気づいていなかった何かを語らせてください。
それから決めるのです。
それはマットの上で私たちが行う実践と同じです。到着し、気づき、選ぶ。道具は変わっても、原理は変わりません。
AI Model Pricing Dashboard は github.com/andreab67/ai-models-pricing でオープンソースとして公開されています。本番環境は私たちの Kubernetes クラスター上で動作しています。導入の支援や、独自のコストアラート用パイプラインとの統合をご希望なら、ご連絡ください。
