2026年6月16日

AIトークンに払い過ぎるのはやめよう:ローカルモデルとカスタムスキルでコストを90%削減する方法

AIトークンに払い過ぎるのはやめよう:ローカルモデルとカスタムスキルでコストを90%削減する方法

ヨガには、驚くほどテクノロジーにも当てはまる静かな原則があります。それは、その瞬間に必要な努力だけを使うこと — それ以上でもそれ以下でもない、ということです。今日AIを運用している多くのチームは、その逆をしています。必要かどうかにかかわらず、すべての作業に最大限の労力を注ぎ、その特権に対してトークンごとに支払っているのです。

AIコストがなぜ上がり続けるのか、そしてどうすれば意図のある形に戻せるのかを見ていきましょう。

フロンティアモデルはトークンを消費するように作られている

AnthropicとOpenAIのフロンティアモデルは本当に目覚ましいものですが、その大きな理由のひとつは、最新世代が単純に1回のリクエストあたりでより多くの仕事をするからです。段階的に推論します。答える前に「考え」ます。より長く、多段階のエージェント的ループを回します。丁寧で、慎重で、文脈が豊かな応答を返します。

これは実際にユーザー体験の向上です。数年前の簡潔なモデルよりも、回答はより良く、より注意深く、より高い能力を持っています。ただし、それには明確にしておく価値のある構造的な副作用があります。

これらのモデルはトークンごとに課金され、しかもより多くのトークンを使うように設計されています。

より多い推論、より多い出力、より多い往復 — そのすべてが体験を向上させる一方で、消費も増やします。トークンを売る側のインセンティブと、買う側であるあなたのインセンティブは、同じ方向を向いていません。結果として、本来は一文で済む作業に対して、深い熟考の代金を支払うことになります。

それが実際にビジネスにとってどれくらいのコストか

1回のチャットでは、コストは目に見えません — ほんの一部のセントです。問題は規模です。

  • 1日に50,000件のメッセージを処理するカスタマーサポートのワークフロー。
  • 数百件の下書きを生成するコンテンツパイプライン。
  • 「じっくり考えさせる」ために、1件ごとに5回も6回もループする社内エージェント。

1回あたりのトークン使用量に推論のオーバーヘッドを掛け、それを件数で掛け、さらに30日で掛けます。デモでは驚くほど安く見えたワークフローが、実際には重大な継続的運用コストになります。そして、そのコストは機能や顧客を追加するたびに増えていきます。さらに厄介なのは、それが予測不能だということです。今月はより深く考えることを選んだモデルが、誰かが新しいコードを1行も出荷していないのに、静かに請求額を押し上げるのです。

小規模または中規模のビジネスにとって、本当の税金はこの予測不能性です。

ローカルな代替案:Ollama

ここで考え方を切り替えましょう。すべてのタスクにフロンティアモデルが必要なわけではありません。 実際、ほとんどのタスクでは不要です。

Ollama を使えば、Llama、Mistral、Qwen、その他多くの高性能オープンソースモデルを、自分のハードウェアや手頃なサーバー上で直接実行できます。いったん動き始めれば、1回のリクエストあたりの限界コストはほぼゼロになります。計算資源にはすでに支払っているので、トークンメーターが回り続けることはありません。

トレードオフとして、ローカルな 7B–30B モデルはフロンティアモデルほど広範に優秀ではありません。ですが、分類、抽出、要約、ルーティング、テンプレートに沿った下書きなど、定義が明確で反復可能な作業なら、小さなローカルモデルで十分すぎるほどです。重要なのは、どのタスクをローカルに残し、どのタスクをエスカレートさせるかを見極めることです。

AnythingLLMのカスタムスキル:本当のレバー

ここにこそ、節約の大半があります。

AnythingLLM は、ローカルモデル(Ollama経由)をドキュメント/RAGサポート付きのクリーンなワークスペースで包み込むオープンソースアプリケーションであり、さらに重要なことに、カスタムスキル システムを備えています。毎回同じタスクをモデルに一から推論させる代わりに、作業の反復可能な部分を決定論的なスキルとして実装します。つまり、予測可能に動き、APIを呼び出し、出力を整形し、本当に曖昧な判断だけをモデルに戻す実コードです。

結果はハイブリッドになります。

  • 決定論的なコード が、重くて反復的な作業を無料で、毎回、同じようにこなします。
  • モデル は、実際に判断が必要なタスクのごく一部にだけ呼び出されます。

同じ最終結果を、トークン消費のほんの一部で得られます — すでに知っているプロセスを言語モデルに再構築させるために、料金を払うのをやめたからです。

MCPサーバーの役割

小さなローカルモデルは、到達できる範囲があって初めて役に立ちます。その役割を担うのが MCP(Model Context Protocol)サーバー です。

MCPは、AIモデルをツール、データ、ライブシステム — データベース、ファイルストア、社内API、チケットシステム、CRM — に接続するためのオープン標準です。AnythingLLMはMCPサーバーをサポートしており、つまりローカルスタックは閉じたチャットボットではありません。クリーンで標準化されたインターフェースを通じて、実データを読み、実際のアクションを実行できるエージェントなのです。

これが、ローカルなアプローチを本格的な作業に使えるものにしている理由です。フロンティア側の提供者は、すべてを彼らのトークン計測付きコンテキストウィンドウの内部でやらせようとします。MCPは、データ、ツール、決定論的ロジックを自分たちの側に置いたままにし、本当に考える部分だけにトークンを使うことを可能にします。

実践的なヒント:標準スキルを最適化されたカスタムスキルとして書き換える

今フロンティアモデルに投げているタスクを取り出し、そのコストのほんの一部で動くように再構築する方法は次のとおりです。

  1. まずトークン消費を可視化する。 最も頻繁に実行される3〜5個のワークフローを見つけます。節約効果が積み上がるのはそこです。週に2回しか実行しないものを最適化しないでください。

  2. 決定論的な部分と曖昧な部分を分ける。 モデルが各呼び出しで実際に何をしているのかを確認します。毎回同じ部分 — データ取得、フォーマット適用、フィールド検証、ルーティング — に言語モデルは不要です。

  3. 決定論的な部分をコードに移す。 AnythingLLMのカスタムスキルでは、そのロジックはハンドラ関数になります。毎回同じように実行され、トークンコストはゼロです。

  4. プロンプトを判断部分まで縮める。 モデルには、本当に曖昧な質問だけを、答えるのに必要な最低限の文脈とともに渡します。毎回プロセス全体を言い直す必要はありません。入力が小さければ、出力も小さくなり、請求額も小さくなります。

  5. ライブデータはプロンプトではなくMCPで取得する。 必要なフィールドをオンデマンドで正確に取得できるMCPツールがあるのに、4,000トークンのドキュメントをそのままコンテキストに貼り付ける必要はありません。

  6. 難易度で振り分ける。 日常的な版はローカルのOllamaモデルで実行します。本当に難しい5%のためにだけフロンティアモデルを残し、いつエスカレートするかはスキル側で判断させます。

  7. 前後で測定する。 タスクあたりのトークン数を、導入前と導入後で追跡します。これを継続的に行うチームの多くは、最も件数の多いワークフローで80–95%の削減を見つけています。

意図を持った結論

フロンティアAIは、タスクが本当にそれを必要とするときには、費用を払う価値があります。間違いなのは、それをすべてのデフォルトにしてしまい、増え続けるように設計されたトークン単位のメーターに、気づかないうちに資金を流し続けることです。

定型作業はローカルで実行しましょう。反復可能なものはカスタムスキルとしてコード化しましょう。MCPで現実世界につなぎましょう。フロンティアモデルは、本当に必要な瞬間のために取っておきましょう。

それは手を抜くことではありません。その瞬間にふさわしい努力を使う、というだけのことです。実のところ、それはマットの上でもクラウドでも良い実践なのです。