本質的には個人用チャットボットに対して月額 $400 のクラウド請求が来ることは、以前は妥当だと感じられました。ところが、同じ処理は、すでに手元にある中古のグラフィックカード、つまり1日あたり数セント分の電気代で済むハードウェアで動くと気づくのです。ローカルAIのコスト構造は、もはや理論ではありません。AIをめったにない用事ではなく日常のインフラとして扱う人にとっては、まったく別の経済モデルです。そして、その層を見ていくと、前進の道筋は驚くほどシンプルになります。
最初の層はハードウェアの最低ラインで、ほとんどの人が思っているより低いです。整備済みの RTX 3090 は、ゲーム用途では2〜3年前の型落ちですが、量子化された700億パラメータのモデルを実用的な速度で動かします。統合メモリを備えた Mac Studio なら、同様の負荷をより少ない手間で処理できます。初期費用は一度きりの出費ですが、すぐに回収できますし、こうしたカードは10年にわたって同じ役割を果たし続けるため、減価償却の曲線も穏やかです。
第二の層はモデルそのものです。オープンウェイトのモデルは、実際に多くの人が行う作業、つまり下書き作成、要約、分類、散らかったテキストからの構造化データ抽出で、急速に追いついてきました。妥協しているわけではありません。誰か他人のシリコン上で時間を借りるのではなく、自分のハードウェア予算に合うモデルを選んでいるのです。量子化版は、わずかな品質低下と引き換えにメモリ使用量を大きく減らしますが、個人向けの構成では、ほとんど常にこちらのほうが適切な選択です。
第三の層はランタイムとオーケストレーションのソフトウェアです。llama.cpp、Ollama、vLLM、および同様のプロジェクトにより、モデルの提供はワンラインコマンドになりました。モデルがローカルで動き始めれば、それを自分のツールに公開するのは簡単です。「このPDFを要約して」といった作業を一打鍵で済む自動化に変えるカスタムスキルは、ホスト先のエンドポイントに接続するのと同じようにローカルのエンドポイントへ接続できます。統合コストは実質ゼロです。
第四の層はワークフロー設計です。人が犯しがちな間違いは、ローカルAIをクラウドの代替とみなし、あらゆる非効率をそのまま再現してしまうことです。成果が出るのは、繰り返し使うプロンプトをキャッシュし、似た作業をまとめて処理し、GPU を誰も待っていない夜間に重い処理を走らせることです。ローカル構成は、クラウドでは決して得られなかった形で、少しのエンジニアリング上の丁寧さに報いてくれます。
第五の層、そして多くの人が飛ばすのが、測定です。実際の使用状況を追跡してください。個人向けAIユーザーの大半は、利用可能な計算資源のごく一部しか使っていません。実数が見えれば、経済性を無視することはできなくなります。
興味があるなら、まずは小さく始めてください。オープンウェイトのモデルを取得し、手元にある機材で動かし、個人的なワークフローを一つそこに向けてみましょう。コミュニティの解説やベンチマークは参考になりますが、最も重要な指標は、それがあなたの仕事をこなせるかどうかだけです。必要になれば、クラウドはそのときもまだあります。個人用スタックが実際に行うことの多くにおいては、必要ないでしょう。
