StrategyCore
リソース一覧へ
21/AI・機械学習 約7分

日本でオープンウェイトLLMをオンプレミス運用する

ソブリンなLLM導入に実際に必要なもの:GPUのサイジング、提供スタック、エアギャップ、そして最新性の維持

モデルを自社内に保つと決めることと、それをうまく運用することは別物です。ソブリンなLLM導入とは、ホスト型APIが隠している運用作業を引き受けることを意味いたします。すなわち、ハードウェアのサイジング、提供スタックの運用、エグレスの制御、そしてモデルの最新性の維持です。そのいずれも特殊なものではありませんが、すべてが現実の作業です。本稿では、オープンウェイトモデルをオンプレミスで動かすために実際に何が必要か、そしてなぜ規制対象の日本のデータにとってその労力が報われるのかを解説いたします。

オンプレミスという構え

SC-BD-04 · REV A · 2026.07

自社構内 · オンプレミス
エグレス遮断ネットワーク

モデルの重み

llm.weights

業務データ

db · in-house

暗号鍵

kms · keys

構内からのリクエスト
構外へは何も出ない
更新は取り込みのみ
クラウド

ホスト型API

llm.hosted · cloud

外向き接続の拒否は約束ではなく検証できる性質です。監査に耐えるソブリン性は、ここから生まれます。

境界図。エグレスを遮断した自社構内にモデルの重み、業務データ、暗号鍵が収まり、外側にクラウドAPIが淡色で置かれ、外向き通信は遮断され、モデル更新は内側への取り込みのみで行われることを示します。
01

なぜモデルを自社のハードウェアで動かすのか

セルフホストする理由は、データとモデルが、自社が管理する1つの環境の中にとどまることです。規制対象の日本のデータにとって、建物の外へ決して出ないプロンプトはレジデンシー規則に抵触しえず、重みを自社が保有するモデルは、知らぬ間に取り消されたり、絞られたり、変更されたりすることがございません。それこそが、ソブリンな導入の価値のすべてです。以降で述べることは、その価値を得るために必要なエンジニアリングですが、オープンウェイトのエコシステムが急速に成熟したため、当初思われるよりも取り組みやすいものとなっております。

02

GPUのサイジング

最初の実務的な問いは、モデルがどれだけのGPUメモリを必要とするか、です。おおまかな目安として、フル精度でのモデルの重みは1パラメータあたり約2バイトを要するため、数百億パラメータのモデルは、リクエストごとに加わる作業用メモリの前に、読み込むだけで数十ギガバイトのGPUメモリを必要といたします。量子化、すなわち重みを8ビットや4ビットといった低い精度で保存することは、わずかな品質の代償でその要件を大幅に削減し、能力の高いモデルを、クラスターを要さず単一のアクセスしやすいGPUで動かすことを可能にいたします。サイジングは、まずメモリの計算であり、次にスループットの計算です。

03

提供スタック

素のモデルファイルは、サービスではありません。推論サーバーがその前段に立ち、大規模に使えるものにするための作業を担います。すなわち、同時リクエストのバッチ処理、生成を効率化するキーバリューキャッシュの管理、トークンのストリーミング返却、そしてAPIの公開です。成熟したオープンソースのサーバーがこれを十分にこなすため、作業はそれを動かし運用することであり、ゼロから構築する必要はございません。これが、ホスト型APIが隠している主たる運用コストであり、モデルを自社内に保つための対価です。Kubernetes上では、利用率とコストを抑えるオートスケーリングとフラクショナルGPUの技術も得られます。

04

エアギャップとエグレス制御

ソブリン性は、前提とするだけでは足りず、強制されて初めて現実のものとなります。ソブリンな導入は、外向きの接続を拒否するネットワークの中で動くため、モデル、データ、ログは物理的に外へ出ることができず、その拒否は、約束にとどまらず検証できます。これが重要なのは、作業のいずれかの部分で外部サービスを密かに呼び出すセルフホストモデルは、もはやソブリンとは呼べないからです。エグレス制御は、理想的にはエアギャップまたはエグレス遮断の環境において、ソブリン性の主張を、監査できる性質へと変えます。

05

最新性を保つ

セルフホストについてよくある懸念は、フロンティアから取り残されることです。実際には、オープンウェイトの分野は速く動き、強力な新モデルが絶え間なくリリースされるため、最新性の維持はプロセスの問題にすぎません。新しいオープンウェイトモデルを取得し、自社のタスクに対して検証し、同じ提供スタックとオーケストレーション層の背後で差し替えれば済みます。アプリケーションが対話する相手はオーケストレーション層であり、モデルそのものではないため、その差し替えはアプリケーションに触れません。セルフホストと最新性の維持は、アーキテクチャがモデルを差し替え可能なものとして扱うとき、両立いたします。これは、モデル非依存の原則を運用に適用したものです。

// 要点

押さえておきたいポイント

  • セルフホストは、データとモデルを1つの管理された環境にとどめます。それが規制対象データにとっての価値のすべてです
  • サイジングはメモリの計算です。パラメータ数×精度を、量子化でアクセスしやすいGPUに収まるよう削減します
  • 素のモデルはサービスではありません。推論サーバーがバッチ処理・KVキャッシュ・APIを担い、それを運用することが実際の運用コストとなります
  • ソブリン性はエグレス制御によって、理想的にはエアギャップで強制され、監査可能なものとすべきです
  • 最新性の維持は、オーケストレーション層の背後で取得・検証・差し替えを行うプロセスであり、アプリケーションには触れません

// よくあるご質問

よくあるご質問

Q1

オープンウェイトLLMには、どれくらいのGPUメモリが必要ですか。

フル精度では1パラメータあたり約2バイトであるため、数百億パラメータのモデルは、読み込むだけで数十ギガバイトを必要とし、これにリクエストごとの作業用メモリが加わります。8ビットや4ビットへの量子化は、わずかな品質の代償でこれを大幅に削減し、能力の高いモデルを単一のアクセスしやすいGPUで動かせることが多くなります。

Q2

セルフホストLLMの提供スタックとは何ですか。

モデルファイルの前段に立ち、それを使えるサービスにする推論サーバーでございます。同時リクエストのバッチ処理、KVキャッシュの管理、トークンのストリーミング、そしてAPIの公開を担います。成熟したオープンソースのサーバーがこれをこなすため、作業はそれを運用することであり、ゼロから構築する必要はございません。Kubernetes上では、オートスケーリングとフラクショナルGPUの効率も得られます。

Q3

セルフホストLLMからデータが外へ出ないことを、どう保証しますか。

エグレス制御を強制することによってでございます。外向きの接続を拒否するネットワーク、理想的にはエアギャップまたはエグレス遮断の環境で導入を動かせば、モデル・データ・ログは外へ出ることができず、その拒否は検証可能でございます。外部サービスを呼び出すセルフホストモデルは、真にソブリンとは言えません。

Q4

セルフホストは、最新のモデルから取り残されることを意味しますか。

いいえ、アーキテクチャがモデルを差し替え可能なものとして扱う限りは、そうなりません。オープンウェイトの分野は速く動きます。最新性を保つことは、新しいモデルを取得し、自社のタスクで検証し、同じ提供・オーケストレーション層の背後で差し替えるプロセスであり、アプリケーションには影響いたしません。

Q5

日本のエンタープライズにとって、LLMのオンプレミス運用は現実的ですか。

はい。規制対象データにおいては、ますます一般的になっております。オープンウェイトのエコシステムは成熟し、量子化により能力の高いモデルがアクセスしやすいGPUで動き、成熟した提供ソフトウェアが運用を担います。主な制約はGPUの供給と運用の労力でございますが、いずれも適切なスタックで管理可能でございます。

最終更新:

この領域での導入をご検討ですか

技術評価、製品選定、概念実証の設計まで、日本語で具体的にご相談いただけます。まずはお気軽にお問い合わせくださいませ。