Blog

ローカルLLMに必要なスペックと速度・電気代を実測:社内サーバーで常時運用して分かったこと

この記事の要点

  • 当社では、GPU(NVIDIA GeForce RTX 3090)を1枚積んだサーバーで、Google のAIモデル「Gemma 4 12B」を常時動かしています。
  • 実測すると、回答の速さは1秒に約88トークン(日本語で約150字)、2,700字ほどの文章の読み込みは0.5秒でした。
  • 生成中のGPUの消費電力は約345W、待機中は約16Wです。小さいモデルは「気を利かせない」ので、指示の書き方とアプリ側の作りで補うのがコツでした。

ローカルLLMとは

ローカルLLMとは、自社で用意した機械の中でAI(大規模言語モデル)を動かす使い方です。ChatGPT などのクラウドのAIと違い、入力した文章が外部のサービスに送られません。

比べる点ローカルLLMクラウドのAI
入力した情報の行き先自社の機械の中だけ提供会社のサーバー
賢さ機械の性能で動かせる大きさまで最新・最大級のモデルを使える
費用のかかり方最初に機械代、その後は電気代使った分だけ、または月額
保守自社で行う提供会社が行う

社外秘の資料や個人情報を扱う業務で、「AIに入力してよいか」が問題になる場面では、有力な選択肢になります。

ローカルLLMに必要なスペック:当社のサーバーの構成

部品内容
GPUNVIDIA GeForce RTX 3090(GPUのメモリ 24GB)
CPUAMD Ryzen 5 7600
メモリ16GB(DDR5)
ストレージNVMe SSD 500GB
OSUbuntu 26.04 LTS
AIを動かすソフトllama.cpp(2026年7月版)
モデルGemma 4 12B(Google 公式の4ビット版。画像も読めます)
同じGPUで動かしているもの画像生成(ComfyUI)

llama.cpp は、AIモデルを少ないメモリで動かすための無料のソフトです。OpenAI の API と同じ形式で呼び出せるので、既存のシステムやアプリにも組み込みやすくなっています。

これまでに15種類ほどのモデルを試し、ダウンロードしたモデルのファイルだけで約280GBになりました。今は、画像も読めること、画像生成と同じGPUに同居できる軽さ(約9GB)、回答の速さを重視して、このモデルを使っています。

実測:どのくらいの速さで動くか

2026年9月30日に、実際に動いているサーバーで測りました。

試したこと結果
短い質問への回答(回答は605字)3.9秒(1秒に約88トークン)
聞き取りメモ(2,694字)を読んで3行に要約読み込み0.5秒(1秒に約3,100トークン)、回答0.9秒
使っているGPUのメモリ約9GB(24GBのうち)
  • トークンはAIが文章を扱う単位です。今回の文章では、日本語のおよそ1.8字が1トークンでした。
  • 1秒に約150字は、人が読むよりずっと速い速さです。短い回答なら、画面で待たされる感覚はほとんどありません。
  • 条件: 同時に処理するのは1件、考える過程を出す機能(思考モード)は切った状態、扱える文章の長さは約6万5千トークンに設定しています。

ローカルLLMの電気代の目安

GPUの消費電力は、回答を作っている間が約345W(上限350W)、待機中が約16Wでした。家電の電気代の表示に使われる目安単価(1kWhあたり31円)で、GPUの分だけを計算すると次のとおりです。

使い方電力量電気代
待機(24時間×30日)約11.5kWh約360円/月
回答を作る(1日1時間×22日)約7.6kWh約240円/月

GPUの分は月600円ほどです。実際には、これにCPUなどパソコン全体の電力が加わります。

ローカルLLMでできること・苦手なこと

実際に使ってみた感触をまとめます。

得意なこと

  • 社外秘の文章の要約・分類・下書き
  • 画像の内容の読み取り(写真や資料の画像を説明させる)
  • 自社のシステムやサービスへの組み込み
  • 決まった型の文章を、大量に作る仕事

苦手なこと

  • 幅広い知識や、難しい推論が要る仕事。クラウドの大きなモデルのほうが上です。
  • 細部の正確さが大事な仕事。今回の要約でも、元のメモの「表計算ソフトに転記している」を「手書きの転記作業」と言い換えていました。人の確認が欠かせません。
  • 大勢が同時に使う仕事。1件ずつ処理するので、重なると待ちが出ます。

運用して分かった3つのこと

当社のAIホームページ・LP作成ツール「Asura」では、このサーバーを「ローカルAI」の選択肢として使っています。そこで分かったことです。

1. 指示は「レシピ」のように細かく書く

12Bクラスのモデルは、クラウドの大きなAIのように気を利かせてはくれません。最初は「明るい背景に白い文字を置いて読めない」といった失敗が出ました。守ってほしい決まりを箇条書きで具体的に渡すと、品質が大きく上がりました。ページを一から作らせるより、用意した部品の中から選ばせるほうが安定することも分かりました。

2. 時間がかかる前提でアプリを作る

ページ1枚分のような長い文章を作らせると、数十秒から数分かかることがあります。画面で待たせずに裏側で処理し、終わったら知らせる作りにしました。

3. GPUのメモリの配分を先に決める

AIと画像生成を同じGPUで動かしているため、両方が同時に動いてもメモリが足りるかで、モデルの大きさ(どこまで軽くするか)を選んでいます。より精度の高い大きな版は、画像生成と重なるとメモリが足りなくなるおそれがあったため、見送りました。

安全に使うために気をつけていること

  • AIの窓口は、サーバーの中だけで受け付けています。外のアプリから使うときは、暗号化(HTTPS)と認証キーをかけた入口を1か所だけ設けています。
  • モデルごとに利用規約があります。Gemma は Google の Gemma 利用規約に沿って使っています。

まとめ

  • ローカルLLMの一番の利点は、入力した情報を外に出さないことです。GPU 1枚でも、仕事に使える速さで動きます。
  • 賢さはクラウドの大きなAIに及ばないので、得意な仕事を選び、指示の書き方とアプリの作りで補うのが現実的です。
  • サーバーを置かずに、ブラウザの中だけで小さなAIを動かす方法もあります。当社のトップページでデモを試せます。

当社では、情報を外に出さないAIの構成づくりや、今お使いのシステムへのAIの組み込みをお手伝いしています。「うちの業務でも使えるか」という段階から、お気軽にご相談ください。詳しくはAI活用支援のページをご覧ください。

参考

ブログ一覧へ ご相談はこちら

Contact

お気軽にご相談ください

システム開発、DX推進、クラウド構築など、ITに関するお悩みはトータスグローブにお任せください。ヒアリングとお見積りは無料です。

  • 相談・お見積り無料
  • NDA締結に対応
  • 全国オンライン対応
080-5829-3541

通常2営業日以内にご返信いたします

お問い合わせフォームへ