速いGemma、正確なQwen──ローカルLLM2強を業務文書で使い倒して見えた”使い分け”

社内にローカルLLMを入れてはみたものの、「で、どのモデルを使えばいいの?」と迷っていませんか。

当社のAIワークステーション『GX10』には、Googleの『Gemma 4』とAlibabaの『Qwen 3.6』が同居しています。性格のかなり違うこの2モデルを、同じマシン・同じ条件で、業務でいちばん効く3つの軸――日本語・PDF文書認識・速度――で測ってみました。

カタログspec比べではなく、実際に動かして出た数字です。「ローカルで使うなら結局どっち?」の答え合わせにどうぞ。

比較の土俵──同じGX10で、同じ条件で測った

比べたのは gemma4:12b(軽量・約11GB)と qwen3.6:35b(高精度・約29GB)。どちらも日本語・画像(PDF)に対応するモデルです。文書はこちらで用意した「正解つきのテスト文書」を使い、出力を正解と照合して採点しました。

日本語の実力──どちらも自然、でも“クセ”が違う

結論から言うと、普段使いの日本語はどちらも十分に自然です。ただし性格が分かれます。

  • Gemma 4:軽快で読みやすい文章。ただし長文や固有名詞で“もっともらしく言い換える”クセがあり、たとえば社名や「税込/税抜」がさらっと書き換わることがありました。流暢なだけに気づきにくいのが要注意ポイントです。
  • Qwen 3.6:固有名詞や数字に強く、逐語の正確性が高い。お堅い文書ほど安心感があります。

ここが分かれ目: 速くて気持ちいいのがGemma、几帳面で正確なのがQwen。重要な文書ほどQwen、量をさばくならGemmaが向きます。

PDF文書認識──“正確さのQwen、速さのGemma”

請求書・帳票・集計表などを画像として読ませ、テキスト化の精度を比べました。

文書タイプ Gemma 4(12b) Qwen 3.6(35b)
請求書(金額・項目) 86% 92%
集計表(数値の表) 約99% 約99%
縦書き文書 33%(不安定) 100%
1ページの処理時間 約15秒 約6分

数字や表はどちらも優秀。差が出たのは“難所”です。正確性はQwenが上(とくに縦書きはGemmaがほぼ読めず、Qwenは完璧)。一方で速度はGemmaが桁違いに速く、Qwenは1ページ6分と、大量処理には向きません。

速度とメモリ──“軽さ”のGemma、“質”のQwen

面白いことに、速度は使う場面で逆転します。

  • 文章の生成:実はQwenの方が速い(内部が“専門家を切り替えるMoE方式”のため、サイズの割に軽快)。
  • 画像(PDF)の処理Gemmaが圧勝(前述のとおり15秒 vs 6分)。
  • メモリ:Gemmaは約11GB、Qwenは約29GB。軽さ・同時起動のしやすさはGemma

結局どっち?──用途で使い分けるのが正解

こんな時は おすすめ
チャット・要約・大量処理・とにかく速く Gemma 4(12b)
契約書・縦書き・固有名詞・正確さ最優先 Qwen 3.6(35b)
両取り Gemmaで一次処理 → 重要箇所だけQwenで確認

まとめ──“1つに絞らない”のがローカルの強み

クラウドのAPIと違い、ローカルなら複数モデルを入れて使い分けるのも自由です。今回の結論はシンプルでした。

  • 速さ・気軽さのGemma 4
  • 正確さ・几帳面さのQwen 3.6
  • 数字・表はどちらも実用レベル。ただし重要文書は最終確認を

『GX10』はメモリに余裕があるので、両方入れて「今日の仕事に合う方」を選ぶのがいちばん賢い使い方です。まずは同じ資料を2つのモデルに読ませて、あなたの業務での“相性”を確かめてみてください。

次回は「ローカルで作るインタラクティブ音声AI」をお届け予定です。

なぜ社内に”自前のAI”を持つのか──ローカルLLMを立てた目的と、AIと組んで分かったこと

生成AIは、もはや仕事に欠かせない相棒です。けれど便利さに比例して、別の感情も育っていないでしょうか。「このデータ、外に出していいのか」「ここまで依存して、もし止まったら」――そんな引っかかりです。

当社が社内マシン『GX10』に自前のローカルLLMを立てたのは、流行りに乗ったからではありません。明確な“目的”があったからです。

本記事は構築手順書ではなく、「なぜローカルなのか」という目的と、AI(Claude Code)を相棒に組み上げる中で見えてきたことを、現場の言葉でお伝えします。

なぜローカルなのか──「守りたいもの」と「止めたくないもの」

ローカルLLMを立てる理由は、突き詰めると3つに集約されました。

目的 解決したい不安
データ主権 機密文書や顧客情報を、社外のAIに渡したくない
可用性 提供側の都合(仕様変更・規制・障害)で、ある日業務が止まるのを避けたい
自由度 使うほど増えるAPI課金や制限を気にせず、用途に合わせて自由に使い倒したい

クラウドAIの“賢さ”には及ばなくても、「外に出さず、止まらず、気兼ねなく使える」AIには独自の価値があります。これがエッジAIの本質です。

何に使うのか──“そこそこ賢いAI”を社内で使い倒す

目的が定まると、用途も具体化します。実際にGX10で動かしているのは、Googleの『Gemma』とAlibabaの『Qwen』。社内文書の要約、PDFの読み取り、音声の文字起こし、社内向けの質問応答といった“地味だが効く”業務が対象です。

ポイントは「1つの万能AIを選ばない」こと。速さ重視ならGemma、正確さ重視ならQwen、と目的ごとにモデルを使い分ける。これはローカルだからこそできる贅沢です。

作って実感した、AIと組む3つのコツ──任せきりでは進まない

今回の構築は、AI(Claude Code)と対話しながら進めました。コマンドや設定をAIに相談し、提案を実機で試す、という進め方です。効率は劇的に上がりましたが、“AIに任せきり”では進まない場面も多くありました。そこで身についたコツが3つあります。

  • ① 環境の前提を、最初に渡す。 「最新GPU搭載機で」「OSはこれ」と前提を伝えないと、AIは一般的な(=この環境では的外れな)手順を返します。聞き方が曖昧だと、答えも曖昧になります。
  • ② エラーは“全文”を渡す。 こちらで要約して渡すと原因がぼやけ、AIも迷走します。ログをそのまま見せるのが、解決への最短ルートでした。
  • ③ 提案は鵜呑みにせず、実機で検証する。 もっともらしい回答が必ずしも正解とは限りません。動かして確かめる一手間が、結局いちばん速いのです。

失敗が教えてくれたこと──最新ハードの“宿命”と、AIの限界

つまずき:最新すぎて、AIも知らなかった
GX10のGPUは世代が新しく、AIの学習データにもまだ載っていないほど。音声合成の起動エラーは、AIの“一般論”では解けませんでした。最終的にはエラーログを一緒に読み解き、原因(GPU向けコード生成の非対応)を切り分けて回避。「最新ハードは速いが、ソフトの対応待ちがある」という宿命を、身をもって学びました。

ここに、AIと組む時代の本質があります。AIは“調べ物と手数”を高速化する最強の相棒。しかし未知の領域の“最後の切り分け”は、人間の仕事として残る。だからこそ、AIを使いこなす人材の価値はむしろ上がっています。

まとめ──ローカルAIは「目的」から逆算する

ローカルLLMは、手順をなぞれば誰でも立てられます。けれど大事なのは、その手前の「なぜ立てるのか」です。

  • データ主権・可用性・自由度――守りたいものから逆算して設計する
  • モデルは1つに絞らず、目的で使い分ける
  • 構築はAIと組めば加速する。ただし前提とログを渡し、最後は人が検証する

「便利だけど、ちょっと不安」――そのモヤモヤは、社内に“自前のAI”を持つことで、かなり晴れます。御社の「守りたいもの」は何でしょうか。そこから、ローカルAIの設計は始まります。