AIの進化を、ニュースで終わらせない。

コラム · ·

ちゃんと使えるローカルLLMはどこまで組めるか

自分のAIを持ちたい。その願いに、いまのMac、DGX Spark、Windows PCはどこまで応えられるのか。日本語の使い勝手、公開測定から見える待ち時間、VRAMとRAM、Strataの仕組みから、100万円・200万円の構成でできることと残る制約を考える。

自分のパソコンにAIを置きたい。書きかけの原稿も、仕事の資料も、相談のたびに外へ送らずに済む。サービスの都合でモデルが入れ替わっても、気に入った版を使い続けられる。AIを「持つ」という願いには、月々の料金を減らすこと以上の意味がある。

ただ、モデルが起動して返事をしたところで満足できるのは、最初のうちだけだ。日本語を何度も直さなくてよいか。長い資料を渡しても待てるか。コードの修正を頼んだとき、説明だけで終わらず確認まで進めるか。毎日使うなら、この差が機材の値段以上に大きい。

2026年10月7日時点で考えると、小さめの仕事を手元へ移す選択は十分に現実的だ。一方、最先端のクラウドAIに頼んでいる仕事を、同じ速さと手間で丸ごと移す構成は簡単には決まらない。100万円、200万円という予算は、その違いを見るために使う。予算を使い切ることを目標にはしない。

この記事の要点

  1. 日本語の下書きや限られたコード修正から始めるなら、小型モデルや27B級が候補になる。16GB VRAMは選べる量子化と文脈長が限られ、32GBでは27B級をGPUへ収める余裕が増える。
  2. 大容量を共有できるMacやSparkと、GPU推論に強いWindows PCでは買う理由が違う。Strataは大型MoEを扱う選択肢を増やすが、RAMの容量だけでなく帯域、量子化、GPUキャッシュにも速度が左右される。
  3. 公開ベンチは、モデルや量子化、入力などの条件と合わせて読む。生成の速さだけでなく、回答が出始めるまでと完了までの待ち時間で判断し、難しい推論や長い自律作業はクラウドも残して選ぶ。

動くモデルを仕事の道具にする

「ちゃんと使える」の基準は、用途によって変わる。社内文書の表記をそろえる仕事なら、原文の意味を保つことと返答の速さを重く見る。設計を相談するなら、条件がぶつかったときに矛盾に気づけるかが気になる。どちらも流暢に返事をするが、必要な能力は同じではない。

そのため、最初に決めるのは最大モデルのサイズではなく、毎週繰り返している仕事だ。たとえば議事録から決定事項を拾う、短い仕様からテストの候補を出す、自分のメモの文体を整える。入力と期待する出力が見えている仕事ほど、回答を確認しやすく、ローカルへ移す価値も判断しやすい。

反対に、事情をほとんど説明せずに複雑な問題を解かせると、うまくいかなかった理由が見えにくい。モデルの能力、量子化、渡した情報、ツールの設定のどこに原因があるのかを、自分で切り分けることになる。機材を高くすれば、この手間までなくなるわけではない。

日本語とコードと長文で選び方が変わる

日本語では、文法の正しさだけでは足りない。相手との距離感、主語を省いた文のつながり、専門語の訳し方、断定を避けた条件の保持まで見る必要がある。小さいモデルでも決まった形式の整形には役立つ一方、長い説明を自然に書き直しながら意味を保つ仕事では、確認と手直しの時間が増えやすい。これは機種の速さだけでは解消できない。

候補を置くなら、軽めの仕事にはGemma 4 12BのQAT版、もう少し広い仕事にはQwen3.8-27Bを比較の出発点にしたい。Gemma 4には26B A4BというMoEもある。A4Bは生成時に動くパラメータの規模を示すが、4Bモデルと同じ容量で置けるという意味ではない。どちらが日本語で上かを、パラメータ数だけで決めることはできない。

01 / DenseとMoE

保存する重みと、毎回使う重みを分ける

FFNは、各トークンの情報を変換する部分。1層分だけを描き、今回計算する場所を色で示す。

Dense

1トークンの入力

共通のAttentionなどを経て、この層のFFNへ

↓

FFN全体を使う

各トークンが、同じ一つのFFNを通る。

このFFNの重みを保存し、計算に使う。

MoE

1トークンの入力

共通のAttentionなどを経て、この層のFFNへ

↓

ルーターが専門家を選ぶ

次のトークンでは、選ばれる組合せが変わり得る。

↓

専門家1

専門家2

専門家3

専門家4

専門家5

専門家6

専門家7

専門家8

緑の2個を今回使う。残る専門家の重みも保存し、必要なときに使えるようにする。

「26B A4B」の読み方

Gemma 4 26B A4Bは総数が約260億、1トークンで使う規模が約40億。保存容量は4Bモデルと同じにはならない。

保存する場所はGPU、RAMなどの実装による。モデルの規模や方式だけでは、日本語の品質は決まらない。

専門家8個中2個の選択は説明用で、実モデルの個数や容量比ではない。FFN以外の処理と重みも必要になる。Gemma 4公式資料に基づく概念図。

Googleの資料では、Gemma 4の4bit版を読み込むメモリの概算は12Bが6.7GB、26B A4Bが14.4GBだ。追加の読み込み分を20%含む目安だが、任意の長文や複数利用者を含めた上限ではない。16GB GPUで始めるなら12B側には余裕を作りやすい。26B A4Bを選ぶときは、文脈長を含む実際の使用量まで確かめる必要がある。

Gemma 4のモデル構成とメモリの目安

Qwen3.8-27Bは、コード、専門的な作業、長い手順を伴うエージェント用途を開発元が重視しているモデルだ。ただし公式の高得点には、指定した実行環境や長い文脈、思考設定がある。手元で軽く量子化して動かしたときに、その成績がそのまま出るとは考えない。

Qwen3.8-27Bのモデルカードと評価条件

量子化は、重みの数値を少ないビットで保存して容量を減らす方法だ。Unslothの配布ファイルでは、Qwen3.8-27BのUD-Q4_K_Mが16.5GB、UD-Q6_Kが22GBである。16GB VRAMに16.5GBのファイルが近いから使える、と判断するのは危うい。単位の違いに加え、文脈の状態を保存するKVキャッシュや計算用の領域も必要になる。

02 / モデル規模と量子化

同じ27Bでも、保存精度で容量が変わる

パラメータの数と、一つひとつの数値の保存方法は、別々に見る。

Qwen3.8-27B

約270億パラメータの同じモデルから、保存する精度を選ぶ。

UD-Q4_K_M

16.5GB ≈ 15.4GiB

UD-Q6_K

22GB ≈ 20.5GiB

棒が示すのは公開ファイルの容量。Q4とQ6は量子化形式の名前で、ファイル全体を単純に「27B×4bit」「27B×6bit」と計算した値ではない。

保存する精度を変えると、容量や出力への影響も変わる。どの設定が自分の仕事に合うかは、回答を確かめて選ぶ。

Unslothの配布ファイルの丸められた表示値から換算。1GB=10億バイト、1GiB=2³⁰バイト。棒の比は16.5:22。実行時のメモリ使用量や性能を測った図ではなく、KVキャッシュと作業領域は含まない。

03 / 推論のメモリ予算

重みが置けても、回答するための余白が要る

GPUのVRAM、Macなどの共有メモリ。それぞれ同じメモリ領域の中で、必要量を足して考える。

① 読み込んだ重み

実行ソフトが実際に配置する容量。ダウンロードしたファイルサイズと一致するとは限らない。

② KVキャッシュ

入力や会話の状態を保持する。長文や同時処理が増えると、必要量も増えやすい。

③ 計算の作業領域

一時バッファなど。実行ソフト、モデルの処理方法、追加機能で変わる。

④ ほかの用途の余裕

共有メモリではOSやアプリも同居する。VRAMでも画面表示や他のGPU処理が容量を使う。

同じメモリ領域の容量に、①+②+③+④を収める。

長文にする前に、空きを確かめる

重みを読み込めても、その後のKVキャッシュで不足することがある。

27Bを主力にするなら32GBを候補に

本文のQ6級・32K文脈は、実際の割り当てを検証する出発点。あらゆる追加機能や並列数で動く保証ではない。

RAMやSSDとは別に考える

RAMの増設はVRAMの増設ではない。SSDを4TBから8TBへ変えても、この計算用メモリは増えない。

容量を計画するための概念図。箱の面積は容量比ではなく、実測していないGB数は割り当てていない。分散して配置する場合は、GPU側とCPU側を別々に見積もる。KVの必要量はモデルの構造やキャッシュ形式によっても変わる。

このため、27B級を日常の中心にするなら、32GB VRAMを選ぶ理由は明確だ。Q6級と32K程度の文脈を出発点に、実際の割り当てを確認する余地がある。ただし画像処理用の追加部品や予測生成、同時処理まで全部載せた構成を保証する数字ではない。16GBで使う場合は、小型モデル、より強い圧縮、CPUへの一部移動のどれを受け入れるかが先に決まる。

量子化方式別の実ファイルと容量

コードでは、関数を一つ書けることと、リポジトリを調べて複数ファイルを直せることを分けたい。後者には、ファイル検索、編集、テスト実行、失敗後の修正を行うソフトも要る。モデルのAPIがつながっただけでは、クラウドの開発エージェントと同じ作業環境にはならない。初めは変更範囲を小さくし、既存のテストで確かめられる仕事を任せると判断しやすい。

長文でも、入力欄に収まる量と、最後まで正確に使える量は別だ。モデルが長い文脈に対応していても、必要な情報を見落とすことはある。全文を毎回渡す前に、章やファイルを絞る、出典つきで検索して必要箇所を渡す、といった使い方を考えたい。読み込み時間も減り、回答の根拠を人が追いやすくなる。

VRAMとRAMの間をStrataはどう使うか

Windows PCで見る容量は、GPUのVRAMと本体のRAMの二つだ。VRAMにモデル全体と作業領域が収まれば、GPUの中で処理しやすい。収まらない部分をRAMへ置く構成では、CPU側の計算やPCIe経由のやり取りが増える。RAMを64GBから128GBへ増やしても、16GBのGPUが128GBのGPUになるわけではない。

Strataが面白いのは、その分担を大型MoE向けに作り込んでいることだ。MoEは、重みの全体を毎回同じように計算するのでなく、入力に応じて一部の「専門家」を選ぶ。StrataはGPUによく使う専門家をキャッシュし、残りをRAMに置いてCPUと分担する。GPUの容量を超えるモデルを扱える理由は、この計算の性質と配置にある。

Strata本家の対応環境と推論方式

対象の中心はQwen3.8-Flash-Nextであり、どの巨大モデルでも同じように速くする汎用の増設機能ではない。本体125Bに加え、51BのPLEと4BのMTPがある。PLEは入力に応じて必要な箇所を参照する埋め込み表で、MTPは後続のトークンを予測するための部品だ。全部を足した数だけでも、125Bという呼び名だけでも、必要なRAMを判断できない。

Qwen3.8-Flash-Nextの構成

Strataのモデル案内では、IQ3_Sの本体側は54.8GBで、専門家は約50GBを占める。別のPLEファイル約28.8GBはSSDに置く。64GB RAMでも動作範囲に入るが、OSやブラウザ、開発環境を並べる余裕は小さい。128GBにする意味は、より高精度の量子化や普段のアプリを選びやすくすることだ。4bit側のUD-IQ4_XSはダウンロード約94GB、専門家約59.5GBという規模になる。

ここで、SSDを使う二つの場面を混同しないようにしたい。PLEの必要箇所を読むことと、RAMが足りず専門家の重みまでSSDから頻繁に読むことは違う。後者では速度が落ちる。SSDを4TBから8TBへ変えることは、まずモデルや資料を多く保管するための選択で、RAM不足の解消策にはならない。

Strataの量子化別容量とRAM不足時の説明

04 / モデルを置く場所

容量を足せても、同じ速さのメモリにはならない

読み出す場所と、計算を担当する部品を分けて見る。

1

通常のGPU推論

Windows PC / NVIDIA GPU

GPU · VRAM

モデルの重み+KVキャッシュ+作業領域

全体が収まればGPUで処理

PCIe

CPU · RAM

収まらない重みを保持し、CPUで処理する構成もある

増設RAMはVRAMの増設ではない

2

CPUとGPUで分担するStrata

対応する大型MoEで使う専用の経路

GPU · VRAM

Attentionなどの処理と、よく使う専門家のキャッシュ

ヒット率も速度を左右する

分担

CPU · RAM

専門家の重みを保持し、GPUキャッシュ外の計算を担当

容量とメモリ帯域の両方が必要

SSD · PLEの必要箇所を参照

PLEの疎な読み出しと、RAM不足で専門家の重みもSSDから繰り返し読むことは別。後者は速度を落とす。

3

CPUとGPUで容量を共有する

Mac Studio / DGX Spark・OEM

CPUGPU

ユニファイドメモリ

モデルの重み・KVキャッシュ・OS・アプリが、一つの容量を使う。

MacはMLXやMetal、SparkはCUDA。実行ソフトは共通ではない。

LATENTによる配置の概念図。面積は容量や性能の比率ではない。KVキャッシュは会話や入力の状態を保持する領域で、文脈長や同時利用数によって必要量が変わる。

もう一つの制約は、実行する機種だ。Strata本家の通常の導入先はx86のWindows/Linuxで、GB10には別のArm64対応フォークがある。Macで同じ手順を動かせるとは扱わない。MacはMLXやllama.cppのMetal対応を選ぶため、Strataの速度報告をそのままMacの購入理由にはできない。

運用もまだ変化している。10月6日のv0.1.40.1は、引用中のツール呼び出しが実行される問題と、エンジン再起動時の待ち要求が止まる問題を修正した。これは、動作速度だけでなく、文章として見せたコードと実行する指示を正しく分けられるかまで確認が必要だという具体例だ。ファイルを書き換える仕事を任せるなら、変更を戻せる作業場所と、人が確認する区切りも用意したい。

Strata v0.1.40.1の修正内容

公開ベンチから分かる待ち時間

公開ベンチを見るときは、回答が出始めるまで、本文が伸びる速さ、回答が終わるまでを分けて考えたい。生成が速くても、長い入力の処理や非表示の思考に時間がかかれば、待ち時間は伸びる。

05 / 応答の時間

「出始めが速い」と「読み終えられる」は違う

送信から回答完了まで。箱の長さは時間の比率を表していない。

A

入力を読む

モデルの読み込み、待ち行列、プロンプト処理。長文を渡すほど、この待ち時間が増え得る。

回答はまだ見えない
B

内部で考える

思考モードを使う場合の追加時間。内部トークンが出ても、読者向けの回答はまだ始まっていないことがある。

設定と課題で変わる
C

回答が画面に出る

本文が伸びる速さと、最後まで待つ時間を分けて見る。

可視の回答

初回の可視回答まで

送信 → Cの開始

AとBの待ち時間も含む。

回答が出始めた後

本文が伸びる速さ

画面に出る本文の速さ。内部思考の生成とは区別する。

回答完了まで

送信 → Cの終了

普段の仕事に近い回答で、待てるか確かめる。

LATENTによる待ち時間の概念図。機種の実測グラフではない。APIの最初のトークンと、画面で読める最初の回答は同じとは限らない。

公開されたStrataのRTX 5090測定は、この区別を考える材料になる。2026年9月30日のLinux、RAM 64GB、v0.1.29、IQ2_XSという条件で、思考を切り、合成したコード説明の入力から256トークンを出した。各条件3回の中央値は次の通りだ。

入力トークン 生成速度 APIの初回テキストまで(TTFT) 256トークン完了まで
4,096 179.4tok/s 0.974秒 2.392秒
32,768 175.7tok/s 5.950秒 7.390秒
128,000 165.0tok/s 22.262秒 23.850秒

生成速度の差は小さいが、長い入力ではTTFTが22秒を超えた。ここでのTTFTは、HTTP要求から最初の空でないテキスト断片までで、画面の初回表示そのものではない。モデルの読み込みは含まず、GPUの専門家キャッシュのヒット率は97.8〜99.7%だった。後述する128GB RAMのWindows構成や高精度の量子化へ、この速さをそのまま当てはめることはできない。

RTX 5090測定の条件と全結果

GB10側には、ASUS GX10を使ったArm64フォークの10月4日測定がある。IQ3_XXS、MTP有効、思考なし、合成入力、出力上限128トークンで各条件1回。入力約1.6K〜75Kでは37〜42tok/sだったが、431トークンの短い入力では15.3tok/sだった。

同じ測定の全体所要時間は、431トークン入力で16.1秒、6,190トークン入力で8.6秒、75,047トークン入力で60.0秒だった。いずれも128トークンの出力だ。短い入力ほど必ず速い結果でもないため、普段の質問に近い条件を選んで見る必要がある。

GB10フォークの測定条件と短い入力での結果

二つの記録は、量子化、ソフトの版、入力、出力、キャッシュ条件が違う。5090とSparkの同条件比較ではなく、回答の品質を評価した結果でもない。公開記録から確認できるのは、5090で高速に返せた設定例と、GB10で動く経路とその速度だ。tok/sは、モデルや文章によってトークンの区切りが変わることも踏まえて読む。

購入前には、使いたいモデルに普段の資料や質問を渡し、回答の質と待ち時間を確かめたい。小型モデルで仕事が足りるなら、100万円まで使う必要もない。より大きなモデルや長い資料が必要になったときに、VRAMや共有メモリの容量を増やす価値が出てくる。

MacとSparkとWindows PCの得意分野

Mac Studioの分かりやすい利点は、CPUとGPUが大きなメモリを共有できることだ。64GBや256GBを、GPU専用メモリと本体メモリに分けずに使える。ただしOSやアプリも同じ容量を使う。搭載量のすべてをモデルの重みに割り当てる計画にはしない。

M5世代のMac Studioは8月25日に発表され、9月22日に発売された。512GB構成は10月後半予定という区別がある。今回の64GB Maxと256GB Ultraは発売済みでも、注文すればすぐ届くという意味ではない。販売店にはそれぞれ5〜6週、9〜10週の入荷目安が記載されている。

今回の40コアGPU版M5 Maxの公称メモリ帯域は614GB/s、M5 Ultraは1.2TB/sだ。大きいモデルを継続して読み出す処理では帯域が重要になる。ただし、Sparkの273GB/sと割り算して、そのまま日本語や英語の生成速度の倍率にはできない。演算の仕方、量子化、使うライブラリ、文脈長が違うためだ。

AppleによるM5 Mac Studioの発表

Macを選びやすいのは、日常の仕事もMacで行い、MLXやMetal対応のモデルを広く試したい人だ。256GBの価値は、32GB VRAMでは置きにくいモデルや、重めの量子化を選べる余地にある。CUDA専用の実装を使いたい、Strata本家の設定をそのまま試したい、という目的には別の選択が合う。

MLX LMとllama.cppは、対応モデルと実行方法を確認する入口になる。容量が足りても、使いたい新モデルにソフト側が対応しているかは別に確認する。

DGX Sparkや同系統のOEM機は、GB10と128GBの共有メモリを備えた小型のCUDA機として見ると分かりやすい。ArmのCPUとLinux系のDGX OSを使う。普段のノートPCから接続する推論用の別置き機、CUDAを使う開発環境として理由がある。「最大何千億パラメータ対応」という数字だけでは、待てる速さや同時に使える人数は分からない。

DGX Sparkの仕様

10月2日のNVIDIAの発表は、Spark全体が初めて発売されるという話ではない。新しい64GB版はOEM限定で、10月23日から4,999ドルよりと案内されている。この記事の調査では国内価格を確認できなかったため、円換算だけで100万円以内の国内購入案へ組み込んでいない。

新しい64GB版の提供時期と対象メーカー

Windows PCは、GPUに収まるモデルを使い、必要に応じてStrataも試す構成を作りやすい。GPUやSSDを後から変更しやすく、ゲームや制作の機材とも兼用できる。その代わり大型GPUの電力と排熱、ドライバー、推論ソフトごとの対応を引き受ける。GPUの性能を求める買い物と、モデルを大きくするためのメモリを買うことを分けて考えたい。

100万円と200万円で買える余裕

以下は2026年10月7日に確認した税込の構成例だ。最安値の一覧でも、同じ回答品質を保証した比較でもない。SSDは4TBを基本にする。8TBは複数の大きなモデルや資料を多く置く人の選択肢であり、推論を速くするための必須条件ではない。

構成例 税込価格と購入状況 選ぶ理由 残る制約
Windows/RTX 5080 16GB
Core Ultra 7 270K Plus
RAM 64GB・4TB SN850X
829,280円
選択肢と送料の合算・納期未確定
小型モデルをGPUに収め、制作やゲームとも兼用する 27B級の全GPU常駐は量子化と文脈の余裕が乏しい
Mac Studio/M5 Max
18コアCPU・40コアGPU
共有64GB・4TB SSD
923,800円
受注後5〜6週の入荷予定
Macでの日常作業と、27B級以上のモデルの試用を両立する CUDAは使えず、Strata本家と同じ経路でもない
HP ZGX Nano/GB10
共有128GB・4TB SSD
1,097,800円
調査時は在庫あり表示
小型のCUDA推論機を別置きする 100万円を超える。Arm対応と使う推論経路の確認が必要
Windows/RTX 5090 32GB
Core Ultra 7 270K Plus
RAM 128GB・4TB SSD
1,873,280円
選択肢と送料の合算・納期未確定
27B級のGPU常駐とStrataを使い分ける 32GB VRAMは増えない。RAMは4枚挿しでDDR5-3600
Mac Studio/M5 Ultra
30コアCPU・64コアGPU
共有256GB・4TB SSD
1,939,800円
受注後9〜10週の入荷予定
容量を優先し、大きいモデルや高精度の重みを扱う 容量の大きさだけでは対話速度や品質は決まらない

100万円以内で新しく一台を買うなら、まずMacが必要か、WindowsのGPU機が必要かで分かれる。27B級を含む複数のモデルをMacで試すなら64GB Maxに理由がある。すでに16GB以上のGPUがある人は、同じ容量の新型へ急いで買い替えるより、今の機材で任せる仕事を決めるほうが先だ。小型モデルのためだけに予算を使い切る必要はない。

Spark系は今回の128GB・4TB例だと100万円を少し超える。NVIDIA純正DGX Sparkは同容量で1,078,000円だが、販売店には売り切れと10月中旬の次回出荷予定が出ていた。安いほうの価格だけを見て、すぐ買えると考えないほうがよい。小型の別置きCUDA機が欲しいのかを先に決めれば、Macや大型PCとの比較もしやすい。

純正DGX Sparkの価格と出荷予定

200万円まで広げると、Windowsの32GB GPUと128GB RAM、Macの256GB共有メモリが比べられる。コード編集を中心に、27B級をGPUで使い、必要なときだけStrataへ切り替えるなら5090側を選びたい。より大きいモデルを複数試すことや、量子化を弱めることに価値を置くならUltra側だ。どちらも、200万円を払ったからクラウドの最上位モデルと同じになる、という選択ではない。

Windowsの128GB構成には特に注意したい。掲載例の32GB×4はDDR5-3600で、64GB構成の32GB×2はDDR5-5600だ。RAMが増える利益と、CPU側のメモリ帯域が下がる不利益が同時にある。CPUでも専門家を計算するStrataでは、容量だけを見て上位構成と判断しにくい。64GB×2が選べるなら、マザーボードの対応と実際の動作速度を確認して優先候補にしたい。

別の例として、arkにはRTX 5090、128GBのDDR5-5600、2TB SSDで1,698,000円の掲載がある。ただし4TBへそろえた見積ではなく、部品の取り寄せ状況もある。掲載例の中で安いから即決するより、2枚で128GBにできるか、4TBにした総額と納期はいくらかを確かめる比較先と考える。

arkの128GB構成例

ドスパラの5090例は、本体1,369,980円、128GBへの変更308,000円、4TB SN850Xへの変更192,000円、送料3,300円を足した。正式なカート見積や在庫の確保を行った金額ではない。価格差にはケースや冷却なども含まれるため、LLM性能だけの費用比較とは扱わない。

5080例は本体534,980円、64GBへの変更99,000円、4TB SN850Xへの変更192,000円、送料3,300円の合算だ。標準の1000W電源と240mm水冷を含む。こちらもカートで確定した見積ではなく、調査時に選択肢を読み取った構成である。

自分のAIに任せる仕事を決める

ローカルで賄う範囲は、モデルの名前より仕事の性質で決めると無理がない。原稿の整形、短い資料からの抽出、手元の文書検索、テストで確認できる小さいコード修正は、入力と出力を確認しやすい。多少時間がかかっても構わない一括処理も、手元で動かす理由を作りやすい。

難しい設計判断、初めて扱う分野の調査、長い手順を自律的に進める仕事は、クラウドの強いモデルも残したい。ローカルで下書きや資料整理を済ませ、必要な部分だけをクラウドへ渡す使い方もできる。外に送れない情報なら、その部分を切り離せるか、人が判断する範囲を広げるかを考える。

費用にも、初期投資以外の部分がある。電気代だけでなく、モデルのダウンロード、更新後の確認、調子が悪いときの調査に自分の時間を使う。クラウドの月額費用と本体価格を割り算するだけでは、どちらが安いかは決まらない。逆に、送信先を自分で選べることや、同じ版を使い続けられることに価値があるなら、料金だけでは買う理由を説明しきれない。

AIの民主化を「誰でも最も強いAIを所有できること」と置くと、いまはまだ機材費も運用の負担も大きい。それでも、自分に必要な仕事の一部を、サービス提供者の都合から切り離して持てる範囲は広がっている。使うモデルと更新時期、渡す資料、任せる権限を自分で決められることは、小さな違いではない。

いま組むなら、毎日任せる小さな仕事から始め、その仕事に必要なメモリを買う。日本語を読み終えるまでの待ち時間と、直す手間を見てから範囲を広げる。自分のAIを持つ現実的な一歩は、予算いっぱいの大きな箱を先に買うことより、そのAIに任せ続けたい仕事を一つ見つけることにある。

調査の範囲と出典

公開資料と国内販売ページを2026年10月7日、日本時間で確認した調査記事である。LATENTによる機材の実測、日本語品質の独自採点、購入、モデルの大量ダウンロードは行っていない。機種選びの結論は、仕様、公開測定、ソフトの対応範囲を踏まえた編集部の判断だ。価格、構成選択肢、在庫、納期は変わる。

モデルの能力と形式は各開発元の資料、量子化ファイルの容量は配布元、速度は測定者の記録を参照した。公開測定は本文で条件を示した範囲に限って使っている。販売価格は上表の販売元へのリンクから確認できる。