ローカルAI

RTX Spark vs Mac M5 Max vs RTX 5090|ローカルLLM実測比較・帯域と価格

yume
記事内にアフィリエイト広告・商品プロモーションを含む場合があります。

「生成AIを、自分のPCの中で動かしたい」。
ローカルで生成AIを動かす機材を調べ始めた人の前には、従来2つの選択肢が並んでいました。
Mac(M5 Max)か、RTX 5090を積んだデスクトップか。

新たな候補として2026年6月、NVIDIAのRTX Sparkが割り込んできました。
128GBの統合メモリとCUDAを薄型ノートに積んだという、従来にはなかった1台です。

「RTX Spark」で検索して記事を開いた人が知りたいのは、本命として選べるかどうかですよね。
結局RTX Sparkは、自分の本命候補に入ってくるのか?

LLMの講座を3年前に受講してから、「ローカルで生成AIを動かしたい」という目標があります。
LLMを学ぶと、ローカル環境での生成AIの実行が最終目標だとわかります。
しかし、多額の予算がなく、まだ実現できていません。

先に、この記事が誰のためのものかをはっきりさせておきます。
クラウドなら安く生成AIが使える今、あえて数十万円のローカル機を組む理由は、だいたい2つに絞られます。

機密情報や社外秘を、外のサーバーに出さずに扱いたい。
たとえば自治体案件のように情報漏えいが許されない仕事だと、クラウドの生成AIはそもそも使えません。
今後上がっていくAPI料金に先回りして、ローカル環境へ先行投資しておきたい。

この記事は、その目的を持つ人に向けて、RTX Spark・Mac M5 Max・RTX 5090の3台を、スペックだけでなく実測のトークン速度(AIが答えを書き出す速さ)まで並べて突き合わせます。

逆に、「そもそもRTX Sparkって何? ふだん使いのPCを、今買うべきか発売まで待つべきか」という疑問には、次の記事で答えています。
≫ RTX SparkとDGX Sparkの違いと、どれを買うか待つかのガイド
この記事では、買うか待つかの判断から一歩進めて、ローカルAIを本気で動かす前提で比較します。

この記事の情報はNVIDIA公式(製品ページ)・Arm・MediaTek・Microsoft・Appleの各公式発表がベース(2026年6月時点)。
価格や発売日など、まだ正式発表されていない項目は「予想」とはっきり区別して書きます。

この記事で使うたとえ
  • AI(LLM)=分厚い百科事典を持った物知りの人。20B・70B・120Bといった数字は、百科事典の分厚さの目安
  • GPUのメモリ(VRAM)=手元の作業台。いちばん速く使えるが、RTX 5090でも32GBと広さに限りがある。メインメモリ=机
  • 統合メモリ(Mac・RTX Spark)=作業台と机がつながって1つの大きな台になったもの。128GBなら120B級の分厚い百科事典も丸ごと広げられる
  • メモリ帯域(GB/s)=作業台へ本を運ぶ通路の幅。広いほど一度にたくさん運べて、AIが答えを書くのも速くなる
  • トークン/秒(tok/s)=AIが1秒に書ける文字のかたまり(トークン)の数。日本語ならおおよそ1かたまりが1〜2文字
  • 量子化(Q4など)=百科事典を縮小コピーして薄くした版。MoE=百科事典が専門家ごとの分冊に分かれていて、必要な分冊だけ開く方式
2026年10月3日の追記

本文の比較は2026年6月時点の情報です。
その後、2026年8月25日にAppleがMac Studio(M5 Max・M5 Ultra)の新構成を発表、9月22日に発売しました。

M5 Ultraは帯域1.2TB/s・統合メモリ最大512GBと、6月の公開時点で予想として書いていた値より大きく、本命候補に正式追加しています。
Windows on Arm版Claude Code拡張の更新停止(本文中は2026年6月時点の情報)も、その後のバージョンで解消済みとみられます。
RTX 5090・Mac M5 Max・M5 Ultraの現在の候補は、記事後半の「本命候補を選ぶときの機種」に2026年10月3日時点でまとめました。

結論から:一般用途なら今買う、ローカルAI本気なら本命はMac M5 Max・M5 Ultra か RTX 5090

結論:一般用途は現行モデルを今すぐ購入、ローカルAI本気ならMac M5 Max・Mac Studio M5 Ultra・RTX 5090が本命という図解

ローカルAIを動かすPCは、物知りの人に分厚い百科事典を広げて仕事をしてもらう部屋にたとえられます。
見るところは2つで、百科事典を丸ごと広げられる台の広さ(メモリ容量)と、作業台へ本を運ぶ通路の幅(メモリ帯域)です。
RTX Sparkは、台は広いのに通路が3台の中でいちばん狭いPCです。

用途がゲームや一般作業で、今すぐPCが要るなら、現行モデルを買って問題ありません。
生成AIをローカルで本気で動かしたいなら、本命はMac M5 Max・Mac Studio M5 UltraかRTX 5090。

2026年6月時点のRTX Spark・RTX 5090と、確定済みのApple M5世代(10月時点で反映)を踏まえても、
話題のRTX Sparkは“速度の壁”で本命からは外れがち、というのがこの記事の結論です。

意外に思うかもしれません。
128GB×CUDA×持ち運びというRTX Sparkの組み合わせは新しいのに、なぜ本命にならないのか。
理由は、開発で効くメモリ帯域(本を運ぶ通路の幅)が3者で一番低いからです。

この記事は、価格やスペックだけでなく、実測のトークン速度まで並べて、本命にならない理由を一つずつ分解していきます。
とにかく「買うか待つか」だけ先に知りたい人は、RTX SparkとDGX Sparkの違いと、どれを買うか待つかのガイドに要点だけまとめています。

ローカルAI目線で見たRTX Sparkの“素性” — 効くスペックは4つだけ

RTX Sparkの主要スペック(統合メモリ128GB・CUDA・Blackwell GPU・メモリ帯域273GB/sはDGX Sparkの公式値)をまとめた図解

物知りの人に仕事を頼む部屋を選ぶとき、気にするのは壁紙の色より、百科事典を広げる台の広さや本を運ぶ通路の幅です。
RTX Sparkのスペック表も同じで、ローカルAIの“使えるかどうか”を分ける行は限られます。

RTX Sparkが何者かという成り立ちや、DGX Sparkとの違い・発売状況・掲載されている6機種といった“買う前のベース”は、RTX SparkとDGX Sparkの違いと、どれを買うか待つかのガイドで解説しています。
この記事ではローカルAIの“使えるかどうか”を分けるスペックだけに絞ります。
下の表は左が項目名、右がNVIDIA公式の仕様で、たとえば「統合メモリ」の行が台の広さ、「メモリ帯域」の行が通路の幅にあたります。

項目仕様
GPUアーキテクチャBlackwell RTX GPU
CUDAコア数最大6,144コア
CPUNVIDIA Grace CPU(Armベース・20コア・MediaTek共同設計)
AI演算性能最大1ペタフロップス(FP4)
統合メモリ最大128GB(LPDDR5X)
メモリ帯域273GB/s(DGX Sparkの公式値・RTX Sparkは未公表)
ソフトウェア基盤NVIDIA CUDA ネイティブ

スペック表は長いですが、ローカルでLLMを動かす人が見るべきは、たった4行です。

  • 統合メモリ128GB:台の広さ。どれだけ大きいモデル(分厚い百科事典)を“載せられるか”。120B級の巨大LLMも丸ごと収まる容量です
  • メモリ帯域273GB/s:通路の幅。載せたモデルをどれだけ“速く”回せるか。NVIDIAはRTX Sparkの帯域を公表していないため、同じGB10系のDGX Sparkの公式値(273GB/秒)で見ています。帯域が後半の主役になります
  • CUDAネイティブ:NVIDIAのGPUでAIを動かすときの共通言語。最新のAIツールやフレームワークが、翻訳なしでそのまま動くかどうか
  • ArmベースのCPU:PCの頭脳の“話す言葉”の種類。ふだんのWindowsアプリの互換性に影響する土台で、詳しくは後の章で

注目してほしいのは、容量(128GB)は規格外に大きいのに、帯域(273GB/s)はこのクラスにしては控えめ、という“ねじれ”です。
たとえるなら、大広間ほどの台があるのに、そこへ本を運ぶ通路は細い部屋。
この“ねじれ”が、RTX Sparkの評価をまるごと左右します。
RTX Spark実機の帯域は、発売後に確かめる必要があります。

評価の理由を、Mac M5 Max・RTX 5090との実測比較で確かめていきます。

128GBの統合メモリが効く理由(そして、Macとどう違うのか)

統合メモリがローカルAIで効く理由とMacとの違いを示す図解

一般的なWindowsノートは、GPU用の作業台(VRAM)とCPU用の机(メインメモリ)が別々に置かれた部屋のようなものでした。
GPUにデータを渡すたびに、机の本を作業台へ写し直す手間(コピー)が発生し、しかもコンシューマ向けGPUのVRAMは最大でも32GB前後で頭打ち。
だから大きなAIモデルは、作業台に載りきらず動かないか、極端に遅くなっていました。

統合メモリは、作業台と机をつなげて1つの大きな台にしたものです。
128GBの台があれば、分厚い百科事典にあたる大きなモデルも、写し直さずに丸ごと広げられます。
128GBの統合メモリがローカルAIに効き、AIをやる人にとって本丸になるのはこのためです。

別々の台と、1つの大きな台。(左:一般的なWindowsノート=作業台(VRAM・最大でも32GB前後)と机(メインメモリ)が離れていて、本を写し直して運ぶ矢印(コピー)。右:統合メモリ(Mac M5 Max・RTX Spark)=作業台と机がつながった1枚の大きな台(最大128GB)に百科事典が丸ごと広がっている。表示する数値はだけ)
別々の台と、1つの大きな台

「大容量の統合メモリ」そのものは、RTX Sparkの発明ではありません。
先に実現していたのはAppleで、Mac(M5 Max)も最大128GBの統合メモリを積めます。
「巨大モデルをまるごと載せられる」という一点だけなら、Macでも前からできていたわけです。

RTX Sparkの新しさは、その大容量の統合メモリをNVIDIAのCUDAで、しかも持ち運べるWindowsノートで使える点にあります。
CPUとGPUが同じ128GBの台(プール)を共有し、写し直す手間なく巨大なモデルを置けます。
メモリを共有する点はMacと同じで、違うのは、AI開発で事実上の標準になっているCUDAがそのまま手元で動くことです。

  • 大規模モデルがローカルで動く:1,200億パラメータ(120B)級のLLMを最大100万トークンのコンテキストで手元実行(NVIDIA公式値)
  • クラウド不要:使った分だけ払うAPIの料金、通信の待ち時間(レイテンシ)、機密データを外へ送るリスクを避けられる
  • CUDAが手元にある:MacのMLX系と違い、CUDA前提の最新フレームワークやサンプルがそのまま動きやすい
  • 帯域はDGX Sparkの公式値で273GB/s(弱点):台は広い一方で、本を運ぶ通路の幅(データを送り込む速さ)はMac M5 Maxの約614GB/sより狭い。巨大モデルを“速く”回す場面では、通路の狭さ(帯域)がボトルネックになりがちです

華々しいデビューとはいえ、何もかもを期待するのは少し気が早いのかもしれません。
「データセンターと同じCUDA」とはいえ、RTX SparkはArmベースのWindowsモデル。
Arm版でどこまで開発ツールやライブラリが揃うかは、まだ実機で確かめないと分からない部分が残ります(この点はあとの「Windows on Arm」の章で掘り下げます)。

生成AIのコード補助を日常的に使う身として、CUDAを持ち歩けるという発想自体は刺さりました。
ただ、その魅力が実際の速度やArm対応に見合うかは、価格と発売後の検証しだいだと見ています。

正直な懸念 — Windows on Arm とエミュレーション問題

Windows on Armのアプリ互換性に対する懸念を示す図解

PCの頭脳にあたるCPUには、“話す言葉”の種類があります。
ふだん使うWindowsアプリの多くはx86/x64という言葉向けに作られていますが、RTX SparkのCPUは Arm アーキテクチャ という別の言葉を話します。
Armチップ上でWindowsを動かす「Windows on Arm」という構成には、2年前から続く根深い問題があり、Arm版であることは購入前に必ず押さえておきたい点です。

まず確定事実:RTX Spark が Arm 版であることは公式4社が認めている

Arm版かどうかは曖昧にできない部分なので、公式ソースで固めます。
下の表は、左が各社の公式発表の言葉、まん中が発言した会社、右が出典のリンクです。
たとえば1行目は、Arm社自身が記事タイトルで「Arm-based」と書いていることを示しています。

根拠(公式発言)発言主出典
「Powered by the Arm-based NVIDIA Grace CPU」/記事タイトル「Arm-based NVIDIA RTX Spark」Arm社 公式newsroomnewsroom.arm.com
「a high-performance, 20-core NVIDIA Grace™ CPU」/「MediaTek … collaborated with NVIDIA on the custom CPU design」NVIDIA公式プレスリリースnvidianews.nvidia.com
NVIDIAと協業し、RTX Spark のカスタム Arm CPU を設計MediaTek公式mediatek.com
「Windows on Arm」「PrismをRTX Spark向けに最適化」Microsoft公式(Windows Blog)blogs.windows.com

CPUの正式名称は、NVIDIA・Arm両社の公式発表が明記する「NVIDIA Grace CPU」(Armベース・20コア)。
設計はNVIDIAとMediaTekの共同で、NVLink-C2C(CPUとGPUをつなぐ内部の配線)でBlackwell GPUと接続する構成です。

Arm公式newsroomのRTX Spark関連記事のスクリーンショット
Arm社サイトより


チップを作ったArm社自身が記事タイトルに「Arm-based」と掲げているので、Arm版であることはもう議論の余地がありません。

補足すると、コア構成(Cortex-X925×10+Cortex-A725×10、最大4.1GHz)やチップのコードネーム「N1x」は、現時点ではNVIDIA公式文書に記載がない非公式情報です。

ところが面白いことに、NVIDIAの日本語製品ページには「Arm」の表記が一切ありません。
NVIDIA Newsroomや公式Xが前面に出すのは「Windowsネイティブのエージェント」と「NVIDIAのAI&グラフィックス技術」。
同じ1個のチップを、Arm社は「Armチップ」として、NVIDIAは「AIエージェントPC」として語っているわけです。

正直、この売り方に戦略を感じます。
「Arm/Windows on Arm」という言葉には、後述するSnapdragonの負の印象がこびりついている。

だからNVIDIAはその言葉を避け、30年分の技術(CUDA・RTX・DLSS・FP4・TensorRT・OptiX・Reflex・G-SYNC)と、Windows上で自律的に動くエージェントという“前向きな顔”で勝負しています。
裏側はArmでも、表向きは「AIが働くPC」。
このイメージ戦略がハマるかどうかも、普及の鍵になりそうです。

「半分の性能」の正体は通訳の手間 — チップではなくプラットフォームの事情

Microsoft Prismによるx86/x64エミュレーションの仕組みを示す図解

同じ“Armの言葉”を話すCPUでも、作っている会社は別々です。
Snapdragonを作っているのはNVIDIAではなく、Qualcomm(クアルコム) で、RTX SparkとSnapdragonは別会社の競合チップ。
下の表は、左がチップ名、まん中が製造元、右がCPUを誰が設計したかで、2行を見比べると作り手がまったく違うことがわかります。

チップ製造元CPU設計
Snapdragon X / X EliteQualcommQualcomm自社(Oryon)
RTX SparkNVIDIANVIDIA Grace CPU(Armベース・20コア・MediaTek共同設計)

レビュー機で確認していますが、2024年から出ているSnapdragon搭載PCでは、Premiere Proなどが本来の速度を出せず、体感で半分近くまで落ちる場面がありました。
速度の低下はSnapdragonというシリコンの欠陥ではありません。
x86/x64用に作られたアプリを、Microsoftの Prism というエミュレーション層が翻訳して動かすために起きる、Windows on Arm共通の現象です。

たとえるなら、外国語で書かれた台本を、通訳が1行ずつ訳しながら演じている状態です。
通訳(Prism)が優秀でも、訳す手間のぶんだけ、最初からその言葉で書かれた台本(Arm64ネイティブ版)より遅くなります。
原因は「そのアプリにArm64ネイティブ版があるか」であって、チップメーカーが誰かは関係ありません。

だからRTX Sparkも、Windows on Armの互換性事情を引き継ぎます。
NVIDIAだから魔法のように解決、とはなりません。

通訳を挟むと遅くなる。(上段:Arm64ネイティブ版のアプリ=最初からArmの言葉で書かれた台本を、CPUがそのまま読む。下段:x86/x64用のアプリ=別の言葉の台本を、通訳役のPrismが訳しながらCPUに渡す。下段にの吹き出し。注記。数値は入れない)
通訳を挟むと遅くなる

ただし2026年秋は、2年前よりかなりマシ

各社の発表では、互換性は2年前よりかなり良くなったと説明されています。
ただ、各社の説明をそのまま鵜呑みにはできません。

先ほどのPremiere Proの遅さに加えて、そもそもSnapdragon PCの初期設定に一度も成功したことすらありません。
Arm版ではアプリの速度や初期設定でつまずくことがあるので、「改善した」と言い切るのは控えておきます。

  • Adobe Premiere Pro / After Effects / Audition / Media EncoderはArm64ネイティブ化済み(v26.0〜)
  • ただし初期版はサードパーティプラグイン、一部RAW/ProRes、一部H.264/HEVCのハードウェアデコード(動画を専用の回路で読み込む機能)が未対応
  • Prism自体も高速化し、レガシー64bitアプリ(古くからあるx64用のアプリ)も実用域。ただしバッテリー消費は15〜20%増
  • 現代ワークフローの主要アプリは、2026年にはほぼネイティブ対応

そして、アプリ互換への本気度が、今回いちばんの朗報です。
NVIDIAとMicrosoftは、Snapdragon時代に一番嫌われた「アプリが動かない」問題を、正面から潰しに来ています。

  • PrismエミュレータをRTX Spark専用にチューニング(Microsoft公式)。x86アプリの翻訳実行を高速化
  • ジェンスン・フアンCEOが「過去のあらゆるWindowsアプリを動かす」と明言
  • アンチチート(Easy Anti-Cheat/BattlEye)がネイティブ対応 → Fortnite・VALORANT・PUBGがArm上で起動。Snapdragonで一番不評だった「ゲームが動かない」への直接回答
  • Xbox PCアプリ対応、Windows 11のタスクスケジューラ自体をRTX Spark向けに刷新

Snapdragonが2年かけても埋めきれなかった穴を、NVIDIA・Microsoft・ゲーム会社が総がかりで塞ぎに来た構図。
RTX Sparkに本気度を感じたのは、まさにこの一点です。

NVIDIA側の固有の強みもあります。
GPU・CUDA・レイトレ・DLSSはネイティブ動作で、GPU処理はエミュレーションを通りません(通訳を挟まずに動きます)。

Snapdragon X Elite Gen2比でレイトレ性能4倍、マルチスレッド処理(作業を何人かで分けてこなす処理・Blender)は統合メモリの効果で41%上回るというデータも出ています。
一方でCPUのシングルスレッド(1つの作業を1人でこなす速さ)はQualcomm比で約8%劣る、というのが現時点の評価。

本当の敵は「Windows on Arm=Snapdragon=遅い」の刷り込み

実は、Snapdragonが残した刷り込みが一番のハードルだと見ています。
2年間、Windows on Armの顔はSnapdragonでした。
その結果、「Arm版Windows=アプリが動かない・遅い」という負の印象が世間に定着しています。

RTX Sparkはこの先入観を背負わされた状態でスタートします。
Qualcomm株は発表当日に7%下落し、Qualcomm自身が「ようこそ」と皮肉混じりにコメントしたほど。
NVIDIAがこの誤解を解けるかどうかが、普及の分かれ目。

Apple M5 Max(614GB/s)vs RTX Spark(DGX Spark公式値で273GB/s)— 本を運ぶ通路の幅(帯域)で比べると意外な結果

Apple M5 Max(614GB/s)とRTX Spark(273GB/s・DGX Sparkの公式値、RTX Sparkは未公表)のメモリ帯域幅を比較する図解

同じ広さの台がある2つの部屋でも、本を運ぶ通路が広い部屋のほうが、物知りの人は速く答えを書けます。
「結局Macと比べてどうなの」という疑問に、台の広さと通路の幅の数字で答えます。
比べる相手は、2026年3月発売のMacBook Pro(M5 Max)です。

その前に、よく聞かれる「M5っていくつ種類があるの」を片付けておきます。
2026年10月時点のM5ファミリーは、下の4つ。
表は左から、チップ名・台の広さ(統合メモリ上限)・通路の幅(メモリ帯域)・主な搭載機で、たとえばM5 Maxの行は、GPUのコア数によって通路の幅が460GB/sと614GB/sに分かれることを示しています。

チップ統合メモリ上限メモリ帯域主な搭載機・発表
M5(無印)32GB153.6GB/sMacBook Pro 14 / iPad Pro(2025年10月)
M5 Pro64GB307GB/sMacBook Pro(2026年3月)
M5 Max128GB460GB/s(32コアGPU)/614GB/s(40コアGPU)MacBook Pro(2026年3月)
M5 Ultra512GB1.2TB/s(64・80コアGPU共通)Mac Studio(2026年9月22日発売)

4つともApple公式の確定値です(M5 Ultraは2026年8月25日発表・9月22日発売、本文公開時点では未発表の予想として書いていましたが、その後確定しました)。
ローカルAIで大型モデルを丸ごと載せたいなら、128GBに届くのは M5 Max以上 だけ。
M5 Proは上限64GB・帯域307GB/sで、RTX Sparkの273GB/sと近い帯域です。

M5 Ultraは帯域1.2TB/s・統合メモリ最大512GBで、RTX Sparkはおろか本命候補のM5 Maxも大きく超えますが、価格も949,800円からとひとまわり上がります。
だからRTX Sparkとまず同じ土俵で比較すべき相手は、同じ128GBクラスのM5 Max。
以下はそのM5 Maxとの一騎打ちで、M5 Ultraは後半の「本命候補」でもう一度扱います。

次の表は、RTX SparkとM5 Maxを1行ずつ並べたものです。
「統合メモリ」の行は台の広さが同じ128GBで、「メモリ帯域」の行で通路の幅が倍以上違う、という読み方をしてください。

項目RTX SparkApple M5 Max
統合メモリ最大128GB最大128GB
メモリ帯域273GB/s(DGX Sparkの公式値・RTX Sparkは未公表)最大614GB/s(40コアGPU構成)
アーキテクチャBlackwell GPU + Arm CPUApple Silicon
エコシステムCUDA(業界標準)Metal / MLX
OSWindows on ArmmacOS

先に「メモリ帯域」をかみ砕きます。
メモリ帯域は、メモリからチップへデータを送り込む道で、たとえるなら作業台へ本を運ぶ通路の幅です。
通路が広いほど一度にたくさんのページを運べて、AIが答えを書き出す速度も上がります。

容量(128GB)が「どれだけ分厚い百科事典を広げられるか」なら、帯域(GB/s)は「そのページをどれだけ速く運べるか」です。
その目で見ると、実はM5 Maxの614GB/sがRTX Sparkの273GB/sを大きく上回ります。
両方とも128GBの統合メモリなのに、帯域では意外な逆転。

通路の幅が倍以上違うので、メモリ帯域が効くAI推論では、M5 Maxが有利な場面も出てきます。
ではRTX Sparkの価値はどこにあるのか。
答えは CUDA です。

CUDAは、NVIDIA製GPUでAIを動かすための土台(部品をつなぐ共通言語)で、いまの業界標準。
たとえるなら、AIの道具の多くが「CUDAの言葉」で説明書を書いている状態で、最新のAIツールの多くがCUDAを前提に作られています。
従来、CUDAをフルに使える128GBクラスの環境は、デスクトップのデータセンター機しかありませんでした。

大容量メモリとCUDAを薄型Windowsノートに持ち込んだのがRTX Sparkの本質です。
通路の幅(帯域)では負けても、使える道具(ソフトウェア資産)の豊富さで戦う構図です。

生成AIをやるなら、MacとWindowsどっち?

ローカルAI用途でMacとWindowsどちらを選ぶかを示す図解

MacとWindowsの選択は、物知りの人にどちらの部屋で働いてもらうかを決める話に似ています。
NVIDIAのGPUを積んだWindowsは、AIの道具(CUDA対応のツール)がいちばんそろった部屋。
Macは、大きな台を静かに少ない電気で使える部屋です。

2026年時点のローカルAIの実情を、数字で整理します。

速度・エコシステムで選ぶならNVIDIA(CUDA)。
CUDAはMLX(Apple製チップでAIを動かす土台)より推論が2〜4倍速い場面があり、新しいモデルやフレームワーク(vLLM、Unsloth等)はCUDA前提で設計されることが多い。
画像生成や学習タスクもNVIDIAが強い領域です。
RTX 5070 Ti(16GB)で9BのQLoRA学習を回した当サイトの実測は、16GBのファインチューニング実測にまとめています。

大きなモデルを載せる・静音・省電力で選ぶならMac。
Apple Siliconの統合メモリは、64GB機でも70Bモデルを15〜20トークン/秒で動かせます。

MLXは新モデルへの対応が速く、消費電力も大幅に低い。
発熱と騒音が少ないのも日常使いでは効きます。

そしてRTX Sparkの立ち位置は、この両者の強みを1台に束ねようとしたもの。
Macのような大容量統合メモリと、NVIDIAのCUDAエコシステムを1台に。
ただし通路の幅(帯域)ではM5 Maxに譲るので、メモリ帯域がボトルネックになる用途では、まだMacが勝つ場面も残ります。

新しいモデルを片っ端から試したい・学習までやりたいならNVIDIA系。
静かに大きなモデルを動かしたいならMac。

そして「WindowsのままCUDAを持ち歩きたい」という願いに初めて応えるのがRTX Spark。
普段使いでMacとWindowsのどちらが向くかは、MacとWindowsのメリット・デメリット比較でも解説しています。

生成AIの「2台目」をどれにする? — 本命はMac M5 Max と RTX 5090(RTX Sparkは?)

RTX Spark・Mac M5 Max・RTX 5090の3台のスペック比較図解(RTX Sparkのメモリ帯域は273GB/s・DGX Sparkの公式値)

物知りの人に頼む仕事が増えてくると、部屋が1つでは足りなくなります。
生成AIの2台目選びが、今いちばん相談を受ける話です。
生成AIで仕事をしていると、学習用、推論用、画像生成用と、もう1台ほしくなる瞬間が来ます。

手元でも3台のデバイスを稼働しています。
1台では、到底足りません。
生成AI用の2台目候補は、次の3つです。

  • もともとMacユーザーなら、メモリ・ストレージを盛った上位Macをもう1台
  • いっそWindowsで、RTX 5090のようなハイエンドGPU機
  • 新たな候補として2026年6月、RTX Sparkが加わりました

迷う最大の理由は、3者が「得意なこと」も「弱点」もバラバラだからです。
スペックを正面から並べます。
表は列ごとに1台で、「AIで使えるメモリ」の行が台の広さ、「メモリ帯域」の行が通路の幅にあたり、たとえばRTX 5090は台が32GBと小さめでも通路が3台でいちばん広いと読めます。

項目RTX 5090(Windowsデスクトップ)Apple M5 Max(Mac)RTX Spark
AIで使えるメモリ32GB(GDDR7・専用VRAM)最大128GB(統合)最大128GB(統合)
メモリ帯域約1,792GB/s最大614GB/s273GB/s(DGX Sparkの公式値・RTX Sparkは未公表)
エコシステムCUDA(業界標準)MLX / MetalCUDA
消費電力(目安)600〜1,200W級60〜90W高効率(ノート級)
形態据え置きデスクトップノート/デスクトップ薄型ノート/小型デスク

この表に、3者の性格がそのまま出ています。
台の広さと通路の幅のたとえで言い直すと、RTX 5090は「台は小さめだが通路がとても広い部屋」、Mac M5 Maxは「台が広く通路も広めの部屋」、RTX Sparkは「台は広いが通路が細い部屋」です。

3台を“部屋”にたとえると。(3つの部屋を横に並べたイラスト。RTX 5090=小さめの作業台(32GB)に広い通路(約1,792GB/s)・据え置き/Mac M5 Max=大きな台(最大128GB)にやや広い通路(最大614GB/s)・静か/RTX Spark=大きな台(最大128GB)に細い通路(273GB/s・DGX Sparkの公式値)・持ち運べる。通路の太さは3段階の見た目
3台を“部屋”にたとえると

RTX 5090は「速さと画像生成が強み、ただし容量の壁」。
帯域1,792GB/sは3者で最も広い。
小〜中サイズのモデル(〜32GB)なら一番速く、画像生成はCUDAのおかげでMacの数倍。

画像生成を繰り返す人には、RTX 5090が一番気持ちよく使えます。
ただし作業台(VRAM)が32GBで頭打ちなので、70B超の大きなモデル(分厚い百科事典)はそのままだと載りません。
消費電力が大きく、ファンも回る据え置き専用機です。

Mac M5 Maxは「大きいモデルと静けさ、しかも帯域が速い」。
128GBの統合メモリ(大きな1つの台)で70B級も丸ごと載り、しかも通路の幅にあたる帯域614GB/sはRTX Sparkより上。

消費電力は60〜90Wで、RTXの10〜20分の1。
実は、純粋な大規模モデルの推論速度では、Mac M5 MaxがRTX Sparkを上回る場面もあります。
弱点はCUDAではなくMLX系なので、CUDA前提の最新フレームワークは一手間かかること。

RTX Sparkは「128GB×CUDA×持ち運び、ただし帯域は控えめ」。
Macのような大容量統合メモリに、NVIDIAのCUDAを薄型ノートで両立。

大容量統合メモリとCUDAを薄型ノートで使える、従来にはなかった組み合わせです。
ただし帯域はDGX Sparkの公式値で273GB/sと3者で一番低く、巨大モデルを動かすと速度は伸び切りません。
「CUDA資産を活かしたまま大きなモデルを持ち歩きたい」人のための1台、という立ち位置。

この3つは横並びの「三つ巴」に見えて、実は立っている土俵が違います。

まずRTX 5090は据え置きデスクトップ。
持ち運べるノートのMacやRTX Sparkとは、そもそも別カテゴリです。

「電源とスペースを用意して、最速と画像生成を取りにいく」と決めた人のための選択肢。
本当の比較は、RTX 5090を一度わきに置くと見えやすくなります。

残るのは、「1台で持ち歩きも据え置きもこなすノート」という同じ土俵に立つ2台、Mac M5 MaxとRTX Sparkです。
どちらも128GBの統合メモリを積める、数少ないノート。
ところが、この一騎打ちでRTX Sparkは苦しくなります。

帯域が273GB/sと、Mac M5 Maxの614GB/sの半分以下。
開発で実際に回す7B〜70Bあたりのモデルは、本を運ぶ通路の幅(帯域)がそのまま体感速度に効くので、同じモデルならMacのほうが速い。

容量はMacと同じ128GBなので、120B級モデルが載るかどうかはどちらも変わらず、速度はMacが上回ります。
RTX Sparkに実質的な強みがあるとすれば、CUDA資産をそのまま使える点だけです。
ただし120B級のモデルでは生成50トークン/秒ほどで、対話しながら開発するには重すぎます。

ローカルAI開発用の機材については、次のように見ています。
本気でローカルAI開発をするなら、本命はMac M5 MaxとRTX 5090の2台。

1台で携帯まで済ませたいならMac M5 Max、据え置きで最速と画像生成を取るならRTX 5090。
話題のRTX Sparkは、この2台の“いいとこ取り”に見えて、速度の壁で本命からは外れるというのが現時点の結論です。
(128GBでも足りない人向けのMac Studio M5 Ultraは、記事後半でもう一度扱います)

投げかけた質問は早く回答してもらいたい。
そして、PDCAは早くまわしたい。


RTX Sparkが活きるのは、「CUDAを使いたい・巨大モデルを載せたい・持ち歩きたい・速度はある程度妥協できる」という条件がそろったとき。
その立ち位置を理解したうえでなら、面白い1台です。
そもそもGPUを選ぶときの基本の見方は、GPU選びの5つのポイントで書いています。

Claude Code を VS Code で動かすなら? — Windows on Arm・Windows・Mac の違い

Claude CodeをVS Codeで使う場合のMac・Windows・Windows on Armの違いを示す図解

Claude Codeを使うのは、遠くの事務所にいる物知りの人へ電話で質問するのに似ています。
考えるのは電話の向こう(クラウド)で、手元のPCは電話機と、言われた作業をこなす手足の役です。
生成AIでコードを書く人が増え、「Claude CodeをVS Codeで使うなら、どのPCがいい?」という質問もよく受けます。

Claude Codeまわりは誤解が多いので、先に大事な前提を1つ。
Claude Codeの推論(AIが考える部分)は、手元のチップではなくクラウド側で走ります。

だから、トークン生成の速さ自体は、Mac・Windows・Windows on Armで基本的に同じ。
応答速度はネットワークとサーバー次第で、ローカルのCPUやGPUの性能では変わりません。

では何が変わるのか。
拡張機能の対応状況、ターミナルとの相性、そしてローカルの開発ツール(ビルドやテスト)の速さです。

2026年10月時点の実情を表にします。
表は列がPCの種類、行が確かめた項目で、たとえば最後の「AI応答」の行は、電話の向こうで考えるので3者ともほぼ同じ、という意味です。

項目Mac(Apple Silicon)Windows(x86/x64)Windows on Arm(RTX Spark等)
Claude Code本体ネイティブ動作WSL2推奨ネイティブ動作(ただし制約あり)
VS Code拡張のバージョン最新最新最新(Arm64対応済みとみられる)
ターミナル/Unix親和性最高(標準でUnix系)WSL2で確保WSL2で確保
開発ツールチェーンネイティブで快適ネイティブArm64ネイティブなら速い/x86はエミュレーション
AI応答(トークン速度)3者ほぼ同じ(クラウド処理)同左同左

この記事を書いた2026年6月時点では、Windows on Arm版のClaude Code VS Code拡張がv2.0.46で更新が停止し、x64版(v2.1.9)との差が無視できない弱点でした(Anthropic公式GitHubのIssueで報告されていました)。
その後、該当Issueをさかのぼると、同じ問題への対応として拡張機能のArm64ネイティブ対応が入り、関連するクラッシュ修正も重なっています。
2026年10月時点では、この更新停止は解消済みとみられます。

Claude CodeのVS Code拡張という1点だけで見れば、Mac・Windows・Windows on Armの差はもうほとんどありません。
残る違いは、ターミナル(文字で命令を打ち込む画面)やUnix系ツールとの親和性くらいです。

Macは、ターミナルが標準でUnix系、開発ツールもほぼネイティブという点で、今もいちばん摩擦が少ない選択肢。
ファンレスで静かに1日中コードを書ける点も、地味に効きます。

Windows(x86/x64)は、WSL2(Windows上でLinux環境を動かす仕組み)を使うのが定番。
Linuxの部屋を1つ間借りするぶん小さな手間(オーバーヘッド)は乗りますが、実用上は問題ありません。

Windows on Arm(RTX Spark等)は、Claude Code本体はネイティブ動作(ただし制約あり)、拡張機能の更新停止も解消していれば、実用上の差はなくなります。
購入前に念のため、使う時点の拡張機能バージョンがx64版と揃っているかだけ確認しておくと安心です。

ローカルLLMを入れてClaude Codeで動かすなら? — RTX 5090・Mac M5・RTX Spark で何が変わる

ローカルLLMとClaude Codeの組み合わせの向き・不向きを示す図解

今度は電話をやめて、物知りの人に自分の家へ来てもらい、手元の作業台で百科事典を広げて働いてもらう話です。
クラウドではなく、自分のPCにローカルLLMを入れて、Claude CodeをローカルLLMに繋ぐケース。
この瞬間、チップの性能がすべてを決めます。

モデルを動かすのが、クラウドではなく手元のPCになるからです。
台の広さ(メモリ容量)で載せられる百科事典の分厚さが決まり、通路の幅(メモリ帯域)で答えを書く速さが決まります。

先に、押さえておきたい言葉を5つだけ

ローカルAIの基本用語(VRAM・統合メモリ・メモリ帯域など)をまとめた図解

料理のレシピを読む前に「大さじ」「小さじ」を知っておくと迷わないように、数字の前に専門用語を最小限だけ噛み砕いておきます。
この5語さえ押さえれば、後の表はぜんぶ読めます。

  • トークン/秒(tok/s):AIが1秒に書ける文字のかたまり(トークン)の数で、文章を書き出す速さのこと。人が快適に読む目安は20前後で、超えれば待ち感はほぼ消え、10を切ると“少し待つ”体感になります
  • メモリ帯域(GB/s):メモリからチップへデータを送る“通路の幅”。広いほど一度にたくさんのページを運べて、ローカルAIの速度はほぼこの帯域で決まります
  • MoE(混合エキスパート):百科事典が専門家ごとの分冊に分かれていて、1トークン書くたびに必要な分冊だけ開く方式。巨大でも毎回その一部だけを動かすので、Qwen3-Coder-Next 80Bは、80Bのうち毎回3Bぶんだけ使って速度を稼ぎます
  • 量子化(Q4など):百科事典を縮小コピーして薄くするように、モデルを圧縮してメモリ使用量を減らす手法。Q4なら元の約4分の1サイズになり、細かい字が少しつぶれるように精度を少し割り引く代わりに手元で動きます
  • CUDA / MLX:AIを動かす土台(部品をつなぐ共通言語)。CUDAはNVIDIA製GPUの業界標準、MLXはApple製チップ用で、最新ツールの多くはCUDAの言葉で書かれています

まず「できるのか?」から。
2026年は、もう難しくありません。

Ollamaがv0.14.0(2026年1月)からAnthropicのMessages API(Claude CodeがAIとやり取りするときの決まった形式)にネイティブ対応したので、Claude Codeを翻訳レイヤーなしで直接ローカルモデルに繋げます。
LiteLLMのようなプロキシ(間に立つ取り次ぎ役)を挟む方法もあり、設定は環境にもよりますが数十分ほどで済みます。

ただし、ひとつ釘を刺しておきたいことがあります。
ローカルLLMは、どれを選んでもクラウドのClaude本体よりコーディング能力が落ちます。

複雑な多段タスクでの精度が下がり、ツール呼び出し(AIがファイル操作などの道具を使う動き)が不安定になり、存在しないファイルパスを書くことも増えます。
ローカル化は「速さや賢さ」ではなく、プライバシー・コスト・オフラインのための選択だと割り切るのが正解です。

その上で、ローカルで使えるコーディングモデルの実情です。
エージェント用途で評価が高いのは、Qwen3-Coder-Next(80BのMoEモデル・Q4で約35〜40GB)やKimi K2.6など。

Qwen3-Coder-NextやKimi K2.6などの大型モデルは、メモリに丸ごと載せるなら128GBクラスが要ります。
一方、24〜32B級(Devstral 24B・Qwen 27B等)なら、24〜32GBのVRAMでも動きます。

では、3プラットフォームの相性です。
表は列が3台、行が見るべき観点で、たとえば「載るモデルの上限」の行は、RTX 5090の作業台が32GBまでなのに対し、MacとRTX Sparkは128GBの大きな台に大型MoEも丸ごと広げられる、という読み方です。

観点Windows+RTX 5090Mac M5 MaxRTX Spark
載るモデルの上限32GBまで(中型が上限)128GB(大型MoEも丸ごと)128GB(大型MoEも丸ごと)
メモリ帯域約1,792GB/s(GDDR7)約614GB/s(統合)273GB/s(DGX Sparkの公式値・RTX Sparkは未公表)・LPDDR5X・3者で最遅
エコシステムCUDAMLXCUDA
Claude Code本体WSL2推奨・拡張は最新ネイティブ・拡張は最新ネイティブ動作(制約あり)・拡張は最新(更新停止は解消済みとみられる)
形態・消費電力据え置き・カードTDP 575Wノート/デスク・60〜90W小型・システムピーク約240W

Windows+RTX 5090は「中型モデルを最速で回す」型。
帯域1,792GB/sで、24〜32B級のコーダーモデルなら一番速く返してきます。

CUDAなので新しいモデルの対応も早い。
弱点はVRAM 32GBの壁で、80B級のMoEは全部載せきれず、システムメモリに溢れた分だけ失速します。
作業台からはみ出したページを机に置き、必要になるたびに取りに行くので、そのぶん待たされるイメージです。

Mac M5 Maxは「大型エージェントモデルを現実的な速度で」型。
128GBの統合メモリで、Qwen3-Coder-NextのようなMoEも丸ごと載ります。

通路の幅にあたる帯域614GB/sはRTX Spark(DGX Sparkの公式値で273GB/s)の倍以上あり、大型モデルの推論速度でSparkを上回ります。
しかもClaude Code本体がMacではネイティブで、拡張も最新が動く。
記事の執筆時点では、ローカルLLM×Claude Codeの総合バランスは、Mac M5 Maxが一番素直です。

RTX Sparkは「理想形、ただし今はまだ待ち」型。
128GBの大容量とCUDAを薄型ノートで両立する、という発想自体は3者で唯一無二。

ただ帯域が273GB/sと最も低く、大型モデルを動かすとトークン速度が伸び切りません。
Windows on Arm版のClaude Code拡張の更新停止は2026年10月時点で解消済みとみられますが、発売自体がまだです。
ポテンシャルは高いのに、2026年10月の今も発売・実測待ちで実力をフルに出せない、というのが実際のところです。

RTX SparkとDGX Sparkは同じ? — チップは共通、製品は別物

実測値の話に入る前に、「RTX Spark」と「DGX Spark」という似た名前を整理しておきます。
たとえるなら、同じエンジンを積んだ別々の車種です。
名前が途中で変わったわけではなく、同じGB10系のチップを使った、別ブランドの2製品です。

20コアのNVIDIA Grace CPU・Blackwell GPU・統合メモリ最大128GB・FP4性能約1ペタフロップス(AI向けの計算をこなす速さの目安)という核のスペックは共通です。

先に出たのがDGX Spark。
NVIDIA自身が出す開発者向けの製品で、OSはLinux(DGX OS)、すでに発売されています。
米国価格は2026年2月の改定で4,699ドルからになりました(NVIDIA開発者フォーラムの告知)。
日本ではNVIDIAの認定チャネルと小売パートナーから購入する形です。
互換機との違いや買い方は、DGX Sparkと互換機の比較にまとめています。

後から出るのが、この記事のテーマであるRTX Spark。
同じ系統のチップをMicrosoft・Arm・MediaTekと組んでWindows on Arm向けに展開し、NVIDIAの公式ブログ(2026年10月2日)ではAcer・ASUS・Dell・HP・Lenovo・Microsoft・MSIから2026年10月に登場すると案内されています。
2026年10月6日時点では、NVIDIAの製品ページは販売開始のお知らせを受け付けている段階です。
OSがLinuxかWindowsか、DGX Spark(とその互換機)として買うか各メーカーのWindows PCとして買うかが違い、中身のチップは同じ系統という関係です。
ノート・小型デスクトップ・ミニPCのどれを買うか、発売まで待つかは、RTX SparkとDGX Sparkの違いと選び方で整理しています。

RTX Sparkはまだ実機が無いため、この記事では同じチップを積むDGX Sparkの実測値を、RTX Sparkの性能を推定する参考値として使います。

答えを書き出す速さの実測(トークン速度)— 通路の幅(帯域)の差が数字で見える

NVLink-C2C(チップ間の内部配線)と、メモリ帯域273GB/s(DGX Sparkの公式値)の違いを示す図解

100m走のタイムは、同じコースを同じ靴で走ったもの同士でないと比べられません。
前の章まではスペック上の性格の話でしたが、次は公開されている第三者の実測ベンチマークの数字で確かめます(NVIDIA・Apple公式の出荷スペックではなく、同一テスト環境での計測値)。
まず、RTX Spark と同じGB10シリコンを積む開発機(DGX Spark)と、RTX 5090 を 同じ人が同じモデル(gpt-oss 20B)で測った 値がいちばん公平です。

下の表は、左が測った項目、まん中がRTX 5090、右がRTX Spark(GB10)の列で、実際に測ったのは同じGB10を使うDGX Sparkです。
たとえば「トークン生成」の行は、1秒に書ける文字のかたまりの数がRTX 5090で約325、RTX Spark(GB10)で約85だったことを示しています。

gpt-oss 20B(同一テスト)RTX 5090RTX Spark(GB10)
トークン生成約325トークン/秒約85トークン/秒
入力(プロンプト)処理約12,809トークン/秒約3,685トークン/秒

生成(答えを書き出す速さ)で約3.8倍、入力処理(質問や資料を読み込む速さ)で約3.5倍の差。
体感で言うと、85トークン/秒でも読むには十分速い一方、長いコードを一気に書かせると325との差が待ち時間としてはっきり出ます。
同じ20Bモデルで速度差が開くのは、演算力ではなくメモリ帯域の差がそのまま出ているからです。

RTX 5090 の1,792GB/sに対し、Spark系はDGX Sparkの公式値で273GB/s(RTX Sparkの帯域はNVIDIAが公表していません)。
さっきの“通路の幅”でいえば、Spark系の通路は5090の約6.6分の1の幅しかありません。
ローカル推論のトークン速度は、ざっくり「メモリ帯域 ÷ モデルのサイズ」で決まるので、帯域が約6.6分の1なら速度もその比率に引っ張られます。

同じ通路でも、百科事典が分厚くなるほど、1トークン書くたびに運ぶページが増えます。
では大型モデルならどうか。

GB10で gpt-oss 120B を動かすと、生成は約50トークン/秒・入力処理は約1,821トークン/秒まで落ちます。
同じ128GB級のMac M5 Max(帯域614GB/s)は、70BクラスのQ4で約28トークン/秒、122BのMoEで約15トークン/秒という実測値。

(実測値の出典)DGX Spark・RTX 5090・Mac M5 Maxの数値は独自の計測ではなく、公開されている第三者ベンチマークの引用です。
DGX Spark(GB10)とRTX 5090の gpt-oss 計測は Robert McDermott氏のレビュー、Mac M5 Maxの計測は LLM Check のベンチマーク を参照しています。
いずれもメーカー公式の出荷スペックではなく、第三者が同種の条件で測った参考値です。

当サイトでも、RTX 5070 Ti(VRAM 16GB)のデスクトップでgpt-oss-20bを測りました。
llama.cppのllama-benchで、深さ0(前置きの文章なし)の生成は約226 tok/s、32K(論文1本くらい)まで文章を積んでも約181 tok/sです。

上の表とは計測ツールも条件も違うため、コースも靴も違う100m走のタイムと同じで、数字を横に並べて順位を付けることはできません。
それでも20B級なら、16GBのGPUでも読む速さを大きく超えて動きます。
条件と回答品質はgpt-oss-20bの16GB実測にまとめています。

CPUとGPUをつなぐ配線の読み違いに注意 — 渡り廊下(NVLink-C2C)の速さはメモリ帯域ではない

家の中に広い渡り廊下があっても、作業台へ本を運ぶ通路が細ければ、本を運ぶ速さは細い通路で決まります。
もう1つ、混同しやすい点をこのたとえで切り分けておきます。
GB10はCPUとGPUを NVLink-C2C という配線でつないでいますが、NVLink-C2Cの速さはメモリ帯域ではありません。

GB10はCPU側ダイ(チップ本体の1枚・メモリ管理を含む)とBlackwell GPU側ダイの2チップ構成で、その チップ間をつなぐ内部配線(2つの部屋をつなぐ渡り廊下)がNVLink-C2Cです。
チップ内のCPUとGPUをつなぐ配線の速さは、外部メモリの帯域とは別物です。
GPUが実際に外部のLPDDR5Xメモリを読み書きする帯域(本を運ぶ通路の幅)は273GB/s(同じGB10を使うDGX Sparkの公式値)。
推論速度を縛るのは後者のメモリ帯域なので、チップ間の配線の速さを見て「速い」と読むと判断を誤ります。

公式スペックの数字は、渡り廊下の幅なのか通路の幅なのか、正しい場所に当てはめて読む必要があります。

電力と総コスト — 速いだけでは決まらない

最後に、見落とされがちな電力です。
車選びで燃費を見るのと同じで、速い1台ほど毎日の電気代がかさみます。
RTX 5090はカード単体でTDP(設計上の消費電力の目安)575W、瞬間ピークは700Wを超えます。

RTX 5090は画像生成や学習を回すなら頼もしい一方、電気代と発熱・騒音という形で毎日跳ね返ってきます。
対してGB10機はシステム全体のピークで約240W、アイドル(何もしていないとき)は約25W前後。
Mac M5 Maxは負荷時でも60〜90Wに収まります。

仮に1日8時間ローカル推論を回すなら、フル稼働時の消費電力はRTX 5090がSpark系の2倍以上、Macの6〜9倍にあたる計算です。
本体価格だけでなく、数年使ったときの電気代まで含めて見ると、省電力2台(Mac・Spark系)と高性能・高消費電力のRTX 5090で、性格がはっきり分かれます。

3年前にLLMをローカルで構築する環境を調べた時も、最後まで電力問題を解決できませんでした。

モデルの賢さは、どれを選んでも“クラウドのClaude未満”

速度の次は中身です。
家に来てもらえる物知りの人は気軽に頼めますが、遠くの事務所にいる一番の物知り(クラウドのClaude)ほど博識とは限りません。
ローカルで評価の高いコーダーモデル Qwen3-Coder-Next(80B MoE・毎回使うのは3Bぶん=3Bアクティブ)は、SWE-bench Verified(実際のプログラムの不具合を直せるかを測る試験)で約67%。

クラウドの最新Claude本体(Opus・Sonnet系)は、同じSWE-bench Verifiedの数値をAnthropicが公式には出していません。
公開済みの各種ベンチマークを見る限り、ローカルモデルはクラウドの最新Claude本体の水準には届いていません。

数字の差はそのまま、複雑なタスクでのツール呼び出しの安定性や多段作業の精度差として出ます。
どのプラットフォームでローカル化しても、賢さの天井はクラウドのClaude本体より低い、という前提は変わりません。

だからこそ、ローカルLLMの強化が重要になります。
LLMの講座でも、ローカルLLMの強化が最終目標になっています。

3者の強み・弱点を数字で比較

速さ・容量・電力の数字を、通知表のように1台1行でまとめます。
表は左が機種、まん中が強み、右が弱点で、たとえばRTX Spark(GB10)の行は、台の広さと持ち運びが強み、通路の細さ(帯域)が弱点と読めます。
RTX Spark(GB10)の行の数字は、まだ実機の無いRTX Sparkの代わりに、同じGB10を使うDGX Sparkで測った値です。

プラットフォーム強み(数字の裏付け)弱点(数字の裏付け)
RTX 5090gpt-oss 20Bで生成325トークン/秒・入力12,809トークン/秒/帯域1,792GB/sVRAM 32GBの壁/カードTDP 575W・瞬間ピーク700W超
Mac M5 Max70B Q4で約28トークン/秒・122B MoEで約15トークン/秒/帯域614GB/s・消費60〜90WMLX(CUDA非対応)で最新CUDAツールは対応待ち
RTX Spark(GB10)128GB×CUDA×携帯を1台で両立/システムピーク約240W・アイドル約25Wgpt-oss 20Bで生成85トークン/秒(5090の約1/3.8)/帯域273GB/sで3者最遅

この表が、3者の性格を数字でそのまま表しています。
通路がいちばん広く速いRTX 5090、台が広く省電力のMac、台は広いのに通路が細いRTX Spark。

本気でローカルLLM×Claude Codeをやるなら、本命はMac M5 MaxとRTX 5090の2台。
話題のRTX Sparkは、帯域の遅さ(同じGB10を使うDGX Sparkの値で273GB/s)で日常的に回す開発機としては本命から一歩外れ、活きるのは巨大モデルをCUDAで持ち歩きたいという限定用途です。

ただし、Mac M5 MaxとRTX 5090を本命としたのは2026年6月時点の話です。
AI関連は毎日、いや毎時間アップデートが溢れ、状況は一変します。

実際、2026年8月にAppleがMac Studio M5 Ultra(帯域1.2TB/s・統合メモリ最大512GB)を発表し、9月22日に発売しました。
帯域はRTX 5090の1,792GB/sに近づき、容量はM5 Maxの128GBも超えます。
128GBに収まらない超大型モデルを丸ごと動かしたい人には、M5 Ultraも本命候補に入ってきます。

結局、どれを選ぶか — タイプ別の判断

用途タイプ別にMac M5 Max・Mac Studio M5 Ultra・RTX 5090・RTX Sparkの選び方を示す図解

引っ越し先の部屋を、家族の人数や荷物の量で選ぶのと同じで、ローカルAIの1台も「どのくらい分厚い百科事典を、どのくらいの速さで使いたいか」で決まります。
実測を踏まえ、ローカルAI前提で割り振ります。

  • 1台で携帯も据え置きも済ませたい → Mac M5 Max。大型モデルが丸ごと載り、帯域614GB/sで速度も現実的、Claude Code本体もネイティブ。今すぐ買えるのも強い
  • 128GBを超える超大型モデルを丸ごと動かしたい → Mac Studio M5 Ultra。帯域1.2TB/s・統合メモリ最大512GBで、RTX 5090のVRAM 32GBもM5 Maxの128GBも超える容量が要る人向け。価格は949,800円からとM5 Maxより高く、必要な人だけの選択
  • 最速と画像生成を取りに行く・据え置きでよい → RTX 5090。中型モデルなら本命候補の中で一番速く、画像生成はCUDAで大きくリード。VRAM 32GBの壁と電力は割り切る前提
  • CUDAで大容量モデルを“持ち歩きたい”という限定用途のみ → RTX Spark。帯域の遅さ(DGX Sparkの公式値で273GB/s)を許容できて、CUDA資産を128GBのノートで運びたい人向け(容量はMac M5 Maxと同じ128GB)。2026年10月時点でも発売日・価格はNVIDIA公式未発表で、実機の速度とArm対応待ち

本音を言えば、本気でローカルAIをやるなら、いま動けるMac M5 Maxを軸に、最速がほしい場面で据え置きのRTX 5090を足す形を選びます。
128GBでは足りないと分かっている人だけ、M5 Ultraを軸に据えます。
RTX Sparkは、発売後に実測の速度とArm対応を見て、限定用途にハマるならという距離感です。

本命候補を選ぶときの機種(2026年10月3日時点)

据え置きで最速を取るRTX 5090、1台で持ち歩きまで済ませるMac M5 Max、128GBの壁を超えたいMac Studio M5 Ultra。
本命候補を実際に買える形にすると、次の候補になります。

表は1行が1機種で、「AIで使えるメモリ」の列が作業台や台の広さ、右端が購入ページへのボタンです。
たとえばMac Studio(M5 Ultra)の行は、台の広さが最大512GBで、価格は構成ごとにAmazonで確かめる形になっています。

機種AIで使えるメモリ主な構成価格(2026年10月3日時点)購入
マウス G TUNE FG-A9G90RTX 5090(VRAM 32GB)Ryzen 9 9900X/メモリ64GB/2TB/1200W1,359,800円から公式ページを見る
HP OMEN MAX 45L
パラマウント
RTX 5090(VRAM 32GB)Ryzen 9 9950X3D/メモリ32GB/2TB/1200W1,298,000円
(欠品中・再入荷未定)
HP公式で在庫を見る
MacBook Pro(M5 Max)統合メモリ 最大128GBGPUコア数で帯域が変わる(32コア460GB/s・40コア614GB/s)構成ごとにAmazonで確認Amazonで見る
Mac Studio(M5 Ultra)統合メモリ 最大512GB帯域1.2TB/s(64・80コアGPU共通)。949,800円から構成ごとにAmazonで確認Amazonで見る
RTX 5090搭載デスクトップとMac M5 Max・M5 Ultraの候補。価格は各社公式ページの税込表示(2026年10月3日時点)

RTX 5090のデスクトップは、2026年10月3日時点で今すぐ注文できたのがマウスのG TUNE FG-A9G90でした。
メインメモリが標準で64GBあり、VRAMに載りきらないモデルの一部をメインメモリへ逃がす使い方(作業台からはみ出したページを机に置く使い方)でも余裕を取りやすい構成です。
HPのOMEN MAX 45L パラマウントと、同じ筐体でインテルCPUのHyperX OMEN MAX 45Lは、どちらも欠品中の表示でした。

Mac Studio(M5 Ultra)は949,800円からと、表のRTX 5090デスクトップ2機種より価格は下がります。
ただし帯域1.2TB/s・最大512GBという性能は、RTX 5090のVRAM 32GBやM5 Maxの128GBには載せきれない、より大きなモデルを丸ごと動かす用途向け。
発売からまだ間もなく、同条件での第三者ベンチマークはまだ出ていないため、スペック上の位置づけとして候補に加えています。

130万円前後の機材は、一括ではなく分割払いを考える人も多い価格帯です。
手数料0%で組める回数はメーカーごとに違い、マウスコンピューターは36回まで0%で分けられます(2026年10月3日時点)。

RTX 5090や128GBのMacを買う前に、16GBのGPUでどこまでできるかを確かめる方法もあります。
VRAM容量ごとにできることはローカルLLM用のGPU・PCの選び方、16GBで実際に動かしたモデルはQwen3.8-27B・gpt-oss-20b・Gemma 4 26B-A4Bの実測記事にまとめています。

RTX 5070 Ti(16GB)とメモリ32GBのPCで、総125Bのモデルをどこまで動かせるかも試しています。
速さとメモリの限界はQwen3.8-Flash-NextをStrataで動かした実測で確認できます。

次に読む1本

Macはペイディで最大24回、Windows各社は36〜48回まで手数料0%です。
同じ金額でも月々の支払額が変わる理由を、次の記事で解説しています。
パソコンの分割払いはどこが得?メーカー別の手数料0%回数と月々の支払い早見表

よくある質問(FAQ)

RTX Spark・Mac・RTX 5090に関するよくある質問のまとめ図解

ローカルでLLMを動かすには、どれくらいのメモリが必要ですか?

24〜32B級のコーダーモデル(Devstral 24B・Qwen 27Bなど)なら、24〜32GBのVRAM(GPUの作業台)でも動きます。
Qwen3-Coder-Next(80B MoE)のような分厚い百科事典にあたる大型を丸ごと載せるなら、128GBクラスの統合メモリ(作業台と机が1つになった大きな台・Mac M5 MaxやRTX Spark)が目安です。
当サイトの実測では、Qwen3.8-27BもQ3系の量子化(縮小コピーで薄くした版)ならVRAM 16GBのRTX 5070 Tiで全層GPUに載りました(Qwen3.8-27Bの16GB実測)。

ローカルLLMは、クラウドのClaudeと同じくらい賢いですか?

いいえ。ローカルで評価の高いQwen3-Coder-Next(80B)でも、プログラムの不具合を直せるかを測るSWE-benchで約67%で、クラウドの最新Claude本体には届きません。
ローカル化は賢さよりも、プライバシー・コスト・オフラインのための選択で、賢さの天井はクラウドのClaude本体より低い前提になります。

SnapdragonはNVIDIAが作っているのですか?

いいえ、SnapdragonはQualcomm製です。
RTX SparkはNVIDIA製で、CPUはNVIDIAとMediaTekが共同で設計した別物。
どちらもArmの言葉を話すCPUで、両者はWindows on Armの競合関係です。

RTX Sparkでも、Snapdragonと同じく一部アプリが遅くなりますか?

Arm64ネイティブ非対応のアプリはエミュレーション動作(通訳を挟んだ動作)になり、訳す手間のぶん性能が落ちます。
エミュレーションによる性能低下はWindows on Arm共通の事情で、2026年秋時点ではAdobe主要アプリなどネイティブ化が進み、状況は改善しています。

生成AIをやるならMacとWindowsどちらが良いですか?

速度と対応フレームワークの広さならCUDAのNVIDIA系、大容量モデルと省電力ならMacが有利です。
RTX Sparkは両者の利点を1台に狙った設計ですが、帯域(本を運ぶ通路の幅)が狭く、速度の面では本命のMac M5 MaxやRTX 5090に一歩譲ります。

RTX SparkとApple M5 Max、メモリ性能はどちらが上ですか?

両方とも最大128GBの統合メモリで台の広さは同じですが、帯域(本を運ぶ通路の幅)はM5 Maxが614GB/s、RTX SparkはNVIDIAが未公表で、同じGB10系のDGX Sparkは公式で273GB/s。
帯域ではM5 Maxが上回り、RTX SparkはCUDAエコシステムで差別化します。

128GBの統合メモリは何の役に立つのですか?

CPUとGPUがメモリを共有する(作業台と机が1つの大きな台になる)ため、コピー(写し直し)の手間なく巨大なAIモデルをまるごと載せられます。
1,200億パラメータ(120B)級のLLMを100万トークンのコンテキストでローカル実行できる点が、開発者にとって最大の利点です。

Claude CodeをVS Codeで使うなら、RTX SparkとMacどちらが良いですか?

AIの応答速度はクラウド処理(考えるのは電話の向こうのサーバー)なので3プラットフォームでほぼ同じです。
2026年6月時点ではWindows on Arm版のVS Code拡張が更新停止していましたが、2026年10月時点ではこの差は解消済みとみられます。
残る違いはターミナル(文字で命令を打ち込む画面)やUnix系ツールとの親和性で、その点ではMac(Apple Silicon)がいまも一歩扱いやすい側です。

まとめ

RTX Spark・Mac・RTX 5090のまとめと今後のロードマップを示す図解

物知りの人に働いてもらう部屋選びは、台の広さ(メモリ容量)と、本を運ぶ通路の幅(メモリ帯域)の2つで決まります。
結論として、生成AIをローカルで動かす本命はMac M5 Max・Mac Studio M5 Ultra・RTX 5090の3台。
話題のRTX Sparkは台は広いものの通路が細く(帯域の遅さ)、2026年10月時点ではまだ本命から一歩外れます。

1台で携帯まで済ませたいならMac M5 Max。
大型モデルが丸ごと載り、帯域614GB/sで速度も現実的、Claude Code本体もネイティブに動きます。

128GBでも足りない超大型モデルを丸ごと動かしたいならMac Studio M5 Ultra。
帯域1.2TB/s・最大512GBで、価格は949,800円からと一段上がります。

据え置きで最速と画像生成を取るならRTX 5090。
中型モデルなら本命候補の中で一番速く、VRAM 32GBの壁と電力は割り切る前提です。

話題のRTX Sparkは「128GB×CUDA×持ち運び」という、ほかにない組み合わせを持ちながら、帯域の遅さ(DGX Sparkの公式値で273GB/s)で、日常的に回す開発機としては本命から一歩外れます。
活きるのは、CUDA資産を128GBの大容量ノートで持ち歩きたい、という限定用途。

ただ、NVIDIAはこの第1世代で止めるつもりはなく、次世代はLPDDR6(より速い世代のメモリ)を積む「Vera Rubin」世代、その先に「Rosa Feynman」世代を予告しています。
いまの弱点である帯域(細い通路)が世代を追って広がっていけば、RTX Sparkの評価は変わってきます。
本命から外れるのはあくまで2026年の今の話で、AI関連の環境はすぐにアップデートされます。

判断の鍵は、価格でも話題性でもなく、どのサイズのモデルを・どれくらいの速度で回したいか。
2026年10月時点でも発売日・価格はNVIDIA公式未発表のままです。
実測の速度とArm対応の進展を見たうえで、購入を判断したいモデルです。

参考ソース(公式)

記事URLをコピーしました