Skip to content

AI 时代本地 LLM 硬件选购指南 — M5 Ultra、RTX 5090 与 DGX Spark

核心结论一句话:容量决定能不能跑,频宽决定跑得快不快,算力决定想得久不久。2026 年本地硬件溢价严重且迭代快,99% 用户的最优解是「本地 Agent 架构 + 远端商业 API」,只有本地微调、绝对隐私合规等刚需才值得上大显存本地机。

[!info] 基本信息 - 视频: AI 时代下硬件设备选购指南:M5 Ultra、5090、DGX Spark 怎么选?(2026-09-03) - 频道: 深度云创科技(约 3,720 订阅) - 关键外部验证: Apple / NVIDIA 官方规格页、DeepSeek API 文档、Qwen 官方博客

目录


一、三大核心指标:Prefill、Decode、KV Cache

本地跑大模型,判断一台机器行不行,先看三个阶段各吃什么硬件资源。

指标 通俗解释 决定因素 用户体验表现
Prefill(预填充/首字延迟) 模型开始生成前,一次性读完整个 Prompt 的阶段 算力(Compute FLOPs) Prompt 越长,等待首字回复越久
Decode(解码/吐字速度) 生成每个 token 时都要重新扫描一遍模型权重 内存频宽(Memory Bandwidth) 每秒吐几个 token(Tokens/s),决定流式输出流畅度
KV Cache(键值缓存) 模型的"阅读笔记",记录已处理上下文避免重复计算 内存/显存容量 上下文拉到数十万 token 时,笔记本身占满内存

三者关系(一次对话请求的生命周期):

用户输入 Prompt
      │
      ▼
┌─────────────┐    吃算力      ┌──────────────┐
│   Prefill   │ ─────────────▶ │  首 token 延迟 │  ← Prompt 10 万字 = 开场等很久
│ 读完整个提示词 │                └──────────────┘
└─────┬───────┘
      │ 产出 KV Cache(阅读笔记,随上下文增长吃内存)
      ▼
┌─────────────┐    吃频宽      ┌──────────────┐
│   Decode    │ ─────────────▶ │  Tokens/s     │  ← 每个字都要扫一遍全部权重
│ 逐 token 生成 │                └──────────────┘
└─────────────┘
      │ 上下文越来越长
      ▼
┌─────────────┐    吃容量      ┌──────────────┐
│  KV Cache   │ ─────────────▶ │ OOM / 变慢     │  ← 笔记太大 → 内存爆或降速
└─────────────┘                └──────────────┘

为什么 Decode 吃频宽而不是算力:Decode 阶段每次只算一个 token,计算量小,但每个 token 都必须把整个模型权重从内存搬到计算单元一遍。搬运速度上限就是内存频宽——所以同架构模型下,Tokens/s ≈ 频宽 ÷ 模型大小(字节)。

✅ 选购心法: - 经常贴大文档/长代码 → 先看算力(Prefill)和容量(KV Cache) - 追求流畅对话体验 → 先看频宽(Decode) - 想跑 100B+ 大模型 → 先看容量,容量不够其他都免谈


二、主流硬件规格对比

2.1 规格总表(已对官方资料交叉验证)

规格 RTX 5090 Mac Studio (M5 Ultra) DGX Spark (GB10)
内存/显存 32GB GDDR7 256GB / 512GB 统一内存 128GB LPDDR5x 统一内存
内存频宽 1.79 TB/s 1.2 TB/s(256/512GB 相同) 273 GB/s
架构特点 独立显卡,CUDA 生态 统一内存架构(UMA),CPU/GPU 共享 GB10 Superchip,ARM + Blackwell
强项 频宽 + 算力双高,吐字最快 容量巨大,能装 100B+ 模型 128GB 大显存,预填快
致命短板 32GB 装不下大模型 算力相对弱(训练/微调慢) 频宽仅 0.27 TB/s,Decode 极慢
参考价格 首发 ¥18,999,2026 市价 ¥24,399~33,999 256GB 顶配国行 ¥86,749 $4,699(约 ¥3.4 万)

规格来源:Apple Newsroom(M5 Ultra 512GB + 1.2TB/s,比 M3 Ultra 高 50%)、NVIDIA 官网/DGX Spark User Guide(128GB LPDDR5x、256-bit、273 GB/s)、ZOL 报价。

2.2 三台机器的"木桶短板"

RTX 5090            Mac Studio M5 Ultra       DGX Spark
─────────────       ─────────────────         ─────────────
容量 ██████░░░░ 32GB 容量 ██████████ 256-512GB 容量 ████████░░ 128GB
频宽 ██████████ 1.79T 频宽 ████████░░ 1.2T      频宽 ███░░░░░░░ 0.27T
算力 ██████████      算力 ██████░░░░           算力 ████████░░
                   (相对弱,但够推理)        (预填快,解码慢)
  • 5090 的频宽是 Spark 的 6.5 倍——同样是"装得下"的模型,解码速度差出一个数量级
  • M5 Ultra 256GB 与 512GB 频宽完全一致(1.2TB/s):解码速度相同,512GB 的差别只是"书桌更大"——能载更长上下文、更大模型,不会更快
  • Spark 的定位尴尬:128GB 大显存吸引人,但 273 GB/s 频宽让 Decode 吐字极慢(实测见下节),"装得下但跑不动"

2.3 统一内存(UMA)vs 独立显存

维度 Mac UMA / Spark 统一内存 RTX 独立显存
容量上限 极大(512GB) 受显存颗粒限制(32GB)
频宽 中等(LPDDR 系) 极高(GDDR7/HBM)
典型问题 吐字速度上限低 大模型装不下
适合 大模型长上下文推理 小模型高速推理 + 训练

三、不同模型量级下的实测表现

3.1 模型量级 × 硬件适配总表

视频按模型大小给出了四档设备实测(Tokens/s 为 Decode 输出速度):

模型量级 RTX 5090 (32GB) M5 Ultra (256/512GB) DGX Spark (128GB)
轻量(~4B-20B) ✅ 最快,~200 t/s ✅ 140~180 t/s ⚠️ 能跑,垫底
中大(27B~32B 级) ⚠️ 只能 Q4 量化,70~90 t/s ✅ 全精度流畅 ❌ 12~16 t/s,不实用
大型(120B~284B 级) ❌ 显存装不下 ✅ 90~130 t/s ❌ 容量频宽双缺
前沿(400B+) ⚠️ 需 512GB 甚至多机

[!warning] 模型名勘误(视频口播误读) 视频提到"Qwen 3.8B / Qwen 3.8 27B"——经 Qwen 官方博客核对,Qwen3 系列没有 3.8B 和 27B 型号,实际家族为:0.6B / 1.7B / 4B / 8B / 14B / 32B(dense)+ 30B-A3B / 235B-A22B(MoE)。"27B 级"更可能指 Gemma 3 27B 或泛指 30B 上下量级,笔记按量级归类不作具体型号背书。 视频提到的 DeepSeek-V4-Flash 已验证真实存在:MoE 架构,总参数 284B、激活 13B(HF 官方仓库 DeepSeek-V4-Flash-0731,2026-07-31 正式发布),权重 100GB+,属于表中最重的一档。

3.2 轻量模型:频宽说话

四款设备都能流畅载入小模型,差距纯粹体现在频宽上:

Decode 吞吐(轻量模型,约 4B-8B 量化)
RTX 5090  ████████████████████ ~200 t/s   (1.79 TB/s 频宽兑现)
M5 Ultra  ██████████████████   140-180 t/s (1.2 TB/s)
DGX Spark ██████░░░░░░░░░░░░░  慢但可用    (0.27 TB/s)

这个量级下 5090 是体验天花板——200 t/s 已远超人类阅读速度,对话毫无卡顿感。

3.3 中大模型(27B~32B 级):量化分水岭

  • 5090:32GB 只够装 Q4 量化版(权重压到 ~16-20GB),实测 70~90 t/s,仍然流畅
  • M5 Ultra / Spark:内存充裕可跑全精度/BF16,但 Spark 的频宽把 Decode 拖到 12~16 t/s——比人快速阅读还慢,逐字等待,实用性差
  • 互证:vault 内 DeepSeek-V4-Flash-0731-本地部署全解析 记录的 DGX Spark 实测(预填 343 t/s、生成仅 13.75 t/s)与视频 12~16 t/s 区间完全吻合,两组独立数据互相印证 Spark 的频宽瓶颈

[!tip] 量化(Quantization)速记 Q4 = 每参数 4 bit ≈ 原始 FP16 权重的一半再一半。32B 模型 Q4 约 18GB,5090 装得下;全精度 BF16 则要 ~65GB,只有 UMA 大内存机器能装。代价是轻微质量损失,Q4 对多数对话场景几乎无感。

3.4 大型模型(120B~284B 级):容量为王

  • 100GB+ 权重(如 DeepSeek-V4-Flash 284B-A13B):5090 直接出局(32GB 显存连零头都不够)
  • M5 Ultra 256GB/512GB 是唯一实用解:90~130 t/s 的生成速度,MoE 架构激活参数少(13B),对频宽压力小,日常使用体感良好
  • Spark:128GB 勉强装下部分量化版,但频宽太低,速度不可用

3.5 前沿模型(400B+)

单台消费级/工作站硬件全部无法胜任,需要 M5 Ultra 512GB 顶配或多卡集群。这也是视频"别盲目堆本地"论点的边界——总有模型大到本地追不上。


四、成本效益与选购决策

4.1 价格门槛(2026-09 验证)

设备 价格 每元买到什么
RTX 5090 首发 ¥18,999 → 2026 市价 ¥24,399~33,999 最高频宽+算力,但只有 32GB
Mac Studio M5 Ultra 256GB 顶配 ¥86,749(拉满 CPU/GPU/256GB 已破 $10,000) 大容量 UMA,能跑 100B+ 模型
Mac Studio M5 Ultra 起售(96GB) ¥46,999 入门 Ultra,96GB 已可跑多数中大模型量化版
DGX Spark $4,699(约 ¥3.4 万) 128GB 显存但频宽是硬伤
专业多卡(RTX 6000 Ada 级) 数十万 吞吐/训练,非个人性价比选项

对比 API:顶级商业模型 API 按 token 计费,重度个人使用一个月几十到几百美元,一年成本仍远低于 ¥86,749 的硬件门槛——且模型随时最新。

4.2 选购决策树

你需要本地跑大模型吗?
│
├─ 否,只是用 AI 辅助开发/办公
│   └─▶ 本地 Agent(Claude Code / 编排框架)+ 云端 API   ← 99% 的人停在这里
│
├─ 是。数据绝对不能出本机(合规/隐私)?
│   │
│   ├─ 模型 ≤32B 量化可满足
│   │   └─▶ RTX 5090(快、便宜、CUDA 生态全)
│   │
│   ├─ 必须跑 70B~284B 大模型
│   │   └─▶ Mac Studio M5 Ultra 256GB(¥86,749 档)
│   │        └─ 还要更长上下文/更大模型 → 512GB
│   │
│   └─ 前沿 400B+ / 需要训练微调
│       └─▶ 多卡集群 / 专业卡(RTX 6000 Ada 级),个人慎入
│
└─ 犹豫中,预算没到刚需程度
    └─▶ 等。3~5 年端侧硬件成本大降、端侧小模型成熟后再进场(等等党)

4.3 客群分流建议

人群 建议 理由
普通用户 / 轻量开发者(99%) 本地 Agent + 远端 API 性价比最高、零维护、模型永远最新
隐私/合规刚需 + 大模型 Mac Studio M5 Ultra 大显存统一内存中性价比相对突出
小模型高速推理 / CUDA 训练 RTX 5090 频宽算力双高,生态最全
观望者(等等党) 3~5 年后再评估 硬件迭代快,现在高价入手容易"买来即落后"

4.4 视频核心论点:为什么"本地 Agent + 云端 API"是首选

  • 数据流与逻辑编排留在本地(隐私、低延迟、可定制)
  • 重算力交给云端模型(不用承担硬件溢价与折旧)
  • 硬件更新迭代极快,当前高价大显存方案容易面临"买来即落后"
  • 非刚需用户等待端侧硬件普及 + 端侧小模型成熟,成本曲线会大幅下移

❌ 常见踩坑: - 只看显存容量就下单(Spark 教训:装得下 ≠ 跑得动) - 为"未来可能跑大模型"预购顶配(等真用到时硬件已迭代两代) - 忽视 KV Cache 的内存占用(长上下文场景实际可用模型比标称小一档)


验证与勘误记录

视频声称 验证结果 来源
M5 Ultra 256/512GB,1.2 TB/s ✅ 官方确认(512GB 全池 1.2TB/s,较 M3 Ultra +50%) Apple Newsroom 2026-08
DGX Spark 128GB、~0.27 TB/s、$4,699 ✅ 官方确认(273 GB/s,256-bit LPDDR5x) NVIDIA 官网 / DGX Spark User Guide
256GB 版超 86,000 元 ✅ 国行顶配 ¥86,749 Apple 中国官网 / 财联社
DeepSeek-V4-Flash 100GB+ 级 ✅ 真实存在(284B 总参 / 13B 激活 MoE,2026-07-31 发布) DeepSeek API 文档 / HuggingFace
"Qwen 3.8B"、"Qwen 3.8 27B" ❌ Qwen3 无此型号(家族:0.6/1.7/4/8/14/32B + 30B-A3B/235B-A22B) Qwen 官方博客
Spark 27B 级仅 12~16 t/s ✅ 旁证:vault 笔记实测 Spark decode 13.75 t/s DeepSeek-V4-Flash-0731-本地部署全解析
Tokens/s 数据(200/140-180/90-130) ⚠️ 未独立复测,量级合理(与频宽÷模型大小估算一致)

参考资料

相关笔记


笔记生成时间:2026-09-03,基于视频内容资讯 + 官方资料交叉验证