AI 时代本地 LLM 硬件选购指南 — M5 Ultra、RTX 5090 与 DGX Spark¶
核心结论一句话:容量决定能不能跑,频宽决定跑得快不快,算力决定想得久不久。2026 年本地硬件溢价严重且迭代快,99% 用户的最优解是「本地 Agent 架构 + 远端商业 API」,只有本地微调、绝对隐私合规等刚需才值得上大显存本地机。
[!info] 基本信息 - 视频: AI 时代下硬件设备选购指南:M5 Ultra、5090、DGX Spark 怎么选?(2026-09-03) - 频道: 深度云创科技(约 3,720 订阅) - 关键外部验证: Apple / NVIDIA 官方规格页、DeepSeek API 文档、Qwen 官方博客
目录¶
一、三大核心指标:Prefill、Decode、KV Cache¶
本地跑大模型,判断一台机器行不行,先看三个阶段各吃什么硬件资源。
| 指标 | 通俗解释 | 决定因素 | 用户体验表现 |
|---|---|---|---|
| Prefill(预填充/首字延迟) | 模型开始生成前,一次性读完整个 Prompt 的阶段 | 算力(Compute FLOPs) | Prompt 越长,等待首字回复越久 |
| Decode(解码/吐字速度) | 生成每个 token 时都要重新扫描一遍模型权重 | 内存频宽(Memory Bandwidth) | 每秒吐几个 token(Tokens/s),决定流式输出流畅度 |
| KV Cache(键值缓存) | 模型的"阅读笔记",记录已处理上下文避免重复计算 | 内存/显存容量 | 上下文拉到数十万 token 时,笔记本身占满内存 |
三者关系(一次对话请求的生命周期):
用户输入 Prompt
│
▼
┌─────────────┐ 吃算力 ┌──────────────┐
│ Prefill │ ─────────────▶ │ 首 token 延迟 │ ← Prompt 10 万字 = 开场等很久
│ 读完整个提示词 │ └──────────────┘
└─────┬───────┘
│ 产出 KV Cache(阅读笔记,随上下文增长吃内存)
▼
┌─────────────┐ 吃频宽 ┌──────────────┐
│ Decode │ ─────────────▶ │ Tokens/s │ ← 每个字都要扫一遍全部权重
│ 逐 token 生成 │ └──────────────┘
└─────────────┘
│ 上下文越来越长
▼
┌─────────────┐ 吃容量 ┌──────────────┐
│ KV Cache │ ─────────────▶ │ OOM / 变慢 │ ← 笔记太大 → 内存爆或降速
└─────────────┘ └──────────────┘
为什么 Decode 吃频宽而不是算力:Decode 阶段每次只算一个 token,计算量小,但每个 token 都必须把整个模型权重从内存搬到计算单元一遍。搬运速度上限就是内存频宽——所以同架构模型下,Tokens/s ≈ 频宽 ÷ 模型大小(字节)。
✅ 选购心法: - 经常贴大文档/长代码 → 先看算力(Prefill)和容量(KV Cache) - 追求流畅对话体验 → 先看频宽(Decode) - 想跑 100B+ 大模型 → 先看容量,容量不够其他都免谈
二、主流硬件规格对比¶
2.1 规格总表(已对官方资料交叉验证)¶
| 规格 | RTX 5090 | Mac Studio (M5 Ultra) | DGX Spark (GB10) |
|---|---|---|---|
| 内存/显存 | 32GB GDDR7 | 256GB / 512GB 统一内存 | 128GB LPDDR5x 统一内存 |
| 内存频宽 | 1.79 TB/s | 1.2 TB/s(256/512GB 相同) | 273 GB/s |
| 架构特点 | 独立显卡,CUDA 生态 | 统一内存架构(UMA),CPU/GPU 共享 | GB10 Superchip,ARM + Blackwell |
| 强项 | 频宽 + 算力双高,吐字最快 | 容量巨大,能装 100B+ 模型 | 128GB 大显存,预填快 |
| 致命短板 | 32GB 装不下大模型 | 算力相对弱(训练/微调慢) | 频宽仅 0.27 TB/s,Decode 极慢 |
| 参考价格 | 首发 ¥18,999,2026 市价 ¥24,399~33,999 | 256GB 顶配国行 ¥86,749 起 | $4,699(约 ¥3.4 万) |
规格来源:Apple Newsroom(M5 Ultra 512GB + 1.2TB/s,比 M3 Ultra 高 50%)、NVIDIA 官网/DGX Spark User Guide(128GB LPDDR5x、256-bit、273 GB/s)、ZOL 报价。
2.2 三台机器的"木桶短板"¶
RTX 5090 Mac Studio M5 Ultra DGX Spark
───────────── ───────────────── ─────────────
容量 ██████░░░░ 32GB 容量 ██████████ 256-512GB 容量 ████████░░ 128GB
频宽 ██████████ 1.79T 频宽 ████████░░ 1.2T 频宽 ███░░░░░░░ 0.27T
算力 ██████████ 算力 ██████░░░░ 算力 ████████░░
(相对弱,但够推理) (预填快,解码慢)
- 5090 的频宽是 Spark 的 6.5 倍——同样是"装得下"的模型,解码速度差出一个数量级
- M5 Ultra 256GB 与 512GB 频宽完全一致(1.2TB/s):解码速度相同,512GB 的差别只是"书桌更大"——能载更长上下文、更大模型,不会更快
- Spark 的定位尴尬:128GB 大显存吸引人,但 273 GB/s 频宽让 Decode 吐字极慢(实测见下节),"装得下但跑不动"
2.3 统一内存(UMA)vs 独立显存¶
| 维度 | Mac UMA / Spark 统一内存 | RTX 独立显存 |
|---|---|---|
| 容量上限 | 极大(512GB) | 受显存颗粒限制(32GB) |
| 频宽 | 中等(LPDDR 系) | 极高(GDDR7/HBM) |
| 典型问题 | 吐字速度上限低 | 大模型装不下 |
| 适合 | 大模型长上下文推理 | 小模型高速推理 + 训练 |
三、不同模型量级下的实测表现¶
3.1 模型量级 × 硬件适配总表¶
视频按模型大小给出了四档设备实测(Tokens/s 为 Decode 输出速度):
| 模型量级 | RTX 5090 (32GB) | M5 Ultra (256/512GB) | DGX Spark (128GB) |
|---|---|---|---|
| 轻量(~4B-20B) | ✅ 最快,~200 t/s | ✅ 140~180 t/s | ⚠️ 能跑,垫底 |
| 中大(27B~32B 级) | ⚠️ 只能 Q4 量化,70~90 t/s | ✅ 全精度流畅 | ❌ 12~16 t/s,不实用 |
| 大型(120B~284B 级) | ❌ 显存装不下 | ✅ 90~130 t/s | ❌ 容量频宽双缺 |
| 前沿(400B+) | ❌ | ⚠️ 需 512GB 甚至多机 | ❌ |
[!warning] 模型名勘误(视频口播误读) 视频提到"Qwen 3.8B / Qwen 3.8 27B"——经 Qwen 官方博客核对,Qwen3 系列没有 3.8B 和 27B 型号,实际家族为:0.6B / 1.7B / 4B / 8B / 14B / 32B(dense)+ 30B-A3B / 235B-A22B(MoE)。"27B 级"更可能指 Gemma 3 27B 或泛指 30B 上下量级,笔记按量级归类不作具体型号背书。 视频提到的 DeepSeek-V4-Flash 已验证真实存在:MoE 架构,总参数 284B、激活 13B(HF 官方仓库 DeepSeek-V4-Flash-0731,2026-07-31 正式发布),权重 100GB+,属于表中最重的一档。
3.2 轻量模型:频宽说话¶
四款设备都能流畅载入小模型,差距纯粹体现在频宽上:
Decode 吞吐(轻量模型,约 4B-8B 量化)
RTX 5090 ████████████████████ ~200 t/s (1.79 TB/s 频宽兑现)
M5 Ultra ██████████████████ 140-180 t/s (1.2 TB/s)
DGX Spark ██████░░░░░░░░░░░░░ 慢但可用 (0.27 TB/s)
这个量级下 5090 是体验天花板——200 t/s 已远超人类阅读速度,对话毫无卡顿感。
3.3 中大模型(27B~32B 级):量化分水岭¶
- 5090:32GB 只够装 Q4 量化版(权重压到 ~16-20GB),实测 70~90 t/s,仍然流畅
- M5 Ultra / Spark:内存充裕可跑全精度/BF16,但 Spark 的频宽把 Decode 拖到 12~16 t/s——比人快速阅读还慢,逐字等待,实用性差
- 互证:vault 内 DeepSeek-V4-Flash-0731-本地部署全解析 记录的 DGX Spark 实测(预填 343 t/s、生成仅 13.75 t/s)与视频 12~16 t/s 区间完全吻合,两组独立数据互相印证 Spark 的频宽瓶颈
[!tip] 量化(Quantization)速记 Q4 = 每参数 4 bit ≈ 原始 FP16 权重的一半再一半。32B 模型 Q4 约 18GB,5090 装得下;全精度 BF16 则要 ~65GB,只有 UMA 大内存机器能装。代价是轻微质量损失,Q4 对多数对话场景几乎无感。
3.4 大型模型(120B~284B 级):容量为王¶
- 100GB+ 权重(如 DeepSeek-V4-Flash 284B-A13B):5090 直接出局(32GB 显存连零头都不够)
- M5 Ultra 256GB/512GB 是唯一实用解:90~130 t/s 的生成速度,MoE 架构激活参数少(13B),对频宽压力小,日常使用体感良好
- Spark:128GB 勉强装下部分量化版,但频宽太低,速度不可用
3.5 前沿模型(400B+)¶
单台消费级/工作站硬件全部无法胜任,需要 M5 Ultra 512GB 顶配或多卡集群。这也是视频"别盲目堆本地"论点的边界——总有模型大到本地追不上。
四、成本效益与选购决策¶
4.1 价格门槛(2026-09 验证)¶
| 设备 | 价格 | 每元买到什么 |
|---|---|---|
| RTX 5090 | 首发 ¥18,999 → 2026 市价 ¥24,399~33,999 | 最高频宽+算力,但只有 32GB |
| Mac Studio M5 Ultra 256GB 顶配 | ¥86,749(拉满 CPU/GPU/256GB 已破 $10,000) | 大容量 UMA,能跑 100B+ 模型 |
| Mac Studio M5 Ultra 起售(96GB) | ¥46,999 | 入门 Ultra,96GB 已可跑多数中大模型量化版 |
| DGX Spark | $4,699(约 ¥3.4 万) | 128GB 显存但频宽是硬伤 |
| 专业多卡(RTX 6000 Ada 级) | 数十万 | 吞吐/训练,非个人性价比选项 |
对比 API:顶级商业模型 API 按 token 计费,重度个人使用一个月几十到几百美元,一年成本仍远低于 ¥86,749 的硬件门槛——且模型随时最新。
4.2 选购决策树¶
你需要本地跑大模型吗?
│
├─ 否,只是用 AI 辅助开发/办公
│ └─▶ 本地 Agent(Claude Code / 编排框架)+ 云端 API ← 99% 的人停在这里
│
├─ 是。数据绝对不能出本机(合规/隐私)?
│ │
│ ├─ 模型 ≤32B 量化可满足
│ │ └─▶ RTX 5090(快、便宜、CUDA 生态全)
│ │
│ ├─ 必须跑 70B~284B 大模型
│ │ └─▶ Mac Studio M5 Ultra 256GB(¥86,749 档)
│ │ └─ 还要更长上下文/更大模型 → 512GB
│ │
│ └─ 前沿 400B+ / 需要训练微调
│ └─▶ 多卡集群 / 专业卡(RTX 6000 Ada 级),个人慎入
│
└─ 犹豫中,预算没到刚需程度
└─▶ 等。3~5 年端侧硬件成本大降、端侧小模型成熟后再进场(等等党)
4.3 客群分流建议¶
| 人群 | 建议 | 理由 |
|---|---|---|
| 普通用户 / 轻量开发者(99%) | 本地 Agent + 远端 API | 性价比最高、零维护、模型永远最新 |
| 隐私/合规刚需 + 大模型 | Mac Studio M5 Ultra | 大显存统一内存中性价比相对突出 |
| 小模型高速推理 / CUDA 训练 | RTX 5090 | 频宽算力双高,生态最全 |
| 观望者(等等党) | 3~5 年后再评估 | 硬件迭代快,现在高价入手容易"买来即落后" |
4.4 视频核心论点:为什么"本地 Agent + 云端 API"是首选¶
- 数据流与逻辑编排留在本地(隐私、低延迟、可定制)
- 重算力交给云端模型(不用承担硬件溢价与折旧)
- 硬件更新迭代极快,当前高价大显存方案容易面临"买来即落后"
- 非刚需用户等待端侧硬件普及 + 端侧小模型成熟,成本曲线会大幅下移
❌ 常见踩坑: - 只看显存容量就下单(Spark 教训:装得下 ≠ 跑得动) - 为"未来可能跑大模型"预购顶配(等真用到时硬件已迭代两代) - 忽视 KV Cache 的内存占用(长上下文场景实际可用模型比标称小一档)
验证与勘误记录¶
| 视频声称 | 验证结果 | 来源 |
|---|---|---|
| M5 Ultra 256/512GB,1.2 TB/s | ✅ 官方确认(512GB 全池 1.2TB/s,较 M3 Ultra +50%) | Apple Newsroom 2026-08 |
| DGX Spark 128GB、~0.27 TB/s、$4,699 | ✅ 官方确认(273 GB/s,256-bit LPDDR5x) | NVIDIA 官网 / DGX Spark User Guide |
| 256GB 版超 86,000 元 | ✅ 国行顶配 ¥86,749 | Apple 中国官网 / 财联社 |
| DeepSeek-V4-Flash 100GB+ 级 | ✅ 真实存在(284B 总参 / 13B 激活 MoE,2026-07-31 发布) | DeepSeek API 文档 / HuggingFace |
| "Qwen 3.8B"、"Qwen 3.8 27B" | ❌ Qwen3 无此型号(家族:0.6/1.7/4/8/14/32B + 30B-A3B/235B-A22B) | Qwen 官方博客 |
| Spark 27B 级仅 12~16 t/s | ✅ 旁证:vault 笔记实测 Spark decode 13.75 t/s | 见 DeepSeek-V4-Flash-0731-本地部署全解析 |
| Tokens/s 数据(200/140-180/90-130) | ⚠️ 未独立复测,量级合理(与频宽÷模型大小估算一致) | — |
参考资料¶
- Apple Newsroom: Mac Studio with M5 Max and M5 Ultra
- NVIDIA DGX Spark 官方页
- DGX Spark User Guide — Hardware Overview
- DeepSeek API Change Log(V4-Flash 发布记录)
- deepseek-ai/DeepSeek-V4-Flash-0731 — HuggingFace
- Qwen3 官方博客(模型家族规格表)
- 财联社:Mac Studio 256GB 国行 ¥86,749 报道
- 视频:AI 时代下硬件设备选购指南:M5 Ultra、5090、DGX Spark 怎么选?
相关笔记¶
- DeepSeek-V4-Flash-0731-本地部署全解析(DGX Spark 实测 decode 13.75 t/s 出处)
- 本地 AI 模型 - GPU 显存分级选型指南(同款"容量 vs 频宽"框架,含 DGX Spark 陷阱警告)
- Llama.cpp + TurboQuant 本地 LLM 部署指南
- TinyGPU - Nvidia GPU on Mac via Thunderbolt(RTX 5090 TFlops 数据)
笔记生成时间:2026-09-03,基于视频内容资讯 + 官方资料交叉验证