传统显存方案
KV 缓存全部放进 GPU 显存。显存不够 → 大模型直接 OOM,跑不起来。
AI SSD 把大模型的 KV 缓存卸载到高速固态硬盘,突破 GPU 显存墙,让 8GB / 16GB 的笔记本显存也能流畅跑 35B、120B 级别的大模型。
4 个真实硬件平台 / 6 款主流大模型 / AI SSD 与 Normal SSD 对照测试
BENCHMARK / VERIFIED DATA
×405
热 Prefill 最高加速
同平台同模型下,AI SSD 对比 Normal SSD(AMD 395 128G · Gemma4 26B)
×407
KV 缓存复用自加速
二次推理复用 SSD 上的 KV 缓存,单卡 Prefill 较首次推理提速
16GB
显存跑通 122B 大模型
Intel 358H 32G:Normal SSD 全 OOM,AI SSD 全部跑通
8GB
显存跑通 35B 大模型
RTX 5060:Normal SSD 全 OOM,AI SSD 跑通 20B / 35B
Architecture
大模型每生成一个新的 token,都需要读取之前所有 token 的「KV 缓存」。KV 缓存随上下文长度线性增长,是吞噬显存的头号大户。
KV 缓存全部放进 GPU 显存。显存不够 → 大模型直接 OOM,跑不起来。
KV 缓存卸载到高速 SSD,GPU 显存只保留活跃部分,按需加载。
相同上下文二次推理,直接复用 SSD 上的 KV 缓存(Hot),跳过重算。
把「显存容量」问题转化为「SSD 带宽」问题,小显存设备也能承载超大上下文与超大模型。
相同 prompt 二次访问时,KV 缓存已在 SSD 上就绪,Prefill 阶段几乎零重算,速度数量级提升。
128K / 256K 超长上下文下,Normal SSD 往往直接 OOM,AI SSD 仍可稳定运行。
Constraint
消费级与笔记本 GPU 的显存通常只有 8–32GB,而一个 120B 参数模型仅权重就需要 60GB+。显存不足时,传统方案束手无策。
Intel 358H 32G(16GB 显存):Qwen3.6-35B、gpt-oss:120b、Qwen3.5-122B、Gemma4:26B 在 Normal SSD 下全部显存不足(OOM);切换到 AI SSD 后,这 4 款大模型全部跑通。
NVIDIA RTX 5060(8GB 显存):gpt-oss:20b、Qwen3.6-35B 在 Normal SSD 下全部 OOM;AI SSD 让 8GB 显存也能跑 35B 大模型。
长上下文场景:128K / 256K 上下文下,Normal SSD 因 KV 缓存膨胀频繁 OOM;AI SSD 通过卸载将上下文上限显著抬高。
同样的硬件,Normal SSD 跑不动的大模型,AI SSD 跑得动;
同样的模型,AI SSD 的热推理速度,是 Normal SSD 的数倍到数百倍。
数据不会骗人 —— 下面的实测折线图说明一切。
Results
以下数字均来自本报告的真实实测数据(详见「完整数据」中的折线图与明细表)。
AMD 395 128G 上 Gemma4:26B(128K / 64K Input),AI SSD 的热 Prefill TPS 达到 Normal SSD 的约 405 倍。
同一台机器上,复用 SSD KV 缓存的「热推理」较首次「冷推理」的 Prefill 提速最高约 407 倍。
Intel 358H 32G 上 Gemma4:26B,AI SSD 的冷 Decode TPS 达到 Normal SSD 的约 6.4 倍。
16GB 显存跑通 122B、8GB 显存跑通 35B——这些在 Normal SSD 下根本无法启动。
Test Matrix
4 个真实硬件平台、6 款主流大模型(gpt-oss:20b · Gemma3:27B · Qwen3.6-35B · gpt-oss:120b · Qwen3.5-122B · Gemma4:26B)。
AMD 395 128G
96GB 显存 · 7 模型 / Radeon 8060S · 128GB SSD 缓存
Intel 358H 64G
32GB 显存 · gpt-oss:20b / Intel Ultra X7 358H · 85GB SSD 缓存
Intel 358H 32G
16GB 显存 · 6 模型 / 120B/122B 大模型 Normal SSD 全 OOM
NVIDIA RTX 5060
8GB 显存 · 2 模型 / 20B/35B 大模型 Normal SSD 全 OOM
4 个指标维度的折线对比(Cold Prefill TPS · Hot Decode TPS · Cold TTFT · Hot TTFT),AI SSD 青色实线 vs Normal SSD 灰色虚线,OOM 一目了然。
折线图 / 多机型切换 / 每模型展示最大可测上下文