大模型推理与服务架构:计算形态解构、KV Cache 系统与 PD 分离
大模型推理与系统服务架构(LLM Inference and Serving Architecture)是 AI Infra 领域核心分支,致力于在严格的延迟服务等级目标(SLO,如首字时间 TTFT 与输出速率 TPOT)约束下,通过软硬件协同优化、算子设计、显存分级调度与集群并行编排,实现极致吞吐量与最低单 Token 成本。
一、 推理计算形态与 Roofline 模型解构
自回归(Autoregressive)因果注意力模型的单次推理请求生命周期具有两阶段异构特征:
Source: 2026-09-14-bilibili-b23-tv-QqP6xXL-db16406938.md(来源未公开)
- Prefill(输入预填充阶段):一次性并行处理长提示词的所有 Token,对应高算术强度(Arithmetic Intensity)的密集矩阵乘法(GEMM),在传统场景下通常是计算受限型(Compute-bound)。
- Decode(自回归生成阶段):每次仅前向计算 1 个或极少数新 Token,却必须将全部模型权重与历史上下文状态从显存读入片上,对应类 GEMV 的低算术强度访存操作,受 HBM 显存带宽与 Roofline 模型严格制约,属于典型的访存受限型(Memory-bound)。
在 Hopper 架构(H100/H200)单卡部署 70B 模型(BF16 权重约 140GB,HBM 带宽 3.35TB/s)的极限工况下,单并发 Decode 理论最低时延为 42ms/token(吞吐上限约 24 tokens/s)。提高 Decode 算术强度的核心手段是增大 Batch Size,但在长上下文下,KV Cache 显存占用膨胀将反客为主,打破线性扩展优势。
二、 KV Cache 中心化系统(KV Cache-Centric Systems)
由于因果掩码(Causal Mask)的存在,历史 Token 对新 Token 的键值投影(Key/Value)在后续时间步长中恒定不变,缓存 KV 激活值成为避免二次平方级重算的必然选择。现代推理引擎将显存与调度视为围绕 KV Cache 运转的存储系统:
- 虚拟显存分页管理(PagedAttention):
- 传统按最大序列长度静态预留显存会造成大量内部碎片。PagedAttention 借鉴操作系统虚存机制,将连续逻辑 KV 划分为定长物理 Block(如 16/32 tokens),通过 Block Table 进行动态映射,将显存内碎片缩减至单个 Block 级别。
- 前缀共享与树形复用(Prefix Caching & Radix Tree):
- 在多轮对话与 Agent 工具调用中,相同前缀无需重复计算,直接通过 Block 哈希或前缀树(RadixTree,如 SGLang 实现)进行跨请求共享。在 Agent 与 Coding 复杂场景下,缓存命中率可达 56%~90%+,促使 Prefill 阶段由 Compute-bound 转向内存搬运主导。
- 多级显存分层与下沉(Memory Hierarchy & Offloading):
- 显存层级自上而下形成:GPU HBM CPU DRAM 本地 NVMe SSD 远端分布式缓存池(如 Mooncake 架构)。系统必须在“重新计算(Recompute)”与“点对点搬运(P2P Transfer)”之间做出动态 Trade-off,利用流水线技术将网络传输隐藏在计算之后。
三、 注意力架构演进对推理系统的重塑
从 MHA 到 MQA/GQA,再到前沿的 MLA(Multi-head Latent Attention) 与 DSA(DeepSeek Sparse Attention),算法创新极大卸载了推理系统的访存压力:
- DeepSeek MLA:将传统的离散 K/V 投影压缩为极低维度的潜在空间向量(Latent Vector),配合解耦的 RoPE 编码,使得每 Token 的 KV Cache 显存体积缩减近一个数量级。
- FlashMLA 与 FP8 KV:在 Hopper Tensor Core 上直接利用 TMA(Tensor Memory Accelerator)与 FP8 精度进行微块搬运,显著压榨硬件标称带宽。
四、 PD 分离架构(Prefill-Decode Disaggregation)
传统的混合部署中,Prefill 的瞬时大算力占用会导致正在进行的 Decode 发生严重抢占,引发 Token 间时延(ITL)剧烈抖动。PD 分离将系统拆解为异构物理资源池:
- Prefill 专有池:选用算力密度高、Tensor Parallelism / Context Parallelism 拓扑优化的集群,专注打满 GEMM,保障极限 TTFT;
- Decode 专有池:选用 HBM 显存带宽与容量充沛的硬件,运行大 Batch 并发与投机解码(Speculative Decoding,将串行生成转为并行验证);
- 高速网络总线:利用跨节点 RDMA 与专有 P2P 通信库实现已完成 Prefill 的 KV Cache 秒级直传 Decode 节点,彻底解耦吞吐与延迟的帕累托冲突。
关联页面
- ai-infrastructure-engineering — AI 基础设施工程师知识体系与学习路线
- token-efficiency — 大模型 Token 效率与端到端计算优化目标
- managed-agents — 云端托管多智能体集群的运行与调度规范
- agentic-systems — 复杂 Agent 循环对低延迟高命中推理系统的底层依赖