AI Infrastructure Engineering(AI 基础设施工程)

AI 基础设施工程师(AI Infrastructure Engineer)是 AI 时代涌现的关键技术岗位,专注于大语言模型的高效部署、推理优化与底层硬件适配。这一岗位横跨硬件体系结构、系统软件与 ML 工程,是将模型研究成果转化为生产可用能力的关键链条。

核心知识域

1. 硬件基础:GPU 架构与内存体系

  • GPU 架构:理解 SM(流式多处理器)、Warp 调度、Tensor Core 工作原理;NVIDIA 架构演进(Ampere → Hopper → Blackwell)。
  • VRAM 基础:显存带宽、容量与模型尺寸的关系;HBM vs GDDR 的权衡;多 GPU 的 NVLink / InfiniBand 互联。
  • CUDA 与内存层次:Global Memory / Shared Memory / Registers 的访问模式与延迟;Kernel 融合(Kernel Fusion)以减少内存读写轮次;优化 Memory-Bound 操作(如 LayerNorm、Softmax)。

2. 量化与批处理

  • 量化(Quantization):
    • INT8:8位整数量化,训练后量化(PTQ)主流方案;
    • FP8:Hopper 架构原生支持,兼顾精度与效率;
    • 4-bit(GPTQ / AWQ / GGUF):极致压缩以适配消费级硬件或边缘部署;
    • QAT(量化感知训练):在训练中融入量化误差,精度损失更小。
  • 批处理(Batching):
    • 静态批处理:简单但 GPU 利用率低;
    • 连续批处理(Continuous Batching):动态将不同长度请求合并到同一 batch,显著提升吞吐量——vLLM 核心技术之一。

3. 推理引擎

引擎特点适用场景
vLLMPagedAttention、连续批处理、OpenAI 兼容 API云端高并发推理服务
TensorRT-LLMNVIDIA 官方优化,Kernel 融合极致性能NVIDIA GPU 生产部署
SGLang结构化生成(JSON/正则)、RadixAttention 共享 KV有结构化输出需求的 Agent 系统
llama.cppCPU+GPU 混合、跨平台、GGUF 格式本地/边缘部署、消费级硬件

4. KV 缓存与投机解码

  • KV 缓存(KV Caching):保存 Attention 中 Key-Value 矩阵以避免重复计算;PagedAttention(vLLM)将 KV cache 分页管理,解决显存碎片化问题;Prefix Caching 复用共享前缀(如 system prompt)的 KV。
  • 投机解码(Speculative Decoding):用小模型(Draft Model)快速生成候选 token,再由大模型(Target Model)并行验证;在批量 token 验证相比逐 token 生成更高效的场景下显著降低延迟。

技能学习路径

GPU 架构 & VRAM → CUDA 编程基础 → 量化理论(INT8/FP8/4-bit)→
批处理策略(Continuous Batching)→ 推理引擎(vLLM/TGI/SGLang)→
KV 缓存优化 → 投机解码 → 系统级性能调优

与 Agent 系统的关联

AI 基础设施工程与 agentic-systems 深度交织:

  • Token 效率:低延迟推理使 Agent 的工具调用循环(ReAct/Loop)更流畅。参见 token-efficiency。
  • 测试时规模化:长链推理(Chain-of-Thought、多步工具调用)需要 KV 缓存与长上下文优化的底层支撑。参见 test-time-scaling。
  • Harness 部署:推理引擎是 Agent Harness 的底层动力来源。参见 harness-in-agentic-systems。
  • 端侧部署:具身智能体的本地推理依赖量化与边缘优化技术。参见 in-memory-computing-chip。