KAKA WEB3快讯
SemiAnalysis拆解AI推理:内存带宽比容量更重要,调度层成关键
律动 BlockBeats·2026-09-22 12:50 GMT+8
动察 Beating AI 快讯,研究机构 SemiAnalysis 发布报告,系统拆解大模型推理服务的底层架构。报告认为,随着 MoE 模型成为主流,AI 推理已从单一计算任务演变为由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)组成的复杂流水线,不同阶段对算力、内存带宽和网络的需求存在明显差异。 在多数推理场景下,内存带宽比容量更具经济价值。高带宽内存可提升 Token 生成效率,而闲置的 HBM 只会增加成本。SemiAnalysis 预计,2027 年单个流水线阶段可能需要约 400 至 500GB 本地快速内存,但已完成处理的 KV 缓存应及时迁移至 CPU DRAM 及更低成本的网络存储,避免占用稀缺的
动察 Beating AI 快讯,研究机构 SemiAnalysis 发布报告,系统拆解大模型推理服务的底层架构。报告认为,随着 MoE 模型成为主流,AI 推理已从单一计算任务演变为由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)组成的复杂流水线,不同阶段对算力、内存带宽和网络的需求存在明显差异。 在多数推理场景下,内存带宽比容量更具经济价值。高带宽内存可提升 Token 生成效率,而闲置的 HBM 只会增加成本。SemiAnalysis 预计,2027 年单个流水线阶段可能需要约 400 至 500GB 本地快速内存,但已完成处理的 KV 缓存应及时迁移至 CPU DRAM 及更低成本的网络存储,避免占用稀缺的 HBM 资源。 调度层将成为 AI 推理基础设施的关键环节。预填充和中间填充的处理时间相对可预测,而解码时长存在较大波动,容易造成任务积压和「延迟反馈震荡」。因此,稳定的缓冲机制、跨时间尺度的调度和 KV 缓存分级管理,将直接影响推理集群的吞吐效率。 在架构选择上,报告比较了聚合式和分离式两种方案:前者将 Prefill 和 Decode 集中在同一设备上,可减少 KV 缓存跨节点传输,但要求硬件同时具备高计算密度和高内存带宽;后者则针对不同阶段配置专用节点,能够实现硬件优化,但会增加数据搬运和网络开销。SemiAnalysis 认为,两种架构的取舍最终取决于未来能否出现兼具高算力和高内存带宽的「全能型」加速器。 报告还通过模拟器预测 Kimi K3 在英伟达 B200、B300 和 GB200 系统上的表现。结果显示,GB200 在部分低延迟场景具备优势,而多数前沿配置的单 GPU HBM 峰值驻留量低于 80GB,进一步凸显内存带宽和存储编排的重要性。
来自 Kaka Web3 的公开内容。市场与数字资产信息不构成投资建议。