GE图引擎:如何优化大模型推理的PD分离架构设计

发布时间:2026/8/7 21:12:52
GE图引擎:如何优化大模型推理的PD分离架构设计 GE图引擎如何优化大模型推理的PD分离架构设计【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge在当今大模型推理场景中随着模型规模和batch size的不断增大推理系统面临着Prefill阶段性能线性下降和Decode阶段内存占用激增的双重挑战。传统部署模式下Prefill和Decode两阶段共享计算资源导致资源分配不均、成本居高不下。CANN/GE项目通过创新的PD分离架构设计为这一技术难题提供了高效的解决方案。技术挑战大模型推理的性能瓶颈大语言模型LLM推理过程通常分为两个关键阶段Prefill预填充阶段和Decode解码阶段。在Transformer架构中Prefill阶段负责处理用户输入的完整Prompt计算量随序列长度线性增长而Decode阶段则进行增量推理每次只处理一个token但需要频繁访问KV Cache。表1大模型推理两阶段特性对比阶段计算特征资源需求性能指标Prefill阶段计算密集型高算力、低内存TTFT首Token时延Decode阶段访存密集型低算力、高内存TBTToken间时延传统部署模式下两阶段共享同一套计算资源导致资源利用率低下。当新的Prefill请求到达时系统会优先处理导致正在进行的Decode任务被中断TBT指标极不稳定。这种饥饿现象严重影响用户体验特别是在高并发场景下更为明显。架构设计PD分离的创新解决方案GEGraph Engine作为面向昇腾芯片的图编译器和执行器提出了创新的PD分离架构设计。该架构将Prefill和Decode分别部署在不同规格和架构的集群中通过LLM-DataDist组件实现高效的数据传输和缓存管理。核心组件LLM-DataDistLLM-DataDist作为大模型分布式集群和数据管理组件提供了高性能、零拷贝的点对点KV传输能力。其主要功能包括链路管理支持集群之间的动态建链和断链实现集群的弹性扩缩容缓存管理提供Prefill和Decode之间点对点的KV Cache传输能力多传输模式支持D2D设备到设备、D2H设备到主机、H2D主机到设备等多种传输模式架构优势PD分离架构带来了显著的性能提升资源优化根据两阶段不同的计算特征分别配置最优化的硬件资源性能隔离Prefill和Decode执行互不干扰提供稳定的TBT指标成本降低通过资源差异化配置实现整体成本的最优化图PD分离架构实现Prefill和Decode的物理隔离确保稳定的TBT指标技术实现GE的完整技术栈GE项目的技术架构分为四个核心层共同构成了从模型输入到设备执行的完整链路。前端框架适配层前端适配层负责将GE作为主流深度学习框架的后端使用。支持PyTorch、TensorFlow等框架的AtenIR和GraphDef转换为AscendIR实现无缝集成TorchAir将PyTorch的AtenIR转换为AscendIRTF Adapter将TensorFlow的GraphDef转换为AscendIR离线编译工具链atcatcAscend Tensor Compiler是GE的独立编译工具链支持离线场景下的模型编译无需昇腾设备纯Host侧即可完成编译多格式支持支持ONNX、PB等主流模型格式独立部署生成的OM文件可在设备上直接加载执行GE编译器图编译器GE Compiler是核心编译组件负责将AscendIR编译为可在昇腾设备上执行的二进制模型图级优化在AscendIR层面进行通用编译器优化和算子融合算子编译结合shape信息进行在线编译优化流分配识别可并行关系将算子分配到不同流上内存分配以整图视角规划和复用张量内存模型序列化将编译好的模型序列化为OM文件GE执行器图执行器GE Executor负责模型在昇腾设备上的执行控制模型加载将算子二进制和权重加载至设备模型执行按照模型语义执行提供必要的控制逻辑资源管理管理设备内存和计算资源图GE系统架构总览展示从前端框架到设备执行的完整链路性能优化KV Cache管理与传输机制在PD分离架构中KV Cache的高效管理是性能优化的关键。GE通过创新的缓存管理策略实现了跨集群的高性能数据传输。KV Cache传输优化零拷贝传输利用昇腾集群的多样化通信链路RoCE/HCCS/UB实现设备间的直接数据传输PagedAttention支持采用离散block方式管理KV Cache显著减少内存占用动态扩缩容根据业务负载动态调整集群数量和PD配比连续批处理技术GE支持Continuous Batching技术通过将多个推理请求组合成批次处理最大化计算资源利用率减少空闲时间优化计算过程中的资源调度提高吞吐量通过批处理提升整体推理速度资源复用在Decode阶段实现请求的动态调度部署实践构建高效的大模型推理系统基于GE的PD分离架构企业可以构建高性能、可扩展的大模型推理系统。以下是关键部署建议集群配置策略硬件选型Prefill集群选择高算力设备优化TTFT指标Decode集群选择大内存设备优化TBT指标网络配置确保PD集群间的高速网络连接优化数据传输路径减少延迟资源调度优化负载均衡根据请求类型动态分配资源实现PD集群间的智能调度弹性伸缩支持集群的动态扩缩容根据业务负载自动调整资源配置监控与调优性能监控实时监控TTFT和TBT指标跟踪资源利用率和系统吞吐量故障恢复实现快速故障检测和恢复保障系统的高可用性技术展望未来发展方向随着大模型技术的不断发展GE项目也在持续演进多模态支持扩展支持视觉、语音等多模态模型异构计算优化CPU、GPU、NPU的协同计算边缘部署支持边缘设备的轻量级部署方案自动化优化引入AI驱动的自动编译优化技术总结CANN/GE项目通过创新的PD分离架构设计为大模型推理提供了高效、可靠的解决方案。通过将Prefill和Decode阶段物理分离结合LLM-DataDist的高性能数据传输能力GE实现了资源利用率的最大化和性能指标的最优化。对于技术决策者和架构师而言GE不仅提供了完整的大模型推理技术栈更重要的是提供了可扩展、可维护的系统架构设计。随着大模型应用的不断深入这种基于计算特征差异化的架构设计思路将为更多AI推理场景提供有价值的参考。进一步学习资源GE架构设计文档LLM-DataDist开发指南图编译器技术细节图执行器实现原理【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考