当前大型语言模型(LLM)的推理过程对计算资源和内存带宽提出了极高要求。石静指出,主流大模型采用“自回归”方式逐字生成回答的过程,其机制导致计算量呈平方级增长,这构成了AI推理效率提升的关键瓶颈。
针对这一背景,中科曙光发布了基于存算协同理念的ParaCache高效管理方案。该方案的核心目标在于优化模型运行过程中对存储和计算资源的调度与利用,旨在重构AI推理的整体效率结构。
从技术架构层面看,中科曙光推出的ParaCache方案构建了一个业界完整的L1至L4四级缓存体系。具体而言,L1对应GPU HBM,L2为CPU DRAM,L3创新性地纳入了集中式存储FlashNexus作为SSD层级,而L4则由分布式共享存储池ParaStor构成。
石静进一步阐述了该方案的调度优势,指出ParaCache的调度算法可以基于目录设置不同的淘汰策略,例如可以根据不同推理应用的需求设置不同的淘汰时间。此外,中科曙光特别强调了其首创的XDS技术价值,该技术支持国内主流AI加速卡直接与分布式存储交互,实现了从L1到L4的直接卸载与回迁能力。
在实际性能表现上,ParaCache方案展现出显著的提升。实测数据显示,基于中科曙光发布的ParaCache高效管理方案,模型单轮对话首词元时延(TTFT)最高降低了98.5%,高并发场景下的词元吞吐量最大提升了27倍。更细致的测试数据表明,面对30K至120K长度的多轮对话场景,ParaCache可将首次Token时延(TTFT)降低89%;在高并发场景下,Token吞吐量最大可提升27倍。
石静在阐述技术价值时提出了一个关键的资源分配思路:与其投入巨资购买更大的显存,不如通过智能的KV Cache管理机制,将昂贵的HBM留给最急迫的实时计算任务,而将历史的、共享的上下文信息交给更大且成本更低的存储池进行承载。
从应用兼容性角度看,石静明确表示ParaCache与LMCache等业界主流开源项目深度兼容。这意味着已基于vLLM、SGLang等主流推理框架搭建业务的客户可以无缝接入中科曙光推出的ParaCache方案。
在更宏观的市场背景下,有资料显示赛迪顾问预测,中国分布式存储市场规模预计将从428亿元增长至838亿元。这预示着AI基础设施对高性能、高容量存储的需求持续增长,为存算协同技术的发展提供了广阔的产业基础。
本次ParaCache方案的发布,体现了业界从单纯追求计算单元性能向构建全栈式、多级缓存体系迈进的趋势。它将内存管理和数据流转优化提升到了与核心计算能力同等重要的战略高度,为解决超大模型推理中的长上下文处理难题提供了新的技术路径。
需要指出的是,本次介绍的所有信息均来源于环球网报道的内容,仅基于该单一来源进行梳理和分析,不代表其他机构的评估或市场共识。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。