互联网 频道

中科曙光发布新一代词元加速方案ParaCache

8月28日,2026中国国际大数据产业博览会开幕。大会期间,中科曙光发布新一代词元加速方案——基于存算协同理念的ParaCache高效管理方案。实测显示:基于该方案,模型单轮对话首词元时延(TTFT)最高降低98.5%,高并发场景词元吞吐量最大提升27倍。

AI推理的双重困境

随着大模型应用规模化落地,算力消耗的重心已从训练转向推理。然而推理环节正遭遇两大瓶颈。

一是推理越来越慢。在多轮对话中,大模型的每次回答,都需要重新计算所有历史内容,计算量平方级增长:处理16K长文本,单次推理需执行2.56亿次键值对计算。

二是“记忆”越来越贵。为避免重复计算问题,业界普遍采用KV Cache(键值缓存)技术加速推理,把已算好的键值向量缓存在GPU显存中。但显存容量有限、价格高昂,随着模型变大、上下文变长,硬件成本也将急剧攀升。不仅如此,传统KV Cache只能消除单对话、单节点内的重复计算,在跨对话、跨节点的大集群场景中,加速效果大打折扣。

一次计算、多次复用

ParaCache通过构建四级架构,对KV Cache进行全层级的高效管理:热数据放显存、温数据放内存、冷数据放SSD(固态硬盘)和分布式存储。这种“四级缓存池化”的管理解决方案可以实现两大关键突破:在硬件层,ParaCache优化了跨芯片、跨节点的计算效率,打通各级存储资源;在运行层,则可以跨请求参与前端应用,消除重复计算,缓存可复用时间长达数周甚至数月。

ParaCache让KV Cache从“用完即弃”的临时数据,变成可反复调用的数据资产。这可以直接让词元提升推理响应速度、降低成本,并为智能体的扩展提供支撑。

“多”“快”“好”“省”

ParaCache为用户带来的价值很直观。

更快:缩短首词元时延,让“第一字”更快出现。120K长文本下,单轮对话首词元时延最高降低98.5%,仅400毫秒;多轮会话下该指标仍降低超80%,至4.9秒。

更多:提升词元吞吐量,每一秒处理更多推理任务。高并发场景下,词元吞吐量最大可提升27倍,在硬件规模不变的前提下,可承接更多请求。这一收益在大集群的高并发场景下更为显著。

更省:削减词元内存占用,降低硬件开销。冷热数据分层管理的方式,大幅降低对内存硬件的依赖,实测显示,即便缓存容量下调,系统性能也几乎不变。企业用中低配硬件的成本,就能跑出高配硬件的上下文长度,集群总拥有成本(TCO)大幅优化。

更好用:无缝对接全球推理生态。该方案同时原生兼容全球推理生态的事实标准——LMCache,企业无需重构技术栈,即可平滑升级。

在7月落成的首个全国产十万卡AI超集群曙光8000上,ParaCache成功支撑长上下文对话、高并发在线推理、智能体工作流与高通量推理四类应用场景,扛住了生产级考验。

从存数据到存智能

“ParaCache并非改写GPU的性能上限,而是通过减少重复计算和数据搬运,让既有算力得到更充分的利用。”

中科曙光北京公司总裁助理、分布式存储产品部总经理石静指出,过去GPU是推理架构的绝对中心,而ParaCache的推出,让存储的定位也随之重写:从被动的IO响应,转向推理链条上的主动参与者。它将决定哪些记忆留在显存、哪些下沉到内存和SSD、哪些进入分布式存储,何时预取、何时淘汰。

这正是AI驱动下数据基础设施的一次结构性变化。作为中科曙光“AI数据工厂”理念的最新落地,ParaCache将存储能力从数据读写延伸到优化词元产出,为词元经济时代的大规模应用提供了可行路径。



特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,并请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。
0
相关文章