重构缓存边界:翼华科技ODX大会详解 “AI DPU 让每一个 Token 更便宜”
——从“算力”到“记忆”,一篇读懂大模型推理降本的新路径
9 月 2 日,北京国家会议中心二期。2026 开放数据中心大会暨首届算博会(2026 ODX)现场,翼华科技联合创始人兼高级副总裁贾淑芸发表《重构缓存边界:AI DPU 让每一个 Token 更便宜》主题演讲。“今天我想跟大家聊的,不是又一颗更快的芯片,而是一件更朴素的事——怎么让每一个 Token,变得更便宜。”演讲开篇,贾淑芸便把话题从“算力”引向了一个被行业长期忽视的角落:缓存。
大会同期,翼华科技作为唯一一家 DPU 厂商荣获“2026 ODX 年度先锋企业”,与中兴通讯、上海三星半导体等少数几家行业头部企业同登荣誉榜单。
一个判断:推理成本的瓶颈,正从“算力”转向“记忆”
贾淑芸在演讲中指出,随着大模型进入规模化推理阶段,行业长期关注的“算力”正在让位于一个更隐蔽的成本项——缓存。在短对话场景下,KV Cache 可以容纳在 GPU 显存中,成本可控;但在长上下文、多轮对话的 Agent 任务中,KV Cache 容量远超单卡显存,被迫反复驱逐与重算——用贾淑芸的话说,GPU 大量的时间不是在干活,而是在“补作业”。
她将这一现象归纳为核心论断:推理成本的瓶颈,正从“算力”转向“记忆”。上下文越长,KV Cache 越大、离 GPU 越远,访问延迟与重算叠加,直接推高每一个 token 的能耗与成本。

一个方案:Context Memory 节点,填补内存层级的“空白地带”
针对这一痛点,贾淑芸在演讲中详解了 DPU 驱动的 Context Memory 节点方案。她分析,当前内存层级存在一个结构性空白:GPU HBM 带宽极高但容量有限且昂贵,主机内存容量居中成本仍高,底层存储容量大但延迟无法满足推理需求,中间缺少一层兼具接近内存的性能与接近闪存的成本、且支持跨节点共享的“上下文记忆层”。
翼华的方案是用 AI-DPU 驱动 Context Memory 节点填补这一空白:热 KV 保留在 GPU HBM,温 KV 置于主机内存,Context Memory 节点由“培风图南”AI-DPU 与 NVMe 闪存池构成,承担 KV 的池化、共享与持久化,冷数据归档至对象存储。各层之间通过 RDMA 网络实现零拷贝流动,全部调度由 DPU 完成,不占用 CPU 与 GPU 资源。

三个动作:让“每一个 Token 更便宜”落到工程
把技术翻译成钱,翼华做了三件事,每一件都对应一笔能算得清的成本节约:
极致降本
通过前缀 KV 跨请求复用与会话持久化,大幅减少重复计算,在典型场景下显著降低 Decode 阶段硬件成本与首 Token 延迟——同样的算力服务更多用户,同样的预算支撑更长的上下文。
高效卸载
AI-DPU 将 KV 索引、RDMA 零拷贝、压缩加密与智能预取等任务从 CPU/GPU 卸载,主计算全程不被打扰,数据高速流转,让最贵的算力专注最核心的计算。
开放生态
全面兼容异构 GPU、标准以太网及 vLLM、SGLang 等主流推理框架,支持存量集群平滑、渐进式升级——不推倒重来,让普惠真正接得住。
“三件事归结成一句话:不重算,就是最大的降本。”贾淑芸说。
演讲现场,贾淑芸同时宣布翼华已开放 POC 合作计划,邀请推理框架、存储伙伴与云厂商共建开放的 Context Memory 接口标准——“带着你的真实负载来,我们一起把这笔账算清楚。”
一个底座:技术实力让“更便宜”不只是口号
“Token 更便宜”的背后,是翼华近四年在高端算力芯片国产化上的持续投入。
深耕智能网卡、算力芯片全栈研发近四年,翼华科技专注于高性能网络芯片与高性能计算芯片核心技术研发,以“双芯驱动+全栈服务”模式打造国际一流算力集群。其智能网卡图南一代 SmartNIC 已实现规模化商用出货,目前已广泛部署于智算中心、大模型分布式训练集群与云数据中心,稳定承载多个算力集群的训练、推理业务。客户矩阵覆盖头部服务器厂商、AI 大模型企业、云服务商与算力运营机构。
作为工信部机间互联标准工作组牵头单位,翼华深度参与 RISC-V 架构、智算网络等多项国家及行业标准编制,先后斩获第二十届“中国芯”优秀技术创新产品奖、算力强基行动卓越产品、AI Cloud 典型案例等行业权威荣誉,自研算力互联核心产品及解决方案入选工信部 2025 年先进计算赋能新质生产力典型应用案例。
“算力,决定模型能想多快;记忆,决定模型能想多远;而成本,决定这一切能不能真正普惠。”贾淑芸在演讲结尾表示,“翼华愿意做那个把‘记忆’做便宜、让智能真正普惠的人。让每一个 Token,更便宜。”