UbiCache AI 推理缓存存储
面向推理场景极致优化的分布式 KV CACHE 存储引擎
UbiCache 是泛联专为大模型推理打造的 KV Cache 专用存储系统,核心解决大模型推理场景下 KV Cache 挤占 GPU 显存、重复计算、高并发卡顿行业痛点。 大模型推理生成的 KV Cache 是 AI 对话、多智能体运行的核心 “工作内存”,随上下文长度、并发量暴涨,极易耗尽昂贵 GPU 计算资源和显存;UbiCache 通过存储卸载 KV Cache,把缓存从 GPU 显存下沉至 NVMe 存储池,搭配 RDMA 高速网络实现跨节点微秒级缓存共享,是大规模 AI 推理的核心基础设施。
UbiCache AI 推理缓存存储
产品特点
UbiCache采用全栈用户态分布式架构,依托 GDR 直传降时延,原生 KV 接口减少协议开销,聚合写优化存储损耗,支持快照分支,全局资源池化调度,保障推理低延迟与高效缓存复用。
产品优势
◆ 全生态兼容、开箱即用
原生 KV 接口,摒弃 POSIX 协议转换开销,无缝对接 NIXL、LMCache、Mooncake 等主流框架,无需改造现有推理业务即可接入。
◆ 弹性线性扩展
全局统一命名空间,集群扩容后台无感重平衡,容量、性能随节点数量线性增长,支撑业务弹性扩容。
典型应用场景
UbiCache 适配政企知识库、电商客服、多模态生成、多 Agent 协同及边缘推理场景,依托外置缓存提升并发,支撑超长上下文,实现低成本稳定的 AI 推理服务。
政企知识库问答服务
单条对话上下文可达数万 Token,KV Cache 体量巨大,UbiCache 外置大容量缓存支撑超长上下文,稳定承载政务、企业知识库检索问答。
电商智能客服
大促高峰期上万用户同时在线对话,短文本并发请求密集,频繁置换缓存造成算力浪费;UbiCache 分担 GPU 算力压力,提升并发承载上限,降低算力成本。
多模态 AI 在线生成服务
图文、视频混合生成业务上下文复杂,读写吞吐压力大;UbiCache 低时延高吞吐能力保障连续对话、多轮生成不中断,稳定支撑文生图、视频生成业务。
多 Agent 复杂协同业务
多智能体交互需要长期记忆、跨节点共享历史推理信息;UbiCache 分布式缓存实现 Agent 全局上下文互通,支撑复杂 AI 决策、自动化工作流场景。
边缘中小规模推理
UbiCache 5000 轻量化机型适配园区、本地私有化 AI 服务、边缘算力节点,低成本快速部署推理加速能力。
两大型号,覆盖全场景AI推理需求
◆ 极致推理性能提升
技术团队基于公开数据集和业界公认测试工具测试:首 Token 延迟最大降低97%,推理吞吐量从 9000 tokens/s 提升至 13 万 + tokens/s,大幅缓解长对话、高并发卡顿问题。
◆ 大幅降低算力成本
通过以存代算,将 KV Cache 卸载到存储中,同等 GPU 硬件可承载数倍并发请求,减少 GPU 采购数量,显著降低单 Token 运营成本;支持 PD 分离推理架构,提升集群整体 GPU 利用率。
◆ 全链路低时延无抖动
全用户态 Kernel-Bypass、GPU Direct RDMA 直传、RDMA 高速网络,实现微秒级 I/O 响应;聚合写 IO 消除 SSD 垃圾回收抖动,闪存使用寿命提升 2 倍,保障 7×24 小时在线推理稳定。
