UbiCache 是泛联专为大模型推理打造的 KV Cache 专用存储系统,核心解决大模型推理场景下 KV Cache 挤占 GPU 显存、重复计算、高并发卡顿行业痛点。 大模型推理生成的 KV Cache 是 AI 对话、多智能体运行的核心 “工作内存”,随上下文长度、并发量暴涨,极易耗尽昂贵 GPU 计算资源和显存;UbiCache 通过存储卸载 KV Cache,把缓存从 GPU 显存下沉至 NVMe 存储池,搭配 RDMA 高速网络实现跨节点微秒级缓存共享,是大规模 AI 推理的核心基础设施。

UbiCache  AI 推理缓存存储

产品特点

UbiCache采用全栈用户态分布式架构,依托 GDR 直传降时延,原生 KV 接口减少协议开销,聚合写优化存储损耗,支持快照分支,全局资源池化调度,保障推理低延迟与高效缓存复用。

全栈用户态

Share-Nothing 分布式架构  

自研 FlashNetEngine 引擎,绕过操作系统内核内存拷贝与锁竞争,通过GDR 技术实现数据 GPU 直传,不占用主机 CPU / 内存,减少内存拷贝,大幅降低时延;去中心化架构无单点瓶颈,保障 P99 长尾低延迟。

原生轻量级 KV 接口

不依赖传统文件系统语义,向上直接暴露 KV 原生接口,消除协议转换开销,跨 Worker、跨物理节点高效复用历史缓存,减少重复计算。

Append-only 聚合写 +

细粒度版本控制

碎片化小块写先聚合为大块顺序写入 SSD,减少盘内磨损;支持 Epoch 零拷贝快照分支,适配 Beam Search 多分支回溯场景,算力全部用于模型运算。

全局统一命名空间调度

池化集群内存与 SSD 资源,推理请求跨实例迁移时缓存透明可见;后台空闲带宽完成数据重平衡,不冲击在线推理时延。

产品优势

 

 

全生态兼容、开箱即用

原生 KV 接口,摒弃 POSIX 协议转换开销,无缝对接 NIXL、LMCache、Mooncake 等主流框架,无需改造现有推理业务即可接入。

 

弹性线性扩展

全局统一命名空间,集群扩容后台无感重平衡,容量、性能随节点数量线性增长,支撑业务弹性扩容。

 

 

 

典型应用场景

UbiCache 适配政企知识库、电商客服、多模态生成、多 Agent 协同及边缘推理场景,依托外置缓存提升并发,支撑超长上下文,实现低成本稳定的 AI 推理服务。

政企知识库问答服务

单条对话上下文可达数万 Token,KV Cache 体量巨大,UbiCache 外置大容量缓存支撑超长上下文,稳定承载政务、企业知识库检索问答。

电商智能客服

大促高峰期上万用户同时在线对话,短文本并发请求密集,频繁置换缓存造成算力浪费;UbiCache 分担 GPU 算力压力,提升并发承载上限,降低算力成本。

多模态 AI 在线生成服务

图文、视频混合生成业务上下文复杂,读写吞吐压力大;UbiCache 低时延高吞吐能力保障连续对话、多轮生成不中断,稳定支撑文生图、视频生成业务。

多 Agent 复杂协同业务

多智能体交互需要长期记忆、跨节点共享历史推理信息;UbiCache 分布式缓存实现 Agent 全局上下文互通,支撑复杂 AI 决策、自动化工作流场景。

边缘中小规模推理

UbiCache 5000 轻量化机型适配园区、本地私有化 AI 服务、边缘算力节点,低成本快速部署推理加速能力。

UbiCache 10000(旗舰版)

面向大型智算中心、高并发企业级推理集群,支撑 PB 级缓存、多节点大规模部署,适配多 Agent、超长上下文复杂业务。

 

UbiCache 5000(敏捷版)

轻量化高性价比机型,部署简单、资源占用低,面向中小规模推理业务、边缘 AI 场景。

两大型号,覆盖全场景AI推理需求

 

 

极致推理性能提升

技术团队基于公开数据集和业界公认测试工具测试:首 Token 延迟最大降低97%,推理吞吐量从 9000 tokens/s 提升至 13 万 + tokens/s,大幅缓解长对话、高并发卡顿问题。

 

大幅降低算力成本

通过以存代算,将 KV Cache 卸载到存储中,同等 GPU 硬件可承载数倍并发请求,减少 GPU 采购数量,显著降低单 Token 运营成本;支持 PD 分离推理架构,提升集群整体 GPU 利用率。

 

全链路低时延无抖动

全用户态 Kernel-Bypass、GPU Direct RDMA 直传、RDMA 高速网络,实现微秒级 I/O 响应;聚合写 IO 消除 SSD 垃圾回收抖动,闪存使用寿命提升 2 倍,保障 7×24 小时在线推理稳定。

 

资料下载
联系我们