当AI Coding上下文动辄 128K、任务一跑数天,大量“算过的记忆”因存不下而被反复重算,“以存代算”正成为企业AI账单的关键。
很多人已经开始意识到,当AI Coding从“补全一行代码”走向“端到端完成任务”,它开始在改写AI推理基础设施。
最直接的压力来自上下文长度。AI Coding是最典型的长上下文场景:以往8K已算长序列,现在64K是常态,128K往上才算得上“长”。一个任务可能持续数天,每一轮推理都要复用此前积累的信息。这些信息本已算好了结果,却常常因为存不下而被删除,等到下一轮需要时,再花算力重算一遍。于是,一笔越来越难忽视的重复计算开销浮出水面——而如何消除它,正在成为推理基础设施要解决的问题。
在华为全联接大会2026上,一位产品工程师说,从2024年公司开始讲长上下文和KV Cache时还属于少数派;到今年上半年,几乎所有存储厂商都在讲同一件事。
智能体真正落地之后,存储不再是后台角色。它能否留住这些“记忆”,直接影响着一家企业的AI账单。
01
一个人的三天,和800TB的记忆
陈工是某集团软件开发中心的开发者,团队有五百人,他是其中之一。
最近,他手上的任务是按照新规范,更新一个老系统的模块。他的开发模式和一年前已完全不同。过去是他写一段代码让AI补全,贴一段报错让AI找Bug;现在他和Agent协同工作,走的是规范驱动开发(SDD)流程——先做逆向,把老系统的结构还原出来;再采集和确认新需求;然后进入规约环节,让后面所有代码按同一套规范贯标;再后面是编程、测试,反复优化。
每一环的产物都要经他确认后,AI才能进入下一环。在某头部银行AI Coding场景里,典型轮次超过两百次,周期从一天到一周,单次上下文128K。
三天里,陈工几乎没有手写过代码。他的工作变成了定义问题、补充上下文、判断结果对不对。
这是开发的新模式。2026开发者生态系统调查显示,开发者代码里平均已有54%由AI生成,一年前还是28%;中国银行半年报披露,其智能研发助手月活用户超过一万人。变化更剧烈的是任务长度。AI研究组织METR的测试显示,智能体能独立完成的任务跨度,已从GPT-3 的约9秒,拉长到2026年Claude Opus 4.6的约12小时。
但新问题也随之而来:这些上下文,存不住。
AI Coding任务里,每一轮大约超过95%的内容是重复的——同一份规约、同一份接口定义、前面所有的讨论记录,每次几乎都是原封不动的。
而模型每读一遍上下文,都会在每一层网络算出K、V向量存下来,这就是KV Cache,它是模型的“阅读笔记”。有笔记,下一轮模型只读新增部分;没笔记,模型就要从头重算。
为什么笔记不都存下来?这是因为模型的笔记很占地方。比如在部分模型上,大约1000个Token的上下文,对应上百MB的KV Cache;一个128K的长序列,就是十几GB。如果团队500人,每人每天下发多个任务,任务要跑几天,笔记就得保存几天。在一个智谱GLM-5.3-flash的实测中,这样一个500人团队三天产生的KV Cache超过800TB。
而算力卡上的高带宽显存(HBM)是GB级的,加上服务器内存(DRAM),合起来也只有几十TB。800TB对几十TB,几乎是瞬间填满。装不下了,系统就先删掉旧的,腾给新的。
这里有一个关键指标叫命中率——一次新请求的上下文里,有多少比例能直接找到现成笔记,不必重算。陈工的会话95%都是老内容,命中率本该有95%。但笔记存不下、被删掉了,实测只有三成多。这意味着六成本可以直接取用的内容,每一轮都要重算一遍,浪费大量token。
实际上,token消耗的账,今年也开始第一次出现在金融机构的财务考核里。比如,招商银行2026年6月披露,截至5月底日均Token消耗已达330亿,工商银行两年内Token消耗增长近百倍。已有银行高层在年中总结会上直接提出,不能无休止地烧钱消耗Token,所有大模型和智能体应用都要建立投入产出比评估机制。
而在几乎所有大模型的定价体系里,命中缓存的输入Token和未命中的输入Token,是两个价钱。以DeepSeek V4-Flash的公开价格为例,命中是每百万Token0.0028 美元,未命中是 0.14 美元,相差50倍。
AI Coding原本应该是所有AI场景里命中率最高、最便宜的,现实中却最贵。这件事成为用户的一大痛点。
02
把记忆搬出显存
怎么把这些记忆留住?业界给出了三个选项。
全放在GPU卡的HBM上:速度最快,但只有GB级容量,成本极高。HBM加服务器内存:能到TB级,面对800TB的需求,仍是杯水车薪,成本同样不友好。这两条路不只是贵,容量上限也卡住了命中率上限。
于是有了第三条路:HBM加内存再加外置存储,容量拉到PB级,还能继续扩展,单位成本最低。华为选的是第三条。
但一说到“外置存储”,做推理系统的人立刻会有疑问:从外部盘里取数据,会不会很慢?这个疑问是对的。要让这条路成立,得同时解决两件事——存储本身要够快,调度系统要够聪明。
首先要解决快的问题。KV Cache加载需要高带宽,取大模型的笔记动辄要把十几GB的文件,“一把”搬上来。HBM的带宽是每秒TB级,DRAM内存带宽也达到每秒几十GB。外置存储要当得起“第三级缓存”,带宽必须尽可能贴近内存水平。华为OceanStor A800单框提供500GB/s带宽、1.6PB可用容量,并支持Scale-out横向扩展。
这个高带宽是怎么实现的?先要有足够强的硬件打底,然后是架构上的创新,比如数控分离——过去CPU既要指挥数据往哪走,又要亲自搬数据;现在控制流归CPU,数据从DPU直通到SSD,路径更短,时延自然下来。
但存储这一端通路再宽,算力卡那段路如果变成羊肠小道,速度照样上不去。DataTurbo就是解决这一段的——它在AI服务器上部署DTFS客户端,配合OceanStor A800的DPU硬件卸载,绕过传统协议栈,让数据在内核态直通存储,甚至通过NDS能力直达NPU。核心是让存储500GB/s的高带宽真正发挥出来。
其次是调度。几百TB的KV Cache里,哪些该留在HBM,哪些该放内存,哪些该下沉到外部的SSD?什么时候取?怎么取?这需要一位“管理员”。华为去年发布并已开源了UCM(Unified Cache Manager,推理记忆数据管理器),就是在做这件事:
它首先识别冷却的KV Cache,从HBM逐级下沉到SSD,热数据则留在HBM中,温数据放内存。
然后UCM要决定谁能用。例如,Coding每一轮上下文开头一大段是固定的,只有末尾是新的。这段不变的开头叫前缀,可以一直留着反复用。UCM把它做在全局KV池,让所有节点乃至跨集群共用同一份KV Cache。500名开发者的任务虽然分散在不同服务器上,但A机器算过的前缀,请求落到B机器时也能命中。
最后它决定怎么取。 模型是一层一层往下算的,UCM也就一层一层地加载KV,在模型计算第N层时,把第N+1层的笔记取上来。就像厨师炒第一道菜时,助手已经去准备第二道菜的食材。取数的时间,就这样被藏进了模型处理新输入的时间里。
这两方面的配合,让命中率从三成多可以提升到九成以上,原本用于重复计算的算力被省了出来。首Token时延(TTFT)最大降低90%;假设原来首Token时延是10秒,一分钟机器只能响应6个请求;现在缩短到2秒,一分钟就能响应30个请求,算力没有增加,并发翻了五倍。每秒生成token数(TPS)加速50%到200%,同样的算力在单位时间内吐出更多Token。
单位时间产出的Token越多、能响应的请求越多,每个Token摊到的成本就越低。
03
一把尺子下,客户跑出来了数字
AI Coding成为大模型最大应用场景后,行业急需基准测试指引产业发展。
2026华为全联接大会上,信通院发布《大模型推理优化 AI Coding 场景基准测试》,华为OceanStor A800/A600首批通过认证。
该基准针对代码补全、长上下文、多轮 Agentic三大AI Coding推理优化场景制定评测标准,从开发体验、系统吞吐双维度评估。其中代码补全以TTFT、TPOP衡量时延;长上下文评估超大输入下吞吐与时延;多轮Agentic结合HumanEval/RepoBench/ SWE-bench数据集,采用TTFT、TPOT评估系统性能与输出质量。
与此同时,这套方案也在客户现网跑出了结果。
一家头部金融机构,它建了一套支撑全行关键业务代码开发的AI Coding助手,痛点和陈工一模一样,从代码补全走向规范驱动开发之后,轮次超过上百、周期一天到一周、上下文 128K,超过90%是重复计算,助手效率低,任务排队积压。
接入OceanStor A800存储和UCM之后,AI编程任务KV命中率从35%提升到92%。首Token时延从55.94秒降到4.24秒,降幅92%;每秒Token数从19493涨到41227,提升2.1倍。
另一个案例来自运营商。2026年9月,天津移动宣布与华为合作的AI推理加速方案实现全国运营商首个现网规模商用:OceanStor A800加昇腾910C集群,基于UCM技术实现KV Cache的高效复用。现网数据显示,在GLM-5.1、Kimi-K2.6、DeepSeek V4、Qwen等主流模型的64K、128K长序列场景下,单卡吞吐提升1.1至3倍,首Token时延降低30%至40%,Token推理成本降低30%,已用于对外Token服务。
这套方案还在医疗、制造、政务等多个行业落地,AI Coding是目前最典型的场景,也是客户最密集的切入点,不过场景也从AI Coding不断延伸。医疗机构科研过程的学术论文、证券公司研报分析、政府卷宗分析,都是同一类长上下文场景。
过去几年,AI基础设施围绕训练展开,存储一直是后台的配角。但当智能体开始干活,命中率、响应速度,开始影响财务考核的Token账单,尤其在长序列场景里,几百TB的"阅读笔记",命中率是三成还是九成,背后是50倍的Token价差。AI Coding最先把这件事摆上了台面,留住记忆,就是省下算力。"以存代算"不再只是一个技术选项,而是每一家用AI写代码的企业都绕不开的一道必答题。



