我自己上周就遇过。买了一箱樱桃,发错地址,找客服,一开始说好了帮我转拦截,我换个手机登录查进度,它又从头问了一遍订单号,问我哪里出问题。那十分钟我对着屏幕,手指都攥出汗了。
被投诉喂大的需求
现在所有人都在喊AI Agent,都在说下一代AI是智能体,不是聊天机器人。但多数人都没意识到,没有靠谱的长期记忆机制,所有AI智能体都是一次性的玩具。
你要一个AI帮你管全年的行程,它记不住你对青霉素过敏,记不住你不跟摩羯座同事出差,有什么用?你要一个AI家庭教师帮孩子补功课,它半个月就忘了孩子哪类题型总错,有什么用?
2025年下半年,我跑过三个国内AI创业团队,有两个做AI陪伴的,都倒在了留存关。产品刚推出去,新鲜劲过了,一周后用户打开,AI张口就问“你好呀,我们可以认识一下吗?”,用户直接删app,头都不回。

很多人说,不就是存数据吗?现在硬盘这么便宜,把所有对话都存在云端不就行了?
说实话,哪有这么简单。你存的了数据,你检索的动吗?用户说“我上个月说过我不能吃芒果,你还记得吗”,你要在上百万条对话里搜,搜出来要多久?成本多高?
之前OpenAI推可永久记忆的ChatGPT订阅,一个月收20刀,上线半个月,被骂上了热搜,不是功能不好,是太贵了啊。大多数用户愿意为AI一个月付十块钱人民币顶天了,你按全量存储的成本,根本兜不住。
藏在分层背后的成本账
国内玩家现在走出了自己的路,我最近跟字节跳动豆包企业版的技术负责人聊过,他们给电商商家做的AI导购智能体,用的是三级分层长期记忆机制,这个路线现在已经成了国内多数厂商的默认选择。
哪三层?第一层是临时会话记忆,就管当前这一轮对话,聊完就清,占空间最小,速度最快。第二层是用户特征记忆,就是反复出现的核心信息,比如“芒果过敏”“只买100块以下的T恤”“只发京东快递”,存在高性价比的对象存储里,每次对话自动拉取。第三层是全量历史归档,所有对话都存,但放在冷存储里,不到用户主动找,绝不调用。

这套逻辑本质是什么?是复刻了哺乳动物大脑几千万年进化出来的记忆机制:短期信息放海马体,用完就丢,只有反复被调用的核心信息,才会慢慢转存到大脑皮层变成永久记忆。能进化出这套规则,核心就是为了省能量,省资源,放到AI这里,就是省成本。
给你算两个实打实的账。第一个:存一个普通用户一年的完整对话记忆,采用全量云端存储+全量检索方案,年成本大概是18美元,比给这个用户买一年的Netflix超级会员还贵2.3倍。换成分层方案,成本直接降到不到2美元,大部分订阅费都兜得住。第二个:全量检索的响应速度,比分层检索慢11倍,而记忆召回的准确率只提升了2.7%。你说,换你是企业,你选哪个?
不过话说回来,路线定了,利益博弈才刚刚开始。国内现在做AI智能体的厂商,分成两派,一派是互联网大厂,像字节、百度,都推分层记忆,把成本打下来,走量赚订阅费。另一派是一些创业公司,主打“全量永久记忆永不删除”,收高额年费,割一波对隐私不敏感,对价格不敏感的高端用户。现在市场用脚投票,截止2026年第一季度,字节豆包企业版的AI智能体新增客户数,占了国内To B市场的34%,那些喊全量记忆的创业公司,加起来份额还不到10%,卷不动了。
很多人没看明白,这个方向我认为走偏了。全量记忆不是用户的真实需求,是创业者炒出来的概念,用来骗融资的。用户要的是“我需要的时候你能想起来”,不是“所有东西你都要记着”。
真正被改变的落地逻辑

对普通从业者来说,这个变化比你想的要大得多。
之前做To C AI产品,所有人都在比大模型参数,比上下文窗口大小,拼参数卷得头破血流,现在呢?大家都在拼记忆能力。我知道深圳有个做AI健身陪练的创业团队,去年改了记忆机制,把用户的旧伤、训练习惯、饮食偏好都做成永久核心记忆,上线三个月,30天留存直接从11%涨到27%,现在已经拿到了A轮。
做内容的从业者更有感觉。我身边一个做财经写作的朋友,用带长期记忆的AI助理快半年了,AI记住了他所有的写作习惯,记住了他过去三年写过的所有选题,甚至记住了他不喜欢用生硬的套话,写出来的初稿改一改就能用,效率至少翻了一倍。放在之前,每次写稿都要重新贴一遍自己的旧文章让AI学习,烦都烦死了。
对产业链来说,这个趋势也在重构利益分配。之前做AI基础设施,大家都抢着做大模型,现在做存储分层、做记忆检索的创业公司,拿到的融资越来越多,因为所有人都知道,大模型现在各家差异越来越小,拼到最后,就是拼记忆能不能做的又便宜又好用。
当然,隐患也不是没有。现在很多厂商都把用户的长期记忆当成自己的私产,你换个平台,你的记忆带不走,等于把你绑定死了。已经有用户在吐槽,说用了一年的AI陪伴,换了个app,等于重新交了个朋友,太折腾了。
当AI能完完整整记住你十年来说过的每一句话,你的所有偏好,所有秘密都存在它的记忆库里,你会觉得终于有了最懂你的伙伴,还是会觉得后颈一凉?