腾讯开源Agent Memory,Token消耗降61%,虾皮商家一键部署

2026年05月14日

腾讯刚把Agent Memory开源了,不是小打小闹的补丁更新,而是直接甩出一套能大幅压低Token开销的内存管理方案。业内不少人盯着看毕竟现在大模型应用卡在哪儿?不是模型不够强,是推理成本太高,尤其在长上下文、多轮对话、状态持续维护这类场景里,光是记忆存储和检索就能吃掉一半以上的Token预算。这次开源一落地,实测平均Token消耗降了61%,不是实验室数据,是真实业务链路跑出来的结果。

为什么Agent Memory能“省”得这么狠?

传统Agent架构里,每次调用大模型前,都得把历史对话、用户偏好、任务进度一股脑拼进Prompt。越往后走,上下文越长,Token账单就越吓人。Agent Memory换了一种思路:不靠堆文本,而是建轻量级结构化记忆索引。它把对话中的关键事实、用户意图、待办节点、实体关系自动抽出来,存成可检索的向量+符号混合表征。调用时只传摘要特征,模型再根据这些线索动态还原上下文逻辑,相当于给大模型配了个“记忆外挂”,而不是让它硬背整本《新华字典》。

开源不是交个代码就完事,配套工具链很实在

腾讯同步放出了三类核心组件,全部开箱即用:

1. Memory Core:核心记忆引擎,支持时间衰减、意图优先级、跨会话关联等策略配置;

2. Adapter Bridge:已适配主流LLM框架(Llama.cpp、vLLM、Ollama),无需改模型权重或推理服务;

3. Shrimp一键部署脚本:基于Docker+Shell封装,三行命令拉起本地服务,连Redis缓存、向量库(Chroma)都自动配好,连端口冲突检测都做了。

不少团队反馈,原来跑一个带记忆的客服Agent,单次请求要3200 Token,接入Agent Memory后压到1250左右,降幅确实接近六成。关键是响应延迟没涨因为检索快,模型负担轻,整体吞吐反而上去了。

这不是孤立的技术动作,背后有清晰的演进节奏

今年Q2起,腾讯混元团队就在内部多个ToB项目中灰度验证这套机制,包括金融投顾助手、政务问答系统、工业设备巡检Agent。实际跑下来,除了Token省得多,还意外改善了两个隐性问题:一是长周期任务中记忆漂移减少,比如用户上午说“帮我查A型号参数”,下午追问“对比B型号”,系统不再混淆上下文;二是多角色协同场景下,不同Agent之间的状态同步更准,避免了传统方案里靠全局日志回溯带来的冗余计算。

想用起来,其实没那么复杂

如果你已有Agent服务,升级路径非常平滑:

1. 克隆GitHub仓库(github.com/Tencent/agent-memory),确认Python 3.9+和PyTorch 2.1+环境;

2. 运行shrimp.sh脚本,自动拉取镜像并启动本地Memory服务,默认监听localhost:8001;

3. 在现有Agent逻辑中,将原Prompt拼接模块替换为调用/memory/query接口,传入当前用户ID和任务ID即可获取结构化记忆片段;

4. 首次运行建议启动debug模式,查看memory.log里每条记忆的提取质量与检索命中率,针对性调整抽取规则。

目前项目文档里已列出常见踩坑点,比如中文命名实体识别对缩写词(如“深证成指”)的泛化不足,平台推荐加一条正则预处理规则;还有部分企业私有模型因输出格式不统一,导致记忆解析失败,建议先用schema-validator校验输出JSON结构。

以上是Agent Memory开源后的核心事实和落地要点,希望对你有所帮助。

免责申明:本站部分作品是由网友自主投稿和发布、编辑整理上传,对此类作品本站仅提供交流,不为其版权负责。如果您发现网站上有侵犯您的版权,请与我们取得联系,我们会及时修改或删除。

叙述跨境独立站搭建
嗨,想咨询什么业务?
深色
顶部