AI 越聊上下文越肥,graph-memory 让 DeepSeek Harness 边记边瘦身
和 AI 干长活的人都懂:会话拖到十几二十轮,上下文越滚越大,token 账单跟着水涨船高,模型对开头聊过的事反而犯迷糊。graph-memory 是开发者 adoresever 出品的开源记忆插件(MIT 协议),为 DeepSeek Harness(DSH)做的原生记忆层:它不删 DSH 自己的事件日志,而是接管「模型看得见的历史」——最新几轮对话原样保留,更早的推理和工具轨迹折叠成一个归档标记;等哪天要用到旧话题,再从知识图谱里把当年的原话问答捞回来。作者给出一份真实的 20 轮 GLM-5.2 工程实测:第 20 轮的首请求上下文从 56,998 个 token 压到 11,008 个,降幅八成(作者注明非严格对照 A/B,基准脚本随仓库可复跑)。项目在 SkillHub 插件广场(DeepSeek Harness Plugin 广场)记忆分类拿星 600 多,2026 年 4 月受邀在清华大学讨论会上发布;当前 1.6.0-beta.16 版通过 138/138 项自动化测试。
它能做什么
- 上下文接管:可配置保留最新 N 轮完整对话(默认 5 轮),更早的历史压成一个归档标记,不再随每个请求反复计费。
- 图谱只做导航:每轮收尾只取「用户问题 + 最终答案」生成轮次摘要,再从同一句话派生 SPO 三元组(TASK/SKILL/EVENT 节点);节点只负责定位,召回时带回来的始终是原始问答——证据不经过转述。
- 跨会话跨项目召回:记忆落本地 SQLite,新会话、新项目里问到旧话题会自动召回,不用手动调用。
- 检索双保险:向量 Top-K 检索优先,没配嵌入模型时自动回落 FTS5 全文检索,不挡对话。
- 失败隔离:结构化提取失败就进隔离区,前台对话照常进行,坏数据不会被「修复」后写进库。
- 成本可控:每收尾一轮只多一次辅助 LLM 调用,图谱计算全在本地。
怎么获取
源码在 GitHub 搜 adoresever/graph-memory。要求 Node.js 22.13 以上,不用 fork DSH 本体。因为 npm 上还挂着旧版 1.5.8,官方建议先装 GitHub 固定版:npx @deepseek-ai/dsh plugin --profile web add github:adoresever/graph-memory#v1.6.0-beta.16,装完重启 dsh web,在 Settings → Plugins 确认已激活。数据库默认在 ~/.dsh/graph-memory/ 下,纯本地。想加强召回可配 OpenAI 兼容的嵌入端点(环境变量四件套),不配也能跑 FTS5。OpenClaw 用户另有适配器,openclaw plugins install graph-memory 两步开启。
上手怎么用
- 直接聊:自动召回不需要命令,问到旧话题时相关问答自己回来。
- gm_search:显式搜图谱记忆,查「之前的会话里定过什么」。
- gm_record:手工确定性地存一条 TASK/SKILL/EVENT,重要决策不靠模型自觉。
- gm_status / gm_stats / gm_retry_extraction:查存储与图谱账单,把隔离区的失败提取重跑一遍。
适合谁用
拿 DSH 干长活的开发者;上下文一长就心疼 token 的团队;想让经验跨会话、跨项目复用的 AI 重度用户;以及所有「上礼拜明明跟它讲过」患者。贵州诚鑫致达科技在帮客户搭 AI 工作流时,长会话的 token 成本同样是笔要算的账,这类记忆与上下文管理方案我们也在持续验证。
企业存储选型参考|贵州诚鑫致达
群晖在售企业级机型速览:FS6400(全闪存阵列,数据库与虚拟化场景)。需要选型建议或上门评估,搜「诚鑫致达」即可找到我们。