AI 快讯 编译自 marktechpost #模型发布#工具评测#AI 记忆

Google Cloud 发布 Always-On Memory Agent,用持续 LLM 整合替代 RAG 和 Embedding

Google Cloud 开源 Always-On Memory Agent,基于 Gemini 3.1 Flash-Lite 和 ADK,无需向量数据库和 embedding,通过持续运行的 LLM 将记忆写入 SQLite。本文解析其 Ingest-Consolidate-Query 架构,并讨论对中文开发者的意义。

编译发布 2026/07/18 原文发布 2026/07/18

一句话看懂

Google Cloud 开源 Always-On Memory Agent,用持续运行的 LLM 替代传统 RAG 和 embedding,将记忆写入 SQLite,实现低成本、低延迟的持久记忆。

详细发生了什么

Google Cloud 在 generative-ai 仓库中发布了一个参考实现——Always-On Memory Agent。它不是一个一次性的问答工具,而是一个 24/7 持续运行的后台进程,专为解决 AI agent 的「遗忘」问题设计。

该 agent 基于 Google ADK(Agent Development Kit)和 Gemini 3.1 Flash-Lite 构建。最大的特点是:完全不用向量数据库和 embedding。取而代之的是,一个 LLM 负责读取、思考并将结构化记忆写入 SQLite。模型选择 Gemini 3.1 Flash-Lite 是为了在持续后台工作中实现低延迟和低成本。

架构上,一个 orchestrator 将请求路由到三个子 agent:

  • IngestAgent:处理输入内容,利用 Gemini 的多模态能力提取摘要、实体、主题和重要性分数,存入 memories 表。
  • ConsolidateAgent:每 30 分钟(默认)定时运行,像睡眠周期一样,审查未整合的记忆并发现关联,然后写入综合摘要、关键洞察和连接关系。
  • QueryAgent:回答问题时,读取所有记忆和整合洞察,合成回复,并引用来源记忆 ID。

中文圈视角

这个项目对中文开发者有几点直接价值:

  1. 降低门槛:传统 RAG 需要搭建向量数据库(如 Pinecone、Weaviate)和 embedding 模型,而 Always-On Memory Agent 只用 SQLite,国内开发者可以轻松在本地或云服务器上部署,无需额外基础设施。

  2. 国产替代参考:目前国内类似方案如 Dify、FastGPT 等主要依赖向量检索。Google 这个思路提示了一种新方向——用 LLM 自身做记忆管理,可能更适合小规模、低成本的个人或团队项目。

  3. 合规友好:数据全部存在本地 SQLite,不涉及数据出境问题,对于有数据安全要求的国内用户来说是一个优势。

  4. 场景适用:适合个人知识管理、会议纪要整理、持续学习型 agent 等场景。但需要注意,Gemini 3.1 Flash-Lite 在国内可能无法直接访问,开发者需要自行适配国产 LLM(如 DeepSeek、Qwen)来实现类似逻辑。

几条值得记住的细节

  • 完全不用向量数据库和 embedding,改用 LLM 直接读写 SQLite。
  • ConsolidateAgent 默认每 30 分钟运行一次,自动发现记忆之间的关联。
  • QueryAgent 回答时会引用具体记忆 ID,保证可溯源。
  • 基于 Google ADK 和 Gemini 3.1 Flash-Lite,专为低延迟低成本设计。
  • 项目已开源在 Google Cloud 的 generative-ai 仓库,可直接下载使用。

一句话总结

如果你需要一个轻量、低成本、可本地运行的持久记忆方案,Always-On Memory Agent 提供了一个无需向量数据库的新思路。