Google Cloud lance un agent mémoire toujours actif qui remplace le RAG par une consolidation continue via LLM

Google Cloud a publié en open source un agent IA léger qui repense la façon dont les systèmes d’IA gèrent la mémoire à long terme, en remplaçant le pipeline standard de génération augmentée par récupération (RAG) par un processus fonctionnant en continu qui lit, consolide et interroge des mémoires structurées stockées entièrement dans SQLite.

L’agent mémoire toujours actif, construit avec l’Agent Development Kit de Google et fonctionnant sur Gemini 3.1 Flash-Lite, opère 24h/24 et 7j/7 en tant que processus d’arrière-plan. Il n’utilise ni base vectorielle ni plongements (embeddings). Au lieu de cela, un LLM lit le contenu entrant, extrait des informations structurées et consolide périodiquement les mémoires connexes, une conception que ses créateurs comparent à la façon dont le cerveau humain traite les informations pendant le sommeil.

« La plupart des agents IA oublient. Ils traitent une requête, y répondent, puis abandonnent le contexte », indique la documentation du projet.

Le système utilise trois sous-agents spécialisés travaillant sous un seul orchestrateur. Un IngestAgent extrait des résumés, des entités, des sujets et des scores d’importance du contenu entrant, prenant en charge 27 types de fichiers, y compris le texte, les images, l’audio, la vidéo et les PDF. Un ConsolidateAgent s’exécute sur une minuterie, par défaut toutes les 30 minutes, et examine les mémoires non consolidées, trouve des liens entre elles et rédige des résumés synthétisés et des informations clés. Un QueryAgent répond aux questions en lisant toutes les mémoires stockées et les informations de consolidation, en citant les identifiants de mémoire spécifiques qu’il utilise.

Cette approche constitue une rupture fondamentale avec le modèle RAG dominant. Dans un système RAG traditionnel, les documents sont intégrés dans un stockage vectoriel au moment de l’ingestion et récupérés passivement au moment de la requête. Il n’y a aucun traitement actif entre l’ingestion et la récupération. L’agent mémoire toujours actif, au contraire, traite la mémoire activement pendant l’intervalle entre l’ingestion et la requête, reliant les informations connexes et générant des références croisées qu’une recherche de similarité vectorielle manquerait.

L’agent est disponible sur GitHub dans le dépôt d’IA générative de Google Cloud. Il surveille un répertoire de boîte de réception configurable, consolide automatiquement et fournit une API HTTP sur le port 8888 pour les opérations d’ingestion et d’interrogation. Un tableau de bord Streamlit offre une interface visuelle pour parcourir et gérer les mémoires.

Les cas d’utilisation vont des assistants de recherche qui ingèrent des PDF, des fichiers audio de réunions et des captures d’écran sur une semaine, et peuvent ensuite relier de manière autonome un objectif de coût à un problème de fiabilité, aux agents de support qui stockent les tickets passés sous forme de mémoires structurées et répondent aux nouvelles questions avec des références citées.

Pour les développeurs et les entreprises qui construisent des systèmes d’IA ayant besoin de maintenir un contexte entre les sessions sans les frais d’infrastructure d’une base vectorielle, l’agent offre une alternative plus simple : une base de données SQLite, un processus d’arrière-plan et une invite qui demande au LLM de réfléchir avant de stocker.

Sources : “Google Cloud’s Always-On Memory Agent Replaces RAG and Embeddings With Continuous LLM Consolidation on Gemini 3.1 Flash-Lite” (MarkTechPost, 18 juillet 2026); Dépôt GitHub Google Cloud

Traduit par Lydie

Scroll to Top