Un agent IA qui oublie tout d’une conversation à l’autre reste limité. hindsight, un projet de vectorize-io sous licence MIT, propose une mémoire pensée pour que l’agent apprenne avec le temps, pas seulement pour qu’il retrouve un historique. Cet article explique comment elle est organisée, comment la lancer et ce que la documentation en dit.
En bref
- Mémoire d’agent qui vise l’apprentissage, pas seulement le rappel
- Trois opérations : retain, recall et reflect
- Serveur via Docker, pip ou Helm ; clients Python, Node.js, Go et CLI
- Plus de 25 fournisseurs de LLM, dont des options locales
- Licence MIT, avec une offre hébergée facturée à l’usage
Un système de mémoire pour agents IA
Un agent est un programme qui s’appuie sur un modèle de langage (LLM) pour accomplir des tâches. Sans mémoire, il repart de zéro à chaque échange. hindsight ajoute cette mémoire à long terme, avec une idée directrice : faire des agents qui apprennent, pas seulement qui se souviennent.
Le README explique que la plupart des systèmes de mémoire d’agent se concentrent sur le rappel de l’historique des conversations. Il présente hindsight comme une alternative au RAG (une recherche de passages à injecter dans le modèle) et aux graphes de connaissances.
Comment la mémoire est organisée
Les souvenirs sont rangés dans des banks, des espaces de mémoire distincts, par exemple un par utilisateur. Le README parle de structures de données « biomimétiques », inspirées du fonctionnement de la mémoire humaine.
À l’entrée, chaque information est dirigée vers la voie des faits sur le monde ou celle des expériences, puis représentée sous forme d’entités, de relations et de séries temporelles, avec des vecteurs denses et épars pour faciliter la recherche.
- Faits sur le monde : par exemple « le poêle est chaud »
- Expériences : ce que l’agent a lui-même vécu
- Observations : croyances consolidées à partir de nombreux souvenirs, appuyées sur des preuves
- Modèles mentaux : compréhension de l’environnement de l’agent, synthétisée à partir des observations et des faits
Trois opérations : retain, recall, reflect
retain sert à stocker une information. Selon le README, un LLM en extrait les faits clés, les données temporelles, les entités et les relations. recall cherche dans les souvenirs, et reflect génère une réponse qui tient compte de la « disposition » de l’agent.
Le README indique aussi un benchmark, LongMemEval, sur lequel hindsight affiche des résultats de pointe. Selon lui, ses scores ont été reproduits de façon indépendante par des chercheurs de Virginia Tech et du Washington Post, tandis que les autres scores sont déclarés par les éditeurs eux-mêmes.
Lancer un serveur
La voie recommandée est Docker. La commande ci-dessous démarre l’API sur le port 8888 et l’interface web sur le port 9999, et conserve les données dans un volume. Il faut fournir une clé d’API pour le fournisseur de LLM choisi, ici OpenAI.
D’autres options existent : Docker avec PostgreSQL externe, installation par pip, chart Helm pour Kubernetes, ou hindsight Cloud, l’offre hébergée.
export OPENAI_API_KEY=sk-xxx
docker run -it --pull always --name hindsight --restart unless-stopped -p 8888:8888 -p 9999:9999 \
-e HINDSIGHT_API_LLM_API_KEY=$OPENAI_API_KEY \
-v hindsight-data:/home/hindsight/.pg0 \
ghcr.io/vectorize-io/hindsight:latest
Se connecter depuis du code
Des clients existent pour Python, Node.js et TypeScript, Go, ainsi qu’une ligne de commande. En Python, l’installation se fait avec pip, puis les trois opérations s’appellent directement sur le client.
Le fournisseur de LLM se règle avec la variable HINDSIGHT_API_LLM_PROVIDER. Le README en compte plus de 25 : hébergés, locaux comme ollama, lmstudio et llamacpp, ou tout point d’accès compatible OpenAI.
pip install hindsight-client -U
from hindsight_client import Hindsight
client = Hindsight(base_url="http://localhost:8888")
client.retain(bank_id="my-bank", content="Alice works at Google as a software engineer")
client.recall(bank_id="my-bank", query="What does Alice do?")
client.reflect(bank_id="my-bank", query="Tell me about Alice")
Intégrations et usages
Pour un agent existant, le README propose un LLM Wrapper : on remplace son client LLM par une version enveloppée, et les souvenirs sont rappelés avant l’appel puis enregistrés après, sans autre changement. Un serveur MCP (un protocole qui expose des outils aux agents) est aussi fourni, un par bank et activé par défaut.
Le README annonce plus de 60 intégrations : agents de code comme Claude Code, Codex ou Cursor, frameworks comme LangGraph, LlamaIndex ou CrewAI, outils no-code comme n8n et Zapier. Un paquet dédié aux agents de code construit une mémoire par dépôt à partir de l’historique git et des sessions passées.
- Ajouter de la mémoire à un agent existant
- Donner une mémoire de projet à un agent de code
- Exposer la mémoire à tout client MCP
- Brancher la mémoire dans un outil no-code
Ce qu’il faut savoir avant de se lancer
hindsight est sous licence MIT et écrit en Python. Il a besoin d’un fournisseur de LLM : une clé d’API, ou un abonnement existant pour certains cas que le README détaille. Le tableau des plateformes couvre Linux, macOS et Windows ; sur Mac Intel, l’installation par pip passe par hindsight-all-slim.
hindsight Cloud est facturé à l’usage, avec des crédits gratuits au départ et sans abonnement fixe ni tarif par utilisateur. Le README ne chiffre pas les tarifs dans le passage fourni, et ne détaille pas les limites au-delà de ce qui précède.
Questions fréquentes
Quelle différence avec une simple recherche dans l’historique ?
Le README affirme que hindsight cherche à faire apprendre les agents, pas seulement à rappeler les conversations. Il organise les souvenirs en faits, expériences, observations et modèles mentaux.
Faut-il un serveur pour l’essayer ?
Pas forcément. Le paquet hindsight-all permet un mode embarqué en Python, sans serveur séparé, et l’offre hébergée hindsight Cloud évite tout déploiement.
Peut-on l’utiliser avec un modèle local ?
Oui, le README cite ollama, lmstudio et llamacpp parmi les fournisseurs pris en charge, en plus des services hébergés.
Quelle est la licence ?
Le dépôt est sous licence MIT, d’après les métadonnées et le README.
À retenir
hindsight est une mémoire open source pour agents IA, organisée en banks et pilotée par trois opérations : retain, recall et reflect. Elle se déploie avec Docker, pip ou Helm, ou s’utilise via une offre hébergée facturée à l’usage.

