Oui — mais pas n’importe laquelle. Une étude sur 23 440 épisodes d’exécution montre que la mémoire longue fait passer le succès des agents IA de 0 à 0,55-1,00 sur les tâches qui en dépendent. À une condition : bien la choisir. Le rappel par embeddings s’effondre sur les faits mis à jour, tandis que les magasins à écriture — dont le résumé par LLM — restent fiables.
La mémoire n’est pas la mémorisation
Les benchmarks actuels (LoCoMo, LongMemEval) mesurent la capacité à répondre à des questions sur l’historique d’une conversation. Ils ne mesurent jamais si un fait mémorisé change réellement ce que l’agent fait.
C’est précisément ce fossé que l’équipe de Shweta et Shashank Mishra a voulu combler. Leur constat : retenir n’est pas agir, et un agent qui « se souvient » sans en tirer conséquence est un agent qui ne se souvient de rien d’utile.
MERIT : mesurer ce que la mémoire change vraiment
Le papier introduit MERIT (Memory Evaluation for Realistic Instrumented Tasks), un benchmark qui mesure l’utilité marginale de la mémoire sous comptabilité explicite des coûts. Il inclut des tâches d’outils épisodiques sur trois domaines, dont la dépendance aux faits passés est vérifiée par un contrôle automatique de fuite.
L’évaluation ajoute une échelle de difficulté culminant sur le rappel de faits mis à jour, une corruption de mémoire contrôlée, et un métré complet — en tokens comme en dollars — de chaque opération de mémoire.
Le verdict : de 0,00 à 0,55-1,00
Sur 23 440 épisodes notés (42,57 $ de coût total), la mémoire élève le succès des tâches dépendantes depuis un plancher vérifié de 0,00 jusqu’à 0,55-1,00. Sans mémoire, ces tâches échouent systématiquement ; avec elle, elles réussissent la plupart du temps.
L’expérience repose sur un pilote à deux générations (gpt-4.1-mini) puis une grille pré-enregistrée de 3 modèles × 3 graines (GPT-4.1, Claude Haiku 4.5). Le résultat se confirme sur un contrôle de dernière génération (Claude Sonnet 5).
Les faits mis à jour : le talon d’Achille du retrieval
Quand un fait change, le rappel par embeddings s’effondre de façon imprévisible : entre 0,30 et 0,95 selon les modèles, avec un écart maximal de 0,45 entre graines. Pire, même quand la bonne valeur est retrouvée, l’agent n’agit correctement dessus que 55 % du temps.
À l’inverse, les magasins « update-on-write » — un magasin de faits structuré et, plus notable encore, le résumé par LLM — se maintiennent entre 0,70 et 1,00. Leur robustesse vient d’un principe simple : ils réécrivent la connaissance à la source plutôt que de la reconstruire par similarité.
Le résumé par LLM, champion inattendu
Le résultat le plus frappant est que le résumé par LLM rivalise avec le magasin de faits structuré. Là où le retrieval vectoriel suppose que « proche veut dire vrai », le résumé reformule explicitement l’état du monde.
C’est une leçon profonde : une mémoire qui digère et réécrit vaut mieux qu’une mémoire qui stocke et ressort. Le coût cognitif de la synthèse se paie par une fidélité durable.
Le coût : le replay complet n’est jamais rentable
Rejouer intégralement l’historique à chaque tâche n’est jamais économique. Changer l’implémentation mémoire déplace le succès d’une tâche jusqu’à 60 points — mais la meilleure condition de chaque domaine livre 2,7 à 3,9 fois son utilité marginale par dollar dépensé.
Autrement dit : le plein replay est un luxe qui ne paie pas. La mémoire utile est sélective, structurée et réécrite, pas exhaustive.
FAQ
La mémoire longue est-elle toujours bénéfique pour un agent IA ?
Non. Elle est décisive sur les tâches dont le succès dépend de faits passés (elle fait passer le succès de 0 à 0,55-1,00), mais son coût n’est rentable que si l’implémentation est bien choisie.
Pourquoi le rappel par embeddings échoue-t-il sur les faits mis à jour ?
Parce que la similarité vectorielle ne sait pas qu’un fait a changé : elle retrouve l’ancienne valeur, et l’agent n’agit correctement sur la bonne valeur que 55 % du temps.
Quelle est la meilleure approche de mémoire selon MERIT ?
Les magasins « update-on-write », dont le résumé par LLM, qui se maintiennent à 0,70-1,00 de fiabilité — supérieurs à l’hybride et au retrieval pur.
Le replay complet de l’historique est-il rentable ?
Non. Il n’est jamais économique ; la meilleure condition livre 2,7 à 3,9 fois son utilité marginale par dollar.
Où trouver l’étude et les données ?
Le benchmark, le harnais et toutes les traces sont publiés : arXiv 2609.05441 (Mishra & Mishra, 2026).