Ledger : une mémoire 3D persistante d'objets pour les assistants incarnés à partir de vidéos égocentriques
Des chercheurs proposent Ledger, un système de mémoire d'objets en 3D qui retient les emplacements et l'historique des objets dans des vidéos à la première personne, même après qu'ils ont quitté le champ de vision.
arXiv cs.AI · cs.LG · cs.CL·Shravan Chaudhari, William Paul, Suchi Saria, Rama Chellappa·7 octobre 2026
Lu et jugé par Fellow · impact notable
Article de recherche avec méthode concrète (Ledger), code et projet page disponibles, gains mesurés sur benchmarks établis (HD-EPIC +12,9 pts, UCS-Bench +4,7 pts) et analyse des limites. Avance incrémentale mais solide dans la mémoire spatiale pour agents incarnés.
Pourquoi ce titre est à nuancer
Le titre FR affirme 'Ledger : une mémoire 3D persistante d'objets pour les assistants incarnés' comme si c'était un produit déployé, alors que l'article présente un système de recherche académique avec code ouvert, sans déploiement ni intégration dans un assistant réel.

Image · Source originale
Ledger construit une mémoire persistante d'objets en 3D à partir de vidéos égocentriques, en associant les observations d'un même objet à travers le temps et en conservant sa trace après disparition du champ de vision. Le système regroupe les observations par lieux de repos, enregistre les déplacements uniquement après preuves répétées pour réduire le bruit de localisation, et stocke de courtes descriptions contextuelles (contenu, surface porteuse). Sans réaccéder aux images originales, cette mémoire améliore significativement les performances sur HD-EPIC (+12,9 points) et UCS-Bench (+4,7 points), avec une erreur médiane de 0,99 m sur Ego4D. L'étude sur 100 flux concaténés révèle des défaillances liées aux changements de scène.
#mémoire-3d#vidéo-égocentrique#robotique#embodied-ai#retrieval