En une phraseIn one sentence
Un modèle du monde n'a pas besoin d'être juste : il a besoin d'être corrigé — et la correction est déjà là, gratuitement, dans la conséquence de chaque action qu'il vient de faire exécuter. A world model does not need to be right: it needs to be corrected — and the correction is already there, for free, in the consequence of every action it has just had executed.
- TypeType
- Papier empirique — méthode nouvelle, expériences en simulation. Pas de résultat théorique ; le mécanisme (test-time training) est connu, sa transposition dans la boucle MPC d'un JEPA ne l'était pasEmpirical paper — new method, simulation experiments. No theoretical result; the mechanism (test-time training) is known, its transposition inside a JEPA's MPC loop was not
- Idée centraleCore idea
- Réutiliser la loss de pré-entraînement telle quelle comme signal d'adaptation en ligne : la transition observée après chaque action est sa propre cibleReuse the pretraining loss as-is as an online adaptation signal: the transition observed after each action is its own target
- CoûtCost
- Un seul pas de gradient par replanification, buffer de 5 transitions, dernières couches seulement — ≈ 0,03 s de latence supplémentaire par replanOne gradient step per replan, a 5-transition buffer, last layers only — ≈ 0.03 s of extra latency per replan
- Résultat centralCentral result
- Sous décalage de distribution, le succès de planification passe par exemple de 53,3 % à 78,7 % sur labyrinthes inédits ; en distribution, l'adaptation ne dégrade pasUnder distribution shift, planning success rises e.g. from 53.3% to 78.7% on unseen mazes; in-distribution, adaptation does no harm
- PortéeReach
- Agnostique au modèle du monde sous-jacent ; validé en simulation sur des tâches d'atteinte de but à horizon courtAgnostic to the underlying world model; validated in simulation on short-horizon goal-reaching tasks
Le problème : planifier avec une carte qu'on refuse de corrigerThe problem: planning with a map you refuse to correct
Un modèle du monde latent apprend à prédire l'avenir non pas en pixels mais dans un espace de représentation compact. Les architectures JEPA (Joint-Embedding Predictive Architectures) en sont la forme dominante : un encodeur transforme l'observation en vecteur, un prédicteur avance dans cet espace, et l'entraînement se fait sur des trajectoires hors-ligne sans récompense, en minimisant l'erreur de prédiction latente — jamais une erreur de reconstruction d'image. A latent world model learns to predict the future not in pixels but in a compact representation space. JEPAs (Joint-Embedding Predictive Architectures) are the dominant form: an encoder turns the observation into a vector, a predictor moves forward in that space, and training runs on reward-free offline trajectories by minimising latent prediction error — never an image reconstruction error.
Une fois entraîné, ce modèle sert à planifier, presque toujours par MPC (model predictive control) : on déroule le modèle en imagination sur un court horizon, on optimise une séquence d'actions qui rapproche du but, on exécute la première, on observe, on recommence. C'est la recette standard du contrôle conditionné par un but. Once trained, the model is used for planning, almost always via MPC (model predictive control): roll the model forward in imagination over a short horizon, optimise an action sequence that approaches the goal, execute the first one, observe, repeat. This is the standard recipe for goal-conditioned control.
Et pendant tout ce temps, le modèle reste gelé. C'est là que le papier plante son coin. Si le modèle se trompe, le MPC ne se trompe pas : il optimise consciencieusement la mauvaise fonction objectif. Les actions paraissent excellentes dans l'imagination latente et échouent dans le monde réel. Pire, une petite erreur à un pas se compose le long de l'horizon de planification. Et le décalage de distribution amplifie tout : un changement visuel (bruit, éclairage, distracteur d'arrière-plan) désaligne l'encodeur ; un changement physique (frottement, masse, dynamique de contact) désaligne le prédicteur. And throughout, the model stays frozen. This is where the paper drives its wedge. If the model is wrong, MPC is not wrong: it faithfully optimises the wrong objective. Actions look excellent in latent imagination and fail in the real world. Worse, a small one-step error compounds along the planning horizon. And distribution shift amplifies everything: a visual change (noise, lighting, background distractor) misaligns the encoder; a physical change (friction, mass, contact dynamics) misaligns the predictor.
Les auteurs adossent l'intuition à la biologie : l'adaptation sensorimotrice humaine repose sur des mécanismes cérébelleux qui réajustent le comportement quand les entrées ou la dynamique changent, et nous mettons continuellement à jour nos modèles internes à partir de l'expérience nouvelle. C'est une analogie de motivation, pas un argument — le papier ne prétend pas modéliser le cervelet. The authors ground the intuition in biology: human sensorimotor adaptation relies on cerebellar mechanisms that readjust behaviour when inputs or dynamics change, and we continually update internal models from new experience. This is motivating analogy, not argument — the paper makes no claim to model the cerebellum.
L'idée clé : la conséquence est déjà l'étiquetteThe key idea: the consequence is already the label
Le déplacement conceptuel tient en une observation presque triviale, et c'est ce qui en fait la force. Un JEPA est entraîné à faire correspondre \(\hat{z}_{t+1}\), sa prédiction, à \(z_{t+1}\), la représentation de ce qui est effectivement arrivé. Or, au moment du déploiement, dès que l'agent exécute une action, il obtient \(o_{t+1}\). Donc il obtient \(z_{t+1}\). Donc il dispose exactement de la cible dont la loss d'entraînement avait besoin. The conceptual shift rests on an almost trivial observation, and that is its strength. A JEPA is trained to match \(\hat{z}_{t+1}\), its prediction, to \(z_{t+1}\), the representation of what actually happened. But at deployment, as soon as the agent executes an action, it gets \(o_{t+1}\). So it gets \(z_{t+1}\). So it holds exactly the target the training loss needed.
Il n'y a donc rien à inventer : ni récompense, ni démonstration d'expert, ni phase de collecte séparée, ni objectif auxiliaire spécialement conçu pour le test. On réutilise la même loss, sur une donnée que la planification produit d'elle-même. C'est ce qui distingue AdaJEPA de la plupart des travaux d'adaptation de modèles du monde, qui exigent des données de fine-tuning dans le domaine cible, des rollouts en ligne supplémentaires ou une boucle externe d'auto-amélioration. Nothing needs to be invented: no reward, no expert demonstration, no separate collection phase, no auxiliary objective designed for test time. The same loss is reused on data that planning generates by itself. This is what separates AdaJEPA from most world-model adaptation work, which requires target-domain finetuning data, extra online rollouts, or an outer self-improvement loop.
Apprentissage et planification cessent alors d'être deux phases séparées et deviennent un couplage : le modèle optimise des actions à partir de ses prédictions, la conséquence de ces actions fournit le signal d'adaptation, et le modèle adapté améliore la prédiction — donc la planification — de l'itération suivante. Learning and planning stop being two separate phases and become a coupling: the model optimises actions from its predictions, the consequence of those actions provides the adaptation signal, and the adapted model improves prediction — hence planning — at the next iteration.
La méthodeThe method
Le socle : un modèle du monde JEPAThe base: a JEPA world model
On considère des trajectoires d'observations \(o_t \in \mathbb{R}^{n_o}\) et d'actions \(a_t \in \mathbb{R}^{n_a}\). Le modèle est fait d'un encodeur sensoriel \(\mathcal{E}^s_\phi\), d'un encodeur d'action \(\mathcal{E}^a_\psi\) et d'un prédicteur \(f_\theta\) : Consider trajectories of observations \(o_t \in \mathbb{R}^{n_o}\) and actions \(a_t \in \mathbb{R}^{n_a}\). The model consists of a sensory encoder \(\mathcal{E}^s_\phi\), an action encoder \(\mathcal{E}^a_\psi\) and a predictor \(f_\theta\):
\[ z_t = \mathcal{E}^s_\phi(o_t), \qquad u_t = \mathcal{E}^a_\psi(a_t), \qquad \hat{z}_{t+1} = f_\theta(z_t, u_t). \]
L'entraînement se fait sur des transitions hors-ligne sans récompense \(\mathcal{D}_{\mathrm{off}} = \{(o_t, a_t, o_{t+1})\}\), en prédisant des cibles latentes futures plutôt qu'en reconstruisant des pixels : Training runs on reward-free offline transitions \(\mathcal{D}_{\mathrm{off}} = \{(o_t, a_t, o_{t+1})\}\), predicting future latent targets rather than reconstructing pixels:
\[ \mathcal{L}_{\mathrm{pred}} = \frac{1}{K} \sum_{k=1}^{K} \ell(\hat{z}_{t+k}, z_{t+k}), \]
où \(\ell\) est typiquement une MSE latente. Les variantes de JEPA préviennent l'effondrement de la représentation soit par un stop-gradient sur la branche cible, soit par une régularisation de type VICReg. where \(\ell\) is typically a latent MSE. JEPA variants prevent representational collapse either with a stop-gradient on the target branch or with VICReg-style regularisation.
Au test, étant donné une observation but \(o_g\) de représentation \(z_g\), le MPC optimise une séquence d'actions en déroulant \(f_\theta\) et en minimisant un coût d'atteinte de but dans l'espace latent : At test time, given a goal observation \(o_g\) with representation \(z_g\), MPC optimises an action sequence by rolling out \(f_\theta\) and minimising a latent goal-reaching cost:
\[ a^{*}_{t:t+H-1} = \arg\min_{a_{t:t+H-1}} \sum_{k=1}^{H} \alpha_k \, d(\hat{z}_{t+k}, z_g), \]
avec \(H\) l'horizon de planification, \(\alpha_k\) des poids temporels, et \(d\) le plus souvent la distance euclidienne au carré \(d(\hat{z}, z_g) = \lVert \hat{z} - z_g \rVert_2^2\). L'optimisation se fait par descente de gradient (GD) ou par échantillonnage (CEM). Le MPC standard exécute \(a_t\), observe \(o_{t+1}\), et replanifie — avec le même modèle. with \(H\) the planning horizon, \(\alpha_k\) temporal weights, and \(d\) usually the squared Euclidean distance \(d(\hat{z}, z_g) = \lVert \hat{z} - z_g \rVert_2^2\). Optimisation uses gradient descent (GD) or sampling (CEM). Standard MPC executes \(a_t\), observes \(o_{t+1}\), and replans — with the same model.
L'ajout : la loss d'adaptationThe addition: the adaptation loss
AdaJEPA maintient un petit buffer en ligne \(\mathcal{B}\) des transitions récemment vécues, et minimise dessus : AdaJEPA maintains a small online buffer \(\mathcal{B}\) of recently experienced transitions, and minimises over it:
\[ \mathcal{L}_{\mathrm{ada}}(\mathcal{B}) = \frac{1}{|\mathcal{B}|} \sum_{(o_i, a_i, o_{i+1}) \in \mathcal{B}} \ell\!\left( f_\theta\!\left( z_i, \mathcal{E}^a_\psi(a_i) \right), \operatorname{sg}(z_{i+1}) \right), \]
où \(z_i = \mathcal{E}^s_\phi(o_i)\) et \(\operatorname{sg}(\cdot)\) est l'opérateur stop-gradient. C'est littéralement l'équation de pré-entraînement, appliquée à des données que l'agent vient de produire. Puis, après chaque pas de MPC, on effectue \(U\) mises à jour de gradient sur le sous-ensemble \(\Omega \subseteq \{\phi, \psi, \theta\}\) des paramètres adaptés : where \(z_i = \mathcal{E}^s_\phi(o_i)\) and \(\operatorname{sg}(\cdot)\) is the stop-gradient operator. This is literally the pretraining equation, applied to data the agent has just produced. Then, after each MPC step, \(U\) gradient updates are performed on the subset \(\Omega \subseteq \{\phi, \psi, \theta\}\) of adapted parameters:
\[ \Omega \leftarrow \Omega - \eta \nabla_{\Omega} \mathcal{L}_{\mathrm{ada}}(\mathcal{B}). \]
- Entrée : modèle pré-entraîné \((\mathcal{E}^s_\phi, \mathcal{E}^a_\psi, f_\theta)\), paramètres adaptables \(\Omega\), but \(o_g\), horizon \(H\), pas d'adaptation \(U\), taille de buffer \(N\), pas max \(T\).Input: pretrained model \((\mathcal{E}^s_\phi, \mathcal{E}^a_\psi, f_\theta)\), trainable parameters \(\Omega\), goal \(o_g\), horizon \(H\), adaptation steps \(U\), buffer size \(N\), max steps \(T\).
- Initialiser \(\mathcal{B} \leftarrow \emptyset\) ; observer \(o_0\).Initialise \(\mathcal{B} \leftarrow \emptyset\); observe \(o_0\).
- Pour \(t = 0, \dots, T-1\) : planifier avec le modèle courant (équation du coût MPC).For \(t = 0, \dots, T-1\): plan with the current model (MPC cost equation).
- Exécuter la première action \(a_t\), observer \(o_{t+1}\).Execute the first action \(a_t\), observe \(o_{t+1}\).
- Ajouter \((o_t, a_t, o_{t+1})\) à \(\mathcal{B}\), élaguer à \(N\) transitions maximum.Add \((o_t, a_t, o_{t+1})\) to \(\mathcal{B}\), trim to at most \(N\) transitions.
- Pour \(u = 1, \dots, U\) : \(\Omega \leftarrow \Omega - \eta \nabla_{\Omega} \mathcal{L}_{\mathrm{ada}}(\mathcal{B})\).For \(u = 1, \dots, U\): \(\Omega \leftarrow \Omega - \eta \nabla_{\Omega} \mathcal{L}_{\mathrm{ada}}(\mathcal{B})\).
- Le modèle adapté est immédiatement réutilisé pour la planification suivante.The adapted model is immediately reused for the next planning problem.
Les trois choix qui rendent la chose viableThe three choices that make it viable
Le mécanisme est trivial ; sa mise en œuvre ne l'est pas, parce qu'un modèle qu'on met à jour en ligne, sans supervision, sur cinq échantillons, peut s'effondrer ou dériver. Trois garde-fous : The mechanism is trivial; its implementation is not, because a model updated online, without supervision, on five samples, can collapse or drift. Three safeguards:
1. Le buffer est minuscule. Cinq transitions récentes par défaut. Deux stratégies sont comparées : recent-N (les \(N\) dernières, ce qui focalise l'adaptation sur les observations et la dynamique locales) et hard-N (les \(N\) transitions de plus grande erreur de prédiction). Recent-N est le défaut. 1. The buffer is tiny. Five recent transitions by default. Two strategies are compared: recent-N (the last \(N\), focusing adaptation on locally encountered observations and dynamics) and hard-N (the \(N\) transitions with largest prediction error). Recent-N is the default.
2. On ne touche presque rien. Seules les dernières couches de l'encodeur visuel et du prédicteur sont mises à jour, tout le reste est gelé. Un seul pas de gradient, avec les taux d'apprentissage de l'entraînement : \(\eta_{\text{pred}} = 5 \times 10^{-4}\), \(\eta_{\text{enc}} = 10^{-5}\). 2. Almost nothing is touched. Only the final layers of the visual encoder and predictor are updated; everything else is frozen. A single gradient step, at the training learning rates: \(\eta_{\text{pred}} = 5 \times 10^{-4}\), \(\eta_{\text{enc}} = 10^{-5}\).
3. Chaque épisode repart de zéro. Chaque épisode part du modèle pré-entraîné et maintient sa propre copie et son propre buffer. Rien ne s'accumule d'un épisode à l'autre : pas de dérive à long terme, mais pas de capitalisation non plus. 3. Each episode restarts from scratch. Each episode starts from the pretrained model and keeps its own copy and buffer. Nothing accumulates across episodes: no long-term drift, but no capitalisation either.
Sur l'effondrement, les auteurs font une remarque honnête et intéressante : retirer le stop-gradient tout en ne mettant à jour que les dernières couches pour un seul pas donne des performances de planification similaires. Autrement dit, la restriction de la mise à jour suffit déjà, à elle seule, à limiter l'effondrement — le stop-gradient est une ceinture par-dessus des bretelles. On collapse, the authors make an honest and interesting remark: removing the stop-gradient while updating only the last layers for one step gives similar planning performance. In other words, restricting the update already limits collapse on its own — the stop-gradient is a belt on top of braces.
Le dispositif expérimentalThe experimental setup
Modèle du monde entraîné de zéro pour chaque environnement : encodeur ResNet produisant des features globales, prédicteur à base de transformer, stop-gradient sur la branche cible et régularisation de courbure (pour obtenir des trajectoires latentes plus droites, plus faciles à planifier). Frameskip 5, fenêtre d'historique de 3 images. Les embeddings d'action sont concaténés aux embeddings visuels et proprioceptifs avant le prédicteur. A world model trained from scratch for each environment: a ResNet encoder producing global features, a transformer-based predictor, stop-gradient on the target branch and curvature regularisation (to obtain straighter latent trajectories, easier to plan through). Frameskip 5, history window of 3 frames. Action embeddings are concatenated with visual and proprioceptive embeddings before the predictor.
Quatre familles de décalage sont testées : Four families of shift are tested:
- Formes (PushObj) : entraînement sur {T, L, Z, +}, test sur trois formes retenues {I, petit T, carré} qui partagent la même dynamique de contact mais une géométrie inédite. Buts échantillonnés à 25 pas.Shape (PushObj): trained on {T, L, Z, +}, tested on three held-out shapes {I, smallT, square} sharing the same contact dynamics but unseen geometry. Goals sampled 25 steps away.
- Visuel (PushT) : flou gaussien, bruit poivre-et-sel, éclairage sombre, plus trois changements de couleur (bloc mobile en rouge, ancre en rouge, agent en rouge).Visual (PushT): Gaussian blur, salt-and-pepper noise, dark lighting, plus three colour changes (moving block red, anchor red, agent red).
- Dynamique (PointMaze-Medium) : masse faible (×0,2 — l'agent va plus vite à force égale) et amortissement fort (×20 — la vitesse décroît plus vite).Dynamics (PointMaze-Medium): low mass (×0.2 — the agent moves faster under the same force) and high damping (×20 — velocity decays faster).
- Layout : labyrinthes générés sur une grille 8×8, 25 layouts d'entraînement, 5 layouts retenus pour le test, buts à 3–5 cases du départ en plus court chemin.Layout: mazes generated on an 8×8 grid, 25 training layouts, 5 held-out test layouts, goals 3–5 cells away by shortest path.
Vingt pas de MPC maximum, résultats moyennés sur trois graines de données de test, 50 épisodes par graine. At most twenty MPC steps, results averaged over three test-data seeds, 50 episodes per seed.
Les résultatsThe results
Sur les formes d'entraînement de PushObj et le rendu PushT par défaut, l'adaptation améliore nettement le modèle gelé, pour les deux planificateurs. Comme le modèle PushObj est entraîné sur plusieurs formes, s'adapter à la forme courante le fait se spécialiser : c'est là que le gain est le plus fort, plus de 20 points. Sur PointMaze avec la dynamique par défaut, où le modèle gelé est déjà excellent (82,7 %), l'adaptation préserve simplement ce niveau. On PushObj training shapes and default PushT rendering, adaptation clearly improves on the frozen model for both planners. Since the PushObj model is trained across several shapes, adapting to the current shape makes it specialise: that is where the gain is largest, over 20 points. On PointMaze with default dynamics, where the frozen model is already excellent (82.7%), adaptation simply preserves that level.
Conclusion des auteurs, formulée prudemment : l'adaptation au test est sûre à appliquer en distribution — grands gains quand le modèle gelé est sous-optimal, aucun dommage quand il est déjà quasi optimal. The authors' conclusion, carefully phrased: test-time adaptation is safe to apply in-distribution — large gains when the frozen model is suboptimal, no harm when it is already near-optimal.
Sur les formes inédites de PushObj, la performance du modèle gelé chute nettement tandis qu'AdaJEPA double presque le taux de succès. Le détail le plus parlant n'est pas le chiffre final mais la forme de la courbe : le succès d'AdaJEPA continue d'augmenter au fil des replanifications, alors que le modèle gelé sature tôt. Le planificateur adaptatif se remet de prédictions initialement fausses ; le planificateur gelé, non — il refait indéfiniment la même erreur. On unseen PushObj shapes, the frozen model's performance drops sharply while AdaJEPA nearly doubles the success rate. The most telling detail is not the final number but the shape of the curve: AdaJEPA's success keeps increasing over replanning steps, whereas the frozen model saturates early. The adaptive planner recovers from initially wrong predictions; the frozen planner does not — it repeats the same error indefinitely.
Sur les décalages visuels, gains nets sous flou, bruit et éclairage sombre. Sur les décalages de dynamique, le modèle gelé est déjà étonnamment robuste — les auteurs avancent une hypothèse qu'ils ne testent pas : l'historique de trois images permettrait une forme d'apprentissage en contexte de la dynamique courante. AdaJEPA améliore quand même au-delà de cette base solide. On visual shifts, clear gains under blur, noise and dark lighting. On dynamics shifts, the frozen model is already surprisingly robust — the authors offer an untested hypothesis: the three-frame history may enable a form of in-context learning of the current dynamics. AdaJEPA still improves beyond that strong baseline.
| Paramètres adaptésAdapted parameters | DéfautDefault | Masse faible ×0,2Low mass ×0.2 | Amortissement ×20High damping ×20 | Layouts inéditsUnseen layouts | ||||
|---|---|---|---|---|---|---|---|---|
| GD | CEM | GD | CEM | GD | CEM | GD | CEM | |
| Gelé (référence)Frozen (baseline) | 82.7 ± 6.8 | 84.0 ± 3.3 | 77.3 ± 8.2 | 82.0 ± 2.8 | 77.3 ± 5.0 | 76.0 ± 2.8 | 53.3 ± 8.2 | 49.3 ± 6.2 |
| predlast + enclast | 83.3 ± 6.6 ↑0.7 | 83.3 ± 3.4 ↓0.7 | 80.0 ± 3.3 ↑2.7 | 86.7 ± 2.5 ↑4.7 | 77.3 ± 10.5 — | 78.7 ± 3.4 ↑2.7 | 66.0 ± 7.1 ↑12.7 | 55.3 ± 5.0 ↑6.0 |
| predfirst + enclast | 84.0 ± 1.6 ↑1.3 | 84.0 ± 4.3 — | 82.0 ± 1.6 ↑4.7 | 82.7 ± 3.4 ↑0.7 | 78.7 ± 4.7 ↑1.3 | 82.0 ± 3.3 ↑6.0 | 78.7 ± 5.0 ↑25.3 | 70.7 ± 3.8 ↑21.3 |
Table 1 du papier — taux de succès de planification (%) sur PointMaze, sous décalage de dynamique et de layout. GD = planificateur par descente de gradient, CEM = cross-entropy method. « enclast » = dernière couche de l'encodeur ; « predlast » / « predfirst » = dernière ou première couche du prédicteur. Table 1 of the paper — planning success rate (%) on PointMaze, under dynamics and layout shift. GD = gradient-descent planner, CEM = cross-entropy method. "enclast" = last encoder layer; "predlast" / "predfirst" = last or first predictor layer.
Le tableau ci-dessus contient le résultat le plus instructif du papier, et il est presque discret. Sur les layouts inédits, adapter les dernières couches donne +12,7 points ; adapter la première couche du prédicteur donne +25,3 points — le double. Or un layout de labyrinthe est un changement de structure du monde, pas un changement d'apparence : il faut le corriger tôt dans la chaîne de prédiction, pas en sortie. Sur les décalages de dynamique, où le modèle gelé est déjà bon, l'écart entre les deux stratégies est bien plus faible. The table above contains the paper's most instructive result, and it is almost discreet. On unseen layouts, adapting the last layers gives +12.7 points; adapting the predictor's first layer gives +25.3 points — twice as much. A maze layout is a change in the structure of the world, not in its appearance: it must be corrected early in the prediction chain, not at the output. On dynamics shifts, where the frozen model is already good, the gap between the two strategies is far smaller.
Autrement dit, la profondeur à laquelle il faut intervenir dépend de la nature du décalage. Le papier ne théorise pas ce point ; il l'observe. C'est peut-être la piste la plus ouverte qu'il laisse. In other words, the depth at which one must intervene depends on the nature of the shift. The paper does not theorise this; it observes it. It may be the most open thread it leaves.
Sur un H200, pour la variante à features globales (latent \(1 \times 384\), stop-gradient) évaluée sur les trajectoires de validation PushT : On an H200, for the global-feature variant (latent \(1 \times 384\), stop-gradient) evaluated on PushT validation trajectories:
| GD (%) | Temps / replanTime / replan | CEM (%) | Temps / replanTime / replan | |
|---|---|---|---|---|
| GeléFrozen | 84.0 ± 2.0 | 3.14 s | 74.0 ± 3.5 | 0.24 s |
| AdaJEPA | 85.3 ± 3.1 ↑1.3 | 3.17 s +0,03 | 81.3 ± 6.4 ↑7.3 | 0.27 s +0,03 |
Trente millisecondes par replanification. Et le coût réel est souvent négatif : l'agent adapté atteint le but en autant ou moins de replanifications, ce qui réduit le temps total. Le papier montre par ailleurs que le gain se retrouve à travers plusieurs implémentations de modèle du monde — AdaJEPA est agnostique à l'architecture sous-jacente. Thirty milliseconds per replan. And the real cost is often negative: the adapted agent reaches the goal in equal or fewer replans, reducing total time. The paper also shows the gain holds across several world-model implementations — AdaJEPA is agnostic to the underlying architecture.
En faisant varier la diversité de formes \(K\) et le nombre de trajectoires par forme \(N\) dans les données d'entraînement PushObj : l'échelle des données améliore les deux modèles, mais l'adaptation au test est particulièrement précieuse en régime de données limitées. Sur les formes vues en faible régime, AdaJEPA peut plus que doubler le succès du modèle gelé — et dépasser des modèles gelés entraînés sur beaucoup plus de données. Varying shape diversity \(K\) and trajectories per shape \(N\) in the PushObj training data: data scale improves both models, but test-time adaptation is especially valuable in the low-data regime. On seen shapes with little data, AdaJEPA can more than double frozen-model success — and outperform frozen models trained on far more data.
C'est le résultat le plus économiquement intéressant : quelques millisecondes de calcul au moment de l'action remplacent une quantité substantielle de données d'entraînement. This is the economically most interesting result: a few milliseconds of compute at action time substitute for a substantial amount of training data.
Ce que l'adaptation ne fait pasWhat adaptation does not do
La partie la plus intéressante du papier est celle où il se limite lui-même, et elle mérite d'être lue lentement. The most interesting part of the paper is where it limits itself, and it deserves slow reading.
L'échec sur la couleurThe colour failure
Sous flou, bruit et éclairage, les gains sont nets. Sous changement de couleur (bloc rouge, ancre rouge), ils sont modestes. L'explication des auteurs est structurelle, pas anecdotique : le modèle s'appuie sur la couleur pour distinguer l'ancre fixe de l'objet manipulé. Quand la couleur change, ce n'est pas une perturbation de surface — c'est la disparition d'un trait qui portait une distinction fonctionnelle. Une adaptation auto-supervisée ne peut pas réinventer cette distinction à partir de l'erreur de prédiction seule ; il faudrait de l'augmentation de données ou une régularisation d'invariance explicite. Under blur, noise and lighting, gains are clear. Under colour change (red block, red anchor), they are modest. The authors' explanation is structural, not anecdotal: the model relies on colour to distinguish the fixed anchor from the manipulated object. When colour changes, this is not a surface perturbation — it is the loss of a feature that carried a functional distinction. Self-supervised adaptation cannot reinvent that distinction from prediction error alone; it would require data augmentation or explicit invariance regularisation.
Le modèle reste sur sa variétéThe model stays on its manifold
Les auteurs entraînent un décodeur sur l'espace latent pré-entraîné, puis décodent les rollouts imaginés après adaptation. Ce qu'ils voient est révélateur : les rollouts décodés conservent la structure du domaine d'entraînement. Un bloc rouge inédit se décode en bloc gris — la couleur d'entraînement. Un objet inconnu se décode en forme connue visuellement voisine. The authors train a decoder on the pretrained latent space, then decode imagined rollouts after adaptation. What they see is revealing: decoded rollouts retain training-domain structure. An unseen red block decodes as a grey block — the training colour. An unknown object decodes as a visually similar known shape.
AdaJEPA n'apprend donc pas une structure nouvelle. Il recalibre en exploitant une structure latente déjà partagée, en restant proche de la variété apprise. C'est une explication du succès autant qu'une borne : la méthode marche tant que le nouvel environnement peut être projeté sur ce que le modèle sait déjà. Quand le décalage demande une représentation absente de l'espace latent — la distinction ancre/objet privée de la couleur — cinq transitions et un pas de gradient ne suffisent pas, et ne peuvent pas suffire. AdaJEPA therefore does not learn new structure. It recalibrates by exploiting already-shared latent structure, staying close to the learned manifold. This explains the success as much as it bounds it: the method works as long as the new environment can be projected onto what the model already knows. When the shift demands a representation absent from the latent space — the anchor/object distinction stripped of colour — five transitions and one gradient step do not suffice, and cannot.
Le périmètreThe scope
Tout est en simulation (PushT, PushObj, PointMaze), sur des tâches d'atteinte de but à horizon court, avec des buts définis par une observation-cible. Aucune expérience sur robot réel, aucune tâche à structure temporelle longue ou à sous-buts. L'adaptation ne persiste pas entre épisodes. Et le papier ne fournit aucune garantie : rien n'exclut, formellement, qu'une séquence de transitions pathologique dégrade le modèle — l'argument de sûreté est empirique (« ça ne nuit pas en distribution »), pas démontré. Everything is in simulation (PushT, PushObj, PointMaze), on short-horizon goal-reaching tasks with goals specified by a target observation. No real-robot experiment, no task with long temporal structure or subgoals. Adaptation does not persist across episodes. And the paper offers no guarantee: nothing formally rules out that a pathological transition sequence could degrade the model — the safety argument is empirical ("it does no harm in-distribution"), not proven.
Pourquoi cette référence est iciWhy this reference is here
Ce qui m'a arrêté dans ce papier n'est pas la performance : c'est le statut qu'il donne à la justesse d'un modèle. Le modèle gelé est traité comme un objet à valider — il est bon ou mauvais, et s'il est mauvais on l'entraîne davantage. AdaJEPA déplace la question : un modèle n'a pas à être juste, il a à être corrigible en cours de route. La qualité pertinente n'est plus une propriété de l'objet, c'est une propriété de la boucle dans laquelle il vit. C'est exactement le déplacement objet → trajectoire qui traverse la trajectoire BAAM. What stopped me in this paper is not the performance: it is the status it gives to a model's correctness. The frozen model is treated as an object to validate — it is good or bad, and if bad you train it more. AdaJEPA moves the question: a model need not be right, it needs to be correctable along the way. The relevant quality is no longer a property of the object but of the loop it lives in. This is exactly the object → trajectory shift that runs through the BAAM trajectory.
Deuxième chose : le signal de correction n'est pas ajouté, il est déjà là. Rien n'a besoin d'être annoté, récompensé ou démontré — il suffisait de ne pas jeter ce que l'action produit. Il y a une frugalité dans ce geste qui n'est pas seulement technique. La plupart des systèmes qui apprennent traitent leur propre activité comme un déchet ; celui-ci la traite comme sa nourriture. La question que ça me laisse : dans les systèmes que je construis, qu'est-ce qui est produit à chaque pas et systématiquement jeté ? Second: the correction signal is not added, it is already there. Nothing needs annotating, rewarding or demonstrating — it was enough not to discard what action produces. There is a frugality in this gesture that is not merely technical. Most learning systems treat their own activity as waste; this one treats it as food. The question it leaves me: in the systems I build, what is produced at every step and systematically thrown away?
Troisième chose, la plus dérangeante et la plus utile. L'analyse par décodage montre qu'AdaJEPA ne découvre rien : il projette le nouveau sur l'ancien — un bloc rouge devient un bloc gris. C'est un succès et une cécité par le même mécanisme. Adapter, ici, veut dire ramener l'inconnu dans le vocabulaire du connu, et cela marche remarquablement tant que l'inconnu est une variation, et pas du tout quand il est une distinction absente du vocabulaire. Ça pose une limite nette entre recalibrer et apprendre, entre s'ajuster et se restructurer — et c'est une limite qui ne se voit pas dans les chiffres de succès, seulement dans les images décodées. Third, the most unsettling and most useful. The decoding analysis shows AdaJEPA discovers nothing: it projects the new onto the old — a red block becomes a grey block. Success and blindness by the same mechanism. Adapting, here, means bringing the unknown back into the vocabulary of the known, and this works remarkably well as long as the unknown is a variation, and not at all when it is a distinction absent from the vocabulary. It draws a sharp line between recalibrating and learning, between adjusting and restructuring — a line invisible in the success numbers, visible only in the decoded images.
Cette section est une lecture personnelle, pas le propos du papier. This section is a personal reading, not the paper's claim.