Que se cache-t-il après les LLM ? Mamba, Diffusion et Modèles du Monde

Que succède aux LLM ? L’ère post-transformers.

Sommaire

La surexcitation autour de l’IA suit un rythme : environ tous les trois ans, l’architecture sur laquelle tous parient est remplacée par quelque chose de plus récent. La prochaine transition se forme déjà dans les laboratoires de recherche.

Ce qui suit est un tour des candidats les plus forts susceptibles de remplacer le transformeur, et des preuves que ce changement est déjà en marche. Le schéma se répète : une architecture dominante, un mur qu’elle ne peut pas dépasser, et une nouvelle conception qui contourne ce mur.

Architectures post-transformer pour l’IA : modèles d’état spatial, modèles de diffusion pour le langage et modèles du monde JEPA

Cet article passe en revue les quatre limites qui se referment sur les transformeurs, les trois architectures alternatives, et ce que les systèmes hybrides déjà en production nous apprennent. L’objectif est une lecture pratique pour les ingénieurs qui doivent décider de quoi construire pour 2027 et au-delà — pas un marché de prédiction, juste les preuves telles qu’elles se présentent en 2026.

Le schéma : le cycle de percée de l’IA tous les trois ans

Tous les quelques années, le centre de gravité de l’IA se déplace :

flowchart LR A["~2017
Les transformeurs remplacent
les RNN et CNN"] --> B["2020-2022
Les modèles de diffusion prennent
la génération d'images"] B --> C["2022
Les LLM atteignent tous
(GPT-3, ChatGPT)"] C --> D["2026-2028
Systèmes hybrides post-transformer
en production"]

Les transformeurs sont apparus vers 2017 et ont rendu les RNN et CNN comme des reliques. Les modèles de diffusion ont ensuite pris le relais dans la génération d’images entre 2020 et 2022. Et les LLM ont explosé dans tous les domaines à partir de 2022 avec GPT-3 et ChatGPT.

D’après ce schéma, nous devrions approcher la prochaine transition. Elle est déjà en cours — juste pas là où vous le期望ez. Pas sur les réseaux sociaux ou dans les communiqués de presse, mais dans les laboratoires de recherche.

Yann LeCun a passé 2025 à affirmer que les LLM autoregressifs sont fondamentalement limités. « Nous avons besoin de modèles du monde, pas de prédicteurs de mots », a-t-il dit lors de conférence après conférence. Pendant ce temps, son équipe a publié une série de papiers sur l’Architecture de Prédiction d’Intégration de Plongements (JEPA) — d’abord pour les images, puis la vidéo, puis le langage en septembre 2025.

Les preuves appuyées des douze derniers mois sont inhabituellement concrètes :

  • Les modèles d’état spatial comme Mamba gèrent des contextes de millions de jetons avec une mise à l’échelle linéaire — ce que les transformeurs ne peuvent pas faire à cause de leur mécanisme d’attention quadratique.
  • Google a annoncé Gemini Diffusion, promettant une génération de texte jusqu’à 10 fois plus rapide.
  • NVIDIA a lancé Nemotron 3 avec des couches Mamba-2 intégrées.
  • Le Qwen3.5 chinois est entré en service en utilisant des Gated DeltaNets.
  • En décembre 2025, VL-JEPA est arrivé — un modèle vision-langage avec la moitié des paramètres de ses concurrents qui a nonetheless performé mieux.

Pourquoi les transformeurs arrivent au bout de la route

Les transformeurs sont incroyables dans ce qu’ils font. Mais quatre problèmes se referment qui ne peuvent être corrigés par aucune quantité de mise à l’échelle.

L’attention quadratique échoue au long contexte

L’attention auto signifie que chaque jeton communique avec chaque autre jeton — complexité O(n²). Doublez votre contexte et vous quadruplez le calcul. À 10 millions de jetons, le calcul se brise simplement. Vous pouvez jeter plus de GPU dessus, mais vous luttez contre l’arithmétique de base.

Les données d’entraînement viennent à manquer

Les LLM s’entraînent sur le texte d’Internet, et d’ici 2026 la majeure partie a été scrapée. Livres, Wikipédia, Reddit, GitHub — tout est consommé. Les données synthétiques semblent une solution jusqu’à ce que vous réalisiez que les modèles entraînés sur du texte généré par IA se dégradent au fil des générations : ils apprennent les artefacts et les biais du processus de génération lui-même. Les lois d’échelle qui ont propulsé tout depuis 2020 jusqu’à 2024 touchent les rendements décroissants.

L’énergie et le coût sont la limite dure

Les modèles frontieres coûtent des dizaines ou des centaines de millions pour s’entraîner maintenant. Servir des milliards de requêtes par jour brûle un calcul massif. Les centres de données IA ont besoin de gigawatts de puissance, et la capacité de génération d’énergie devient un goulot d’étranglement. Sam Altman a admis en 2024 que les coûts de calcul limitent tout — et cela n’a pas changé.

Si la contrainte est l’énergie, la réponse peut venir du côté du modèle ou du côté de la silice. Mes notes sur l’optimisation des coûts pour les systèmes LLM et sur les puces d’inférence LLM spécialisées couvrent chacun des côtés de ce compromis.

La correspondance de motifs n’est pas la compréhension

Les LLM sont des correspondeurs de motifs à grande échelle, prédicteurs du jeton suivant à partir des données d’entraînement. Exceptionnels en cela, oui — mais pas du raisonnement, et pas de la compréhension des relations causales dans le monde physique. Si vous voulez une IA capable de planifier, simuler ou s’adapter véritablement à de nouveaux environnements, la prédiction de jetons ne vous y amènera pas.

Modèles d’état spatial : mise à l’échelle linéaire avec une mémoire compressée

Les modèles d’état spatial (SSM) tels que Mamba et Gated DeltaNet adoptent une approche complètement différente des séquences. Au lieu d’accorder de l’attention à tous les jetons précédents, ils maintiennent un état interne compressé qui résume l’historique — mise à l’échelle linéaire O(n) au lieu de quadratique, avec une mémoire constante par jeton à l’inférence, quel que soit la longueur de la séquence.

Le mécanisme derrière cette efficacité mérite d’être compris, car il explique à la fois la vitesse et le compromis. Les modèles d’état classiques (la famille S4) étaient invariants dans le temps : la même matrice de transition fixe appliquée à chaque étape, ce qui est rapide mais ne peut pas décider qu’un jeton compte plus qu’un autre. La contribution de Mamba était de rendre ces paramètres de transition sélectifs — fonctions de l’entrée courante — de sorte que le modèle puisse choisir dynamiquement quoi garder dans son état compressé et quoi jeter, beaucoup comme le softmax de l’attention décide quoi mettre en évidence, mais sans matérialiser une matrice de scores O(n²). Pour maintenir cette ré récurrence sélective rapide, Mamba l’exécute comme un balayage parallèle conscient du matériel : une opération associative calculée dans la SRAM du GPU plutôt qu’une boucle jeton par jeton, ce qui est le même type d’ingénierie de noyau de bas niveau que FlashAttention a fait pour les transformeurs. Mamba-2 a poussé cela plus loin avec la « dualité de l’espace d’état », montrant qu’un SSM sélectif et une forme restreinte d’attention linéaire calculent la même opération sous-jacente — permettant aux noyaux SSM de réutiliser le matériel de multiplication matricielle pour lequel les GPU sont optimisés.

La percée réelle en production ici était Gated DeltaNet, une amélioration de Mamba2 qui utilise une règle delta pour un meilleur traitement du long contexte. Qwen3.5 l’a adopté comme architecture de base en février 2026 et a obtenu de forts résultats sur les tâches d’agents et les benchmarks de codage en utilisant seulement 3 milliards de paramètres actifs dans sa configuration hybride MoE. C’est une efficacité impressionnante, et mes benchmarks llama.cpp de Qwen 3.6 MTP par rapport au décodage standard sur un GPU 16 Go donnent une idée du comportement des modèles Qwen sur le matériel grand public.

Le compromis est structurel, pas juste un artefact d’entraînement : parce qu’un SSM comprime l’ensemble de l’historique dans un état de taille fixe, il peut perdre des détails fins que les transformeurs conservent en gardant chaque jeton passé individuellement adressable par l’attention. Si vous avez besoin de copie exacte ou de citation, les transformeurs gagnent encore. Pour la plupart des charges de travail pratiques — résumé, utilisation d’outils par agents, raisonnement sur de longs documents où l’essentiel compte plus que la récitation verbale — le gain d’efficacité en vaut la peine.

Modèles de diffusion pour le langage : plusieurs jetons par passe avant

Les modèles de diffusion pour le langage appliquent la même technique qui a transformé la génération d’images au texte. Au lieu de générer un jeton à la fois, ils peuvent produire plusieurs jetons en parallèle pendant chaque passe avant.

Nemotron-Labs-Diffusion de NVIDIA, publié en mai 2026, a atteint presque 6x jetons par passe avant par rapport à Qwen3-8B tout en maintenant une précision compétitive sur des benchmarks incluant HumanEval, GSM8K et Math500. C’est un modèle tri-mode qui unifie le décodage autoregressif, diffusion et auto-spéculation. Gemini Diffusion de Google promet encore plus de vitesse.

Le piège est la qualité par rapport à la vitesse. Les modèles autoregressifs optimisent la cohérence locale à chaque étape — le jeton suivant le plus probable. Les modèles de diffusion optimisent globalement sur l’ensemble de la sortie, ce qui peut améliorer la structure globale mais sacrifie parfois le détail fin. Pour l’écriture créative ou le brainstorming, la diffusion pourrait être meilleure. Pour une sortie technique précise, l’autoregressif gagne encore.

Il est worth de séparer cela des astuces d’inférence. Le décodage spéculatif délivre déjà plusieurs jetons par passe avant en brouillant et vérifiant, sans changement à la distribution de sortie. La diffusion déplace la génération parallèle de jetons de la couche d’inférence dans l’architecture du modèle elle-même — une mise en jeu structurellement différente.

Modèles du monde et JEPA : prédire le sens, pas les jetons

Les modèles du monde, spécifiquement l’architecture JEPA de Yann LeCun, adoptent l’approche la plus radicale. Au lieu de prédire le jeton suivant, ils prédisent le plongement latent suivant — une représentation compressée de ce qui devrait venir ensuite. C’est plus proche de la façon dont la cognition humaine fonctionne : nous ne prédisons pas des mots individuels, nous prédisons le sens.

La différence architecturale par rapport aux transformeurs et aux modèles de diffusion est le décodeur manquant. Un modèle génératif — autoregressif ou diffusion — doit reconstruire sa cible dans l’espace d’origine : pixels exacts, jetons exacts. Cela force le modèle à dépenser sa capacité à modéliser le bruit de surface imprévisible : la formulation exacte d’une phrase, la valeur de pixel exacte d’une feuille dans le vent. La perte de JEPA opère entièrement à l’intérieur d’un espace de représentation appris au lieu, en comparant un plongement prédit contre un plongement cible produit par un encodeur séparé, mis à jour lentement. Rien n’est jamais décodé de retour vers la sortie brute pendant l’entraînement. Cela permet au prédicteur de jeter le bruit et de garder uniquement la partie structurelle, pertinente pour la tâche, du signal — ce qui est aussi, non par coïncidence, la partie utile pour la planification : un agent peut simuler « que se passe-t-il si je fais X » en faisant rouler vers l’avant dans l’espace latent, sans payer le coût de rendre une image complète ou de générer un texte complet pour chaque hypothèse.

VL-JEPA a atteint des performances comparables aux modèles vision-langage établis avec seulement 1,6 milliard de paramètres par rapport à 7 milliards ou plus pour les concurrents. Il réduit les opérations de décodage d’environ 2,85x tout en améliorant la précision sur le questionnement visuel. Plus important, les architectures JEPA sont conçues pour l’apprentissage continu — elles construisent des modèles internes de la façon dont l’environnement fonctionne, pas juste des motifs statistiques dans le texte.

La limitation est que JEPA est encore en maturation pour les tâches de langage pur : LLM-JEPA existe mais n’a pas encore égalé les grands modèles autoregressifs ou de diffusion sur les benchmarks standards, et JEPA n’est pas un remplacement en place pour un chatbot — c’est un substrat d’apprentissage de représentation et de planification qui complète les modèles de langage plus qu’il ne concurrence avec eux frontalement. Pour l’IA incarnée et la robotique, cependant — où la compréhension de la causalité physique compte plus que la génération de prose fluide — JEPA pourrait être l’architecture appropriée dès le départ.

Ce que font les systèmes de production : architectures hybrides

Les développements les plus intéressants combinent des éléments de plusieurs architectures. Jamba d’AI21 Labs intercale des couches d’attention transformeur avec des couches d’espace d’état Mamba — l’attention pour les dépendances à longue portée, les SSM pour un traitement local efficace. Qwen3.5 combine Gated DeltaNet avec le Mixture of Experts, activant seulement les réseaux d’experts pertinents pour chaque entrée. Les fournisseurs cloud listent déjà des modèles basés sur Mamba — Codestral Mamba de Mistral était la première publication open-source de Mamba-2 — et l’aperçu des fournisseurs LLM cloud suit ce qui est disponible où.

Différentes tâches ont des exigences différentes :

  • La génération de code pourrait bénéficier de la génération parallèle de jetons de la diffusion.
  • L’analyse de longs documents a besoin de la mise à l’échelle linéaire d’un SSM.
  • L’écriture créative pourrait utiliser l’attention du transformeur pour la cohérence.

Une seule architecture ne résoudra pas tout. La même logique qui conduit à la conception de systèmes multi-modèles — le bon mécanisme pour la bonne tâche — apparaît maintenant à l’intérieur des modèles eux-mêmes.

Si vous construisez des applications IA et concevez pour 2027 ou 2028, n’investissez pas excessivement dans des solutions purement transformeur. Considérez si des composants SSM ou de diffusion pourraient mieux servir votre cas d’utilisation. L’écosystème est en train de changer, et les adopteurs précoces auront un avantage.

Deux implications supplémentaires méritent d’être suivies. La performance de Qwen3.5 avec seulement 3 milliards de paramètres actifs suggère que les architectures spécialisées et efficaces surpasseront les grands modèles à usage général pour de nombreuses tâches — ce qui pourrait démocratiser le déploiement de l’IA et rendre les modèles haute performance accessibles sur le matériel grand public. Et les modèles de diffusion pour le langage pourraient réduire la latence d’un ordre de grandeur pour certaines charges de travail ; les applications nécessitant une réponse en temps réel — agents conversationnels, traduction en direct, outils interactifs — bénéficieront le plus.

Où cela mène : l’ère post-transformer

Suivant le cycle de trois ans, je m’attendrais aux premiers déploiements de production d’architectures non transformeur d’ici 2027–2028. Ceux-ci seront probablement des systèmes hybrides qui exploitent l’attention transformeur où nécessaire mais utilisent les SSM ou la diffusion pour des gains d’efficacité.

La phase de consolidation dans laquelle nous sommes maintenant — où les laboratoires prouvent que les LLM peuvent raisonner et agir — cède la place à un défi plus difficile : rendre ces systèmes efficaces, adaptatifs et spatialement conscients. Cela exige des percées dans l’apprentissage continu, les modèles du monde et l’efficacité architecturale. Chacun aborde des limitations fondamentales que la pure mise à l’échelle ne peut pas résoudre.

La prochaine grande chose ne sera pas des modèles plus gros. Ce sera des architectures plus intelligentes qui accomplissent plus avec moins — des modèles qui comprennent plutôt que de juste prédire, qui s’adaptent plutôt que de juste traiter. C’est ce qui vient après les LLM. Pas une seule nouvelle architecture, mais une génération de systèmes spécialisés et efficaces qui passent enfin au-delà de la correspondance de motifs vers une compréhension authentique.

Références

  1. Adaline Labs. « The AI Research Landscape in 2026: From Agentic AI to Embodiment. » https://labs.adaline.ai/p/the-ai-research-landscape-in-2026
  2. Aftab, A. « The End of LLMs As We Know Them: Why 2026 Marks the Beginning of AI’s Next Architecture Revolution. » Medium, 2025. https://medium.com/@aftab001x/the-end-of-llms-as-we-know-them-why-2026-marks-the-beginning-of-ais-next-architecture-revolution-902ee29484f7
  3. Greengard, S. « Beyond LLMs: A Post-Transformer World Emerges. » Communications of the ACM, May 2026. https://cacm.acm.org/news/beyond-llms-a-post-transformer-world-emerges
  4. NVIDIA. « Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding. » arXiv:2607.05722, 2026. https://arxiv.org/html/2607.05722v1
  5. MarkTechPost. « NVIDIA AI Releases Nemotron-Labs-Diffusion: A Tri-Mode Language Model with 6× Tokens Per Forward Over Qwen3-8B. » May 20, 2026. https://www.marktechpost.com/2026/05/20/nvidia-ai-releases-nemotron-labs-diffusion-a-tri-mode-language-model-with-6x-tokens-per-forward-over-qwen3-8b
  6. Chen, D. et al. « VL-JEPA: Joint Embedding Predictive Architecture for Vision-language. » arXiv:2512.10942, 2025. https://arxiv.org/pdf/2512.10942
  7. OpenReview. « VL-JEPA: Joint Embedding Predictive Architecture for Vision-language. » https://openreview.net/forum?id=tjimrqc2BU
  8. NVIDIA Research. « Gated Delta Networks: Improving Mamba2 with Delta Rule. » ICLR 2025. https://research.nvidia.com/publication/2025-04_gated-delta-networks-improving-mamba2-delta-rule
  9. Laon People. « Why Did Qwen3.5 Choose Gated DeltaNet? » February 2026. https://laonpeople.com/en/blog/why-did-qwen3-5-choose-gated-deltanet
  10. Google DeepMind. « Gemini Diffusion. » https://deepmind.google/models/gemini-diffusion
  11. Vicentino, C. « Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison. » arXiv:2603.22075, March 2026. https://www.alphaxiv.org/abs/2603.22075
  12. JetBrains AI Blog. « Why Diffusion Models Could Change Developer Workflows in 2026. » November 2025. https://blog.jetbrains.com/ai/2025/11/why-diffusion-models-could-change-developer-workflows-in-2026
  13. Spheron Blog. « Mamba-3 and State Space Models on GPU Cloud: Deploy SSM Inference as the Transformer Alternative (2026 Guide). » https://www.spheron.network/blog/mamba-3-state-space-model-gpu-cloud-deployment
  14. Gartner. « Gartner Predicts 40 Percent of Enterprise Apps Will Feature Task-Specific AI Agents by 2026. » August 26, 2025. https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025
  15. Reddit r/deeplearning. « Following a 3-year AI breakthrough cycle. » https://www.reddit.com/r/deeplearning/comments/1k8gdwg/following_a_3year_ai_breakthrough_cycle
  16. Gu, A., Dao, T. « Mamba: Linear-Time Sequence Modeling with Selective State Spaces. » arXiv:2312.00752, 2023. https://doi.org/10.48550/arxiv.2312.00752
  17. Dao, T., Gu, A. « Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality (Mamba-2). » arXiv:2405.21060, 2024. https://arxiv.org/abs/2405.21060
  18. Meta AI Blog. « The first AI model based on Yann LeCun’s vision for more human-like AI (I-JEPA). » https://ai.meta.com/blog/yann-lecun-ai-model-i-jepa/
  19. LeCun, Y. « A Path Towards Autonomous Machine Intelligence. » Position paper, 2022. https://openreview.net/forum?id=BZ5a1r-kVsf

S'abonner

Recevez de nouveaux articles sur les systèmes, l'infrastructure et l'ingénierie IA.