¿Qué viene después de los LLM? Mamba, difusión y modelos del mundo
¿Qué sigue a los LLM? La era post-transformer.
La euforia por la IA sigue un ritmo: aproximadamente cada tres años, la arquitectura sobre la que todos apuestan es reemplazada por algo más nuevo. El próximo cambio ya se está formando en los laboratorios de investigación.
Lo que sigue es un recorrido por los candidatos más fuertes para reemplazar al transformer, y por las pruebas de que el cambio ya ha comenzado. El patrón se repite: una arquitectura dominante, un límite al que no puede escalar más allá, y un nuevo diseño que evade ese límite.

Este artículo analiza las cuatro limitaciones que cercan a los transformers, las tres arquitecturas alternativas y lo que nos dicen los sistemas híbridos ya en producción. El objetivo es una lectura práctica para ingenieros que deciden qué arquitecturar para 2027 y más allá; no se trata de un mercado de predicciones, sino simplemente de la evidencia tal como se presenta en 2026.
El patrón: el ciclo de tres años de breakthroughs de la IA
Cada pocos años, el centro de gravedad de la IA se desplaza:
Los Transformers reemplazan
RNNs y CNNs"] --> B["2020-2022
Los modelos de difusión toman
la generación de imágenes"] B --> C["2022
Los LLMs llegan a todos
(GPT-3, ChatGPT)"] C --> D["2026-2028
Sistemas híbridos pos-transformer
en producción"]
Los Transformers aparecieron alrededor de 2017 y hicieron que las RNNs y CNNs pareciesen reliquias. Luego, los modelos de difusión tomaron el control de la generación de imágenes entre 2020 y 2022. Y los LLMs explotaron en todos los ámbitos a partir de 2022 con GPT-3 y ChatGPT.
Según ese patrón, deberíamos estar acercándonos al próximo cambio. Ya está ocurriendo, solo que no donde esperarías. No en redes sociales ni en comunicados de prensa, sino en laboratorios de investigación.
Yann LeCun pasó 2025 argumentando que los LLMs autorregresivos son fundamentalmente limitados. «Necesitamos modelos del mundo, no predictores de palabras», dijo conferencia tras conferencia. Mientras tanto, su equipo publicó una serie de papers sobre la Joint Embedding Predictive Architecture (JEPA) — primero para imágenes, luego video, y después lenguaje en septiembre de 2025.
La evidencia de apoyo de los últimos doce meses es inusualmente concreta:
- Los modelos de espacio de estado como Mamba manejan contextos de millones de tokens con escalado lineal, algo que los transformers no pueden hacer debido a su mecanismo de atención cuadrática.
- Google anunció Gemini Diffusion, prometiendo generación de texto hasta 10 veces más rápida.
- NVIDIA lanzó Nemotron 3 con capas Mamba-2 integradas.
- El Qwen3.5 de China salió al mercado utilizando Gated DeltaNets.
- En diciembre de 2025, aterrizó VL-JEPA, un modelo de visión-lenguaje con la mitad de parámetros que sus competidores y que aun así rindió mejor.
Por qué los transformers están quedando sin camino
Los transformers son increíbles en lo que hacen. Pero cuatro problemas los están cercando que ninguna cantidad de escalado puede resolver.
La atención cuadrática falla en contextos largos
La autoatención significa que cada token habla con cada otro token — complejidad O(n²). Si duplicas tu contexto, cuadruplicas la computación. Con 10 millones de tokens, las matemáticas simplemente se rompen. Puedes meter más GPUs, pero estás luchando contra la aritmética básica.
Los datos de entrenamiento están agotándose
Los LLMs se entrenan con texto de internet, y para 2026 la mayor parte ha sido raspada (scrapeada). Libros, Wikipedia, Reddit, GitHub — todo consumido. Los datos sintéticos suenan a una solución hasta que te das cuenta de que los modelos entrenados con texto generado por IA se degradan a lo largo de generaciones: aprenden los artefactos y sesgos del propio proceso de generación. Las leyes de escalado que impulsaron todo desde 2020 hasta 2024 están alcanzando rendimientos decrecientes.
La energía y el costo son el límite duro
Los modelos de frontera ahora cuestan decenas o cientos de millones para entrenar. Servir miles de millones de solicitudes diarias consume una cantidad masiva de cómputo. Los centros de datos de IA necesitan gigavatios de energía, y la capacidad de generación de energía está convirtiéndose en un cuello de botella. Sam Altman admitió en 2024 que los costos de cómputo limitan todo — y eso no ha cambiado.
Si la restricción es la energía, la respuesta puede venir del lado del modelo o del lado del silicio. Mis notas sobre optimización de costos para sistemas LLM y sobre chips especializados de inferencia LLM cubren cada lado de ese intercambio.
La coincidencia de patrones no es comprensión
Los LLMs son coincididores de patrones a gran escala, prediciendo el siguiente token a partir de los datos de entrenamiento. Son excepcionales en eso, sí, pero no razonan, y no comprenden las relaciones causales en el mundo físico. Si quieres una IA que pueda planificar, simular o adaptarse genuinamente a nuevos entornos, la predicción de tokens no te llevará allí.
Modelos de espacio de estado: escalado lineal con memoria comprimida
Los modelos de espacio de estado (SSMs), como Mamba y Gated DeltaNet, adoptan un enfoque completamente diferente para las secuencias. En lugar de atender a todos los tokens anteriores, mantienen un estado interno comprimido que resume el historial — escalado lineal O(n) en lugar de cuadrático, con memoria constante por token durante la inferencia, sin importar cuánto se alargue la secuencia.
El mecanismo detrás de esa eficiencia merece ser comprendido, porque explica tanto la velocidad como el compromiso. Los modelos de espacio de estado clásicos (la familia S4) eran invariantes en el tiempo: la misma matriz de transición fija se aplicaba en cada paso, lo cual es rápido pero no puede decidir que un token importa más que otro. La contribución de Mamba fue hacer que esos parámetros de transición fueran selectivos — funciones de la entrada actual — para que el modelo pueda elegir dinámicamente qué retener en su estado comprimido y qué descartar, de manera similar a cómo el softmax de la atención decide qué enfatizar, pero sin materializar una matriz de puntuación O(n²). Para mantener esa recurrencia selectiva rápida, Mamba la ejecuta como un barrido paralelo consciente del hardware: una operación asociativa calculada en la SRAM de la GPU en lugar de un bucle token por token, lo cual es el mismo tipo de ingeniería de kernels de bajo nivel que FlashAttention hizo para los transformers. Mamba-2 llevó esto más allá con la «dualidad de espacio de estado», mostrando que un SSM selectivo y una forma restringida de atención lineal calculan la misma operación subyacente — permitiendo que los kernels de SSM reutilicen el hardware de multiplicación de matrices para el cual las GPUs están optimizadas.
El verdadero avance en producción aquí fue Gated DeltaNet, una mejora sobre Mamba2 que utiliza una regla delta para un mejor manejo de contextos largos. Qwen3.5 lo adoptó como su arquitectura central en febrero de 2026 y obtuvo resultados sólidos en tareas de agentes y benchmarks de codificación utilizando solo 3 mil millones de parámetros activos en su configuración híbrida MoE. Esa es una eficiencia impresionante, y mis [benchmarks de llama.cpp de Qwen 3.6 MTP frente a la decodificación estándar](https://www.glukhov.org/es/llm-performance/benchmarks/comparing-qwen-3-6-mtp-vs-standard/ “Qwen 3.6 MTP vs decodificación estándar en una GPU de 16GB: velocidad de tokens, costo de VRAM, ajustes”}) en una GPU de 16 GB dan una idea de cómo se comportan los modelos Qwen en hardware de consumo.
El compromiso es estructural, no solo un artefacto de entrenamiento: porque un SSM comprime todo el historial en un estado de tamaño fijo, puede perder detalles finos que los transformers preservan al mantener cada token pasado individualmente direccionable a través de la atención. Si necesitas copias exactas o citas, los transformers aún ganan. Para la mayoría de las cargas de trabajo prácticas — resumir, uso agéntico de herramientas, razonamiento sobre documentos largos donde la esencia importa más que la recuperación verbatim — la ganancia de eficiencia vale la pena.
Modelos de lenguaje de difusión: muchos tokens por pasada de adelante
Los modelos de lenguaje de difusión aplican la misma técnica que transformó la generación de imágenes al texto. En lugar de generar un token a la vez, pueden producir múltiples tokens en paralelo durante cada pasada de adelante.
Nemotron-Labs-Diffusion de NVIDIA, lanzado en mayo de 2026, logró casi 6x tokens por pasada de adelante en comparación con Qwen3-8B, manteniendo una precisión competitiva en benchmarks que incluyen HumanEval, GSM8K y Math500. Es un modelo de triple modo que unifica la decodificación autorregresiva, de difusión y de auto-especulación. Gemini Diffusion de Google promete aún más aceleración.
La trampa es la calidad versus la velocidad. Los modelos autorregresivos optimizan la coherencia local en cada paso — el siguiente token más probable. Los modelos de difusión optimizan globalmente a lo largo de toda la salida, lo cual puede mejorar la estructura general pero a veces sacrifica el detalle fino. Para escritura creativa o lluvia de ideas, la difusión podría ser mejor. Para salida técnica precisa, la autorregresión aún gana.
Vale la pena separar esto de los trucos de tiempo de inferencia. La decodificación especulativa ya entrega varios tokens por pasada de adelante mediante borrador y verificación, sin cambio en la distribución de salida. La difusión mueve la generación paralela de tokens de la capa de inferencia a la arquitectura del modelo misma — una apuesta estructuralmente diferente.
Modelos del mundo y JEPA: predecir significado, no tokens
Los modelos del mundo, específicamente la arquitectura JEPA de Yann LeCun, adoptan el enfoque más radical. En lugar de predecir el siguiente token, predicen el siguiente embedding latente — una representación comprimida de lo que debería venir después. Eso se acerca más a cómo funciona la cognición humana: no predecimos palabras individuales, predecimos significado.
La diferencia arquitectónica frente a ambos transformers y modelos de difusión es el decodificador ausente. Un modelo generativo — autorregresivo o de difusión — tiene que reconstruir su objetivo en el espacio original: píxeles exactos, tokens exactos. Eso obliga al modelo a gastar capacidad modelando ruido superficial impredecible: la formulación exacta de una frase, el valor exacto del píxel de una hoja en el viento. La función de pérdida de JEPA opera enteramente dentro de un espacio de representación aprendido en su lugar, comparando un embedding predicho contra un embedding objetivo producido por un codificador separado y actualizado lentamente. Nada se decodifica de vuelta a la salida cruda durante el entrenamiento. Esto permite al predictor descartar el ruido y mantener solo la parte estructural y relevante para la tarea de la señal — lo cual es también, no por casualidad, la parte que es útil para la planificación: un agente puede simular «qué sucede si hago X» avanzando en el espacio latente, sin pagar el costo de renderizar una imagen completa o generar texto completo para cada hipótesis.
VL-JEPA logró un rendimiento comparable a los modelos de visión-lenguaje establecidos con solo 1.6 mil millones de parámetros frente a 7 mil millones o más para los competidores. Reduce las operaciones de decodificación en aproximadamente 2.85x mientras mejora la precisión en la respuesta a preguntas visuales. Más importante aún, las arquitecturas JEPA están diseñadas para el aprendizaje continuo — construyen modelos internos de cómo funciona el entorno, no solo patrones estadísticos en el texto.
La limitación es que JEPA aún está madurando para tareas puras de lenguaje: LLM-JEPA existe pero aún no ha igualado a los modelos autorregresivos o de difusión grandes en benchmarks estándar, y JEPA no es un reemplazo directo para un chatbot — es un sustrato de aprendizaje de representaciones y planificación que complementa a los modelos de lenguaje más de lo que compite con ellos de frente. Para la IA encarnada y la robótica, sin embargo — donde comprender la causalidad física importa más que generar prosa fluida — JEPA podría ser la arquitectura correcta desde el principio.
Lo que hacen los sistemas de producción: arquitecturas híbridas
Los desarrollos más interesantes combinan elementos de múltiples arquitecturas. Jamba de AI21 Labs intercala capas de atención transformer con capas de espacio de estado Mamba — atención para dependencias de largo alcance, SSMs para procesamiento local eficiente. Qwen3.5 combina Gated DeltaNet con Mixture of Experts, activando solo las redes de expertos relevantes para cada entrada. Los proveedores de nube ya están listando modelos basados en Mamba — Codestral Mamba de Mistral fue el primer lanzamiento open-source de Mamba-2 — y el [resumen de proveedores de LLM en la nube](https://www.glukhov.org/es/llm-hosting/cloud/cloud-llm-providers/ “Proveedores de LLM en la nube: modelos, precios y capacidades a través de las APIs principales”}) rastrea qué está disponible dónde.
Diferentes tareas tienen diferentes requisitos:
- La generación de código podría beneficiarse de la generación paralela de tokens de la difusión.
- El análisis de documentos largos necesita el escalado lineal de un SSM.
- La escritura creativa podría usar la atención transformer para la coherencia.
Una sola arquitectura no resolverá todo. La misma lógica que impulsa el diseño de sistemas multimodelo — el mecanismo correcto para la tarea correcta — está apareciendo ahora dentro de los modelos mismos.
Si estás construyendo aplicaciones de IA y arquitecturando para 2027 o 2028, no inviertas de más en soluciones puras de transformers. Considera si componentes de SSM o difusión podrían servir mejor a tu caso de uso. El ecosistema está cambiando, y los adoptantes tempranos tendrán una ventaja.
Dos implicaciones adicionales merecen seguimiento. El rendimiento de Qwen3.5 con solo 3 mil millones de parámetros activos sugiere que las arquitecturas especializadas y eficientes superarán a los modelos generalistas más grandes en muchas tareas — lo cual podría democratizar la implementación de IA y hacer que los modelos de alto rendimiento sean accesibles en hardware de consumo. Y los modelos de lenguaje de difusión podrían reducir la latencia en un orden de magnitud para ciertas cargas de trabajo; las aplicaciones que requieren respuesta en tiempo real — agentes conversacionales, traducción en vivo, herramientas interactivas — se beneficiarán más.
Hacia dónde va esto: la era pos-transformer
Siguiendo el ciclo de tres años, me esperarían los primeros despliegues de producción de arquitecturas no-transformer para 2027–2028. Esos probablemente serán sistemas híbridos que aprovechen la atención transformer donde sea necesario pero usen SSMs o difusión para ganancias de eficiencia.
La fase de consolidación en la que estamos ahora — donde los laboratorios prueban que los LLMs pueden razonar y actuar — está dando paso a un desafío más difícil: hacer que estos sistemas sean eficientes, adaptables y espacialmente conscientes. Eso requiere breakthroughs en aprendizaje continuo, modelos del mundo y eficiencia arquitectónica. Cada uno aborda limitaciones fundamentales que el escalado puro no puede resolver.
La próxima gran cosa no serán modelos más grandes. Serán arquitecturas más inteligentes que logran más con menos — modelos que comprenden en lugar de solo predecir, que se adaptan en lugar de solo procesar. Eso es lo que viene después de los LLMs. No una sola nueva arquitectura, sino una generación de sistemas especializados y eficientes que finalmente se mueven más allá de la coincidencia de patrones hacia una comprensión genuina.
Referencias
- Adaline Labs. “The AI Research Landscape in 2026: From Agentic AI to Embodiment.” https://labs.adaline.ai/p/the-ai-research-landscape-in-2026
- Aftab, A. “The End of LLMs As We Know Them: Why 2026 Marks the Beginning of AI’s Next Architecture Revolution.” Medium, 2025. https://medium.com/@aftab001x/the-end-of-llms-as-we-know-them-why-2026-marks-the-beginning-of-ais-next-architecture-revolution-902ee29484f7
- Greengard, S. “Beyond LLMs: A Post-Transformer World Emerges.” Communications of the ACM, mayo de 2026. https://cacm.acm.org/news/beyond-llms-a-post-transformer-world-emerges
- NVIDIA. “Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding.” arXiv:2607.05722, 2026. https://arxiv.org/html/2607.05722v1
- MarkTechPost. “NVIDIA AI Releases Nemotron-Labs-Diffusion: A Tri-Mode Language Model with 6× Tokens Per Forward Over Qwen3-8B.” 20 de mayo de 2026. https://www.marktechpost.com/2026/05/20/nvidia-ai-releases-nemotron-labs-diffusion-a-tri-mode-language-model-with-6x-tokens-per-forward-over-qwen3-8b
- Chen, D. et al. “VL-JEPA: Joint Embedding Predictive Architecture for Vision-language.” arXiv:2512.10942, 2025. https://arxiv.org/pdf/2512.10942
- OpenReview. “VL-JEPA: Joint Embedding Predictive Architecture for Vision-language.” https://openreview.net/forum?id=tjimrqc2BU
- NVIDIA Research. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://research.nvidia.com/publication/2025-04_gated-delta-networks-improving-mamba2-delta-rule
- Laon People. “Why Did Qwen3.5 Choose Gated DeltaNet?” febrero de 2026. https://laonpeople.com/en/blog/why-did-qwen3-5-choose-gated-deltanet
- Google DeepMind. “Gemini Diffusion.” https://deepmind.google/models/gemini-diffusion
- Vicentino, C. “Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison.” arXiv:2603.22075, marzo de 2026. https://www.alphaxiv.org/abs/2603.22075
- JetBrains AI Blog. “Why Diffusion Models Could Change Developer Workflows in 2026.” noviembre de 2025. https://blog.jetbrains.com/ai/2025/11/why-diffusion-models-could-change-developer-workflows-in-2026
- Spheron Blog. “Mamba-3 and State Space Models on GPU Cloud: Deploy SSM Inference as the Transformer Alternative (2026 Guide).” https://www.spheron.network/blog/mamba-3-state-space-model-gpu-cloud-deployment
- Gartner. “Gartner Predicts 40 Percent of Enterprise Apps Will Feature Task-Specific AI Agents by 2026.” 26 de agosto de 2025. https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025
- Reddit r/deeplearning. “Following a 3-year AI breakthrough cycle.” https://www.reddit.com/r/deeplearning/comments/1k8gdwg/following_a_3year_ai_breakthrough_cycle
- Gu, A., Dao, T. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces.” arXiv:2312.00752, 2023. https://doi.org/10.48550/arxiv.2312.00752
- Dao, T., Gu, A. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality (Mamba-2).” arXiv:2405.21060, 2024. https://arxiv.org/abs/2405.21060
- Meta AI Blog. “The first AI model based on Yann LeCun’s vision for more human-like AI (I-JEPA).” https://ai.meta.com/blog/yann-lecun-ai-model-i-jepa/
- LeCun, Y. “A Path Towards Autonomous Machine Intelligence.” Position paper, 2022. https://openreview.net/forum?id=BZ5a1r-kVsf