Что после LLM? Mamba, диффузия и модели мира
Что последует после LLM? Эпоха посттрансформеров.
Хайп вокруг ИИ следует определённому ритму: примерно раз в три года архитектура, на которую все делают ставку, уступает место чему-то более новому. Следующий сдвиг уже формируется в исследовательских лабораториях.
Далее следует обзор самых сильных кандидатов на замену трансформерам и доказательств того, что этот переход уже начался. Паттерн повторяется: доминирующая архитектура, «стена», за которую она не может масштабироваться, и новый дизайн, который обходит эту стену.

В этой статье мы рассмотрим четыре ограничения, сжимающие трансформеры, три альтернативные архитектуры и то, что гибридные системы, уже внедрённые в production-среде, говорят нам о будущем. Цель — практичный взгляд для инженеров, которые принимают архитектурные решения для 2027 года и далее. Это не прогноз рынка, а лишь текущее состояние доказательств на 2026 год.
Паттерн: трёхлетний цикл прорывов в ИИ
Каждые несколько лет центр тяжести в ИИ смещается:
Трансформеры заменяют
RNN и CNN"] --> B["2020-2022
Диффузионные модели берут
на себя генерацию изображений"] B --> C["2022
LLM становятся доступными
всем (GPT-3, ChatGPT)"] C --> D["2026-2028
Гибридные пост-трансформерные
системы в production"]
Трансформеры появились примерно в 2017 году и сделали RNN и CNN похожими на рудименты. Затем диффузионные модели захватили рынок генерации изображений в период с 2020 по 2022 год. А LLM прорвались во все сферы начиная с 2022 года, благодаря GPT-3 и ChatGPT.
По этому паттерну, мы должны подходить к следующему сдвигу. Он уже происходит — просто не там, где вы этого ожидаете. Не в социальных сетях и не в пресс-релизах, а в исследовательских лабораториях.
Ян Лекан в течение 2025 года настаивал на том, что авторегрессионные LLM фундаментально ограничены. «Нам нужны модели мира, а не предсказатели слов», — говорил он на конференции за конференцией. Тем временем его команда опубликовала серию работ по архитектуре совместных вложений (Joint Embedding Predictive Architecture, JEPA) — сначала для изображений, затем для видео, а в сентябре 2025 года — для языка.
Подтверждающие доказательства за последние двенадцать месяцев необычно конкретны:
- Модели пространств состояний, такие как Mamba, обрабатывают контексты в миллионы токенов с линейным масштабированием — то, что трансформеры не могут делать из-за квадратичного механизма внимания.
- Google анонсировала Gemini Diffusion, обещая генерацию текста в 10 раз быстрее.
- NVIDIA выпустила Nemotron 3 со встроенными слоями Mamba-2.
- Китайская модель Qwen3.5 была запущена в эксплуатацию, используя Gated DeltaNets.
- В декабре 2025 года вышла VL-JEPA — мультимодальная модель «зрение-язык» с вдвое меньшим количеством параметров, чем у конкурентов, которая при этом показала лучшие результаты.
Почему трансформеры упираются в потолок
Трансформеры невероятно эффективны в том, что делают. Но существуют четыре проблемы, которые никакое масштабирование не способно решить.
Квадратичное внимание ломается на длинном контексте
Самовнимание означает, что каждый токен взаимодействует со всеми остальными токенами — сложность O(n²). Удвойте контекст, и вы четверносите вычисления. При 10 миллионах токенов математика просто рушится. Можно применить больше GPU, но вы боретесь с базовыми арифметическими законами.
Исчерпываются данные для обучения
LLM обучаются на интернет-текстах, и к 2026 году большая их часть уже была собрана. Книги, Wikipedia, Reddit, GitHub — всё потреблено. Синтетические данные звучат как решение, пока вы не поймёте, что модели, обученные на тексте, сгенерированном ИИ, деградируют от поколения к поколению: они усваивают артефакты и смещения самого процесса генерации. Законы масштабирования, которые двигали всё с 2020 по 2024 год, сталкиваются с убывающей отдачей.
Энергия и стоимость — жёсткий потолок
Стоимость обучения передовых моделей сейчас составляет десятки или сотни миллионов долларов. Обслуживание миллиардов запросов ежедневно потребляет огромные вычислительные мощности. ЦОД для ИИ требуют гигаватты энергии, и генеративные мощности становятся узким местом. Сэм Альтман в 2024 году признал, что стоимость вычислений ограничивает всё — и с тех пор ситуация не изменилась.
Если ограничение связано с энергией, ответ может исходить от модели или от кремниевой основы. Мои заметки о оптимизации стоимости для LLM-систем и о специализированных чипах для инференса LLM охватывают каждую сторону этого компромисса.
Совпадение паттернов — это не понимание
LLM — это масштабированные механизмы сопоставления паттернов, предсказывающие следующий токен на основе тренировочных данных. Они превосходны в этом, но это не рассуждение и не понимание причинно-следственных связей в физическом мире. Если вам нужен ИИ, способный планировать, симулировать или действительно адаптироваться к новым средам, предсказание токенов вас не приведёт к цели.
Модели пространств состояний: линейное масштабирование со сжатой памятью
Модели пространств состояний (SSM), такие как Mamba и Gated DeltaNet, применяют совершенно другой подход к последовательностям. Вместо внимания ко всем предыдущим токенам они поддерживают сжатое внутреннее состояние, резюмирующее историю, — линейное масштабирование O(n) вместо квадратичного, с постоянной памятью на токен при инференсе, независимо от длины последовательности.
Механизм, лежащий в основе этой эффективности, заслуживает понимания, так как он объясняет как скорость, так и компромисс. Классические модели пространств состояний (семейство S4) были неизменными во времени: одна и та же фиксированная матрица переходов применялась на каждом шаге, что было быстрым, но не позволяло определить, что один токен важнее другого. Вклад Mamba состоял в том, чтобы сделать эти параметры перехода селективными — функциями от текущего входа, — чтобы модель могла динамически выбирать, что сохранять в её сжатом состоянии, а что отбрасывать, подобно тому, как softmax внимания решает, чему придавать важность, но без материализации матрицы оценок O(n²). Чтобы сохранить этот селективный рекуррент быстрый, Mamba выполняет его как параллельный скан с учётом особенностей оборудования: ассоциативная операция вычисляется в SRAM GPU, а не в цикле от токена к токену, что является тем же видом низкоуровневой инженерии ядра, что и FlashAttention для трансформеров. Mamba-2 пошла дальше с «двойственностью пространств состояний», показав, что селективная SSM и ограниченная форма линейного внимания вычисляют одну и ту же базовую операцию, — позволяя ядрам SSM использовать оборудование матричного умножения, для оптимизации которого созданы GPU.
Настоящим производственным прорывом здесь стал Gated DeltaNet, улучшение Mamba2, использующее дельта-правило для лучшей работы с длинным контекстом. Qwen3.5 adopted его как базовую архитектуру в феврале 2026 года и получила сильные результаты в агентных задачах и бенчмарках программирования, используя только 3 миллиарда активных параметров в своей гибридной конфигурации MoE. Это впечатляющая эффективность, и мой бенчмарк llama.cpp для Qwen 3.6 MTP против стандартного декодирования на GPU 16 ГБ даёт представление о том, как модели Qwen ведут себя на потребительском железе.
Компромисс является структурным, а не просто артефактом обучения: поскольку SSM сжимает всю историю в состояние фиксированного размера, она может потерять детализацию, которую трансформеры сохраняют, делая каждый прошедший токен индивидуально адресованным через внимание. Если вам нужно точное копирование или цитирование, трансформеры всё ещё побеждают. Для большинства практических задач — суммаризация, агентное использование инструментов, рассуждения над длинными документами, где важна суть, а не побуквенное воспроизведение, — прирост эффективности того стоит.
Диффузионные языковые модели: множество токенов за один проход
Диффузионные языковые модели применяют ту же технику, которая трансформировала генерацию изображений, к тексту. Вместо генерации одного токена за раз они могут производить несколько токенов параллельно во время каждого прямого прохода.
Nemotron-Labs-Diffusion от NVIDIA, выпущенная в мае 2026 года, достигла почти 6-кратного увеличения токенов за прямой проход по сравнению с Qwen3-8B, сохраняя конкурентоспособную точность в бенчмарках, включая HumanEval, GSM8K и Math500. Это модель трёх режимов, объединяющая авторегрессионное, диффузионное и само-спекулятивное декодирование. Gemini Diffusion от Google обещает ещё больший прирост скорости.
Ловушка заключается в балансе качества и скорости. Авторегрессионные модели оптимизируют локальную связность на каждом шаге — наиболее вероятный следующий токен. Диффузионные модели оптимизируют глобально весь вывод, что может улучшить общую структуру, но иногда жертвует детализацией. Для творческого письма или мозгового штурма диффузия может быть лучше. Для точного технического вывода авторегрессия всё ещё побеждает.
Важно отделить это от трюков на этапе инференса. Спекулятивное декодирование уже обеспечивает несколько токенов за прямой проход за счёт черновиков и верификации, без изменения распределения вывода. Диффузия переносит параллельную генерацию токенов из слоя инференса в саму архитектуру модели — это структурно иная ставка.
Мировые модели и JEPA: предсказание смысла, а не токенов
Мировые модели, в частности архитектура JEPA Яна Лекана, принимают самый радикальный подход. Вместо предсказания следующего токена они предсказывают следующее латентное вложение — сжатое представление того, что должно пойти дальше. Это ближе к тому, как работает человеческое когнитивное мышление: мы не предсказываем отдельные слова, мы предсказываем смысл.
Архитектурное отличие от обоих — трансформеров и диффузионных моделей — отсутствие декодера. Генеративная модель — будь то авторегрессионная или диффузионная — должна реконструировать свою цель в исходном пространстве: точные пиксели, точные токены. Это заставляет модель тратить ёмкость на моделирование непредсказуемого поверхностного шума: точную формулировку предложения, точное значение пикселя листа на ветру. Потеря JEPA работает полностью внутри пространства обученных представлений, сравнивая предсказанное вложение с целевым вложением, произведённым отдельным, медленно обновляемым энкодером. Ничего никогда не декодируется обратно в сырой вывод во время обучения. Это позволяет предсказателю отбросить шум и оставить только структурную, значимую для задачи часть сигнала — что, не случайно, является той частью, которая полезна для планирования: агент может симулировать «что произойдёт, если я сделаю X», продвигаясь вперёд в латентном пространстве, не платя стоимость рендеринга полного изображения или генерации полного текста для каждой гипотезы.
VL-JEPA достигла производительности, сопоставимой с устоявшимися мультимодальными моделями, используя лишь 1,6 миллиарда параметров против 7 миллиардов или более у конкурентов. Она сокращает операции декодирования примерно в 2,85 раза, одновременно улучшая точность при визуальном ответе на вопросы. Что более важно, архитектуры JEPA спроектированы для непрерывного обучения — они строят внутренние модели того, как работает окружение, а не просто статистические паттерны в тексте.
Ограничение состоит в том, что JEPA всё ещё находится в стадии развития для чисто языковых задач: LLM-JEPA существует, но пока не догнала крупные авторегрессионные или диффузионные модели в стандартных бенчмарках, и JEPA не является готовой заменой для чат-бота — это субстрат обучения представлений и планирования, который дополняет языковые модели, а не конкурирует с ними напрямую. Однако для воплощённого ИИ и робототехники, где понимание физической причинности важнее, чем генерация беглой прозы, JEPA может стать правильной архитектурой с самого начала.
Что делают производственные системы: гибридные архитектуры
Самые интересные разработки комбинируют элементы из нескольких архитектур. Jamba от AI21 Labs чередует слои внимания трансформера со слоями пространственного состояния Mamba — внимание для длинных зависимостей, SSM для эффективной локальной обработки. Qwen3.5 комбинирует Gated DeltaNet с Mixture of Experts, активируя только релевантные экспертные сети для каждого входа. Облачные провайдеры уже предлагают модели на базе Mamba — Codestral Mamba от Mistral стала первым open-source релизом на базе Mamba-2, — а обзор провайдеров LLM в облаке отслеживает, что и где доступно.
Разные задачи имеют разные требования:
- Генерация кода может выиграть от параллельной генерации токенов диффузией.
- Анализ длинных документов требует линейного масштабирования SSM.
- Творческое письмо может использовать внимание трансформера для связности.
Одна архитектура не решит всё. Та же логика, которая лежит в основе проектирования систем с несколькими моделями — правильный механизм для правильной задачи, — теперь появляется внутри самих моделей.
Если вы строите ИИ-приложения и проектируете систему под 2027 или 2028 год, не инвестируйте чрезмерно в чисто трансформерные решения. Рассмотрите, могут ли компоненты SSM или диффузии лучше служить вашей задаче. Экосистема смещается, и ранние adopters будут иметь преимущество.
Стоит отслеживать два дополнительных следствия. Результаты Qwen3.5 с активными 3 миллиардами параметров предполагают, что специализированные, эффективные архитектуры будут превосходить более крупные универсальные модели во многих задачах — что может демократизировать внедрение ИИ и сделать высокопроизводительные модели доступными на потребительском железе. А диффузионные языковые модели могут сократить задержки на порядок для определенных рабочих нагрузок; приложения, требующие реакции в реальном времени — разговорные агенты, живой перевод, интерактивные инструменты, — выиграют больше всего.
Куда всё движется: эра после трансформеров
Следуя трёхлетнему циклу, я ожидаю первые производственные внедрения нетрансформерных архитектур к 2027–2028 годам. Скорее всего, это будут гибридные системы, использующие внимание трансформера там, где это необходимо, но применяющие SSM или диффузию для повышения эффективности.
Фаза консолидации, в которой мы находимся сейчас — где лаборатории доказывают, что LLM могут рассуждать и действовать, — сменяется более сложным вызовом: сделать эти системы эффективными, адаптивными и осведомленными о пространстве. Это требует прорывов в области непрерывного обучения, мировых моделей и архитектурной эффективности. Каждый из них решает фундаментальные ограничения, которые чистое масштабирование не в силах преодолеть.
Следующая большая вещь не будет больше по моделям. Она будет умнее по архитектурам, достигающими большего меньшими средствами, — моделями, которые понимают, а не просто предсказывают, которые адаптируются, а не просто обрабатывают. Именно это приходит после LLM. Не одна новая архитектура, а поколение специализированных, эффективных систем, которые наконец выходят за рамки совпадения паттернов к истинному пониманию.
Ссылки
- Adaline Labs. “Пейзаж исследований ИИ в 2026 году: От агентного ИИ к воплощению.” https://labs.adaline.ai/p/the-ai-research-landscape-in-2026
- Aftab, A. “Конец LLM, как мы их знаем: почему 2026 год знаменует начало следующей архитектурной революции ИИ.” Medium, 2025. https://medium.com/@aftab001x/the-end-of-llms-as-we-know-them-why-2026-marks-the-beginning-of-ais-next-architecture-revolution-902ee29484f7
- Greengard, S. “За пределами LLM: возникает пост-трансформерный мир.” Communications of the ACM, май 2026. https://cacm.acm.org/news/beyond-llms-a-post-transformer-world-emerges
- NVIDIA. “Nemotron-Labs-Diffusion: Языковая модель трёх режимов, объединяющая авторегрессионное, диффузионное и само-спекулятивное декодирование.” arXiv:2607.05722, 2026. https://arxiv.org/html/2607.05722v1
- MarkTechPost. “NVIDIA AI выпускает Nemotron-Labs-Diffusion: Языковую модель трёх режимов с 6× токенов за прямой проход по сравнению с Qwen3-8B.” 20 мая 2026. https://www.marktechpost.com/2026/05/20/nvidia-ai-releases-nemotron-labs-diffusion-a-tri-mode-language-model-with-6x-tokens-per-forward-over-qwen3-8b
- Chen, D. et al. “VL-JEPA: Архитектура совместных вложений (Joint Embedding Predictive Architecture) для «зрение-язык».” arXiv:2512.10942, 2025. https://arxiv.org/pdf/2512.10942
- OpenReview. “VL-JEPA: Архитектура совместных вложений (Joint Embedding Predictive Architecture) для «зрение-язык».” https://openreview.net/forum?id=tjimrqc2BU
- NVIDIA Research. “Gated Delta Networks: Improvement of Mamba2 using Delta Rule.” ICLR 2025. https://research.nvidia.com/publication/2025-04_gated-delta-networks-improving-mamba2-delta-rule
- Laon People. “Почему Qwen3.5 выбрал Gated DeltaNet?” Февраль 2026. https://laonpeople.com/en/blog/why-did-qwen3-5-choose-gated-deltanet
- Google DeepMind. “Gemini Diffusion.” https://deepmind.google/models/gemini-diffusion
- Vicentino, C. “Авторегрессионные и Masked Diffusion языковые модели: контролируемое сравнение.” arXiv:2603.22075, март 2026. https://www.alphaxiv.org/abs/2603.22075
- Блог JetBrains AI. “Почему диффузионные модели могут изменить рабочие процессы разработчиков в 2026 году.” Ноябрь 2025. https://blog.jetbrains.com/ai/2025/11/why-diffusion-models-could-change-developer-workflows-in-2026
- Блог Spheron. “Mamba-3 и модели пространств состояний на GPU в облаке: Развертывание инференса SSM как альтернативы трансформерам (Гид 2026).” https://www.spheron.network/blog/mamba-3-state-space-model-gpu-cloud-deployment
- Gartner. “Gartner прогнозирует, что 40% корпоративных приложений будут включать в себя ИИ-агентов, специфичных для задач, к 2026 году.” 26 августа 2025. https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025
- Reddit r/deeplearning. “Следуя 3-летнему циклу прорывов ИИ.” https://www.reddit.com/r/deeplearning/comments/1k8gdwg/following_a_3year_ai_breakthrough_cycle
- Gu, A., Dao, T. “Mamba: Линейное моделирование последовательностей с селективными пространствами состояний.” arXiv:2312.00752, 2023. https://doi.org/10.48550/arxiv.2312.00752
- Dao, T., Gu, A. “Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality (Mamba-2).” arXiv:2405.21060, 2024. https://arxiv.org/abs/2405.21060
- Блог Meta AI. “Первая ИИ-модель, основанная на видении Яна Лекана более человекоподобного ИИ (I-JEPA).” https://ai.meta.com/blog/yann-lecun-ai-model-i-jepa/
- LeCun, Y. “Путь к автономному машинному интеллекту.” Позиционная статья, 2022. https://openreview.net/forum?id=BZ5a1r-kVsf