Эффективный фронтенд открытых моделей: поиск оптимального баланса в 2026 году

«Оптимальный размер открытых LLM в 2026 году: около 30 млрд параметров».

Содержимое страницы

В сентябре 2026 года эффективная граница открытых моделей находится в диапазоне от 25 до 34 миллиардов параметров: агентская работа уровня, близкого к передовому, на одном GPU с 24 ГБ памяти, за малую долю стоимости оборудования класса 70B.

Этот диапазон проявляется не в лозунгах о количестве параметров, а в реальных развертываниях. Публичные рейтинги, запуски на одном GPU и ежемесячные счета за API сходятся на моделях, которые сохраняют инструменты и функции, близкие к передовым, при этом веса и KVS-кэш (ключ-значение) помещаются в оборудование, которое можно арендовать или купить.

Эффективная граница открытых моделей в 2026 году: кривая возможностей с отмеченной «сладкой точкой» и одним GPU на заднем плане

Эта страница является центром принятия решений для этого выбора в рамках кластера Производительность LLM. Мы переходим от небольших инструктивных моделей к плотным весам класса 70B, а затем останавливаемся на двух архитектурах, определяющих текущую границу: Qwen3.8-27B, которая комфортно размещается на одной карте с 24 ГБ, и Llama 4 Scout, вычисления которой выглядят скромно лишь потому, что большинство экспертов остаются в режиме простоя. Таблицы токенов в секунду находятся на страницах с бенчмарками, связанных из каждого раздела.

К концу чтения вы должны будете понимать, какой размер протестировать в первую очередь, сколько VRAM действительно занимают веса и кэш, как арендованная RTX 4090 соотносится с текущими ценами на токены Claude Sonnet, и когда более крупная модель все еще является верным выбором.

Почему публичные бенчмарки завышают передачу в производство

Модель может находиться в пределах пары пунктов от передовой API-модели на MMLU или HumanEval и все равно проваливаться на задаче, которую вы разрабатываете. Многоступенчатые потоки инструментов теряют второй вызов инструмента, калибровка отказов смещается к избыточным отказам на запросах, близких к медицинской теме, а P99 задержки под пиковой нагрузкой удваивается. Разрыв в рейтингах казался маленьким, потому что эти бенчмарки измеряют возможности на фиксированном наборе промптов. Они не измеряют передачу на ваши инструменты, ваши документы и ваш бюджет по задержкам.

Эффективная граница — это набор моделей, которые выдерживают вашу загрузку при стоимости, которую вы можете продолжать оплачивать. Для этого нужно парное сравнение на задачах, близких к производственным, с записью трех сигналов на протяжении всего процесса: успешность вызовов инструментов, поведение при отказах и P99 задержка. Репортаж Future AGI о подмене моделей передового уровня дешевыми делает тот же самый вывод со стороны оценки: небольшой разрыв в публичных бенчмарках не дает права на замену моделей.

Рассматривайте приведенные ниже оценки как карту, с которой следует начинать испытательные испытания. Они датированы сентябрем 2026 года, и несколько ключевых показателей по кодированию являются результатами работы вендоров, а не независимыми.

Где на самом деле находятся модели 8B, 30B и 70B

На нижнем уровне 8B-инструктивная модель выполнит короткую явную инструкцию и напишет небольшую функцию. Но попросите ее отладить падающий CI-пайплайн в нескольких сервисах, восстановиться, если первый вызов инструмента вернет ошибку, и сохранить план intact (нетронутым/целым), — и запуск распадется. Это сбой в рабочих нагрузках, а не в рейтинге.

Середина диапазона — это то место, где универсальная агентская работа в настоящее время проходит на одном профессиональном (проsumer) GPU. Qwen3.8-27B — эталонная плотная модель. Архитектуры в том же диапазоне размеров, включая MoE класса Qwen 30B, сравниваемые в прямом противостоянии Qwen3 30B против GPT-OSS 20B, — это те, которые следует протестировать, прежде чем тратить деньги на что-то более крупное.

На верхнем уровне плотная модель 70B в квантовании 4-bit занимает порядка 35–40 ГБ весов до добавления KVS-кэша. Она не помещается на карту с 24 ГБ. Вы выходите на GPU с 48 ГБ, центральную серверную карту с 80 ГБ или разбиение на два GPU, и дополнительное качество по сравнению с хорошо настроенной моделью 27B часто является маргинальным для агентов кодирования, конвейеров документов и ботов поддержки. Закрытые передовые API, такие как Claude Opus, находятся в совершенно другом бюджете: вы платите за токен и вообще не храните веса.

Прежде чем выбирать контрольную точку (чекпоинт), подтвердите карту и свободную память. Веса модели — лишь часть занимаемого пространства. Контекст (KVS-кэш) располагается поверх этого.

# Название GPU и свободная VRAM перед выбором кванта
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# после загрузки: убедитесь, что процесс остался на GPU
nvidia-smi

Если слои выгружаются в CPU, пропускная способность генерации обваливается. Вы можете увидеть разделение в memory.used на GPU и в журнале выгрузки рантайма. О том, что на самом деле обеспечивают плотные чекпоинты и MoE на карте с 16 ГБ, измерения находятся в бенчмарках llama.cpp для 16 ГБ VRAM и сравнении Ollama на 16 ГБ RTX 4080. Эти страницы отвечают за таблицы скорости. Здесь нужно только решение о совместимости.

Qwen3.8-27B: эталонная точка для 24 ГБ

Qwen3.8-27B от Alibaba — это плотная модель, а не смесь экспертов (MoE). В Artificial Analysis она набирает около 51 балла по Agentic Index (округленная цифра; исходное значение 50.9) и около 52 баллов по Intelligence Index при максимальных усилиях по рассуждениям. Это разные замеры. Agentic Index — это использование инструментов и многоступенчатые задачи. Intelligence Index — более широкая смесь возможностей. Практический бенч от MindStudio характеризует агентский балл как немного уступающий Kimi K2, значительно более крупной модели MoE. Разбор от Qubrid стоит прочитать рядом с этим: отрыв от следующей модели меньше пункта, и собственный показатель SWE-bench Pro у Qwen в 61.7 не был воспроизведен как независимый запуск. Интересный результат — форма оценок. Модель 27B необычно хорошо превращает компактный бюджет в планирование и использование инструментов, но она не лидирует в широком наборе знаний.

Архитектура — причина, по которой длинный контекст является доступным. Из 64 слоев только 16 используют полное внимание (full attention). Другие 48 — это слои Gated DeltaNet, дизайн линейного внимания из линии работ Gated Delta Networks, и они поддерживают фиксированное рекуррентное состояние вместо истории ключ/значение для каждого токена. При FP16 слои полного внимания стоят около 64 КБ KVS-кэша на токен. Конвенциональный стек с тем же количеством слоев кэшировал бы примерно в четыре раза больше. Таблица квантов от Locally Uncensored показывает веса Q4_K_M в 17.1 ГБ и IQ4_XS в 15.7 ГБ. Замеры llama.cpp от Hardware Corner на GPU с 24 ГБ показали около 18 ГБ при коротком контексте и около 22 ГБ при 64K, что является практической целью для RTX 4090. Карта с 16 ГБ может удержать квант веса класса IQ4 и почти никакого контекста. Если это ваша машина, оставайтесь на запусках Qwen 3.5 и 3.6, уже измеренных на 16 ГБ, включая Qwen 3.6 27B MTP против стандартного декодирования. Как спланировать сам кэш, рассматривается в KVS-кэше на GPU с 16 ГБ.

Практические отчеты, среди них от MindStudio, также обнаруживают, что модель пригодна для кодирования, анализа изображений и циклов агентов, что является той частью, которую невозможно показать по одному индексу. Зрение добавляет небольшой файл проектора поверх текстовых весов. Спланируйте это, если рабочая нагрузка включает скриншоты.

Llama 4 Scout: активные параметры — это не VRAM

Llama 4 Scout от Meta — это другой тип эффективности. Карты моделей Llama 4 указывают 17 миллиардов активных параметров и 109 миллиардов суммарно, с 16 экспертами, нативным вводом изображений и окном контекста в 10 миллионов токенов. Пост Meta о запуске говорит, что INT4 чекпоинт помещается на один H100. Вычисления декодирования отслеживают 17B, которые активируются для каждого токена. Память — нет. Каждый эксперт все равно должен быть резидентным, поэтому счет за VRAM выглядит как у модели класса 100B, даже если FLOPs выглядят как у модели 17B.

Это поправка, которую стоит внести, прежде чем планировать бюджет на машину. Scout не «работает как модель 3B». Активные параметры задают скорость. Резидентные параметры задают, может ли карта удержать веса. На GPU с 24 ГБ модель, которая помещается, — это Qwen3.8-27B. Scout — это модель, которая имеет смысл, когда у вас уже есть карта с 80 ГБ, и вы хотите вычисления класса 17B с гораздо большим пулом экспертов и очень длинным контекстом.

Статья от июня 2025 года, Могу ли MoE превзойти плотные LLM при строго равных ресурсах?, утверждает, что MoE может победить плотную модель, если сравнение удерживает общие вычисления и данные фиксированными, а уровень активации находится в рабочем диапазоне. Практическое прочтение уже заголовка. MoE побеждает по стоимости только после того, как вы оплатили память, которая хранит простаивающих экспертов. Если вы уже обслуживаете модель этого размера и хотите больше токенов в секунду без изменения весов, спекулятивное декодирование — это смежная техника: черновой путь предлагает токены, а основная модель их проверяет.

Phi-4: исключение для небольших моделей в математике

Phi-4 от Microsoft — это плотная модель 14B. В техническом отчете от декабря 2024 года, technical report, simple-evals оценивает ее в 80.4 по MATH, опережая показатель GPT-4o в той же таблице, с окном контекста, которое в отчете расширяется до 16K. Квант Q4_K_M обычно выполняется примерно в 8 ГБ. Это настоящая эффективность, и она узкая. Phi-4 была обучена для ответа на вопросы STEM. Это модель, которую стоит попробовать, если задача — математика или короткое техническое рассуждение, а машина небольшая. Это не 2026 год по умолчанию для многоинструментальных агентов, длинных документов или зрения. Граница для этой работы все еще находится в диапазоне 25–34B выше, или это Scout, если GPU — это карта класса H100.

Часы аренды GPU для self-hosting против цен API за токен

Цены меняются. Это цифры на середину сентября 2026 года, и они не останутся неизменными в 2027 году.

GPU Finder, проверенный 18 сентября 2026 года, показал RTX 4090 в наличии по цене около $0.26 за GPU-час на Vast, с RunPod community cloud, указанным по $0.34. Шестимесячный минимум наспрос для одного 4090 находился между $0.11 и $0.60. При $0.34 и 730 часах в месяце карта, работающая весь месяц, стоит около $248 без учета налогов, хранения и исходящего трафика. При цене в наличии $0.26 тот же месяц стоит около $190. Предыдущее плановое значение $0.53 в час находится внутри этого шестимесячного диапазона, но оно завышает то, что фактически запрашивали на рынке акций во второй половине сентября.

Со стороны API, примечания к ценам Sonnet 5 от Anthropic указывают $2 за миллион входных токенов и $10 за миллион выходных. Sonnet 4.6 остается на уровне $3 и $15. Тарифная сетка BenchLM, обновленная 3 сентября 2026 года, показывает то же разделение. Рабочая нагрузка в 100 миллионов входных и 10 миллионов выходных токенов стоит $300 на Sonnet 5 и $450 на Sonnet 4.6.

Поставьте это рядом с арендованным 4090 на весь месяц за $248, и этот пример не говорит «self-hosting всегда дешевле». Он говорит, что два счета встречаются в том же районе для этого объема. Sonnet 5 при соотношении вход/выход 10:1 стоит $30 за 10 миллионов входных и 1 миллион выходных. Аренда за $248 покрывает около восьми таких блоков: примерно 80 миллионов входных и 8 миллионов выходных токенов. Выше этого арендованная карта выходит в лидеры, при условии, что вы можете сохранять ее загруженной. Ниже этого API — более дешевая линия, и вы не платите за простаивающий GPU. Собственное оборудование заменяет аренду электроэнергией и амортизацией. Стратегии вокруг этого счета — планирование бюджета, кэширование и резервные варианты — находятся в оптимизация затрат для LLM-систем. Причиной того, почему более низкая цена за токен все еще может быть неправильной архитектурой, является гравитация данных и зависимость от API.

Когда более крупная модель все еще является верным решением

Диапазон 25–34B — это значение по умолчанию для производственных рабочих нагрузок, которые повторяются: агенты кодирования, боты поддержки, обработка документов, извлечение и автоматизация. Это неправильное значение по умолчанию в нескольких ситуациях.

  • Передовое рассуждение над проблемами, в которых более маленькая модель уже провалилась в парном тесте.
  • Проза, где разница в голосе является продуктом, а объем достаточно мал, чтобы цена за токен была шумом.
  • Работа, требующая широкого охвата нескольких специализированных областей одновременно, где модель 27B постоянно упускает один и тот же класс фактов.
  • Решения низкого объема и высокой важности, где стоимость неправильного ответа превышает год аренды модели.

В этих случаях переходите к открытой модели класса 70B или передовому API и сохраняйте те же три производственных сигнала. Если более крупная модель не двигает успешность вызовов инструментов, отказы или P99 в направлении, которое вас волнует, то дополнительный размер не покупает ничего, чем вы можете воспользоваться.

Как выбрать точку на границе

Используйте этот порядок. Дешевле обнаружить, что модель 27B достаточно, чем обнаружить, что карта на 80 ГБ была не нужна.

  1. Начинайте от рабочей нагрузки, а не от самых больших открытых весов, которые вы можете скачать. Одноразовые инструкции и математика могут начинаться с 8–14B. Многоступенчатое использование инструментов начинается с Qwen3.8-27B, если у вас есть 24 ГБ, или с лучшим квантом на 16 ГБ, который вы уже измерили, если нет.
  2. Разделяйте активные параметры и резидентные параметры. Показатель 17B активный у Scout — это заявление о вычислениях. Сумма 109B — это заявление о VRAM. Планируйте бюджет по второму числу.
  3. Квантуйте, а затем перепроверяйте память. Q4_K_M для Qwen3.8-27B — это разговор на 24 ГБ, с контекстом около 64K, прежде чем карта заполнится. Запустите nvidia-smi после загрузки, при длине контекста, которую вы будете фактически обслуживать.
  4. Оценивайте месяц, а не токен. Сравнивайте 730 часов арендованного GPU со смесью входных и выходных данных, которую вы уже фиксируете. Если вы ниже точки безубыточности выше, оставайтесь на API, пока объем не достигнет нужного уровня.
  5. Решайте на собственных задачах. Парный запуск, фиксирующий успешность вызовов инструментов, поведение при отказах и P99 при пиковых нагрузках, — это тест, который не могут заменить публичные бенчмарки.
flowchart TD A[Определите рабочую нагрузку] --> B{Многоступенчатое использование инструментов?} B -- Нет: одноразово или математика --> C[Начать с 8-14B] B -- Да --> D{Один GPU на 24 ГБ?} D -- Да --> E[Qwen3.8-27B около Q4, затем проверить KVS-кэш] D -- Нет: карта класса 80 ГБ --> F[Llama 4 Scout: 17B актив, 109B резидент] C --> G[Парный запуск на ваших задачах] E --> G F --> G G --> H{Вызовы инструментов, отказы и P99 проходят?} H -- Да --> I[Развернуть и поддерживать эти три сигнала] H -- Нет, объем низкий --> J[Веса класса 70B или передовое API] H -- Нет, объем высокий --> K[Следующий размер выше, затем пересчитать стоимость месяца]

Полезный вопрос в 2026 году: какие веса помещаются на карту, в контекст и в месячный счет, при этом все еще проходя ваши собственные задачи. Для многих агентских задач этой точкой является гибридная модель 27B на одном GPU с 24 ГБ. Scout — это та же идея при памяти дата-центра: меньше вычислений на токен, чем предполагает общее количество параметров, и никакой скидки на VRAM.

Ссылки

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.