A Fronteira Eficiente dos Modelos Abertos: Encontrando o Ponto Ideal em 2026

O ponto ideal para LLMs abertos em 2026: cerca de 30B.

Conteúdo da página

Em setembro de 2026, a fronteira eficiente dos modelos abertos situa-se entre 25B e 34B parâmetros: trabalho agêntico próximo da fronteira em uma única GPU de 24 GB, com uma fração do hardware de classe 70B.

Essa faixa aparece nas implantações, não em um slogan sobre contagem de parâmetros. Classificações públicas, execuções em uma única GPU e faturas mensais de API convergem para modelos que permanecem próximos ao uso de ferramentas da fronteira, enquanto os pesos e o cache de KV ainda cabem em hardware que você pode alugar ou possuir.

A fronteira eficiente dos modelos abertos em 2026: uma curva de capacidade com o ponto ideal marcado e uma única GPU ao fundo

Esta página é o centro de decisão para essa escolha, dentro do cluster de desempenho de LLMs. Ela percorre desde modelos instruct pequenos até pesos densos de classe 70B, para então parar nas duas arquiteturas que definem a fronteira neste momento: Qwen3.8-27B, que é confortável em um cartão de 24 GB, e Llama 4 Scout, cujo cálculo parece modesto apenas porque a maioria de seus especialistas permanece ociosa. As tabelas de tokens por segundo permanecem nas páginas de benchmark vinculadas de cada seção.

Ao final, você deve saber qual tamanho testar primeiro, quanto VRAM os pesos e o cache realmente consomem, como uma RTX 4090 alugada se compara com os preços atuais de tokens do Claude Sonnet e quando um modelo maior ainda é a escolha certa.

Por que benchmarks públicos superestimam a transferência para produção

Um modelo pode ficar a poucos pontos de um modelo de API de fronteira no MMLU ou HumanEval e ainda assim falhar na tarefa que você está entregando. Fluxos multi-ferramenta perdem a segunda chamada de ferramenta, a calibração de recusa desvia para excesso de recusa em consultas próximas a medicina, e a latência P99 sob carga de pico dobra. A lacuna na classificação parecia pequena porque aqueles benchmarks medem capacidade em um conjunto fixo de prompts. Eles não medem a transferência para as suas ferramentas, os seus documentos e o seu orçamento de latência.

A fronteira eficiente é o conjunto de modelos que se mantêm no seu fluxo de trabalho a um custo que você pode continuar pagando. Isso requer uma comparação pareada em tarefas semelhantes à produção, com três sinais registrados durante todo o processo: sucesso da chamada de ferramenta, comportamento de recusa e latência P99. A análise da Future AGI sobre substituição por fronteira barata faz o mesmo ponto do lado da avaliação: uma pequena lacuna em benchmark público não é uma licença para trocar de modelos.

Trate as pontuações abaixo como um mapa de onde começar a comparação direta. Elas são datadas de setembro de 2026, e vários números de destaque em codificação são executados pelo fornecedor e não de forma independente.

Onde 8B, 30B e 70B realmente se situam

Na extremidade baixa, um modelo instruct de classe 8B seguirá uma instrução curta e explícita e escreverá uma pequena função. Peça-lhe para depurar um pipeline de CI falho em vários serviços, recuperar-se quando a primeira chamada de ferramenta retorna um erro e manter o plano intacto, e a execução desmorona. Isso é uma falha no fluxo de trabalho, não uma falha na classificação.

O meio da faixa é onde o trabalho agêntico de uso geral atualmente supera uma única GPU prosumer. O Qwen3.8-27B é o modelo denso de referência. Arquiteturas na mesma faixa de tamanho, incluindo o MoE de classe 30B da Qwen comparado de frente a frente em Qwen3 30B vs GPT-OSS 20B, são os que devem ser testados antes de gastar em algo maior.

Na extremidade alta, um modelo denso de 70B em 4-bit está na ordem de 35–40 GB de pesos antes de qualquer cache de KV. Ele não cabe em um cartão de 24 GB. Você entra em uma GPU de 48 GB, um cartão de data center de 80 GB, ou uma divisão de duas GPUs, e a qualidade extra sobre um modelo 27B bem ajustado é frequentemente marginal em agentes de codificação, pipelines de documentos e bots de suporte. APIs de fronteira fechadas, como Claude Opus, estão em um orçamento completamente diferente: você paga por token e não carrega os pesos.

Antes de escolher um checkpoint, confirme o cartão e a memória livre. Os pesos do modelo são apenas parte da pegada. O contexto (o cache de KV) fica por cima.

# Nome da GPU e VRAM livre antes de escolher uma quantização
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# após carregar: confirmar que o processo permaneceu na GPU
nvidia-smi

Se as camadas transbordarem para a CPU, a taxa de geração colapsa. Você pode ver a divisão em memory.used na GPU e no log de offload do runtime. Para o que checkpoints densos e MoE realmente entregam em um cartão de 16 GB, as medições estão nos benchmarks llama.cpp de VRAM de 16 GB e na comparação de Ollama em uma RTX 4080 de 16 GB. Essas páginas possuem as tabelas de velocidade. Esta página apenas precisa da decisão de encaixe.

Qwen3.8-27B: o ponto de referência de 24 GB

O Qwen3.8-27B da Alibaba é um modelo denso, não uma mistura de especialistas. No Artificial Analysis, ele pontua cerca de 51 no Agentic Index (o número arredondado; o valor subjacente é 50.9) e cerca de 52 no Intelligence Index no máximo esforço de raciocínio. Essas são medições diferentes. O Agentic Index é uso de ferramentas e tarefas multi-etapas. O Intelligence Index é uma mistura mais ampla de capacidades. O bench prático da MindStudio enquadra a pontuação agêntica como logo atrás do Kimi K2, um modelo muito maior de mistura de especialistas. A análise da Qubrid é a que deve ser lida ao lado: a margem sobre o próximo modelo é inferior a um ponto, e o número da própria Qwen no SWE-bench Pro de 61.7 não foi reproduzido como uma execução independente. O resultado interessante é a forma das pontuações. Um modelo de 27B converte um orçamento compacto em planejamento e uso de ferramentas de forma incomum, mas não lidera um conjunto amplo de conhecimento.

A arquitetura é a razão pela qual o contexto longo é acessível. De 64 camadas, apenas 16 usam atenção completa. As outras 48 são camadas Gated DeltaNet, um design de atenção linear da linha de trabalho Gated Delta Networks, e mantêm um estado recorrente fixo em vez de um histórico de chave/valor por token. Em FP16, as camadas de atenção completa custam cerca de 64 KB de cache de KV por token. Uma pilha convencional com a mesma contagem de camadas armazenaria aproximadamente quatro vezes isso. A tabela de quantização da Locally Uncensored coloca os pesos Q4_K_M em 17,1 GB e IQ4_XS em 15,7 GB. As medições da Hardware Corner com llama.cpp em uma GPU de 24 GB atingiram perto de 18 GB em contexto curto e cerca de 22 GB em 64K, que é o alvo prático em uma RTX 4090. Um cartão de 16 GB pode conter uma quantização de classe IQ4 dos pesos e quase nenhum contexto. Se essa é a sua máquina, fique com as execuções da Qwen 3.5 e 3.6 já medidas em 16 GB, incluindo Qwen 3.6 27B MTP versus decodificação padrão. Como orçar o cache em si é coberto em Cache de KV em GPUs de 16 GB.

Relatos práticos, entre eles o da MindStudio, também encontram o modelo utilizável para codificação, análise de imagem e loops de agentes, que é a parte que um único índice não pode mostrar. Visão adiciona um pequeno arquivo de projetor por cima dos pesos de texto. Planeje para isso se o fluxo de trabalho incluir capturas de tela.

Llama 4 Scout: parâmetros ativos não são VRAM

O Llama 4 Scout da Meta é um tipo diferente de eficiência. A ficha do modelo Llama 4 lista 17 bilhões de parâmetros ativos e 109 bilhões no total, com 16 especialistas, entrada nativa de imagem e uma janela de contexto de 10 milhões de tokens. O post de lançamento da Meta diz que o checkpoint INT4 cabe em uma única H100. O cálculo de decodificação acompanha os 17B que disparam para cada token. A memória não. Cada especialista ainda precisa estar residente, então a fatura de VRAM parece a de um modelo de classe 100B, mesmo que os FLOPs pareçam os de um modelo de 17B.

Essa é a correção que vale a pena fazer antes de orçar uma máquina. O Scout não “executa como um modelo de 3B”. Parâmetros ativos definem a velocidade. Parâmetros residentes definem se o cartão pode conter os pesos. Em uma GPU de 24 GB, o Qwen3.8-27B é o modelo que cabe. O Scout é o modelo que faz sentido uma vez que você já tem um cartão de 80 GB e deseja cálculo de classe 17B com um pool de especialistas muito maior e um contexto muito longo.

Um artigo de junho de 2025, Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?, argumenta que MoE pode superar um modelo denso quando a comparação mantém o cálculo total e os dados fixos e a taxa de ativação está em uma faixa viável. A leitura prática é mais estreita que o destaque. MoE vence em custo apenas depois que você pagou pela memória que armazena os especialistas ociosos. Se você já está servindo um modelo deste tamanho e deseja mais tokens por segundo sem mudar os pesos, a decodificação especulativa é a técnica vizinha: um caminho de rascunho propõe tokens e o modelo principal os verifica.

Phi-4: a exceção de modelo pequeno para matemática

O Phi-4 da Microsoft é um modelo denso de 14B. No relatório técnico de dezembro de 2024, o simple-evals pontua-o com 80,4 em MATH, à frente do número do GPT-4o na mesma tabela, com uma janela de contexto que o relatório estende para 16K. Uma quantização Q4_K_M é comumente executada em cerca de 8 GB. Isso é eficiência real, e é estreita. O Phi-4 foi treinado para perguntas e respostas STEM. É o modelo a tentar quando a tarefa é matemática ou raciocínio técnico curto e a máquina é pequena. Não é o padrão de 2026 para agentes multi-ferramenta, documentos longos ou visão. A fronteira para esse trabalho ainda é a faixa de 25–34B acima, ou o Scout quando a GPU é um cartão de classe H100.

Horas de GPU auto-hospedadas versus preços de API por token

Os preços mudam. Estas são cifras de meados de setembro de 2026, e elas não sobreviverão inalteradas até 2027.

O GPU Finder, verificado em 18 de setembro de 2026, mostrou uma RTX 4090 em estoque a cerca de US$ 0,26 por hora de GPU na Vast, com a nuvem comunitária RunPod listada a US$ 0,34. O piso de demanda de seis meses para uma única 4090 estava entre US$ 0,11 e US$ 0,60. A US$ 0,34 e 730 horas em um mês, um cartão que fica ligado o mês todo é cerca de US$ 248 antes de imposto, armazenamento e saída de tráfego. À cotação em estoque de US$ 0,26, o mesmo mês é cerca de US$ 190. Uma cifra de planejamento anterior de US$ 0,53 por hora está dentro dessa faixa de seis meses, mas ela superestima o que o estoque do mercado estava realmente pedindo na segunda metade de setembro.

No lado da API, as notas de preço do Sonnet 5 da Anthropic listam US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. O Sonnet 4.6 permanece em US$ 3 e US$ 15. A tabela de preços da BenchLM, atualizada em 3 de setembro de 2026, mostra a mesma divisão. Um fluxo de trabalho de 100 milhões de tokens de entrada e 10 milhões de tokens de saída é US$ 300 no Sonnet 5 e US$ 450 no Sonnet 4.6.

Colocado ao lado de uma 4090 alugada o mês todo a US$ 248, esse exemplo não diz “auto-hospedagem é sempre mais barata”. Ele diz que as duas faturas se encontram na mesma vizinhança para esse volume. Sonnet 5 com uma proporção de entrada para saída de 10:1 custa US$ 30 por 10 milhões de entradas mais 1 milhão de saídas. O aluguel de US$ 248 cobre cerca de oito desses blocos: aproximadamente 80 milhões de tokens de entrada e 8 milhões de tokens de saída. Acima disso, o cartão alugado ganha vantagem, desde que você possa mantê-lo ocupado. Abaixo disso, a API é a linha mais barata, e você não está pagando por uma GPU ociosa. Hardware próprio substitui o aluguel por eletricidade e depreciação. As estratégias em torno dessa fatura — orçamento, cache e alternativas — estão em otimização de custos para sistemas de LLM. A razão pela qual um preço de token mais baixo ainda pode ser a arquitetura errada é gravidade de dados e lock-in de API.

Quando um modelo maior ainda é a escolha certa

A faixa de 25–34B é o padrão para fluxos de trabalho de produção que se repetem: agentes de codificação, bots de suporte, processamento de documentos, extração e automação. É o padrão errado em algumas situações.

  • Raciocínio de fronteira em problemas que o modelo menor já falhou em um teste pareado.
  • Prosa onde a diferença na voz é o produto, e o volume é baixo o suficiente para que o preço do token seja ruído.
  • Trabalho que precisa de ampla cobertura em vários domínios especializados ao mesmo tempo, onde o modelo 27B continua errando a mesma classe de fato.
  • Decisões de baixo volume e alto risco, onde o custo de uma resposta errada excede um ano de aluguel de modelo.

Nesses casos, suba para um modelo aberto de classe 70B ou uma API de fronteira, e mantenha os mesmos três sinais de produção. Se o modelo maior não mover o sucesso da chamada de ferramenta, recusas ou P99 na direção que importa para você, o tamanho extra não está comprando nada que você possa usar.

Como escolher um ponto na fronteira

Use esta ordem. É mais barato descobrir que um modelo de 27B é suficiente do que descobrir que um cartão de 80 GB não era necessário.

  1. Comece do fluxo de trabalho, não dos maiores pesos abertos que você pode baixar. Instruções de tiro único e matemática podem começar em 8–14B. Uso de ferramentas multi-etapas começa no Qwen3.8-27B se você tem 24 GB, ou na melhor quantização de 16 GB que você já mediu se não tem.
  2. Separe parâmetros ativos de parâmetros residentes. O número de 17B ativos do Scout é uma afirmação de cálculo. O total de 109B é a afirmação de VRAM. Orçamente o segundo número.
  3. Quantize, depois confira a memória novamente. O Q4_K_M do Qwen3.8-27B é uma conversa de 24 GB, com cerca de 64K de contexto antes de o cartão encher. Execute nvidia-smi após o carregamento, no comprimento de contexto que você realmente vai servir.
  4. Preço o mês, não o token. Compare 730 horas da GPU que você alugaria com a mistura de entrada e saída que você já registra. Se você está abaixo do ponto de equilíbrio acima, fique na API até que o volume chegue.
  5. Decida com base nas suas próprias tarefas. Uma execução pareada que registra sucesso da chamada de ferramenta, comportamento de recusa e P99 sob carga de pico é o teste que os benchmarks públicos não podem substituir.
flowchart TD A[Definir o fluxo de trabalho] --> B{Uso de ferramentas multi-etapas?} B -- Não: tiro único ou matemática --> C[Começar em 8-14B] B -- Sim --> D{Uma GPU de 24 GB?} D -- Sim --> E[Qwen3.8-27B perto de Q4, depois verificar cache de KV] D -- Não: cartão de classe 80 GB --> F[Llama 4 Scout: 17B ativos, 109B residentes] C --> G[Execução pareada nas suas tarefas] E --> G F --> G G --> H{Chamadas de ferramenta, recusas e P99 passam?} H -- Sim --> I[Implantar e manter esses três sinais] H -- Não, volume é baixo --> J[Pesos de classe 70B ou uma API de fronteira] H -- Não, volume é alto --> K[Tamanho acima, depois reprecificar o mês]

A pergunta útil em 2026 é quais pesos cabem no cartão, no contexto e na fatura mensal, ao mesmo tempo em que ainda superam as suas próprias tarefas. Para muito trabalho agêntico, esse ponto é um modelo híbrido de 27B em uma única GPU de 24 GB. O Scout é a mesma ideia na memória de data center: menos cálculo por token do que o total de parâmetros sugere, e nenhum desconto na VRAM.

Referências

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

Subscrever

Receba novos artigos sobre sistemas, infraestrutura e engenharia de IA.