«El frente eficiente de los modelos abiertos: encontrar el punto óptimo en 2026»

«El punto óptimo de 2026 para los LLM abiertos: alrededor de 30 B.»

Índice

En septiembre de 2026, la frontera eficiente de los modelos abiertos se sitúa entre 25B y 34B parámetros: trabajo agéntico cercano a la frontera en una sola GPU de 24 GB, con una fracción del hardware de la clase 70B.

Esa franja se manifiesta en las implementaciones, no en un eslogan sobre el recuento de parámetros. Los marcadores de posición públicos, las ejecuciones en una sola GPU y las facturas mensuales de la API convergen en modelos que se mantienen cerca de la frontera en el uso de herramientas, mientras que los pesos y la caché KV todavía caben en hardware que se puede alquilar o comprar.

La frontera eficiente de los modelos abiertos en 2026: una curva de capacidad con el punto óptimo marcado, y una sola GPU detrás de ella

Esta página es el centro de decisiones para esa elección, dentro del clúster de rendimiento de LLM. Recorre desde modelos de instrucción pequeños hasta pesos densos de clase 70B, y luego se detiene en las dos arquitecturas que definen la frontera en este momento: Qwen3.8-27B, que es cómodo en una tarjeta de 24 GB, y Llama 4 Scout, cuyo cómputo parece modesto solo porque la mayoría de sus expertos permanecen inactivos. Las tablas de tokens por segundo se mantienen en las páginas de benchmarks vinculadas desde cada sección.

Al finalizar, debería saber qué tamaño probar primero, cuánta VRAM consumen realmente los pesos y la caché, cómo se compara una RTX 4090 alquilada con los precios de tokens actuales de Claude Sonnet, y cuándo un modelo más grande sigue siendo la decisión correcta.

Por qué los benchmarks públicos sobreestiman la transferencia a producción

Un modelo puede ubicarse dentro de un par de puntos de un modelo de frontera de API en MMLU o HumanEval y aun así fallar en la tarea que está implementando. Los flujos de múltiples herramientas pierden la segunda llamada a la herramienta, la calibración de rechazo se desvía hacia el sobre-rechazo en consultas vecinas a lo médico, y la latencia P99 bajo carga en ráfaga se duplica. La diferencia en el marcador de posición parecía pequeña porque esos benchmarks miden la capacidad en un conjunto fijo de prompts. No miden la transferencia a sus herramientas, sus documentos y su presupuesto de latencia.

La frontera eficiente es el conjunto de modelos que se sostienen en su carga de trabajo a un costo que puede seguir pagando. Eso requiere una comparación emparejada en tareas similares a la producción, registrando tres señales durante todo el proceso: éxito en las llamadas a herramientas, comportamiento de rechazo y latencia P99. La publicación de Future AGI sobre la sustitución de fronteras económicas hace el mismo punto desde el lado de la evaluación: una pequeña diferencia en benchmarks públicos no es una licencia para cambiar modelos.

Trate las puntuaciones a continuación como un mapa de dónde comenzar la competencia. Están fechadas en septiembre de 2026, y varios números destacados de codificación son ejecutados por el proveedor en lugar de ser independientes.

Dónde se ubican realmente el 8B, el 30B y el 70B

En el extremo bajo, un modelo de instrucción de clase 8B seguirá una instrucción corta y explícita y escribirá una función pequeña. Pídale depurar una tubería de CI que falla en varios servicios, recuperarse cuando la primera llamada a la herramienta devuelve un error y mantener el plan intacto, y la ejecución se desmorona. Ese es un fallo de la carga de trabajo, no un fallo en el marcador de posición.

El medio del rango es donde el trabajo agéntico de uso general actualmente supera una sola GPU de consumo profesional. Qwen3.8-27B es el modelo denso de referencia. Las arquitecturas en la misma banda de tamaño, incluido el MoE de clase Qwen 30B comparado en la comparativa directa Qwen3 30B vs GPT-OSS 20B, son las que debe probar antes de gastar en algo más grande.

En el extremo alto, un modelo denso de 70B a 4 bits está en el orden de 35–40 GB de pesos antes de cualquier caché KV. No cabe en una tarjeta de 24 GB. Está entrando en una GPU de 48 GB, una tarjeta de centro de datos de 80 GB, o una división entre dos GPUs, y la calidad adicional sobre un modelo 27B bien ajustado a menudo es marginal en agentes de codificación, tuberías de documentos y bots de soporte. Las APIs de frontera cerradas como Claude Opus se sitúan en un presupuesto completamente diferente: paga por token y no lleva los pesos en absoluto.

Antes de elegir un checkpoint, confirme la tarjeta y la memoria libre. Los pesos del modelo son solo parte de la huella. El contexto (la caché KV) se sitúa encima.

# Nombre de la GPU y VRAM libre antes de elegir una cuantización
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# después de cargar: confirme que el proceso se mantuvo en la GPU
nvidia-smi

Si las capas se derraman a la CPU, el rendimiento de generación colapsa. Puede ver la división en memory.used en la GPU y en el registro de descarga de la plataforma de ejecución. Para saber qué entregan realmente los checkpoints densos y MoE en una tarjeta de 16 GB, las mediciones están en los benchmarks de llama.cpp con 16 GB de VRAM y la comparación de Ollama en una RTX 4080 de 16 GB. Esas páginas poseen las tablas de velocidad. Esta solo necesita la decisión de ajuste.

Qwen3.8-27B: el punto de referencia de 24 GB

El Qwen3.8-27B de Alibaba es un modelo denso, no una mezcla de expertos. En Artificial Analysis obtiene una puntuación de aproximadamente 51 en el Índice Agéntico (la cifra redondeada; el valor subyacente es 50.9) y aproximadamente 52 en el Índice de Inteligencia con el esfuerzo de razonamiento máximo. Esas son mediciones diferentes. El Índice Agéntico es uso de herramientas y tareas de múltiples pasos. El Índice de Inteligencia es una mezcla más amplia de capacidad. El bench práctico de MindStudio enmarca la puntuación agéntica como justo detrás de Kimi K2, un modelo de mezcla de expertos vastamente mayor. La desglose de Qubrid es lo que debe leer junto a ella: el margen sobre el siguiente modelo es inferior a un punto, y la cifra de SWE-bench Pro de 61.7 de Qwen no se ha reproducido como una ejecución independiente. El resultado interesante es la forma de las puntuaciones. Un modelo de 27B convierte un presupuesto compacto en planificación y uso de herramientas de manera inusualmente bien, y no lidera un conjunto amplio de conocimiento.

La arquitectura es la razón por la que el contexto largo es asequible. De 64 capas, solo 16 usan atención completa. Las otras 48 son capas Gated DeltaNet, un diseño de atención lineal de la línea de trabajo de Gated Delta Networks, y mantienen un estado recurrente fijo en lugar de un historial de clave/valor por token. En FP16, las capas de atención completa cuestan aproximadamente 64 KB de caché KV por token. Una pila convencional con el mismo número de capas cachearía aproximadamente cuatro veces eso. La tabla de cuantización de Locally Uncensored sitúa los pesos Q4_K_M en 17.1 GB e IQ4_XS en 15.7 GB. Las mediciones de llama.cpp de Hardware Corner en una GPU de 24 GB llegaron a cerca de 18 GB en contexto corto y aproximadamente 22 GB en 64K, que es el objetivo práctico en una RTX 4090. Una tarjeta de 16 GB puede mantener una cuantización de clase IQ4 de los pesos y casi ningún contexto. Si esa es su máquina, manténgase con las ejecuciones de Qwen 3.5 y 3.6 ya medidas en 16 GB, incluido Qwen 3.6 27B MTP versus decodificación estándar. Cómo presupuestar la caché en sí está cubierto en Caché KV en GPUs de 16 GB.

Los informes prácticos, entre ellos el de MindStudio, también encuentran que el modelo es útil para codificación, análisis de imágenes y bucles de agentes, que es la parte que un solo índice no puede mostrar. La visión añade un pequeño archivo de proyectar encima de los pesos de texto. Planifique para ello si la carga de trabajo incluye capturas de pantalla.

Llama 4 Scout: los parámetros activos no son VRAM

El Llama 4 Scout de Meta es un tipo diferente de eficiencia. La ficha de modelo de Llama 4 lista 17 mil millones de parámetros activos y 109 mil millones en total, con 16 expertos, entrada de imagen nativa y una ventana de contexto de 10 millones de tokens. La publicación de lanzamiento de Meta dice que el checkpoint INT4 cabe en una sola H100. El cómputo de decodificación sigue los 17B que se activan para cada token. La memoria no. Cada experto todavía debe estar residente, por lo que la factura de VRAM parece la de un modelo de clase 100B aunque los FLOPs parezcan los de un modelo de 17B.

Esa es la corrección que vale la pena hacer antes de presupuestar una máquina. Scout no “funciona como un modelo de 3B”. Los parámetros activos establecen la velocidad. Los parámetros residentes establecen si la tarjeta puede contener los pesos. En una GPU de 24 GB, Qwen3.8-27B es el modelo que cabe. Scout es el modelo que tiene sentido una vez que ya tiene una tarjeta de 80 GB y quiere cómputo de clase 17B con un pool de expertos mucho mayor y un contexto muy largo.

Un papel de junio de 2025, ¿Puede la Mezcla de Expertos superar a los LLMs Densos con Recursos Estrictamente Iguales?, argumenta que MoE puede superar a un modelo denso cuando la comparación mantiene el cómputo total y los datos fijos y la tasa de activación se sitúa en una banda viable. La lectura práctica es más estrecha que el titular. MoE gana en costo solo después de que haya pagado por la memoria que almacena a los expertos inactivos. Si ya está sirviendo un modelo de este tamaño y quiere más tokens por segundo sin cambiar los pesos, la decodificación especulativa es la técnica vecina: un camino de borrador propone tokens y el modelo principal los verifica.

Phi-4: la excepción del modelo pequeño para matemáticas

El Phi-4 de Microsoft es un modelo denso de 14B. En el informe técnico de diciembre de 2024, simple-evals lo puntúa en 80.4 en MATH, por delante de la cifra de GPT-4o en la misma tabla, con una ventana de contexto que el informe extiende a 16K. Una cuantización Q4_K_M se ejecuta comúnmente en aproximadamente 8 GB. Esa es eficiencia real, y es estrecha. Phi-4 fue entrenado para preguntas y respuestas STEM. Es el modelo a probar cuando el trabajo es matemáticas o razonamiento técnico corto y la máquina es pequeña. No es el predeterminado de 2026 para agentes de múltiples herramientas, documentos largos o visión. La frontera para ese trabajo sigue siendo la banda de 25–34B mencionada arriba, o Scout cuando la GPU es una tarjeta de clase H100.

Horas de GPU autoalojadas versus precios de API por token

Los precios cambian. Estas son cifras de mediados de septiembre de 2026, y no sobrevivirán sin cambios hasta 2027.

GPU Finder, verificado el 18 de septiembre de 2026, mostró una RTX 4090 en stock a aproximadamente $0.26 por hora de GPU en Vast, con la nube comunitaria de RunPod listada a $0.34. El piso de demanda de seis meses para una sola 4090 se situó entre $0.11 y $0.60. A $0.34 y 730 horas en un mes, una tarjeta que se mantiene encendida todo el mes es de aproximadamente $248 antes de impuestos, almacenamiento y salida. A la cotización en stock de $0.26, el mismo mes es de aproximadamente $190. Una cifra de planificación anterior de $0.53 por hora está dentro de ese rango de seis meses, pero sobreestima lo que el inventario del mercado estaba pidiendo realmente en la segunda mitad de septiembre.

En el lado de la API, las notas de precios de Sonnet 5 de Anthropic listan $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Sonnet 4.6 se mantiene en $3 y $15. La tarifa de BenchLM, actualizada el 3 de septiembre de 2026, muestra la misma división. Una carga de trabajo de 100 millones de tokens de entrada y 10 millones de tokens de salida es de $300 en Sonnet 5 y $450 en Sonnet 4.6.

Puesto junto a una 4090 alquilada todo el mes por $248, ese ejemplo no dice “autoalojar siempre es más barato”. Dice que las dos facturas se encuentran en el mismo vecindario para este volumen. Sonnet 5 en una proporción de entrada a salida de 10:1 cuesta $30 por 10 millones de entrada más 1 millón de salida. El alquiler de $248 cubre aproximadamente ocho de esos bloques: aproximadamente 80 millones de tokens de entrada y 8 millones de tokens de salida. Por encima de eso, la tarjeta alquilada saca ventaja, siempre que pueda mantenerla ocupada. Por debajo, la API es la línea más barata, y no está pagando por una GPU inactiva. El hardware propio reemplaza el alquiler con electricidad y depreciación. Las estrategias alrededor de esa factura — presupuestación, caché y alternativas — están en optimización de costos para sistemas LLM. La razón por la que un precio de token más bajo puede ser aún la arquitectura equivocada es gravedad de los datos y bloqueo de API.

Cuándo un modelo más grande sigue siendo la decisión correcta

La banda de 25–34B es el predeterminado para cargas de trabajo de producción que se repiten: agentes de codificación, bots de soporte, procesamiento de documentos, extracción y automatización. Es el predeterminado equivocado en algunas situaciones.

  • Razonamiento de frontera en problemas en los que el modelo más pequeño ya ha fallado en una prueba emparejada.
  • Prosa donde la diferencia de voz es el producto, y el volumen es lo suficientemente bajo como para que el precio del token sea ruido.
  • Trabajo que necesita una amplia cobertura en varios dominios especializados a la vez, donde el modelo de 27B sigue fallando en la misma clase de hecho.
  • Decisiones de bajo volumen y alto riesgo, donde el costo de una respuesta incorrecta supera un año de alquiler del modelo.

En esos casos, suba a un modelo abierto de clase 70B o a una API de frontera, y mantenga las mismas tres señales de producción. Si el modelo más grande no mueve el éxito de las llamadas a herramientas, los rechazos o el P99 en la dirección que le importa, el tamaño extra no está comprando nada que pueda usar.

Cómo elegir un punto en la frontera

Use este orden. Es más barato descubrir que un modelo de 27B es suficiente que descubrir que una tarjeta de 80 GB era innecesaria.

  1. Comience desde la carga de trabajo, no desde los pesos abiertos más grandes que pueda descargar. Instrucciones de un solo disparo y matemáticas pueden comenzar en 8–14B. El uso de herramientas de múltiples pasos comienza en Qwen3.8-27B si tiene 24 GB, o en la mejor cuantización de 16 GB que ya haya medido si no.
  2. Separe los parámetros activos de los parámetros residentes. La cifra de 17B activos de Scout es una afirmación de cómputo. El total de 109B es la afirmación de VRAM. Presupueste el segundo número.
  3. Cuantice, luego vuelva a verificar la memoria. Q4_K_M de Qwen3.8-27B es una conversación de 24 GB, con aproximadamente 64K de contexto antes de que la tarjeta esté llena. Ejecute nvidia-smi después de la carga, en la longitud de contexto que realmente va a servir.
  4. Presupueste el mes, no el token. Compare 730 horas de la GPU que alquilaría con la mezcla de entrada y salida que ya registra. Si está por debajo del punto de equilibrio anterior, manténgase en la API hasta que llegue el volumen.
  5. Decida en sus propias tareas. Una ejecución emparejada que registre el éxito de llamadas a herramientas, el comportamiento de rechazo y el P99 bajo ráfaga es la prueba que los benchmarks públicos no pueden reemplazar.
flowchart TD A[Definir la carga de trabajo] --> B{¿Uso de herramientas de múltiples pasos?} B -- No: un solo disparo o matemáticas --> C[Comenzar en 8-14B] B -- Sí --> D{¿Una GPU de 24 GB?} D -- Sí --> E[Qwen3.8-27B cerca de Q4, luego verificar caché KV] D -- No: tarjeta de clase 80 GB --> F[Llama 4 Scout: 17B activos, 109B residentes] C --> G[Ejecución emparejada en sus tareas] E --> G F --> G G --> H{¿Las llamadas a herramientas, rechazos y P99 pasan?} H -- Sí --> I[Implementar y mantener esas tres señales] H -- No, volumen bajo --> J[ Pesos de clase 70B o una API de frontera] H -- No, volumen alto --> K[Próximo tamaño hacia arriba, luego volver a presupuestar el mes]

La pregunta útil en 2026 es qué pesos caben en la tarjeta, el contexto y la factura mensual mientras todavía superan sus propias tareas. Para mucha parte del trabajo agéntico, ese punto es un modelo híbrido de 27B en una sola GPU de 24 GB. Scout es la misma idea con memoria de centro de datos: menos cómputo por token de lo que sugiere el total de parámetros, y ningún descuento en la VRAM.

Referencias

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

Suscribirse

Recibe nuevas publicaciones sobre sistemas, infraestructura e ingeniería de IA.