Skuteczna granica otwartych modeli: poszukiwanie optymalnego punktu w 2026 roku

Idealny punkt otwartych LLM na 2026 rok: ok. 30 mld parametrów.

Page content

We wrześniu 2026 roku efektywna frontiera otwartych modeli znajduje się w zakresie od 25 do 34 miliardów parametrów: zadania agenticzne bliskie frontier na jednej karcie GPU o pamięci 24 GB, przy ułamku kosztów sprzętu klasy 70B.

Ta zakres manifestuje się w wdrożeniach, a nie w sloganach dotyczących liczby parametrów. Publiczne tabele wyników (leaderboardy), uruchomienia na pojedynczym GPU oraz miesięczne rachunki za API zbiegają się przy modelach, które pozostają blisko możliwości narzędziowych frontier, podczas gdy wagi i bufor KV mieszczą się w sprzęcie, który można wynająć lub posiadać.

Efektywna frontiera otwartych modeli w 2026 roku: krzywa możliwości z oznaczonym optymalnym punktem oraz pojedyncze GPU w tle

Ta strona jest hubem decyzyjnym dla tego wyboru, w ramach klasteru wydajność LLM. Przechodzi od małych modeli instruct do wag dense klasy 70B, a następnie zatrzymuje się przy dwóch architekturach, które definiują obecną frontierę: Qwen3.8-27B, które swobodnie mieści się na jednej karcie o pamięci 24 GB, oraz Llama 4 Scout, którego obliczenia wydają się skromne tylko dlatego, że większość jego ekspertów pozostaje nieaktywna. Tabele tokenów na sekundę znajdują się na stronach z benchmarkami, do których prowadzi odnośnik z każdej sekcji.

Na końcu powinieneś wiedzieć, jaki rozmiar przetestować w pierwszej kolejności, ile VRAM faktycznie zajmują wagi i bufor, jak wynajęta RTX 4090 porównuje się z bieżącymi cenami tokenów Claude Sonnet, oraz kiedy większy model wciąż jest właściwym wyborem.

Dlaczego publiczne benchmarky przeszacowują transfer w produkcji

Model może plasować się w odległości kilku punktów od modelu API klasy frontier w MMLU lub HumanEval i mimo to nie sprostać zadaniu, które wdrażasz. Przepływy wielonarzędziowe gubią drugi wywołanie narzędzia, kalibracja odmów (refusal) dryfuje w stronę nadmiernych odmów na zapytania o charakterze medycznym, a latencja P99 przy obciążeniu szczytowym podwaja się. Różnica w tabelach wyników wydawała się niewielka, ponieważ te benchmarki mierzą zdolności na stałym zestawie promptów. Nie mierzą transferu na Twoje narzędzia, Twoje dokumenty i Twój budżet latencji.

Efektywna frontiera to zbiór modeli, które utrzymują się na Twoim obciążeniu pracy przy kosztach, które możesz stale ponosić. Wymaga to porównania parowego na zadaniach przypominających produkcyjne, z rejestrowaniem trzech sygnałów przez cały czas: sukcesu wywołań narzędzi, zachowania odmowy oraz latencji P99. Artykuł Future AGI o substytucji niedrogą frontierą stawia ten sam punkt z perspektywy ewaluacji: niewielka różnica w publicznym benchmarku nie jest pozwoleniem na wymianę modeli.

Traktuj poniższe wyniki jako mapę, gdzie rozpocząć testy porównawcze. Są datowane na wrzesień 2026 roku, a kilka głównych wyników kodowych zostało wykonanych przez dostawców, a nie niezależnie.

Gdzie faktycznie znajdują się modele 8B, 30B i 70B

Na dolnym końcu, model instruct klasy 8B wykona krótką, wyraźną instrukcję i napisze małą funkcję. Poproś go o debugowanie nieudanej potoku CI w kilku serwisach, odzyskanie, gdy pierwsze wywołanie narzędzi zwróci błąd, i utrzymanie planu w nienaruszonym stanie, a uruchomienie się rozpadnie. To jest awaria obciążenia pracy, a nie awaria w tabeli wyników.

Środek zakresu to miejsce, gdzie ogólny prac agenticzny obecnie przechodzi przez pojedynczy GPU klasy prosumenckiej. Qwen3.8-27B to referencyjny model dense. Architektury w tym samym zakresie wagowym, w tym model MoE klasy Qwen 30B porównywany w test Qwen3 30B vs GPT-OSS 20B, to te, które należy przetestować, zanim wydajesz pieniądze na cokolwiek większego.

Na górnym końcu, model dense 70B w kwantyzacji 4-bitowej waży około 35–40 GB wag, zanim uwzględni się dowolny bufor KV. Nie mieści się na karcie 24 GB. Wchodzisz w obszar GPU 48 GB, karty datacenter 80 GB lub rozdziału na dwa GPU, a dodatkowa jakość w stosunku do dobrze dostrojonego modelu 27B jest często marginalna w przypadku agentów kodowania, potoków dokumentów i botów supportowych. Zamknięte API frontier, takie jak Claude Opus, znajdują się w zupełnie innym budżecie: płacisz za token i nie nosisz z sobą wag.

Przed wybraniem checkpointu potwierdź kartę i wolną pamięć. Wagi modelu to tylko część stopnia. Kontekst (bufor KV) nakłada się na nie.

# Nazwa GPU i wolna VRAM przed wyborem kwantyzacji
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# po załadowaniu: potwierdź, że proces pozostał na GPU
nvidia-smi

Jeśli warstwy wylądują na CPU, przepustowość generowania się załamie. Możesz zobaczyć ten rozdział w memory.used na GPU i w logu offload runtime’u. Co checkpointi dense i MoE faktycznie oferują na karcie 16 GB, znajdują się w benchmarkach llama.cpp na VRAM 16 GB i porównaniu Ollama na 16 GB RTX 4080. Te strony mają tabele szybkości. Ta potrzebuje tylko decyzji o dopasowaniu.

Qwen3.8-27B: punkt odniesienia dla 24 GB

Qwen3.8-27B od Alibaba to model dense, a nie mieszanka ekspertów (mixture of experts). W Artificial Analysis otrzymuje około 51 w Indeksie Agenticznym (zaokrąglona wartość; dokładna wartość to 50,9) i około 52 w Indeksie Intelektu przy maksymalnym wysiłku wnioskowania. To są różne pomiary. Indeks Agenticzny dotyczy używania narzędzi i zadań wieloetapowych. Indeks Intelektu to szersza mieszanka zdolności. Hands-on bench od MindStudio przedstawia wynik agenticzny jako tuż za Kimi K2, znacznie większym modelem typu mixture-of-experts. Rozbicie od Qubrid to ten, który należy przeczytać obok niego: margines ponad następnym modelem wynosi mniej niż punkt, a własna wartość Qwen SWE-bench Pro wynosząca 61,7 nie została odtworzona jako niezależne uruchomienie. Ciekawym wynikiem jest kształt wyników. Model 27B przekłada kompaktowy budżet na planowanie i użycie narzędzi w nietypowo dobry sposób, ale nie prowadzi w szerokim zestawie wiedzy.

Architektura to powód, dla którego długi kontekst jest opłacalny. Z 64 warstw tylko 16 używa pełnej uwagi (full attention). Pozostałe 48 to warstwy Gated DeltaNet, projekt linearna uwagi (linear-attention) z linii badań Gated Delta Networks, i utrzymują stały stan rekurencyjny zamiast historii key/value per token. Przy FP16 warstwy pełnej uwagi kosztują około 64 KB bufora KV na token. Konwencjonalny stos z taką samą liczbą warstw zbuforowałby około czterokrotnie więcej. Tabela kwantyzacji od Locally Uncensored podaje wagi Q4_K_M na 17,1 GB i IQ4_XS na 15,7 GB. Pomiarzy llama.cpp od Hardware Corner na GPU 24 GB wskazały na około 18 GB przy krótkim kontekście i około 22 GB przy 64K, co jest praktycznym celem na RTX 4090. Karta 16 GB może utrzymać kwantyzację klasy IQ4 wag i prawie żaden kontekst. Jeśli to Twoja maszyna, zostań przy uruchomieniach Qwen 3.5 i 3.6 już zmierzonych na 16 GB, w tym Qwen 3.6 27B MTP versus standard decoding. Jak budżetować sam bufor, omawia się w bufor KV na GPU 16 GB.

Raporty praktyczne, w tym od MindStudio, również stwierdzają, że model jest użyteczny do kodowania, analizy obrazów i pętli agentowych, co jest częścią, której pojedynczy indeks nie pokazuje. Wzrok dodaje mały plik projektora na wagi tekstowe. Zaplanuj to, jeśli obciążenie zawiera zrzuty ekranu.

Llama 4 Scout: aktywne parametry to nie VRAM

Llama 4 Scout od Meta to inny rodzaj efektywności. Karta modelu Llama 4 wymienia 17 miliardów aktywnych parametrów i 109 miliardów łącznie, z 16 ekspertami, natywnym wejściem obrazowym i oknem kontekstu 10 milionów tokenów. Post launchowy Meta mówi, że checkpoint INT4 mieści się na pojedynczym H100. Obliczenia dekodowania śledzą 17B, które są uruchamiane dla każdego tokena. Pamięć nie. Każdy ekspert musi być rezydentny, więc rachunek za VRAM wygląda jak model klasy 100B, nawet jeśli FLOPs wyglądają jak model 17B.

To jest korekta warta poczynienia, zanim zbudżetujesz maszynę. Scout nie „działa jak model 3B”. Aktywne parametry ustawiają szybkość. Parametry rezydentne ustawiają, czy karta może utrzymać wagi. Na GPU 24 GB, Qwen3.8-27B to model, który się mieści. Scout to model, który ma sens, gdy już masz kartę 80 GB i chcesz obliczeń klasy 17B z znacznie większą pulą ekspertów i bardzo długim kontekstem.

Papiér z czerwca 2025 r., Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?, argumentuje, że MoE może pokonać model dense, gdy porównanie utrzymuje całkowite obliczenia i dane jako stałe, a stopień aktywacji znajduje się w zadolnym zakresie. Praktyczne odczyty są węższe niż nagłówek. MoE wygrywa w kosztach dopiero po tym, jak zapłacisz za pamięć przechowującą nieaktywnych ekspertów. Jeśli już obsługujesz model tej wielkości i chcesz więcej tokenów na sekundę bez zmiany wag, speculative decoding jest sąsiednią techniką: ścieżka robocza proponuje tokeny, a model główny je weryfikuje.

Phi-4: wyjątek modeli małych dla matematyki

Microsoft Phi-4 to model dense 14B. W raporcie technicznym z grudnia 2024 r. technical report, simple-evals ocenia go na 80,4 w MATH, powyżej wartości GPT-4o w tej samej tabeli, z oknem kontekstu, które raport rozszerza do 16K. Kwantyzacja Q4_K_M jest powszechnie uruchamiana w około 8 GB. To jest realna efektywność, ale jest wąska. Phi-4 został wytrenowany dla pytań STEM. To jest model, który warto wypróbować, gdy zadaniem jest matematyka lub krótkie rozumowanie techniczne i maszyna jest mała. To nie jest domyślny wybór 2026 dla wielonarzędziowych agentów, długich dokumentów lub wzroku. Frontierą dla tych prac jest nadal zakres 25–34B powyżej, lub Scout, gdy GPU to karta klasy H100.

Samodzielne godziny GPU vs ceny API per token

Ceny się zmieniają. To są dane z połowy września 2026 i nie przetrwają bez zmian do 2027 roku.

GPU Finder, sprawdzony 18 września 2026, wykazał RTX 4090 w magazynie po około 0,26 $ za godzinę GPU na Vast, z RunPod community cloud na liście po 0,34 $. Dno cen on-demand dla pojedynczej 4090 w ciągu sześciu miesięcy znajdowało się między 0,11 $ a 0,60 $. Przy 0,34 $ i 730 godzinach w miesiącu, karta, która pracuje cały miesiąc, kosztuje około 248 $ przed podatkiem, przechowywaniem i transferem wyjściowym. Przy wycenie 0,26 $ za magazynowy stan ten sam miesiąc kosztuje około 190 $. Wcześniejsza wartość planistyczna 0,53 $ za godzinę mieści się w tym sześciomiesięcznym zakresie, ale przeszacowuje to, co stany magazynowe na rynku faktycznie kosztowały we wrześniu drugiej połowy.

Po stronie API, notatki cenowe Anthropic Sonnet 5 pricing notes wymieniają 2 $ za milion tokenów wejściowych i 10 $ za milion tokenów wyjściowych. Sonnet 4.6 pozostaje na 3 $ i 15 $. Karta stawek BenchLM, zaktualizowana 3 września 2026, pokazuje ten sam podział. Obciążenie 100 milionów tokenów wejściowych i 10 milionów tokenów wyjściowych kosztuje 300 $ w Sonnet 5 i 450 $ w Sonnet 4.6.

Postawione obok 4090 wynajętej cały miesiąc po 248 $, ten przykład nie mówi „self-hosting jest zawsze tańszy”. Mówi, że dwa rachunki spotykają się w tym samym sąsiedztwie dla tej ilości. Sonnet 5 przy proporcji wejście/wyjście 10:1 kosztuje 30 $ za 10 milionów tokenów wejściowych plus 1 milion wyjściowych. Wynajem za 248 $ pokrywa około osiem takich bloków: około 80 milionów tokenów wejściowych i 8 milionów wyjściowych. Powyżej tego poziomu, wynajęta karta wychodzi na prowadzenie, pod warunkiem, że potrafisz ją utrzymać zajęta. Poniżej, API jest tańszą linią, i nie płacisz za bezczynne GPU. Własny sprzęt zastępuje wynajem energią i amortyzacją. Strategie wokół tego rachunku — budżetowanie, cache i awaryjne — znajdują się w optymalizacja kosztów dla systemów LLM. Powód, dla niższa cena tokenu może nadal być błędną architekturą, to przyciąganie danych i zamknięcie w API.

Kiedy większy model jest nadal właściwym wyborem

Zakres 25–34B to domyślny wybór dla produkcyjnych obciążeń powtarzających się: agenci kodowania, boty supportowe, przetwarzanie dokumentów, ekstrakcja i automatyzacja. To jest błędny domyślny wybór w kilku sytuacjach.

  • Wnioskowanie frontierowe w problemach, w których mniejszy model już zawiodł w teście parowym.
  • Proza, gdzie różnica w tonie głosowym jest produktem, a wolumen jest na tyle niski, że cena tokena to szum.
  • Praca, która wymaga szerokiego pokrycia kilku dziedzin specjalistycznych jednocześnie, gdzie model 27B wciąż gubi tę samą klasę faktów.
  • Niskowolumenowe, wysokie stawki decyzje, gdzie koszt błędnej odpowiedzi przekracza rok wynajmu modelu.

W tych przypadkach, przejdź do otwartego modelu klasy 70B lub API frontier, i zachowaj te same trzy sygnały produkcyjne. Jeśli większy model nie porusza sukcesu wywołań narzędzi, odmów lub P99 w kierunku, który Cię interesuje, dodatkowy rozmiar nie kupuje niczego, co możesz wykorzystać.

Jak wybrać punkt na frontierze

Użyj tej kolejności. Tańsze jest odkrycie, że model 27B wystarcza, niż odkrycie, że karta 80 GB była niepotrzebna.

  1. Zacznij od obciążenia pracy, a nie od największych otwartych wag, które możesz pobrać. Instrukcje jednokrotnego strzału i matematyka mogą zacząć się od 8–14B. Wieloetapowe użycie narzędzi zaczyna się od Qwen3.8-27B, jeśli masz 24 GB, lub od najlepszej kwantyzacji 16 GB, którą już zmierzyłeś, jeśli nie masz.
  2. Rozdziel aktywne parametry od parametrów rezydentnych. Wartość aktywna 17B Scout to roszczenie obliczeniowe. Całkowita wartość 109B to roszczenie VRAM. Budżetuj drugi numer.
  3. Skwantyzuj, a następnie ponownie sprawdź pamięć. Q4_K_M Qwen3.8-27B to rozmowa na 24 GB, z około 64K kontekstu, zanim karta się wypełni. Uruchom nvidia-smi po załadowaniu, przy długości kontekstu, którą faktycznie będziesz obsługiwać.
  4. Wycenij miesiąc, a nie token. Porównaj 730 godzin GPU, które wynająłbyś, z mieszanką wejścia i wyjścia, którą już logujesz. Jeśli jesteś poniżej progu opłacalności powyżej, zostań na API, aż wolumen przyjdzie.
  5. Decyduj na własnych zadaniach. Uruchomienie parowe, które rejestruje sukces wywołań narzędzi, zachowanie odmowy i P99 pod obciążeniem szczytowym, to test, którego publiczne benchmarki nie mogą zastąpić.
flowchart TD A[Definiuj obciążenie pracy] --> B{Wieloetapowe użycie narzędzi?} B -- Nie: jednorazowe lub matematyka --> C[Zacznij od 8-14B] B -- Tak --> D{Jedno GPU 24 GB?} D -- Tak --> E[Qwen3.8-27B blisko Q4, potem sprawdź bufor KV] D -- Nie: karta klasy 80 GB --> F[Llama 4 Scout: 17B aktywnych, 109B rezydentnych] C --> G[Uruchomienie parowe na Twoich zadaniach] E --> G F --> G G --> H{Wywołania narzędzi, odmowy i P99 przechodzą?} H -- Tak --> I[Wdróż i utrzymuj te trzy sygnały] H -- Nie, wolumen jest niski --> J[Wagi klasy 70B lub API frontier] H -- Nie, wolumen jest wysoki --> K[Następny rozmiar w górę, potem wycenij miesiąc]

Przydatnym pytaniem w 2026 roku jest to, które wagi mieszczą się na karcie, kontekście i rachunku miesięcznym, jednocześnie przechodząc własne zadania. Dla wielu prac agenticznych, ten punkt to model hybrydowy 27B na jednym GPU 24 GB. Scout to ten sam pomysł w pamięci datacenter: mniej obliczeń per token, niż sugeruje suma parametrów, i żadna zniżka na VRAM.

Źródła

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

Subskrybuj

Otrzymuj nowe wpisy o systemach, infrastrukturze i inżynierii AI.