오픈 모델의 효율적 프론티어: 2026년의 최적의 균형점 찾기

2026년 오픈 LLM의 최적 구간: 약 30B

Page content

2026년 9월, 오픈 모델의 효율적 프런티어(efficient frontier)는 25B~34B 파라미터 사이에 위치합니다: 24 GB 단일 GPU에서 프런티어에 근접한 에이전틱 작업을 수행할 수 있으면서, 70B급 하드웨어의 일부 비용으로만 가능합니다.

이 구간은 슬로건의 파라미터 수가 아닌 실제 배포 환경에서 나타납니다. 공개 리더보드, 단일 GPU 실행 결과, 월간 API 비용은 모두 프런티어 수준의 도구 사용 능력을 유지하면서도 가중치와 KV 캐시가 임대하거나 소유할 수 있는 하드웨어에 맞춰지는 모델들로 수렴합니다.

2026년 오픈 모델의 효율적 프런티어: 스위트 스팟이 표시된 성능 곡선과 그 뒤의 단일 GPU

이 페이지는 해당 선택에 대한 의사결정 허브로, LLM 성능 클러스터 내부에 위치합니다. 여기서 소형 인스트럭트 모델부터 70B급 dense 가중치까지 순서를 따라가며, 현재 프런티어를 정의하는 두 가지 아키텍처, 즉 24 GB 단일 카드에서 편안한 Qwen3.8-27B와 대부분의 전문가가 비활성 상태로 남아 있어 연산량이 적어 보이는 Llama 4 Scout에서 멈춥니다. 토큰당 초(t/s) 테이블은 각 섹션에서 링크된 벤치마크 페이지에 유지됩니다.

이 글을 읽으면 먼저 어떤 크기의 모델을 테스트해야 하는지, 가중치와 캐시에 실제로 얼마나 많은 VRAM이 필요한지, 임대된 RTX 4090이 현재 Claude Sonnet의 토큰 가격과 어떻게 비교되는지, 그리고 더 큰 모델이 여전히 올바른 선택인 시점이 언제인지 파악할 수 있을 것입니다.

왜 공개 벤치마크는 생산 환경에서의 성능 전환을 과장하는가

모델이 MMLU나 HumanEval에서 프런티어 API 모델과 몇 점 차이 내에서 머물더라도, 실제로 배포 중인 작업에서는 실패할 수 있습니다. 멀티-툴 플로우에서 두 번째 도구 호출이 떨어지고, 의료 관련 쿼리에 대한 거부(refusal) 캘리브레이션이 과도한 거부 방향으로 기울며, 버스트 부하 하에서 P99 지연이 두 배로 증가합니다. 리더보드의 격차가 작아 보인 이유는 해당 벤치가 고정된 프롬프트 세트에 대한 능력을 측정하기 때문입니다. 그것들은 여러분의 도구, 문서, 지연 예산에 대한 전환을 측정하지 않습니다.

효율적 프런티어는 유지 가능한 비용으로 워크로드에서 버텨내는 모델들의 집합입니다. 이를 위해서는 생산 환경과 유사한 작업에 대한 페어링 비교가 필요하며, 그 과정에서 세 가지 신호를 계속 기록해야 합니다: 도구 호출 성공률, 거부 행동, P99 지연. Future AGI의 저렴한 프런티어 대체에 대한 작성은 평가 측면에서 동일한 점을 지적합니다: 공개 벤치마크의 작은 격차는 모델 교체에 대한 면허가 아닙니다.

아래 점수를 베이크-오프(bake-off, 비교 테스트)를 어디서 시작할지 보여주는 지도로 다루십시오. 이 정보는 2026년 9월 시점이며, 몇 가지 주요 코딩 수치는 벤더 실행 결과이지 독립적인 실행 결과가 아닙니다.

8B, 30B, 70B가 실제로 어디에 위치하는가

하위 끝에서, 8B급 인스트럭트 모델은 짧고 명시적인 지침을 따르고 작은 함수를 작성합니다. 여러 서비스 간의 실패하는 CI 파이프라인 디버깅, 첫 번째 도구 호출이 오류를 반환했을 때의 복구, 계획 유지라는 요청을 하면 실행이 무너집니다. 이는 리더보드 실패가 아니라 워크로드 실패입니다.

범위의 중간은 범용 에이전틱 작업이 현재 단일 프로슈머 GPU를 통과하는 곳입니다. Qwen3.8-27B는 기준이 되는 dense 모델입니다. Qwen3 30B vs GPT-OSS 20B의 1대1 비교에서 다루는 같은 크기 밴드의 Qwen 30B급 MoE를 포함한 아키텍처는 더 큰 것에 지출하기 전에 테스트해야 할 대상입니다.

상위 끝에서, 4-bit의 dense 70B 모델은 KV 캐시를 고려하기 전에 가중치만 35~40 GB 수준입니다. 24 GB 카드에 맞지 않습니다. 48 GB GPU, 80 GB 데이터 센터 카드, 또는 2 GPU 분할이 필요하며, 잘 튜닝된 27B 모델보다 코딩 에이전트, 문서 파이프라인, 지원 봇에서 추가 품질은 종종 미미합니다. Claude Opus와 같은 폐쇄적 프런티어 API는 완전히 다른 예산 범위에 속합니다: 토큰당 요금을 지불하고, 가중치를 전혀 보유하지 않습니다.

체크포인트를 선택하기 전에 카드와 사용 가능한 메모리를 확인하십시오. 모델 가중치는 풋프린트의 일부일 뿐입니다. 컨텍스트(KV 캐시)는 그 위에 쌓입니다.

# 퀀트를 선택하기 전 GPU 이름과 사용 가능한 VRAM
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv

# 로드 후: 프로세스가 GPU에 머물렀는지 확인
nvidia-smi

레이어가 CPU로 스플로우되면 생성 스루풋이 붕괴됩니다. GPU의 memory.used와 런타임 오프로드 로그에서 분할을 볼 수 있습니다. 16 GB 카드에서 dense와 MoE 체크포인트가 실제로 무엇을 제공하는지에 대한 측정은 16 GB VRAM llama.cpp 벤치마크16 GB RTX 4080의 Ollama 비교에 있습니다. 그 페이지들이 속도 테이블의 소유자입니다. 이 페이지는 적합성 결정만 필요로 합니다.

Qwen3.8-27B: 24 GB 기준점

알리바바의 Qwen3.8-27B는 전문가의 혼합(MoE)이 아닌 dense 모델입니다. Artificial Analysis에서 Agentic Index(반올림 수치; 기본 값은 50.9)에서 약 51점, 최대 추론 노력에서 Intelligence Index에서 약 52점을 기록합니다. 이들은 서로 다른 측정입니다. Agentic Index는 도구 사용과 멀티스텝 태스크입니다. Intelligence Index는 더 넓은 능력 혼합입니다. MindStudio의 손쉬운 벤치마크는 에이전틱 점수를 훨씬 더 큰 MoE 모델인 Kimi K2의 바로 뒤에 위치시킵니다. Qubrid의 분해는 함께 읽을 대상입니다: 다음 모델과의 격차는 1점 미만이며, Qwen 자체의 SWE-bench Pro 수치인 61.7은 독립 실행으로 재현되지 않았습니다. 흥미로운 결과는 점수의 형태입니다. 27B 모델은 컴팩트한 예산을 계획과 도구 사용으로 unusually 잘 전환하며, 폭넓은 지식 스위트에서 주도하지는 않습니다.

아키텍처가 장문 컨텍스트가 저렴한 이유입니다. 64개 레이어 중 단 16개만이 전체 어텐션을 사용합니다. 나머지 48개는 Gated Delta Networks 연구 라인에서 나온 선형 어텐션 설계인 Gated DeltaNet 레이어로, 토큰별 키/밸류 히스토리가 아닌 고정된 재귀 상태를 유지합니다. FP16에서 전체 어텐션 레이어는 토큰당 약 64 KB의 KV 캐시 비용을 들입니다. 레이어 수가 동일한 기존 스택은 약 4배의 캐시를 필요로 할 것입니다. Locally Uncensored의 퀀트 테이블은 Q4_K_M 가중치를 17.1 GB, IQ4_XS를 15.7 GB로 제시합니다. Hardware Corner의 llama.cpp 측정에서 24 GB GPU는 짧은 컨텍스트에서 18 GB 근처, 64K에서 약 22 GB를 기록했으며, 이는 RTX 4090에서의 실용적 목표입니다. 16 GB 카드는 가중치의 IQ4급 퀀트와 거의 컨텍스트가 없는 것을 담을 수 있습니다. 그것이 여러분의 머신이라면, 16 GB에서 이미 측정된 Qwen 3.5와 3.6 실행을 유지하십시오. 여기에는 Qwen 3.6 27B MTP 대 표준 디코딩도 포함됩니다. 캐시 자체의 예산 설정 방법은 16 GB GPU의 KV 캐시에서 다룹니다.

손쉬운 보고서는 MindStudio의 것을 포함하여, 해당 모델이 코딩, 이미지 분석, 에이전트 루프에 유용하다는 점을 발견하며, 이는 단일 인덱스로 보여주지 못하는 부분입니다. 비전은 텍스트 가중치 위에 작은 프로젝터 파일을 추가합니다. 워크로드에 스크린샷이 포함된다면 이를 계획하십시오.

Llama 4 Scout: 활성 파라미터는 VRAM이 아님

Meta의 Llama 4 Scout는 다른 종류의 효율성입니다. Llama 4 모델 카드는 170억 활성 파라미터와 1090억 총 파라미터, 16개의 전문가, 네이티브 이미지 입력, 1000만 토큰 컨텍스트 윈도우를 나열합니다. Meta의 출시 게시물은 INT4 체크포인트가 단일 H100에 맞다고 말합니다. 디코딩 연산은 각 토큰에 대해 발화되는 17B를 추적합니다. 메모리는 그렇지 않습니다. 모든 전문가가 거주(resident)해야 하므로, FLOPs가 17B 모델처럼 보임에도 VRAM 비용은 100B급 모델처럼 보입니다.

머신을 예산 설정하기 전에 가치 있는 교정이 바로 이것입니다. Scout는 “3B 모델처럼 실행되지” 않습니다. 활성 파라미터는 속도를 결정합니다. 거주 파라미터는 카드가 가중치를 담을 수 있는지를 결정합니다. 24 GB GPU에서, Qwen3.8-27B는 맞는 모델입니다. Scout는 이미 80 GB 카드를 가지고 있으며, 훨씬 더 큰 전문가 풀과 매우 긴 컨텍스트로 17B급 연산을 원할 때 의미가 있는 모델입니다.

2025년 6월 논문, Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?은 총 연산량과 데이터를 고정하고 활성률이 실행 가능한 밴드에 있을 때 MoE가 dense 모델을 이길 수 있다고 주장합니다. 실용적인 해석은 헤드라인보다 더 좁습니다. MoE는 비활성 전문가를 저장하는 메모리를 지불한 후에만 비용에서 이깁니다. 이미 이 크기의 모델을 서빙 중이고 가중치를 변경하지 않고 더 많은 토큰당 초를 원한다면, speculative decoding은 이웃하는 기술입니다: 드래프트 경로가 토큰을 제안하고 주 모델이 이를 검증합니다.

Phi-4: 수학용 소형 모델 예외

Microsoft의 Phi-4는 14B dense 모델입니다. 2024년 12월 기술 보고서에서, simple-evals는 같은 테이블의 GPT-4o 수치보다 앞선 MATH 80.4점으로 점수를 매기며, 보고서는 컨텍스트 윈도우를 16K로 확장합니다. Q4_K_M 퀀트는 일반적으로 약 8 GB에서 실행됩니다. 이는 실질적인 효율성이며, 좁은 범위입니다. Phi-4는 STEM 질의응답을 위해 훈련되었습니다. 작업이 수학이나 짧은 기술적 추론이고 머신이 작을 때 시도해야 할 모델입니다. 멀티-툴 에이전트, 긴 문서, 비전의 2026년 기본값은 아닙니다. 그 작업의 프런티어는 여전히 위의 25–34B 밴드, 또는 GPU가 H100급 카드인 경우의 Scout입니다.

셀프호스팅 GPU 시간 대 토큰당 API 가격

가격은 변합니다. 이것은 2026년 9월 중순 수치이며, 2027년까지 그대로 유지되지 않을 것입니다.

GPU Finder는 2026년 9월 18일 확인 결과, Vast에서 재고 있는 RTX 4090이 GPU-시간당 약 $0.26, RunPod 커뮤니티 클라우드가 $0.34로 나열되어 있음을 보였습니다. 단일 4090의 6개월 온디맨드 최저가는 $0.11에서 $0.60 사이에 있었습니다. $0.34와 월 730시간으로, 한 달 내내 켜진 카드는 세금, 저장소, 이그레스를 제외하고 약 $248입니다. 재고 견적 $0.26에서는 같은 월이 약 $190입니다. $0.53/시간이라는 이전 계획 수치는 그 6개월 범위 내에 있지만, 9월 후반 시장 재고가 실제로 요구한 가격을 과장하고 있습니다.

API 측면에서, Anthropic의 Sonnet 5 가격 노트는 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $10을 나열합니다. Sonnet 4.6은 $3과 $15를 유지합니다. 2026년 9월 3일 업데이트된 BenchLM의 요율 카드는 동일한 분리를 보여줍니다. 입력 토큰 1억 개와 출력 토큰 1000만 개인 워크로드는 Sonnet 5에서 $300, Sonnet 4.6에서 $450입니다.

한 달 내내 $248로 임대된 4090과 나란히 놓여, 그 예시는 “셀프호스팅이 항상 더 저렴한 것은 아니다"라고 말하지 않습니다. 이 부피에서 두 비용이 같은 동네에서 만난다고 말합니다. 10:1 입력-출력 비율의 Sonnet 5는 입력 1000만 개 + 출력 100만 개당 $30입니다. $248 임대금은 그 블록의 약 8개를 커버합니다: 약 8000만 입력 토큰과 800만 출력 토큰. 그 이상에서, 임대 카드는 바쁘게 유지할 수 있다면 앞섭니다. 그 이하에서, API가 더 저렴한 선이며, 유휴 GPU 비용을 지불하지 않습니다. 소유 하드웨어는 임대를 전기와 감가상각으로 대체합니다. 그 비용 주위의 전략들 — 예산, 캐싱, 폴백 — 은 LLM 시스템의 비용 최적화에 있습니다. 더 낮은 토큰 가격이 여전히 잘못된 아키텍처일 수 있는 이유는 데이터 중력과 API 잠금입니다.

더 큰 모델이 여전히 올바른 선택인 경우

25–34B 밴드는 반복되는 생산 워크로드(코딩 에이전트, 지원 봇, 문서 처리, 추출, 자동화)의 기본값입니다. 몇 가지 상황에서는 잘못된 기본값입니다.

  • 페어링 테스트에서 더 작은 모델이 이미 실패한 문제의 프런티어 추론.
  • 목소리의 차이가 제품인 산문, 그리고 토큰 가격이 소음이 될 정도로 부피가 낮은 경우.
  • 27B 모델이 동일한 유형의 사실을 계속 놓치는, 동시에 여러 전문 영역에 대한 폭넓은 커버리지이 필요한 작업.
  • 오답의 비용이 모델 임대 1년을 초과하는, 저부피 고위험 결정.

그 경우, 70B급 오픈 모델 또는 프런티어 API로 상향하고, 동일한 세 가지 생산 신호를 유지하십시오. 더 큰 모델이 도구 호출 성공률, 거부, P99를 여러분이 중요하게 여기는 방향으로 움직이지 않으면, 추가 크기는 사용할 수 있는 것을 구매하지 않는 것입니다.

프런티어에서 점을 고르는 방법

이 순서를 사용하십시오. 27B 모델이 충분하다는 것을 발견하는 것이 80 GB 카드가 불필요했다는 것을 발견하는 것보다 저렴합니다.

  1. 가장 큰 오픈 가중치가 아닌 워크로드에서 시작하십시오. 단일 샷 인스트럭션과 수학은 8–14B에서 시작할 수 있습니다. 멀티스텝 도구 사용은 24 GB가 있다면 Qwen3.8-27B에서, 없다면 이미 측정된 최적의 16 GB 퀀트에서 시작합니다.
  2. 활성 파라미터와 거주 파라미터를 분리하십시오. Scout의 17B 활성 수치는 연산 주장입니다. 109B 총수는 VRAM 주장입니다. 두 번째 숫자를 예산으로 설정하십시오.
  3. 퀀트화한 후, 메모리를 다시 확인하십시오. Qwen3.8-27B의 Q4_K_M은 카드가 가득 차기 전에 약 64K의 컨텍스트가 있는 24 GB 대화입니다. 실제로 서빙할 컨텍스트 길이에서 로드 후 nvidia-smi를 실행하십시오.
  4. 토큰이 아닌 월을 가격設定하십시오. 임대할 GPU의 730시간을 이미 로그하는 입력과 출력 믹스와 비교하십시오. 위의 손익분기점보다 낮다면, 부피가 도착할 때까지 API를 유지하십시오.
  5. 자신의 작업으로 결정하십시오. 버스트 하에서 도구 호출 성공률, 거부 행동, P99를 기록하는 페어링 실행은 공개 벤치가 대체할 수 없는 테스트입니다.
flowchart TD A[워크로드 정의] --> B{멀티스텝 도구 사용?} B -- 아니요: 단일 샷 또는 수학 --> C[8-14B에서 시작] B -- 예 --> D{단일 24 GB GPU?} D -- 예 --> E[Qwen3.8-27B Q4 근처, KV 캐시 확인] D -- 아니요: 80 GB급 카드 --> F[Llama 4 Scout: 17B 활성, 109B 거주] C --> G[자기의 작업에서의 페어링 실행] E --> G F --> G G --> H{도구 호출, 거부, P99 통과?} H -- 예 --> I[배포 및 세 가지 신호 유지] H -- 아니요, 부피가 낮음 --> J[70B급 가중치 또는 프런티어 API] H -- 아니요, 부피가 높음 --> K[다음 크기로 상승, 월 재가격設定]

2026년에 유용한 질문은 카드, 컨텍스트, 월 비용에 맞으면서도 자신의 작업을 통과하는 가중치가 무엇인 것입니다. 많은 에이전틱 작업에 대해, 그 점은 24 GB 단일 GPU 위의 27B 하이브리드 모델입니다. Scout는 데이터 센터 메모리에서의 동일한 아이디어입니다: 파라미터 총수가 시사하는 것보다 토큰당 연산이 적고, VRAM 할인도 없습니다.

참고 문헌

  1. MindStudio. “Qwen 3.8 27B Benchmarked: Agentic Index, Vision, and Reasoning Tests.” https://www.mindstudio.ai/blog/qwen-3-27b-local-benchmark
  2. Qubrid AI. “Qwen3.8-27B Benchmarks: Official and Independent Results.” https://www.qubrid.com/blog/qwen38-27b-benchmarks-official-and-independent-results
  3. Hardware Corner. “We Tested Qwen3.8 27B: How Much GPU and VRAM Do You Really Need?” https://www.hardware-corner.net/qwen3-8-27b-hardware-tests/
  4. Locally Uncensored. “How to Run Qwen 3.8 27B Locally: VRAM, Quants and the Template Trap.” https://locallyuncensored.com/blog/how-to-run-qwen-3-8-27b-locally.html
  5. Malik, Umesh. “Qwen3.8 27B VRAM: how to fit 262K context in 16 GiB, not 64.” https://umesh-malik.com/blog/qwen3-8-27b-vram-kv-cache-math
  6. Meta AI. “The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.” https://ai.meta.com/blog/llama-4-multimodal-intelligence
  7. Meta. “Llama 4 model card.” https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md
  8. arXiv. “Can Mixture-of-Experts Surpass Dense LLMs Under Strictly Equal Resources?” June 2025. https://arxiv.org/html/2506.12119v1
  9. Yang, S., Kautz, J., Hatamizadeh, A. “Gated Delta Networks: Improving Mamba2 with Delta Rule.” ICLR 2025. https://jankautz.com/publications/GatedDeltaNet_ICLR25.pdf
  10. Abdin, M., et al. “Phi-4 Technical Report.” arXiv:2412.08905, December 2024. https://arxiv.org/html/2412.08905v1
  11. GPU Finder. “RTX 4090 GPU Rental Prices & Live Availability.” Checked 18 September 2026. https://gpufinder.dev/gpu/rtx-4090
  12. Anthropic. “What’s new in Claude Sonnet 5” (pricing: $2 / $10 per million tokens). https://platform.claude.com/docs/en/models/sonnet-5/whats-new-sonnet-5
  13. BenchLM. “Claude API pricing.” Updated 3 September 2026. https://benchlm.ai/anthropic/api-pricing
  14. Future AGI. “Evaluating Cheap Frontier Models in 2026: Substitution Without a Quality Cliff.” https://futureagi.com/blog/evaluating-cheap-frontier-models-2026
  15. Northflank. “Qwen3.8-27B: Performance, benchmarks, GPU requirements & how to run it.” 17 August 2026. https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it

구독하기

시스템, 인프라, AI 엔지니어링에 관한 새 글을 받아보세요.