비교: Qwen3:30b와 GPT-OSS:20b
두 모델의 속도, 파라미터 및 성능 비교
다음은 Qwen3:30b와 GPT-OSS:20b 비교 내용입니다. 지시 따름 능력(instruction following)과 성능 파라미터, 사양 및 속도에 초점을 맞추었습니다.
처리량(throughput), 지연 시간(latency), VRAM, 다양한 런타임과 하드웨어에서의 벤치마크에 대한 자세한 내용은 LLM 성능: 벤치마크, 병목 현상 및 최적화를 참조하세요.

새로운 Qwen 라인업(벌칙(penalties) 및 사고(thinking) 모드와 코딩 프reset 등)에 대한 에이전트 루프(agent-loop) 지향적인 샘플링 기본값을 설정할 때는 Qwen 및 Gemma를 위한 에이전틱 추론 파라미터를 대조하여 확인하십시오.
아키텍처 및 파라미터
| 기능 | Qwen3:30b-instruct | GPT-OSS:20b |
|---|---|---|
| 총 파라미터 수 | 305억개 (30.5 billion) | 210억개 (21 billion) |
| 활성화된 파라미터 수 | 약 33억개 (~3.3 billion) | 약 36억개 (~3.6 billion) |
| 레이어 수 | 48 | 24 |
| 레이어당 MoE 전문가 수 | 128개 (토큰당 8개 활성) | 32개 (토큰당 4개 활성) |
| 어텐션 메커니즘 | Grouped Query Attention (32Q /4KV) | Grouped Multi-Query Attention (64Q /8KV) |
| 컨텍스트 윈도우 | 네이티브 32,768; 확장 시 최대 262,144 | 128,000 토큰 |
| 토크나이저 | BPE 기반, 어휘 크기 151,936 | GPT 기반, 어휘 크기 약 20만(≈ 200k) |
지시 따름 능력 (Instruction Following)
- Qwen3:30b-instruct는 강력한 인간 선호도 정렬(human preference alignment)과 함께 지시 따름 능력 최적화되어 있습니다. 창작 글쓰기, 역할극, 다중 턴 대화, 다국어 지시 따름에서 뛰어난 성능을 발휘합니다. 이 버전은 사용자 지시에 부합하는 더 자연스럽고 제어 가능하며 매력적인 답변을 제공하도록 특별하게 파인튜닝되었습니다.
- GPT-OSS:20b는 지시 따름을 지원하지만, 뉘앙스 있는 지시 튜닝 측면에서는 일반적으로 Qwen3:30b-instruct보다 약간 뒤처지는 것으로 평가됩니다. 유사한 함수 호출(function calling), 구조화된 출력, 추론 모드를 제공하지만, 대화적 정렬과 창의적 대화에서는 열세일 수 있습니다.
성능 및 효율성
- Qwen3:30b-instruct는 수학 추론, 코딩, 복잡한 논리 작업, 119개 언어 및 방언을 포함하는 다국어 시나리오에서 뛰어난 성능을 보입니다. ‘사고(thinking)’ 모드는 강화된 추론을 허용하지만 더 높은 메모리 비용이 발생합니다.
- GPT-OSS:20b는 OpenAI의 o3-mini 모델과匹敌하는 성능을 달성합니다. 레이어 수는 적지만 레이어당 전문가(experts)가 넓고, 소비자 하드웨어에서 효율적인 추론을 위한 네이티브 MXFP4 양자화를 사용하며, 더 낮은 메모리 요구 사항(~16GB vs Qwen3보다 높음)을 갖추고 있습니다.
- GPT-OSS는 약 33% 더 높은 메모리 효율성과 특정 하드웨어 설정, 특히 소비자용 GPU에서 더 빠른 속도를 제공하지만, Qwen3는 특히 복잡한 사용 사례에서 더 나은 정렬과 추론 깊이를 제공합니다.
- Qwen3는 GPT-OSS의 128,000 토큰에 비해 더 긴 확장 컨텍스트 길이 옵션(최대 262,144 토큰)을 제공하여, 매우 긴 컨텍스트 이해가 필요한 작업에 이점을 줍니다.
사용 권장 사항
- 우수한 지시 따름 능력, 창의적 생성, 다국어 지원, 복잡한 추론이 필요한 사용 사례에는 Qwen3:30b-instruct를 선택하세요.
- 메모리 효율성, 소비자 하드웨어에서의 추론 속도, 적은 파라미터 수로 경쟁력 있는 베이스라인 성능이 우선시된다면 GPT-OSS:20b를 선택하세요.
이 비교는 Qwen3:30b-instruct가 고급 지시 튜닝을 갖춘 더 깊고 강력한 모델임을 강조하는 반면, GPT-OSS:20b는 표준 벤치마크에서 경쟁력 있는 성능을 갖춘 더 컴팩트하고 효율적인 대안을 제공한다고 보여줍니다.
지시 따름 능력과 주요 성능 파라미터(MMLU, LMEval, HumanEval)를 중심으로 Qwen3:30b-instruct와 GPT-OSS:20b를 직접 비교하는 벤치마크 점수는 검색 결과에서 직접 확인되지는 않습니다. 그러나 기존에 발표된 다국어 및 다중 작업 벤치마크 보고서에 기반할 때:
MMLU (Massive Multitask Language Understanding)
상세한 내용을 찾기는 어렵지만, 다음과 같은 사실만 확인할 수 있습니다:
- Qwen3 시리즈 모델, 특히 30B 스케일 이상은 57개의 다양한 도메인에서 매우 경쟁력 있는 지식 이해 및 추론 능력을 나타내는, 일반적으로 89%를 초과하는 MMLU 점수를 보입니다.
- GPT-OSS:20b도 MMLU 벤치마크에서 좋은 성능을 보이지만, 더 적은 파라미터 수와 지시 파인튜닝 강조가 덜하기 때문에 더 큰 Qwen 모델보다 점수가 낮은 경우가 많습니다.
LMEval (Language Model Evaluation Toolkit)
현재로서는 많은 세부 정보가 없습니다:
- Qwen3 모델은 LMEval 내에서 추론 및 코드 관련 작업에서 상당한 개선을 보여주며, 논리, 수학 추론 및 일반 능력에서 향상된 점수를 기록합니다.
- GPT-OSS:20b는 LMEval에서 견고한 베이스라인 성능을 제공하지만, 고급 추론과 지시 따름 하위 작업에서는 일반적으로 Qwen3:30b-instruct보다 뒤처집니다.
HumanEval (Code Generation Benchmark)
많은 데이터는 없으며, 단순히 다음과 같습니다:
- Qwen3:30b-instruct는 HumanEval-XL과 같은 다국어 코드 생성 벤치마크에서 강력한 성능을 보이며, 20개 이상의 프로그래밍 언어를 지원하고 우수한 교차 언어(cross-lingual) 코드 생성 정확도를 제공합니다.
- GPT-OSS:20b는 경쟁력이 있지만, 다국어 학습이 덜 광범위하기 때문에 HumanEval 벤치마크에서, 특히 다국어 및 다중 언어 프로그래밍 컨텍스트에서 Qwen3:30b-instruct보다 약간 낮은 성능을 보입니다.
요약 테이블 (문헌에서의 근사적인 추이):
| 벤치마크 | Qwen3:30b-instruct | GPT-OSS:20b | 비고 |
|---|---|---|---|
| MMLU 정확도 | ~89-91% | ~80-85% | Qwen3가 광범위한 지식과 추론에서 더 강력함 |
| LMEval 점수 | 높음, 고급 추론 및 코드 | 중간, 베이스라인 추론 | Qwen3가 수학 및 논리에서 뛰어난 성능 |
| HumanEval | 높은 다국어 코드 생성 성능 | 중간 | Qwen3가 교차 언어 코드 생성에서 더 우수함 |
정확한 벤치마크 번호가 필요하다면, 최근 연구 논문에 언급된 P-MMEval과 HumanEval-XL과 같은 전문 다국어 대규모 벤치마크가 Qwen3 및 유사한 GPT-OSS 변종을 포함한 모델의 상세 점수를 제공하지만, 현재로서는 이러한 점수를 직접 나란히 비교하여 가져오기 위해 공개적으로 정돈되어 있지는 않습니다.
Qwen3:30b와 GPT-OSS:20b 속도 비교
제 하드웨어(16GB VRAM)에서는 4000 컨텍스트 윈도우로 Qwen3:30b와 GPT-OSS:20b를 실행하고 있으며, 다음과 같은 성능을 보이고 있습니다:
- qwen3:30b-a3b => 45.68 토큰/초
- gpt-oss:20b => 129.52 토큰/초
비교를 위해 qwen3:14b와 gpt-oss:120b도 테스트했습니다.
- qwen3:14b => 60.12 토큰/초
- gpt-oss:120b => 12.87 토큰/초
더 긴 컨텍스트 윈도우에서는 속도가 느려지며, qwen3:30b-a3b의 경우 훨씬 더 느려질 것입니다. 이것 역시 제 PC에서의 결과입니다. 상세 기술 사항은 상세 출력(verbose output)에서 가져왔으며, 할당된 메모리는 다음과 같고, 시도해볼 수 있는 명령어는:
- ollama run qwen3:30b-a3b –verbose describe weather difference between state capitals in australia
- 4K 컨텍스트에서 메모리 할당을 보여주는 ollama ps
qwen3:30b-a3b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-a3b 19e422b02313 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 28.151133548s
load duration: 1.980696196s
prompt eval count: 16 token(s)
prompt eval duration: 162.58803ms
prompt eval rate: 98.41 tokens/s
eval count: 1188 token(s)
eval duration: 26.007424856s
eval rate: 45.68 tokens/s
qwen3:30b-thinking
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:30b-thinking ad815644918f 20 GB 23%/77% CPU/GPU 4096 4 minutes from now
total duration: 1m8.317354579s
load duration: 1.984986882s
prompt eval count: 18 token(s)
prompt eval duration: 219.657034ms
prompt eval rate: 81.95 tokens/s
eval count: 2722 token(s)
eval duration: 1m6.11230524s
eval rate: 41.17 tokens/s
gpt-oss:20b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:20b aa4295ac10c3 14 GB 100% GPU 4096 4 minutes from now
total duration: 31.505397616s
load duration: 13.744361948s
prompt eval count: 75 token(s)
prompt eval duration: 249.363069ms
prompt eval rate: 300.77 tokens/s
eval count: 2268 token(s)
eval duration: 17.510262884s
eval rate: 129.52 tokens/s
qwen3:14b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3:14b bdbd181c33f2 10 GB 100% GPU 4096 4 minutes from now
total duration: 36.902729562s
load duration: 38.669074ms
prompt eval count: 18 token(s)
prompt eval duration: 35.321423ms
prompt eval rate: 509.61 tokens/s
eval count: 2214 token(s)
eval duration: 36.828268069s
eval rate: 60.12 tokens/s
gpt-oss:120b
NAME ID SIZE PROCESSOR CONTEXT UNTIL
gpt-oss:120b f7f8e2f8f4e0 65 GB 78%/22% CPU/GPU 4096 2 minutes from now
49GB RAM + 14.4GB VRAM
total duration: 3m59.967272019s
load duration: 76.758783ms
prompt eval count: 75 token(s)
prompt eval duration: 297.312854ms
prompt eval rate: 252.26 tokens/s
eval count: 3084 token(s)
eval duration: 3m59.592764501s
eval rate: 12.87 tokens/s
Qwen3:30b 변종들
qwen3:30b 모델에는 세 가지 변종이 있습니다: qwen3:30b, qwen3:30b-instruct, qwen3:30b-thinking.
주요 차이점 및 권장 사항
- qwen3:30b-instruct는 사용자 지시, 명확성, 자연스러운 대화가 우선시되는 대화에 가장 적합합니다.
- qwen3:30b는 일반적인 기반 모델로, 다양한 작업에서 지시 따름 능력과 도구 사용이 모두 중요할 때 적합합니다.
- qwen3:30b-thinking는 깊은 추론, 수학, 코딩이 주요 초점일 때 뛰어난 성능을 보입니다. 논리/수학적 엄밀성을 측정하는 작업에서 다른 모델보다 우수한 성능을 보이지만, 창작 글쓰기나 가벼운 대화에는 반드시 더 나쁜 것은 아닙니다.
직접 벤치마크 비교
| 모델 | 추론 (AIME25) | 코딩 (LiveCodeBench) | 일반 지식 (MMLU Redux) | 속도 및 컨텍스트 | 이상적인 사용 사례 |
|---|---|---|---|---|---|
| qwen3:30b | 70.9 | 57.4 | 89.5 | 256K 토큰; 빠름 | 일반 언어/에이전트/다국어 |
| qwen3:30b-instruct | N/A (30b와 유사하게 예정) | N/A | 30b와 동일 | 256K 토큰 | 지시 따름, 정렬 |
| qwen3:30b-thinking | 85.0 | 66.0 | 91.4 | 256K 토큰 | 수학, 코드, 추론, 긴 문서 |
더 많은 벤치마크, 하드웨어 선택, 성능 튜닝에 대해서는 LLM 성능: 벤치마크, 병목 현상 및 최적화 허브를 확인하세요.
유용한 링크
- https://ollama.com/library/qwen3
- https://ollama.com/library/gpt-oss
- https://artificialanalysis.ai/articles/analysis-openai-gpt-oss-models
- https://artificialanalysis.ai/models/qwen3-30b-a3b-2507
- Ollama 설치 및 구성
- Ollama 치트시트 - 가장 유용한 명령어
- 구조화된 출력을 통한 LLM 제약: Ollama, Qwen3 및 Python 또는 Go
- Python에서 실제로 작동하는 LLM 구조화된 출력 검증
- Python과의 Ollama 통합: REST API 및 Python 클라이언트 예제
- 2026년 오픈 모델의 효율적 프론티어