<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Llamacpp on Rost Glukhov | 개인 사이트 및 기술 블로그</title>
		<link>https://www.glukhov.org/ko/tags/llamacpp/</link>
		<description>Recent content in Llamacpp on Rost Glukhov | 개인 사이트 및 기술 블로그</description>
		<generator>Hugo</generator>
		<language>ko</language>
		
		
		
		
			<lastBuildDate>Tue, 08 Sep 2026 20:17:30 +1000</lastBuildDate>
		
			<atom:link href="https://www.glukhov.org/ko/tags/llamacpp/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>16GB GPU에서 KV 캐시: 긴 컨텍스트를 실제로 처리하기</title>
				<link>https://www.glukhov.org/ko/llm-performance/optimization/kv-cache-16gb-long-context/</link>
				<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/ko/llm-performance/optimization/kv-cache-16gb-long-context/</guid>
				<description>&lt;p&gt;모델은 128K 컨텍스트 윈도우를 표방하면서도 16 GB GPU에서 40K 토큰 단계에서 실패할 수 있습니다. 아키텍처의 한계는 웨이트, KV 캐시, 계산 버퍼, 그리고 데스크톱 compositor가 모두 동시에 해당 카드에 맞을 것이라고 약속한 적이 없습니다.&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
