<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Llamacpp on Rost Glukhov | Site personnel et blog technique</title>
		<link>https://www.glukhov.org/fr/tags/llamacpp/</link>
		<description>Recent content in Llamacpp on Rost Glukhov | Site personnel et blog technique</description>
		<generator>Hugo</generator>
		<language>fr</language>
		
		
		
		
			<lastBuildDate>Tue, 08 Sep 2026 20:13:19 +1000</lastBuildDate>
		
			<atom:link href="https://www.glukhov.org/fr/tags/llamacpp/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>Le KV Cache sur des GPU de 16 Go : faire tenir réellement les longs contextes</title>
				<link>https://www.glukhov.org/fr/llm-performance/optimization/kv-cache-16gb-long-context/</link>
				<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/fr/llm-performance/optimization/kv-cache-16gb-long-context/</guid>
				<description>&lt;p&gt;Un modèle peut afficher une fenêtre de contexte de 128K et échouer tout de même à 40K jetons sur une carte graphique de 16 Go. La limite architecturale ne garantissait jamais que les poids, le cache KV, les tampons de calcul et le compositeur de bureau tiendraient sur votre carte en même temps.&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
