Hardware

KV Cache на GPU с 16 ГБ: Как действительно уместить длинный контекст

KV Cache на GPU с 16 ГБ: Как действительно уместить длинный контекст

Почему контекст 128K не работает на 16 ГБ

Модель может заявлять о поддержке контекстного окна в 128K, но проваливаться уже на 40K токенах на видеокарте с 16 ГБ. Архитектурный потолок никогда не обещал, что веса, KV-кэш, вычислительные буферы и системный композитор смогут одновременно уместиться на вашем устройстве.

Гравитация данных: реальная стоимость API-first ИИ

Гравитация данных: реальная стоимость API-first ИИ

«Почему ваш AI-стек становится всё более «липким» каждый месяц»

Каждый вызов API кажется простой транзакцией - пока их накопится достаточно много, и ваши данные для дообучения, системы оценки и схемы инструментов не начнут формироваться вокруг одного вендора, после чего смена провайдера перестанет быть простой сменой маршрутизации.

GPU для ИИ в 2026 году: сравнение NVIDIA, AMD и Intel

GPU для ИИ в 2026 году: сравнение NVIDIA, AMD и Intel

Сравнение AI-GPU от трёх производителей

Ландшафт аппаратных решений для ИИ значительно изменился в 2026 году: NVIDIA, AMD и Intel соревнуются за разработчиков, которым требуются GPU, способные запускать локальные большие языковые модели (LLM) и выполнять задачи инференса.

Qwen 3.6 27B и 35B MTP против Standard на GPU 16 ГБ

Qwen 3.6 27B и 35B MTP против Standard на GPU 16 ГБ

MTP и стандартная декодировка на RTX 4080 — реальные результаты тестов

Я протестировал производительность спекулятивного декодирования (Multi-Token Prediction, MTP) для моделей Qwen 3.6 27B и 35B на видеокарте RTX 4080 с 16 ГБ видеопамяти (VRAM).

Самостоятельное размещение LLM и суверенитет ИИ

Самостоятельное размещение LLM и суверенитет ИИ

Управляйте данными и моделями с помощью развернутых локально LLM

Хостинг больших языковых моделей (LLM) на собственных серверах обеспечивает контроль над данными, моделями и процессом инференса — это практический путь к суверенному искусственному интеллекту для команд, предприятий и целых стран.

Сравнение производительности LLM в Ollama на GPU с 16 ГБ VRAM

Сравнение производительности LLM в Ollama на GPU с 16 ГБ VRAM

Тест скорости LLM на RTX 4080 с 16 ГБ видеопамяти

Локальный запуск больших языковых моделей обеспечивает конфиденциальность, работу в автономном режиме и отсутствие затрат на API. Данный бенчмарк точно показывает, чего можно ожидать от 14 популярных LLM на Ollama на видеокарте RTX 4080.

Рост цен на GPU и ОЗУ в Австралии: RTX 5090 подорожал на 15%, ОЗУ — на 38% — январь 2026 года

Рост цен на GPU и ОЗУ в Австралии: RTX 5090 подорожал на 15%, ОЗУ — на 38% — январь 2026 года

Проверка цен на GPU и RAM в январе 2025 года

Сегодня мы рассматриваем топовые потребительские графические процессоры и модули оперативной памяти. Конкретно я смотрю на цены на RTX-5080 и RTX-5090, а также на 32ГБ (2x16ГБ) DDR5 6000.

Ценообразование на DGX Spark AU: от 6249 до 7999 долларов в крупных розничных магазинах

Ценообразование на DGX Spark AU: от 6249 до 7999 долларов в крупных розничных магазинах

Актуальные цены в австралийских долларах от местных розничных продавцов уже доступны.

Компьютер NVIDIA DGX Spark (GB10 Grace Blackwell) поступил в продажу в Австралии у крупных розничных продавцов компьютеров с наличием на местных складах. Если вы следите за мировым ценообразованием и доступностью DGX Spark, то вам будет интересно узнать, что в Австралии цены варьируются от 6 249 до 7 999 австралийских долларов в зависимости от конфигурации накопителей и конкретного продавца.

Ubuntu потеряла сеть после обновления ядра

Ubuntu потеряла сеть после обновления ядра

Как я исправил проблемы с сетью в Ubuntu

После автоматической установки нового ядра, Ubuntu 24.04 потеряла сетевое подключение по Ethernet. Эта раздражающая проблема произошла со мной во второй раз, поэтому я документирую решение здесь, чтобы помочь другим, столкнувшимся с той же проблемой.

Резкий рост цен на оперативную память: до 619 % в 2025 году

Резкий рост цен на оперативную память: до 619 % в 2025 году

Цены на оперативную память выросли на 163–619% из-за дефицита, вызванного спросом на ИИ.

Рынок памяти переживает беспрецедентную волатильность цен в конце 2025 года, когда цены на оперативную память резко выросли по всем сегментам.