Бенчмарки LLM с 16 ГБ VRAM в llama.cpp (скорость и контекст)
Скорость генерации токенов llama.cpp на 16 ГБ VRAM (таблицы).
Здесь я сравниваю скорость нескольких LLM, работающих на GPU с 16 ГБ видеопамяти, и выбираю лучшую для самохостинга.
Скорость генерации токенов llama.cpp на 16 ГБ VRAM (таблицы).
Здесь я сравниваю скорость нескольких LLM, работающих на GPU с 16 ГБ видеопамяти, и выбираю лучшую для самохостинга.
В Австралии RTX 5090 дефицитна и завышена в цене.
В Австралии есть в наличии RTX 5090. Вроде бы. И если вам повезет ее найти, вы заплатите премию, оторванную от реальности.
Доступ к Ollama удаленно без открытых публичных портов
Ollama чувствует себя наиболее комфортно, когда с ним обращаются как с локальным демоном: CLI и ваши приложения взаимодействуют с локальным HTTP-интерфейсом (loopback), а остальная сеть даже не знает о его существовании.
Ollama-сервер с приоритетом композинга, поддержкой GPU и сохранением состояния.
Ollama отлично работает на «голом» железе. Но становится еще интереснее, если рассматривать его как сервис: стабильный конечный пункт, зафиксированные версии, постоянное хранилище данных и GPU, который либо доступен, либо нет.
HTTPS для Ollama без нарушения потоковой передачи ответов.
Запуск Ollama через обратный прокси — самый простой способ обеспечить поддержку HTTPS, опциональный контроль доступа и предсказуемое поведение потоковой передачи данных.
Встраивания для RAG — Python, Ollama, API OpenAI.
Если вы работаете с генерацией с расширением поиска (RAG), этот раздел объясняет векторные представления текста (эмбеддинги) простым языком: что это такое, как они работают в поиске и извлечении данных, и как вызывать два распространенных локальных режима из Python с помощью Ollama или OpenAI-совместимого HTTP API (так как многие серверы на базе llama.cpp поддерживают такой интерфейс).
Запускайте открытые модели быстро с помощью SGLang.
SGLang — это высокопроизводительный фреймворк для развертывания больших языковых и мультимодальных моделей, созданный для обеспечения низколатентного и высокопроизводительного вывода на устройствах от одной GPU до распределенных кластеров.
Горячая замена локальных LLM без изменения клиентов.
Вскоре вы будете жонглировать vLLM, llama.cpp и другими решениями — каждый стек на своем порту. Все downstream-системы все еще хотят один базовый URL /v1; иначе вы постоянно переставляете порты, профили и одноразовые скрипты. llama-swap — это прокси /v1 перед этими стеками.
Большинство локальных конфигураций ИИ начинаются с модели и среды выполнения.
Что происходит на самом деле при запуске Ultrawork.
Oh My Opencode обещает «виртуальную команду AI-разработчиков» — Сизиф координирует специалистов, задачи выполняются параллельно, а волшебное ключевое слово ultrawork активирует всё это.
Установите Oh My Opencode и ускоряйте разработку.
Oh My Opencode превращает OpenCode в многоагентскую среду для разработки: оркестратор делегирует работу специализированным агентам, которые выполняются параллельно.
Тест LLM OpenCode — статистика по кодированию и точности
Я протестировал, как OpenCode работает с несколькими локальными LLM, запущенными через Ollama и llama.cpp, а для сравнения добавил несколько бесплатных моделей из OpenCode Zen.
Познакомьтесь с Sisyphus и его командой специализированных агентов.
Наибольший скачок в возможностях OpenCode обеспечивается специализированными агентами: осозванным разделением оркестрации, планирования, выполнения и исследований.
Быстрый старт с OpenHands CLI за несколько минут
OpenHands — это открытая платформа, не зависящая от конкретной модели, для агентов ИИ в сфере разработки программного обеспечения. Она позволяет агенту вести себя скорее как партнер по программированию, чем как простой инструмент автодополнения.
Запустите собственные API, совместимые с OpenAI, с помощью LocalAI за несколько минут.
LocalAI — это самодостаточный сервер вывода с приоритетом на локальное использование, разработанный для работы как прямая замена OpenAI API для запуска ИИ-нагрузок на вашем собственном оборудовании (ноутбук, рабочая станция или сервер в центре обработки данных).
Как установить, настроить и использовать OpenCode
Я снова и снова возвращаюсь к llama.cpp для локального инференса — он предоставляет уровень контроля, который Ollama и другие инструменты скрывают за фасадом, и он просто работает. Легко запускать модели GGUF в интерактивном режиме через llama-cli или открывать HTTP API, совместимое с OpenAI, с помощью llama-server.