Фронтенды для LLM

Когда я начал экспериментировать с LLM, их интерфейсы находились в активной стадии разработки, и теперь некоторые из них стали действительно хорошими.

Ян - мультиплатформенный UI для LLM

Jan

  • Jan доступен для Windows, Linux и Mac.

Есть тёмная, светлая и прозрачная темы.

Фронтенд LLM Jan - главное окно

Может подключаться к нескольким существующим бэкендам, таким как Anthropic, Cohere, OpenAI, NvidiaNIM, MistralAI и другим, а также хостить модели самостоятельно — смотрите раздел Cortex на скриншоте ниже — там показано, как Jan скачал и хостирует локально Llama3 8b q4 и Phi3 medium (q4).

Фронтенд LLM Jan - опции конфигурации

Плюсы (что мне понравилось):

  • Интуитивный интерфейс
  • Возможность экспериментировать с температурой модели, topp, штрафами за частоту и присутствие, а также системными промптами.
  • Предоставляет API-сервер

Минусы:

  • По какой-то причине работает медленно на моей ОС на базе Ubuntu. На Windows он работал нормально.
  • Может подключаться ко многим бэкендам, но все они управляемые. Было бы неплохо иметь опцию использования Ollama.
  • Не так много вариантов моделей доступно для self-hosting в Cortex. Слишком мало опций квантования.
  • Да, Huggingface gguf — это здорово. Но я хотел
    • повторно использовать то, что ollama уже скачал и загрузил в VRAM
    • не хостить одну и ту же модель везде

KoboldAI

KoboldAI

Очень заметный вариант

Silly Tavern

Silly Tavern

Ещё один очень универсальный вариант

LLM Studio

LLM Studio — не мой любимый UI для LLM, но у него лучший доступ к моделям huggingface.

Оllama из командной строки

Да, это тоже интерфейс пользователя, просто командная строка.

Нужно запустить для LLM llama3.1:

ollama run llama3.1

когда закончите, отправьте команду для выхода из командной строки ollama:

/bye

cURL Ollama

Установите cUrl, если вы ещё этого не сделали

sudo apt-get install curl

Чтобы вызвать локальный LLM mistral nemo q8, хостируемый на ollama, — создайте локальный файл с промптом p.json:

{
  model: mistral-nemo:12b-instruct-2407-q8_0,
  prompt: What is post-modernism?,
  stream: false
}

и теперь выполните в bash-терминале

curl -X POST http://localhost:11434/api/generate -d @p.json > p-result.json

результат будет в файле p-result.json

если вы хотите просто вывести результат:

curl -X POST http://localhost:11434/api/generate -d @p.json

Также:

Я не тестировал эти, но довольно полный список UI для LLM:

Полезные ссылки

Быстрый старт с Vane (Perplexica 2.0), Ollama и llama.cpp

Быстрый старт с Vane (Perplexica 2.0), Ollama и llama.cpp

Самохостинг AI-поиска с локальными LLM

Vane — это один из наиболее прагматичных проектов в пространстве «поиска с использованием ИИ и цитированием»: самохостинговое средство ответов, которое сочетает в себе живой поиск в вебе с локальными или облачными LLM, сохраняя при этом полный контроль над всем стеком технологий.

Интерфейсы чатов для локальных экземпляров Ollama

Интерфейсы чатов для локальных экземпляров Ollama

Краткий обзор наиболее заметных интерфейсов для Ollama в 2025 году

Локально размещённый Ollama позволяет запускать большие языковые модели на вашем собственном устройстве, но использование его через командную строку не очень удобно. Вот несколько открытых проектов, которые предоставляют интерфейсы в стиле ChatGPT, подключающиеся к локальному Ollama.

Farfalle против Perplexica

Farfalle против Perplexica

Сравнение двух саморазмещённых поисковых систем на базе ИИ

Вкусная еда доставляет удовольствие и глазам. Однако в этой статье мы сравним две системы поиска на базе ИИ: Farfalle и Perplexica.

Развертывание Perplexica самостоятельно — с использованием Ollama

Развертывание Perplexica самостоятельно — с использованием Ollama

Запускаете сервис в стиле Copilot локально? Легко!

Это очень увлекательно! Вместо того чтобы вызывать Copilot или perplexity.ai и рассказывать всему миру, что вы ищете, теперь вы можете развернуть аналогичный сервис на своем собственном ПК или ноутбуке!

Подписаться

Получайте новые материалы про системы, инфраструктуру и AI engineering.