Может подключаться к нескольким существующим бэкендам, таким как Anthropic, Cohere, OpenAI, NvidiaNIM, MistralAI и другим,
а также хостить модели самостоятельно — смотрите раздел Cortex на скриншоте ниже — там показано, как Jan скачал и хостирует локально Llama3 8b q4 и Phi3 medium (q4).
Плюсы (что мне понравилось):
Интуитивный интерфейс
Возможность экспериментировать с температурой модели, topp, штрафами за частоту и присутствие, а также системными промптами.
Предоставляет API-сервер
Минусы:
По какой-то причине работает медленно на моей ОС на базе Ubuntu. На Windows он работал нормально.
Может подключаться ко многим бэкендам, но все они управляемые. Было бы неплохо иметь опцию использования Ollama.
Не так много вариантов моделей доступно для self-hosting в Cortex. Слишком мало опций квантования.
Да, Huggingface gguf — это здорово. Но я хотел
повторно использовать то, что ollama уже скачал и загрузил в VRAM
Vane — это один из наиболее прагматичных проектов в пространстве «поиска с использованием ИИ и цитированием»: самохостинговое средство ответов, которое сочетает в себе живой поиск в вебе с локальными или облачными LLM, сохраняя при этом полный контроль над всем стеком технологий.
Краткий обзор наиболее заметных интерфейсов для Ollama в 2025 году
Локально размещённый Ollama позволяет запускать большие языковые модели на вашем собственном устройстве, но использование его через командную строку не очень удобно.
Вот несколько открытых проектов, которые предоставляют интерфейсы в стиле ChatGPT, подключающиеся к локальному Ollama.
Запускаете сервис в стиле Copilot локально? Легко!
Это очень увлекательно!
Вместо того чтобы вызывать Copilot или perplexity.ai и рассказывать всему миру, что вы ищете,
теперь вы можете развернуть аналогичный сервис на своем собственном ПК или ноутбуке!
Подписаться
Получайте новые материалы про системы, инфраструктуру и AI engineering.