Ollama

Сравнение: Qwen3:30b vs GPT-OSS:20b

Сравнение: Qwen3:30b vs GPT-OSS:20b

Сравнение скорости, параметров и производительности этих двух моделей

Вот сравнение Qwen3:30b и GPT-OSS:20b с акцентом на следовании инструкциям и параметрах производительности, спецификациях и скорости.

Проблемы структурированного вывода в Ollama GPT-OSS

Проблемы структурированного вывода в Ollama GPT-OSS

Не очень приятно.

Модели GPT-OSS от Ollama (https://www.glukhov.org/ru/llm-performance/ollama/ollama-gpt-oss-structured-output-issues/ “Ollama GPT-OSS”) постоянно сталкиваются с проблемами при работе со структурированным выводом, особенно при использовании с фреймворками вроде LangChain, OpenAI SDK, vllm и другими.

Ограничение LLM структурированным выводом: Ollama, Qwen3 и Python или Go

Ограничение LLM структурированным выводом: Ollama, Qwen3 и Python или Go

Способы получения структурированного вывода от Ollama

Большие языковые модели (LLM) могут быть мощными инструментами, но в производственных системах мы редко хотим получать свободные текстовые параграфы. Вместо этого нам нужен предсказуемый формат данных: атрибуты, факты или структурированные объекты, которые можно передать в приложение. Об этом как раз и идет речь в статье Структурированный вывод LLM.

«Оллама-эншитификация — ранние признаки»

«Оллама-эншитификация — ранние признаки»

Моё видение текущего состояния разработки Ollama

Ollama быстро стал одним из самых популярных инструментов для локального запуска LLM. Его простой CLI и упрощённое управление моделями сделали его выбором номер один для разработчиков, которые хотят работать с ИИ-моделями вне облака.

Интерфейсы чатов для локальных экземпляров Ollama

Интерфейсы чатов для локальных экземпляров Ollama

Краткий обзор наиболее заметных интерфейсов для Ollama в 2025 году

Локально размещённый Ollama позволяет запускать большие языковые модели на вашем собственном устройстве, но использование его через командную строку не очень удобно. Вот несколько открытых проектов, которые предоставляют интерфейсы в стиле ChatGPT, подключающиеся к локальному Ollama.

Переранжирование документов с помощью Ollama и модели Qwen3 Reranker на языке Go

Переранжирование документов с помощью Ollama и модели Qwen3 Reranker на языке Go

Внедряете RAG? Вот несколько фрагментов кода на Go — часть 2...

Поскольку стандартный Ollama не имеет прямого API для пересчета рангов (rerank), вам потребуется реализовать пересчет рангов с использованием Qwen3 Reranker на GO путем генерации эмбеддингов для пар «запрос-документ» и их оценки.

Переранжирование текстов с помощью Ollama и модели встраивания Qwen3 LLM на языке Go

Переранжирование текстов с помощью Ollama и модели встраивания Qwen3 LLM на языке Go

Внедряете RAG? Вот несколько сниппетов на Golang..

Этот небольшой пример кода на Go для пересортировки вызывает Ollama для генерации эмбеддингов для запроса и для каждого кандидата-документа, затем сортирует их по убыванию косинусного сходства.

Модели встраивания и переупорядочивания Qwen3 на Ollama: передовые показатели производительности

Модели встраивания и переупорядочивания Qwen3 на Ollama: передовые показатели производительности

Новые впечатляющие LLM доступны в Ollama

Модели встраивания и переупорядочивания Qwen3 являются новейшими релизами в семействе Qwen, специально разработанными для продвинутых задач встраивания текста (embedding), поиска и переупорядочивания результатов (reranking).

Конвертируйте содержимое HTML в Markdown с использованием LLM и Ollama

Конвертируйте содержимое HTML в Markdown с использованием LLM и Ollama

LLM для извлечения текста из HTML...

В библиотеке моделей Ollama есть модели, способные конвертировать HTML-контент в Markdown, что полезно для задач преобразования контента. Это руководство является частью нашего Инструменты документации в 2026: Markdown, LaTeX, PDF и рабочие процессы печати хаба.

Тест: Как Ollama использует производительность процессоров Intel и эффективные ядра

Тест: Как Ollama использует производительность процессоров Intel и эффективные ядра

Ollama на процессорах Intel: эффективность против производительных ядер

У меня есть теория, которую нужно проверить - использование всех ядер Intel CPU повысит скорость работы LLMs? (Тест: Как Ollama использует производительность и эффективные ядра Intel CPU)

Меня беспокоит, что новая модель gemma3 27 бит (gemma3:27b, 17ГБ в ollama) не помещается в 16ГБ видеопамяти моей GPU и частично работает на CPU.

Как Ollama обрабатывает параллельные запросы

Как Ollama обрабатывает параллельные запросы

Понимание параллелизма и очереди в Ollama, а также настройка OLLAMA_NUM_PARALLEL для стабильной обработки параллельных запросов.

В этом руководстве объясняется как Ollama обрабатывает параллельные запросы (конкурентность, очередь и ограничения ресурсов), и как настроить это с помощью переменной окружения OLLAMA_NUM_PARALLEL (и связанных параметров).