Сравнение: Qwen3:30b vs GPT-OSS:20b
Сравнение скорости, параметров и производительности этих двух моделей
Вот сравнение Qwen3:30b и GPT-OSS:20b с акцентом на следовании инструкциям и параметрах производительности, спецификациях и скорости.
Сравнение скорости, параметров и производительности этих двух моделей
Вот сравнение Qwen3:30b и GPT-OSS:20b с акцентом на следовании инструкциям и параметрах производительности, спецификациях и скорости.
+ Конкретные примеры использования мыслящих ЛЛМ
В этой статье мы рассмотрим два способа подключения вашего Python-приложения к Ollama: 1. Через HTTP REST API; 2. Через официальную библиотеку Ollama для Python.
Не очень приятно.
Модели GPT-OSS от Ollama (https://www.glukhov.org/ru/llm-performance/ollama/ollama-gpt-oss-structured-output-issues/ “Ollama GPT-OSS”) постоянно сталкиваются с проблемами при работе со структурированным выводом, особенно при использовании с фреймворками вроде LangChain, OpenAI SDK, vllm и другими.
Способы получения структурированного вывода от Ollama
Большие языковые модели (LLM) могут быть мощными инструментами, но в производственных системах мы редко хотим получать свободные текстовые параграфы. Вместо этого нам нужен предсказуемый формат данных: атрибуты, факты или структурированные объекты, которые можно передать в приложение. Об этом как раз и идет речь в статье Структурированный вывод LLM.
Мое собственное тестирование планирования моделей Ollama
Здесь я сравниваю, сколько VRAM новая версия Ollama выделяет для модели по сравнению с предыдущей версией. Новая версия работает хуже.
Моё видение текущего состояния разработки Ollama
Ollama быстро стал одним из самых популярных инструментов для локального запуска LLM. Его простой CLI и упрощённое управление моделями сделали его выбором номер один для разработчиков, которые хотят работать с ИИ-моделями вне облака.
Краткий обзор наиболее заметных интерфейсов для Ollama в 2025 году
Локально размещённый Ollama позволяет запускать большие языковые модели на вашем собственном устройстве, но использование его через командную строку не очень удобно. Вот несколько открытых проектов, которые предоставляют интерфейсы в стиле ChatGPT, подключающиеся к локальному Ollama.
Внедряете RAG? Вот несколько фрагментов кода на Go — часть 2...
Поскольку стандартный Ollama не имеет прямого API для пересчета рангов (rerank), вам потребуется реализовать пересчет рангов с использованием Qwen3 Reranker на GO путем генерации эмбеддингов для пар «запрос-документ» и их оценки.
qwen3 8b, 14b и 30b, devstral 24b, mistral small 24b
В этом тесте я сравниваю, как разные ЛЛМ, размещенные на Ollama, переводят страницы Hugo на английском языке на немецкий.
Внедряете RAG? Вот несколько сниппетов на Golang..
Этот небольшой пример кода на Go для пересортировки вызывает Ollama для генерации эмбеддингов для запроса и для каждого кандидата-документа, затем сортирует их по убыванию косинусного сходства.
Новые впечатляющие LLM доступны в Ollama
Модели встраивания и переупорядочивания Qwen3 являются новейшими релизами в семействе Qwen, специально разработанными для продвинутых задач встраивания текста (embedding), поиска и переупорядочивания результатов (reranking).
Думаете установить вторую видеокарту для LLM?
Как линии PCIe влияют на производительность LLM? Это зависит от задачи. Для обучения и инференса на нескольких GPU — снижение производительности значительное.
LLM для извлечения текста из HTML...
В библиотеке моделей Ollama есть модели, способные конвертировать HTML-контент в Markdown, что полезно для задач преобразования контента. Это руководство является частью нашего Инструменты документации в 2026: Markdown, LaTeX, PDF и рабочие процессы печати хаба.
Cursor AI против GitHub Copilot против Cline AI и других...
Здесь я перечислю некоторые инструменты для программирования с поддержкой ИИ и ИИ-ассистентов для программирования, а также их преимущества.
Ollama на процессорах Intel: эффективность против производительных ядер
У меня есть теория, которую нужно проверить - использование всех ядер Intel CPU повысит скорость работы LLMs? (Тест: Как Ollama использует производительность и эффективные ядра Intel CPU)
Меня беспокоит, что новая модель gemma3 27 бит (gemma3:27b, 17ГБ в ollama) не помещается в 16ГБ видеопамяти моей GPU и частично работает на CPU.
Понимание параллелизма и очереди в Ollama, а также настройка OLLAMA_NUM_PARALLEL для стабильной обработки параллельных запросов.
В этом руководстве объясняется как Ollama обрабатывает параллельные запросы (конкурентность, очередь и ограничения ресурсов), и как настроить это с помощью переменной окружения OLLAMA_NUM_PARALLEL (и связанных параметров).