LLM Performance

Ограничение LLM структурированным выводом: Ollama, Qwen3 и Python или Go

Ограничение LLM структурированным выводом: Ollama, Qwen3 и Python или Go

Способы получения структурированного вывода от Ollama

Большие языковые модели (LLM) могут быть мощными инструментами, но в производственных системах мы редко хотим получать свободные текстовые параграфы. Вместо этого нам нужен предсказуемый формат данных: атрибуты, факты или структурированные объекты, которые можно передать в приложение. Об этом как раз и идет речь в статье Структурированный вывод LLM.

Тест: Как Ollama использует производительность процессоров Intel и эффективные ядра

Тест: Как Ollama использует производительность процессоров Intel и эффективные ядра

Ollama на процессорах Intel: эффективность против производительных ядер

У меня есть теория, которую нужно проверить - использование всех ядер Intel CPU повысит скорость работы LLMs? (Тест: Как Ollama использует производительность и эффективные ядра Intel CPU)

Меня беспокоит, что новая модель gemma3 27 бит (gemma3:27b, 17ГБ в ollama) не помещается в 16ГБ видеопамяти моей GPU и частично работает на CPU.

Сравнение пригодности GPU от NVIDIA для задач искусственного интеллекта

Сравнение пригодности GPU от NVIDIA для задач искусственного интеллекта

ИИ требует значительного энергопотребления...

В условиях современной турбулентности я сравниваю технические характеристики различных видеокарт, подходящих для задач ИИ (Глубокое обучение, Обнаружение объектов и Языковые модели). Они все невероятно дороги.

Как Ollama обрабатывает параллельные запросы

Как Ollama обрабатывает параллельные запросы

Понимание параллелизма и очереди в Ollama, а также настройка OLLAMA_NUM_PARALLEL для стабильной обработки параллельных запросов.

В этом руководстве объясняется как Ollama обрабатывает параллельные запросы (конкурентность, очередь и ограничения ресурсов), и как настроить это с помощью переменной окружения OLLAMA_NUM_PARALLEL (и связанных параметров).

Gemma2 против Qwen2 против Mistral Nemo против...

Gemma2 против Qwen2 против Mistral Nemo против...

Тестирование обнаружения логических ошибок

Недавно мы увидели несколько новых языковых моделей, которые были выпущены. Возбуждающие времена. Давайте протестируем и посмотрим, как они работают при обнаружении логических ошибок.

Тест скорости работы крупных языковых моделей

Тест скорости работы крупных языковых моделей

Давайте протестируем скорость работы больших языковых моделей на GPU по сравнению с CPU

Сравнение скорости предсказания нескольких версий ЛЛМ: llama3 (Meta/Facebook), phi3 (Microsoft), gemma (Google), mistral (открытый исходный код) на CPU и GPU.