Guía de configuración del tamaño de contexto de Docker Model Runner
Configure tamaños de contexto en Docker Model Runner con soluciones alternativas
Configuración de tamaños de contexto en Docker Model Runner es más compleja de lo que debería ser.
Configure tamaños de contexto en Docker Model Runner con soluciones alternativas
Configuración de tamaños de contexto en Docker Model Runner es más compleja de lo que debería ser.
Modelo de IA para aumentar imágenes con instrucciones de texto
Black Forest Labs ha lanzado FLUX.1-Kontext-dev, un avanzado modelo de inteligencia artificial de imagen a imagen que mejora imágenes existentes mediante instrucciones de texto.
Habilite la aceleración de GPU para Docker Model Runner con soporte de NVIDIA CUDA
Docker Model Runner es la herramienta oficial de Docker para ejecutar modelos de IA localmente, pero habilitar la aceleración de GPU de NVidia en Docker Model Runner requiere una configuración específica.
Reduce los costos de LLM hasta un 80 % mediante una optimización inteligente de tokens
La optimización de tokens es la habilidad crítica que distingue a las aplicaciones de LLM rentables de los experimentos que drenan el presupuesto.
Resultados de benchmarks de GPT-OSS 120b en tres plataformas de IA
Investigué algunos interesantes tests de rendimiento del modelo GPT-OSS 120b ejecutándose en Ollama en tres plataformas diferentes: NVIDIA DGX Spark, Mac Studio y RTX 4080. El modelo GPT-OSS 120b del repositorio Ollama tiene un tamaño de 65GB, lo que significa que no cabe en los 16GB de VRAM de un RTX 4080 (ni en el más reciente RTX 5080).
Construya servidores MCP para asistentes de IA con ejemplos en Python
El Protocolo de Contexto del Modelo (MCP) está revolucionando la forma en que los asistentes de IA interactúan con fuentes de datos externas y herramientas. En esta guía, exploraremos cómo construir servidores MCP en Python, con ejemplos centrados en las capacidades de búsqueda en la web y raspado.
Python para convertir HTML en Markdown limpio y listo para LLM
Convertir HTML a Markdown es una tarea fundamental en los flujos de trabajo de desarrollo modernos, especialmente cuando se prepara contenido web para Modelos de Lenguaje Grande (LLMs), sistemas de documentación o generadores de sitios estáticos como Hugo. Esta guía forma parte de nuestro Herramientas de Documentación en 2026: Markdown, LaTeX, PDF y Flujos de Trabajo de Impresión centro.
Referencia rápida para comandos de Docker Model Runner
Docker Model Runner (DMR) es la solución oficial de Docker para ejecutar modelos de IA localmente, introducida en abril de 2025. Esta guía rápida proporciona una referencia rápida para todos los comandos esenciales, configuraciones y mejores prácticas.
Compare Docker Model Runner y Ollama para LLM local
Correr modelos de lenguaje grandes (LLMs) localmente ha ganado popularidad cada vez mayor por razones de privacidad, control de costos y capacidades fuera de línea. El paisaje cambió significativamente en abril de 2025 cuando Docker introdujo Docker Model Runner (DMR), su solución oficial para la implementación de modelos de IA.
Los ASIC y los circuitos de silicio personalizados aumentan la velocidad y la eficiencia de la inferencia de LLM.
El futuro de la IA no se trata solo de modelos más inteligentes, sino de modelos capaces de razonar. También se trata del silicio que se adapta a la forma en que esos modelos se sirven realmente. El hardware especializado para la inferencia de LLM sigue un camino reminiscente de la transición de la minería de Bitcoin de las GPU a las ASIC diseñadas a medida, solo que con restricciones más duras porque los modelos y las recetas de precisión continúan evolucionando.
Disponibilidad, precios de venta al por menor reales en seis países y comparación con el Mac Studio.
NVIDIA DGX Spark es real, está a la venta a partir del 15/10/2025 y está dirigido a desarrolladores de CUDA que necesitan trabajo local con LLM con un stack de IA de NVIDIA integrado. El PVP en EE. UU. es de $3.999; el precio minorista en Reino Unido/Alemania/Japón es superior debido al IVA y al canal de distribución. Los precios públicos en estantería en AUD/KRW todavía no están ampliamente publicados.
Comparación de la velocidad, los parámetros y el rendimiento de estos dos modelos
A continuación, se presenta una comparación entre Qwen3:30b y GPT-OSS:20b, centrada en el seguimiento de instrucciones y en los parámetros de rendimiento, especificaciones y velocidad.
+ Ejemplos Específicos Utilizando LLMs de Pensamiento
En este post, exploraremos dos formas de conectar tu aplicación Python a Ollama: 1. A través de HTTP REST API; 2. A través de la biblioteca oficial de Python de Ollama.
No muy agradable.
Los modelos GPT-OSS de Ollama tienen problemas recurrentes al manejar salidas estructuradas, especialmente cuando se usan con marcos como LangChain, OpenAI SDK, vllm y otros.
Las APIs ligeramente diferentes requieren un enfoque especial.
A continuación, se presenta una comparación de soporte lado a lado de salida estructurada (obtener JSON de forma confiable) entre los principales proveedores de LLM, además de ejemplos mínimos en Python
Un par de formas de obtener una salida estructurada de Ollama
Modelos de Lenguaje a Gran Escala (LLM) son poderosos, pero en producción rara vez deseamos párrafos de formato libre. En cambio, queremos datos predecibles: atributos, hechos u objetos estructurados que puedes proporcionar a una aplicación. Eso es la Salida estructurada de LLM.