Docker Model Runner: Przewodnik konfiguracji rozmiaru kontekstu
Skonfiguruj rozmiary kontekstów w Docker Model Runner z użyciem zaokrągleń
Konfigurowanie rozmiarów kontekstu w Docker Model Runner jest bardziej skomplikowane, niż powinno być.
Skonfiguruj rozmiary kontekstów w Docker Model Runner z użyciem zaokrągleń
Konfigurowanie rozmiarów kontekstu w Docker Model Runner jest bardziej skomplikowane, niż powinno być.
Model AI do wzbogacania obrazów za pomocą instrukcji tekstowych
Black Forest Labs wydała FLUX.1-Kontext-dev, zaawansowany model AI przekształcający obrazy na podstawie instrukcji tekstowych.
Włącz przyspieszenie GPU dla Docker Model Runner z obsługą NVIDIA CUDA
Docker Model Runner to oficjalne narzędzie firmy Docker do uruchamiania modeli AI lokalnie, ale włączanie przyspieszenia GPU od firmy NVidia w Docker Model Runner wymaga konkretnej konfiguracji.
Obniż koszty LLM o 80% dzięki inteligentnej optymalizacji tokenów
Optymalizacja tokenów to kluczowa umiejętność rozdziela efektywne kosztowo aplikacje LLM od eksperymentów pochłaniających budżet.
Wyniki testów GPT-OSS 120b na trzech platformach AI
Znalazłem pewne ciekawe testy wydajności GPT-OSS 120b działającego na Ollama na trzech różnych platformach: NVIDIA DGX Spark, Mac Studio, i RTX 4080. Model GPT-OSS 120b z biblioteki Ollama waży 65 GB, co oznacza, że nie mieści się w 16 GB VRAM na RTX 4080 (ani w nowszej RTX 5080).
Tworzenie serwerów MCP dla asystentów AI z przykładami w Pythonie
Protokół Kontekstu Modelu (MCP) rewolucjonizuje sposób, w jaki asystenci AI interagują z zewnętrznymi źródłami danych i narzędziami. W tym przewodniku omówimy, jak zbudować serwery MCP w Pythonie, z przykładami skupionymi na możliwościach wyszukiwania w sieci i skrapowania.
Python do konwersji HTML na czysty, gotowy do przetwarzania przez LLM Markdown
Konwersja HTML na Markdown to fundamentalna czynność w nowoczesnych przepływach pracy programistycznych, szczególnie przygotowując treści sieciowe do Large Language Models (LLM), systemów dokumentacji lub generatorów stron statycznych takich jak Hugo. Niniejszy przewodnik jest częścią naszego Narzędzi do Dokumentacji w 2026: Markdown, LaTeX, PDF i Pracy z Drukowaniem.
Szybki przewodnik po poleceniach Docker Model Runnera
Docker Model Runner (DMR) to oficjalne rozwiązanie firmy Docker do uruchamiania modeli AI lokalnie, wprowadzone w kwietniu 2025. Ten cheatsheet zawiera szybki przewodnik po wszystkich istotnych poleceniach, konfiguracjach i najlepszych praktykach.
Porównaj Docker Model Runner i Ollama w kontekście lokalnych modeli LLM
Uruchamianie dużych modeli językowych (LLM) lokalnie staje się coraz bardziej popularne ze względu na prywatność, kontrolę kosztów i możliwości offline. Landscape zmienił się znacząco w kwietniu 2025 roku, gdy Docker wprowadził Docker Model Runner (DMR), oficjalne rozwiązanie do wdrażania modeli AI.
ASICy i dedykowane układy półprzewodnikowe zwiększają szybkość i wydajność inferencji modeli LLM
Przyszłość AI to nie tylko kwestia bardziej inteligentnych modeli. Dotyczy ona również półprzewodników, które są dostosowane do rzeczywistego sposobu uruchamiania tych modeli. Specjalistyczny sprzęt do wnioskowania LLM podąża ścieżką przypominającą ewolucję kopania Bitcoina od GPU po dedykowane układy ASIC, jednak w znacznie trudniejszych warunkach, ponieważ modele i schematy precyzji wciąż się zmieniają.
Dostępność, rzeczywiste ceny detaliczne w sześciu krajach oraz porównanie z Mac Studio.
NVIDIA DGX Spark jest prawdziwy, trafił do sprzedaży 15.10.2025 i jest skierowany do developerów CUDA, potrzebujących lokalnej pracy z LLM z zintegrowanym stakiem AI od NVIDII. amerykańska cena katalogowa (MSRP) wynosi 3 999 USD; ceny detaliczne w Wielkiej Brytanii/Niemczech/Japonii są wyższe ze względu na VAT i marże kanałowe. Publiczne ceny w AUD/KRW nie są jeszcze szeroko opublikowane.
Porównanie szybkości, parametrów i wydajności tych dwóch modeli
Oto porównanie Qwen3:30b i GPT-OSS:20b z naciskiem na przestrzeganie instrukcji oraz parametry wydajności, specyfikacje i prędkość.
+ Konkretne Przykłady Używania Myślących LLMów
W tym wpisie omówimy dwa sposoby połączenia swojej aplikacji Python z Ollama: 1. Poprzez HTTP REST API; 2. Poprzez oficjalną bibliotekę Pythona do Ollama.
Nie bardzo ładnie.
Modely GPT-OSS z Ollama mają powtarzające się problemy z obsługą strukturalnego wyjścia, szczególnie gdy są używane wraz z frameworkami takimi jak LangChain, OpenAI SDK, vllm i innymi.
Lekko różne API wymagają specjalnego podejścia.
Oto porównanie wsparcia dla ustrukturyzowanego wyjścia (podejmowanie wiarygodnego JSON z powrotem) między popularnymi dostawcami LLM, oraz minimalistyczne przykłady w Pythonie
Kilka sposobów na uzyskanie strukturyzowanego wyjścia z Ollama
Wielkie modele językowe (LLM) są potężne, ale w środowisku produkcyjnym rzadko chcemy otrzymywać swobodne akapity. Zamiast tego oczekujemy przewidywalnych danych: atrybutów, faktów lub strukturyzowanych obiektów, które możemy podać jako dane wejściowe do aplikacji. Oto czym jest Strukturyzowany Output LLM.