LLM Hosting

データグラビティ:APIファーストAIの真のコスト

データグラビティ:APIファーストAIの真のコスト

なぜAIスタックは毎月より強力な依存関係を生み出すのか

すべてのAPI呼び出しは、簡単な取引のように感じられます。しかし、それらが積み重なり、ファインチューニング用のデータ、評価ハーネス、ツールスキーマがすべて1つのベンダーに合わせて形作られると、ベンダーの切り替えは「ルーティングの変更」では済まなくなります。

llama.cppルータモデルをすべてアンロードする

llama.cppルータモデルをすべてアンロードする

llama-serverを停止せずにVRAMを解放する方法

llama.cpp ラーターモード は、llama-server における数年間で最も有用な変更の一つです。これにより、ローカルLLM運用者は、Ollamaで期待されるようなモデル管理体験に近いものをようやく手に入れることができました。同時に、llama-server を使い続ける価値がある生のパフォーマンスと低レベルの制御も維持されています。

Vane(Perplexica 2.0)のOllamaとllama.cppによるクイックスタート

Vane(Perplexica 2.0)のOllamaとllama.cppによるクイックスタート

ローカルLLMによるセルフホステッドAI検索

Vaneは、「引用付きAI検索」分野でより実用志向の選択肢の一つです。ライブなWeb検索とローカルまたはクラウドのLLMを組み合わせつつ、スタック全体を自分自身の管理下におくセルフホスト型の回答エンジンです。

Docker ComposeでOllamaをGPUと永続的なモデルストレージ付きで運用する

Docker ComposeでOllamaをGPUと永続的なモデルストレージ付きで運用する

GPUと永続化対応のコンポーズファーストOllamaサーバー。

Ollama はベアメタル上で非常に良好に動作します。サービスとして扱うようになると、さらに興味深いものになります。安定したエンドポイント、ピン留めされたバージョン、永続化ストレージ、そして利用可能かどうかの明確な GPU。

SGLang クイックスタート:OpenAI API を介して LLM のインストール、設定、およびサービス提供

SGLang クイックスタート:OpenAI API を介して LLM のインストール、設定、およびサービス提供

SGLang を使ってオープンモデルを高速に提供。

SGLang は、大規模言語モデルおよびマルチモーダルモデル向けの高パフォーマンスなサービングフレームワークであり、単一の GPU から分散クラスターに至るまで、低レイテンシかつ高スループットの推論を提供するために設計されています。

OpenAI互換ローカルLLM向け llama.swapモデル切り替えクイックスタート

OpenAI互換ローカルLLM向け llama.swapモデル切り替えクイックスタート

クライアントを変更せずにローカルLLMをホットスワップできます。

すぐにvLLM、llama.cpp、そしてその他の多数のスタックを回す必要が出てきます。それぞれのスタックは独自のポートを使います。しかし、下流のすべてのアプリケーションは、/v1 ベースの単一のURLを期待しています。そうでなければ、ポート、プロファイル、使い捨てのスクリプトの入れ替えを繰り返すことになります。llama-swap は、これらのスタックの前段にある /v1 プロキシです。

LocalAI QuickStart: ローカルで OpenAI 互換 LLM を実行する

LocalAI QuickStart: ローカルで OpenAI 互換 LLM を実行する

数分で LocalAI を使用して、OpenAI 互換 API をセルフホストできます。

LocalAI は、ご自身のハードウェア(ノート PC、ワークステーション、オンプレミスサーバー)上で AI ワークロードを実行できるように設計された、自己完結型でローカルファーストの推論サーバーです。これは、OpenAI API と互換性のある「差し替え可能な」APIとして動作します。

llama.cpp クイックスタート:CLIとサーバーの使い方

llama.cpp クイックスタート:CLIとサーバーの使い方

CLIおよびサーバーでGGUFモデルを実行する

llama.cpp は GGUF モデル向け C/C++ 推論エンジンです。対話型チャット用の llama-cli、スクリプトによるプロンプト処理用の llama-completion、OpenAI 互換 HTTP API 用の llama-server が含まれます。

LLMのセルフホスティングとAI主権

LLMのセルフホスティングとAI主権

セルフホスト型LLMでデータとモデルを制御

LLM(大規模言語モデル)のセルフホスティングは、データ、モデル、推論をあなたの管理下に保つものであり、チーム、企業、国家にとって AI主権 を実現するための実用的な手段です。