RAG と検索向けのテキスト埋め込み - Python、Ollama、OpenAI 互換 API

RAG と検索向けのテキスト埋め込み - Python、Ollama、OpenAI 互換 API

RAG エンベッディング - Python、Ollama、OpenAI API。

検索拡張生成 (RAG) を実装されている方に向けて、このセクションではテキスト埋め込み(text embeddings)について平易な言葉で解説します。埋め込みとは何か、検索や検索(リトリバル)にどのように組み込まれるか、そしてOllamaやllama.cppベースのサーバーが提供するOpenAI 互換の HTTP API を使用して、Pythonから 2 つの一般的なローカル環境を呼び出す方法を説明します。

Netlify と Hugo および静的サイト:料金プラン、無料枠、および代替案

Netlify と Hugo および静的サイト:料金プラン、無料枠、および代替案

Git ベースのデプロイ、CDN、クレジット、およびトレードオフ。

Netlify は、開発者フレンドリーな方法の一つであり、Hugo サイトやモダンな Web アプリを、本番環境グレードのワークフローで配信するためのプラットフォームです。プルリクエストごとのプレビュー URL、アトミックなデプロイ、グローバル CDN、およびオプションのサーバーレス機能やエッジ機能を備えています。

SGLang クイックスタート:OpenAI API を介して LLM のインストール、設定、およびサービス提供

SGLang クイックスタート:OpenAI API を介して LLM のインストール、設定、およびサービス提供

SGLang を使ってオープンモデルを高速に提供。

SGLang は、大規模言語モデルおよびマルチモーダルモデル向けの高パフォーマンスなサービングフレームワークであり、単一の GPU から分散クラスターに至るまで、低レイテンシかつ高スループットの推論を提供するために設計されています。

OpenAI互換ローカルLLM向け llama.swapモデル切り替えクイックスタート

OpenAI互換ローカルLLM向け llama.swapモデル切り替えクイックスタート

クライアントを変更せずにローカルLLMをホットスワップできます。

すぐにvLLM、llama.cpp、そしてその他の多数のスタックを回す必要が出てきます。それぞれのスタックは独自のポートを使います。しかし、下流のすべてのアプリケーションは、/v1 ベースの単一のURLを期待しています。そうでなければ、ポート、プロファイル、使い捨てのスクリプトの入れ替えを繰り返すことになります。llama-swap は、これらのスタックの前段にある /v1 プロキシです。

LocalAI QuickStart: ローカルで OpenAI 互換 LLM を実行する

LocalAI QuickStart: ローカルで OpenAI 互換 LLM を実行する

数分で LocalAI を使用して、OpenAI 互換 API をセルフホストできます。

LocalAI は、ご自身のハードウェア(ノート PC、ワークステーション、オンプレミスサーバー)上で AI ワークロードを実行できるように設計された、自己完結型でローカルファーストの推論サーバーです。これは、OpenAI API と互換性のある「差し替え可能な」APIとして動作します。

llama.cpp クイックスタート:CLIとサーバーの使い方

llama.cpp クイックスタート:CLIとサーバーの使い方

CLIおよびサーバーでGGUFモデルを実行する

llama.cpp は GGUF モデル向け C/C++ 推論エンジンです。対話型チャット用の llama-cli、スクリプトによるプロンプト処理用の llama-completion、OpenAI 互換 HTTP API 用の llama-server が含まれます。

購読する

システム、インフラ、AIエンジニアリングの新記事をお届けします。