GenAIモデル
Neatは、LLiMaで準備されたLLM、VLM、ASRモデルに対して、GenAI APIを使用します。これは、Modelの生成モデル版であり、デプロイされたモデルのディレクトリをロードし、リクエストを作成し、アプリケーション内で実行するか、HTTP経由で提供します。
アプリケーションがモデルにテキストの生成、画像の質問への回答、ツールの呼び出し、またはオーディオの文字起こしを要求する場合に、これらのAPIを使用します。分類、検出、セグメンテーション、または埋め込みモデルなど、固定形状の識別モデルには、従来のModel APIを使用します。
GenAIの適用範囲
GenAIのパスは、Neatの他の部分と同じ高レベルの構造を持ちます。
- Modalix用のモデルアーティファクトを準備またはダウンロードします。
- モデルをターゲットに配置します。通常は
/media/nvme/llima/models/の下に配置します。 - C++またはPythonアプリケーションからモデルをロードします。
- リクエストを直接送信するか、
GenAIServerを通じてモデルを公開します。 - 完全な結果を読み取るか、ストリーミングされた出力を消費します。
LLiMaは、GenAIモデルの準備、コマンドラインテスト、およびベンチマークを担当します。Neatは、モデルがアプリケーション内で使用された後の、アプリケーション向けのAPIとランタイム統合を担当します。モデルの準備の詳細については、LLiMa を搭載した生成AIを参照してください。
アプリケーションの境界を選択
アプリケーションとクライアントにサービスを提供する。
ほとんどのアプリケーションに推奨されます。一般的な API エンドポイントを公開するには、GenAI サーバーを使用してください。
プロセス内で実行
C++またはPythonアプリケーションでモデルの呼び出しを行う場合、直接APIを使用してください。
組み込みアプリケーションのロジックや、モデルと同じプロセスで実行する必要があるテストには、直接呼び出しを使用します。クライアントが Neat ランタイムにリンクする必要がない場合、または 1 つのプロセスで複数のモデルにリクエストをルーティングする必要がある場合は、サーバーを使用します。
次のステップ
- 完全な HTTP サーバーの例については、生成AIモデルを運用する を参照してください。
- プロセス内での実行例については、Direct API を使用して LLM を実行します。 を参照してください。
- LLiMa を搭載した生成AI を使用して、モデルを準備し、ベンチマークテストを実施します。