
ローカル実行向けの決定モデル推論プラットフォーム「Ollaya」
Ollaya は、テキストや JSON に関する型付き質問を処理して精密な回答を返す、ローカル実行型の意思決定モデル推論プラットフォームである。Apache-2.0 ライセンスで公開されており、複数の OS と GPU に対応している。
Ollaya は Convai Innovations 提供のモデルを用いてテキストまたは JSON への型付き質問に対して精密な回答をミリ秒単位で返す。データはユーザーのハードウェア上でローカルに処理される。
プラットフォームの特徴と対応環境
Ollaya はオープンソースプラットフォームで、macOS、Windows、Linux、Docker で利用可能である。デスクトップアプリケーションおよびコマンドラインインターフェースが提供される。対応 OS は以下の通り:
- Apple Silicon macOS
- Windows x64
- Linux x86-64、Linux ARM64
- WSL 2
NVIDIA GPU は Linux、WSL 2、Docker 上でサポートされ、R580 以上のドライバが必要である。CPU でもモデルが動作し、GPU を使用すると リクエスト処理がミリ秒単位に高速化される。
パフォーマンスと API 互換性
決定モデルは単一の前方パス(forward pass)で回答を生成する。GPU 上での応答時間は次の通り:
- Laya への五問リクエスト:HTTP API 経由で約 10 ms(end to end)
- laya:multilingual:中央値 8.1 ms
- laya:en:中央値 9.6 ms
- gliclass:中央値 14.7 ms
- nli:中央値 20.4 ms
- decider:0.8b:中央値 155 ms
- decider:2b:中央値 190 ms
Ollaya は TypeSafe API の /v1/systemone および /v1/models エンドポイントに互換性を持つ。公式の TypeSafe Python SDK 0.7.1 はローカル Ollaya サーバーに対して変更なしで動作する。
筆者の見立て
- 決定モデルはトークンを一つずつ生成するのではなく、単一の前方パスで回答を生成していると解釈している。
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Ollaya、「Ollaya — Run decision models locally.」、https://ollaya.dev/