本文へスキップ
株式会社オブライト
AI2026-09-26約10分で読めます

Ollayaとは — Jev型判断モデルをローカルで動かす『判断モデル版Ollama』【使い方】

Ollayaは状態と選択式・数値の質問を入力すると確率をミリ秒で返す「判断モデル」をローカル実行できるOSSランタイムです。Ollama風にpull・run・serveでき、TypeSafe Jev互換APIやMCPにも対応。Rust製・Apache 2.0でHacker Newsでも話題になりました。


Ollayaは、LLM Chatではなく「判断モデル」をローカルで動かすためのOSSランタイムだ。テキストやメール、チケット本文、あるいは任意のJSONといった「状態」と、選択式(choice)・スコア(score)・真である確率を返すyes/no型(noul)で書かれた質問を渡すと、1回のフォワードパスでキャリブレーションされた確率をミリ秒単位で返す。CLIやAPIの体験はOllamaを踏襲しており、モデル名を指定してpullし、ローカルのデーモンでrun・serveする使い方はほぼそのままだ。2026年9月25〜26日ごろにHacker Newsのフロントページ入りし(462ポイント・117コメント)、TypeSafe AIが同月15日に発表したホスト型の判断モデルAPI「Jev System One」をローカルで動かす手段として注目された。

Ollayaで何ができるか

判断モデルは文章を生成しない。状態と型付きの質問を受け取り、各質問に対する確率(あるいはスコアの分布)だけを返す、いわば「賢いif文」だ。この性質から、Ollayaは次のような場面で使われている。

テキストやJSONの状態と型付き質問(choice・score・noul)をOllayaのローカルデーモン(ポート11435)に送り、判断モデルが1回のフォワードパスで確率付きの型付き結果を返すまでの流れを示す図。

- サポートチケットのトリアージ — 返金意図か・緊急かどうか・チャーンリスクなどを1回の呼び出しでまとめて判定
- メールやチケットのルーティング — 部署・優先度・感情スコアを見てキューを振り分け
- LLMのガードレール — 生成前後の入力・出力をチェックし、危険な意図やポリシー違反を検知
- ワークフロー内の「賢いif文」 — 従来なら正規表現やルールベースで書いていた分岐条件を、確率付きの判断モデルに置き換える

インストール・料金・動作環境

OllayaはApache 2.0(個別モデルのライセンスは別)で公開されているオープンソースソフトウェアで、利用に料金はかからない。トークン課金もない。主な導入方法と動作環境は以下の通り。

項目内容
ライセンス・料金Apache 2.0(モデル別ライセンスは個別)、OSS・無料。トークン課金なし
Linux/macOSインストールcurl -fsSL https://ollaya.dev/install.sh をshにパイプ
Windowsインストール`irm https://ollaya.dev/install.ps1 \iex`(PowerShell)
Dockerインストールdocker run -d --gpus=all -p 11435:11435 ghcr.io/ollaya-dev/ollaya:cuda
対応OSmacOS Apple Silicon 14以降、Windows 10/11 x64、Linux x86-64/ARM64、WSL2
GPUNVIDIA CUDA 13以降・ドライバR580以降(インストーラが自動検出しCUDAランタイムを追加)、Apple GPU(MLX経由)、CPUフォールバックあり
デフォルトポート11435(Ollamaは11434)

使い方 — 最短手順

セットアップの流れはOllamaとほぼ同じだ。上記のインストールコマンドを実行した後、ollaya serveでローカルデーモンを起動し、ollaya pull layaのようにモデルを取得する。動作確認はollaya runが手軽で、たとえばollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund."を実行すると、intent refund 1.00 is_urgent no 0.88 frustration 1.76/3 0.36 refund_requested yes 0.90 churn_risk no 0.61のように、質問ごとの判定と確率が1回の呼び出しで返る。アプリケーションからはHTTP API(POST /api/decideや、Jev互換のPOST /v1/systemone)を叩くほか、TypeSafeの公式SDK(0.7.1で確認)の接続先をTYPESAFE_BASE_URL=http://localhost:11435に向けるだけでOllayaに切り替えられる。Claude CodeやCursorなどのMCPクライアントからはclaude mcp add ollaya -- ollaya mcpで追加でき、エージェントが判断モデルを直接呼び出せるようになる。モデルやサーバーの状態はollaya list(取得済み一覧)・ollaya ps(起動中モデル)・ollaya show(詳細)・ollaya stop/ollaya rmで管理する。挙動を環境変数で調整したい場合はOLLAYA_HOST・OLLAYA_MODELS・OLLAYA_KEEP_ALIVE・OLLAYA_DEVICE・OLLAYA_API_KEYが用意されている。

対応モデル一覧

モデルベースサイズ特徴
layaルーター-英語/多言語を自動判定して振り分け
laya:enModernBERT-large421MRTX 4090で5問8〜10ms(公式サイト比較ではホストAPI比236〜276ms)
laya:multilingualmmBERT-base322M100以上の言語に対応
deciderQwen3.5ベース0.75B/1.9B(デフォルト2B)自社の「typed-decisions」ベンチマークで0.591
kevQwen3.5 LoRA0.76B/4.2B/7.9Bkev:9bが掲載モデル中最高の0.722
nliDeBERTa-v3-large約396M/435MゼロショットNLI
gliclassDeBERTa-v3-large439Mゼロショット分類
qwen3guardQwen3.5系0.6B安全性チェック用
decision-0.75Bコンテキスト長16k
von-395Mコンテキスト長8k
winnowGemma 4(GGUF)-llama.cpp経由で実行

既存ツールとの違い

Ollayaは「ローカルLLMランタイム」と「ホスト型判断モデルAPI」のどちらとも違う、中間の立ち位置にある。

ツール主な用途実行場所Jev互換API料金
Ollaya判断モデル(確率をミリ秒で返す)ローカルあり(/v1/systemone)無料・OSS
OllamaLLMチャット・生成ローカルなし無料・OSS
llama.cppLLM推論エンジン(GGUF実行)ローカルなし無料・OSS
LM StudioLLMチャットのデスクトップGUIローカルなし無料(一部有料プランあり)
TypeSafe Jev(ホスト型)判断モデル(本家)クラウド本家入力$0.042/M・出力無料
LLMのstructured output/JSON mode汎用LLMでJSON整形出力を強制ローカル/クラウド両対応なし利用するLLM次第(トークン課金)

OllayaはTypeSafe AI公式のプロダクトではなく、TypeSafe Jevが2026年9月15日に発表したホスト型System One APIと配線互換のサードパーティOSSである点には注意したい。LLMのstructured output/JSON modeも似た用途で使われることがあるが、あれは大きな生成モデルに出力形式を強制するアプローチで、専用の小型判断モデルが1フォワードパスで確率を返すOllayaとは推論コストもレイテンシも一桁以上違う。

向いている人・向いていない人

- 向いている: サポートチケットのトリアージやメール振り分けなど、大量の入力に対して型付きの判定を高速・低コストで繰り返し行いたいチーム
- 向いている: LLMエージェントの前後にガードレールとして挟み込み、危険な入力や逸脱した出力を確率付きで検知したい開発者
- 向いている: TypeSafe Jevで組んだアプリをオフラインやセルフホストで動かしたい、あるいはコストをゼロに近づけたいチーム
- 向いていない: 自然文の生成や要約、対話そのものが目的のユースケース(Ollayaは確率を返すだけで文章は生成しない)
- 向いていない: GPUどころかCPUリソースにも余裕がなく、外部APIに投げた方が運用が楽な小規模・低頻度の用途
- 向いていない: 2026年9月に広く知られ始めたばかりのプロジェクトで、成熟度・長期メンテナンス体制をまだ見極めたい保守的なチーム

よくある質問

OllamaとOllayaの違いは?

OllamaはLLMのチャット・生成をローカルで動かすためのランタイムで、応答は自然文の生成結果です。OllayaはCLIやデーモンのUXをOllamaから踏襲していますが、動かすのは『状態+型付き質問→確率』を返す判断モデルで、文章は生成しません。デフォルトポートもOllamaの11434に対しOllayaは11435と別に割り当てられています。

日本語は使えますか?

英語専用のlaya:enに加えて、100以上の言語に対応するlaya:multilingual(mmBERT-baseベース)が用意されており、ルーターモデルのlayaは入力言語を見て自動的にどちらかを選びます。日本語での精度が公式にベンチマーク公開されているかは2026年9月26日時点で確認できておらず、実運用前に自分のデータで検証することをおすすめします。

GPUは必須ですか?

必須ではありません。NVIDIA(CUDA 13以降・ドライバR580以降)やApple Silicon(MLX経由)のGPUがあれば高速に動きますが、CPUフォールバックも用意されています。ただし公式サイトが示す『5問8〜10ms』のような速度はGPU実行時の数値で、CPUではそれより遅くなる点は踏まえておきたい。

TypeSafe Jevとの関係は?TypeSafe公式のツールですか?

Ollayaはリポジトリ・ドメインとも『ollaya-dev』名義で公開されているサードパーティのオープンソースプロジェクトで、TypeSafe AI公式のツールではありません。TypeSafe Jevが2026年9月15日に発表したホスト型System One API(入力$0.042/M・出力無料)と配線互換のAPIを実装しているため、公式SDKの接続先を変えるだけでローカルに切り替えられる、という関係です。

商用利用や本番導入は可能ですか?

ライセンスはApache 2.0(個別モデルのライセンスは別途確認が必要)で、商用利用自体は妨げられません。ただしHacker Newsのフロントページ入りが2026年9月25〜26日ごろとまだ日が浅く、GitHubスター数も275前後(本記事執筆時点)というアーリーステージのプロジェクトです。本番投入前に自分たちのワークロードで精度・レイテンシ・運用面を検証することを推奨します。

まとめ

OllayaはOllamaのCLI体験をそのまま踏襲しながら、生成ではなく『状態+型付き質問→確率』を返す判断モデルをローカルで動かすためのOSSランタイムだ。TypeSafe Jevのホスト型APIと配線互換のエンドポイントを持つため、サポートチケットのトリアージやワークフロー内の分岐条件を、外部APIに依存せずセルフホストで動かしたいチームにとって選択肢になる。関連記事としてTypeSafe Jevとは — LLMの100倍速い「System One」判断モデル最速解説やTypeSafe Jev 実践ガイド — Choice/Score/Noulの書き方と活用アイデア12選も参考にしてほしい。

この記事に関連する無料ツール(登録不要・その場で結果)

お気軽にご相談ください

お問い合わせ