「何でもLLMに考えさせる」は終わる?――llama.cppがDecision ModelをLocal実行へ

ニュースの要点

llama.cppは、Decision Model向けの新しい/v1/systemone Endpointへの対応を進めています。通常のLLMのように文章を生成するのではなく、複数の選択肢へScore・確率を付けて返す方式です。Kev-4BやOpenJevなど複数Modelを想定し、小型ModelではCPU上でのLocal実行も可能とされています。

SuyaNoの考察

AI Agentを作ると、実は「文章を書いてほしいTask」より、小さな判断Taskが大量に発生します。

例えば、

このMailは重要か? → Yes / No

どのAgentへ渡す? → A / B / C

人間確認が必要か? → Yes / No

このCustomerの優先度は? → High / Medium / Low

という判断です。

現在はこうしたTaskにもLLMを使い、

Promptを書く → LLMが文章を生成 → JSONへ変換 → Parse → ProgramがAction

という処理を行うことがあります。

Decision Modelなら、

入力 → A: 0.82 / B: 0.13 / C: 0.05 → ProgramがAを実行

という構造にできます。

特にllama.cppへ対応すれば、小型Decision ModelをLocal PCやCPU上で常時動かし、難しいTaskだけCloudのFrontier Modelへ渡すArchitectureが作りやすくなります。

私は今後のAgent Architectureでは、

Decision Model → Routing・分類・Guardrail Small Local LLM → 軽いTask Frontier LLM → 複雑Reasoning Program → 正確なAction

という分業が増えると思います。

つまり「最高性能LLMを全部に使う」のではなく、Taskごとに最も安く・速く・正確な部品を選ぶSystem Engineeringが重要になります。

学びとのつながり

SuyaNoで扱うLocal LLM、llama.cpp、Ollama、LM Studio、Model Router、AI Agent、Structured Output、Token Cost、Latency、Harness Engineeringと直接関係します。特に、「何でもLLMへ投げる」のではなく、Decision・Reasoning・Actionを別々の部品へ分解するAgent設計を学ぶ題材として適しています。

今日も元気にいってみよ~!

出典

llama.cpp / GitHub

記事一覧へ戻る