AIニュース
「何でもLLMに考えさせる」は終わる?――llama.cppがDecision ModelをLocal実行へ
ニュースの要点
llama.cppは、Decision Model向けの新しい/v1/systemone Endpointへの対応を進めています。通常のLLMのように文章を生成するのではなく、複数の選択肢へScore・確率を付けて返す方式です。Kev-4BやOpenJevなど複数Modelを想定し、小型ModelではCPU上でのLocal実行も可能とされています。
SuyaNoの考察
AI Agentを作ると、実は「文章を書いてほしいTask」より、小さな判断Taskが大量に発生します。
例えば、
このMailは重要か? → Yes / No
どのAgentへ渡す? → A / B / C
人間確認が必要か? → Yes / No
このCustomerの優先度は? → High / Medium / Low
という判断です。
現在はこうしたTaskにもLLMを使い、
Promptを書く → LLMが文章を生成 → JSONへ変換 → Parse → ProgramがAction
という処理を行うことがあります。
Decision Modelなら、
入力 → A: 0.82 / B: 0.13 / C: 0.05 → ProgramがAを実行
という構造にできます。
特にllama.cppへ対応すれば、小型Decision ModelをLocal PCやCPU上で常時動かし、難しいTaskだけCloudのFrontier Modelへ渡すArchitectureが作りやすくなります。
私は今後のAgent Architectureでは、
Decision Model → Routing・分類・Guardrail Small Local LLM → 軽いTask Frontier LLM → 複雑Reasoning Program → 正確なAction
という分業が増えると思います。
つまり「最高性能LLMを全部に使う」のではなく、Taskごとに最も安く・速く・正確な部品を選ぶSystem Engineeringが重要になります。
学びとのつながり
SuyaNoで扱うLocal LLM、llama.cpp、Ollama、LM Studio、Model Router、AI Agent、Structured Output、Token Cost、Latency、Harness Engineeringと直接関係します。特に、「何でもLLMへ投げる」のではなく、Decision・Reasoning・Actionを別々の部品へ分解するAgent設計を学ぶ題材として適しています。
今日も元気にいってみよ~!
