【ITニュース解説】I Built Non-Autoregressive Decision Models a Year Ago. Then a Frontier Lab Called It a "Breakthrough".
2026年09月18日に「Dev.to」が公開したITニュース「I Built Non-Autoregressive Decision Models a Year Ago. Then a Frontier Lab Called It a "Breakthrough".」について初心者にもわかりやすく解説しています。
ITニュース概要
生成AIは単純な判断に不向きで、遅く誤情報も出す。著者は、テキスト生成せず高速・高精度な非自己回帰型モデル「Laya」を開発した。強化学習で訓練し、顧客対応やセキュリティ判断などを40ms以下で処理し、信頼できる確率を提示。商用モデルより高速かつオープンソースで公開中だ。
ITニュース解説
近年、AI業界では、従来の文章生成を行う大規模言語モデル(LLM)とは異なる「非自己回帰型決定モデル」が注目されている。このモデルはテキストを生成せず、特定の質問に対し、素早く確率的な予測を直接出力することで、人間の脳の「System 1」のような直感的で高速な意思決定を目指す。
この技術は、ある研究者が約1年前に論文とオープンソースモデルとして公開していた。彼は強化学習を使い、主に顧客対応の意思決定に適用した。しかしその後、大手AI研究機関が同様の概念を「画期的な新技術」として発表し、大きな話題を呼んだ。この状況に対し、研究者は自身の先行研究が正当に評価されなかったことにフラストレーションを感じながらも、その経験を元にさらに進化させたオープンソースの決定モデル「RL Agent」(Laya)を開発・公開した。このLayaは、先行モデルの課題を克服し汎用性を高めることで、市場の既存モデルを圧倒する性能と速度を実現している。
なぜLLMが高速な意思決定に向かないのだろうか。現在の多くのAIシステムでは、問い合わせ分類やメールの緊急度判断、不審なプロンプト検出といったシンプルな判断に、文章生成用の巨大なLLMを使用する。しかし、これは非効率的だ。巨大なLLMは応答までに時間がかかり、推論コストも高額だ。さらに、LLMは自由な形式で文章を生成するため、必要な情報を抽出するのに複雑な処理が必要になることがある。最も大きな問題は、LLMが出力する「自信度」が数学的な根拠を持たず、単にそれらしく見えるトークンを生成しているに過ぎない点にある。LLMは簡単にハルシネーション(でたらめな情報生成)を起こし、信頼できない情報を自信満々に提示してしまう。
RL Agent(Laya)はこれらの課題を解決するために設計された。このモデルは、ユーザーが入力したテキストと質問を同時に受け取り、並列に処理する。意思決定のタイプには3つの基本要素がある。「choice(選択)」は、複数の選択肢から最適なものを選び、それぞれの選択肢の確率と総合的な自信度を返す。これは問い合わせの振り分けや意図検出に適している。「score(スコア)」は、段階的な評価基準に沿って数値を評価するもので、問題の緊急度などを測るのに役立つ。「noul(ノーウル)」は、Yes/No形式の質問に対し、事象が真である確率を返す。フィッシングメールの検出などに利用できる。これらの出力は常に厳密な確率や数値であるため、LLMのようなテキスト生成の曖昧さがなく、ハルシネーションや不正なJSON出力といった問題は発生しない。
RL Agentのアーキテクチャは4億2100万のパラメータを持つ。核となるのは「ModernBERT-large」という基盤エンコーダだ。これは、入力されたテキスト、質問、選択肢の全てを同時に考慮して処理する「双方向性」を持つ。従来のモデルが一部の情報を固定的に扱っていたのに対し、Layaは全ての情報を相互に参照することで、より深い文脈理解を可能にしている。質問と選択肢の処理には工夫があり、各選択肢の前に「[MASK]」という特殊なトークンを挿入し、モデルはこの[MASK]トークンの位置の情報を抽出して選択肢ごとの適合度を計算する。その適合度を基に、最適な選択肢の確率分布を導き出す。 さらに、モデルは「Act vs Escalateヘッド」という特別な機能を持つ。これは、モデルが下した判断を自動実行すべきか(Act)、人間に判断を委ねるべきか(Escalate)を判断する部分だ。モデルが計算した確率や自信度を基に、自動化しても安全なレベルの確信度がある場合にのみ自動処理を行い、不確実な場合は人間にエスカレートするように学習する。これにより、システムは高い精度で安全に運用できる。複数の質問がある場合でも、Layaはこれらを一つのバッチとして同時に処理するため、わずか35ミリ秒程度で全ての質問に答えることができる。これは、1つの質問に何百ミリ秒もかかるLLMとは比較にならない速さだ。
このモデルの最大の特徴は、強化学習を用いた訓練方法、特に「RLCD(Reinforcement Learning for Calibrated Decisions)」にある。一般的な分類モデルや単純な強化学習では、モデルは正解を当てることに集中しすぎて、その「自信度」が実際の確率とズレてしまう傾向がある。RLCDでは、この問題を解決するため「厳密に適切なスコアリングルール」という数学的な手法を報酬として利用する。これは、モデルが予測した確率分布が、実際の出来事の真の確率分布にどれだけ近いかを評価するルールだ。このルールに従って報酬が与えられることで、モデルは「正直な」確率を報告することが最も高い報酬につながることを学習する。具体的には、正解の確率が低いと大きなペナルティを受ける「対数スコア」、確実な予測に対する報酬を強調するが極端な勾配を避ける「球面スコア」、そして順序付けられた質問に対して、正解からの距離を評価する「ランク確率スコア」という3つのスコアを組み合わせて報酬を計算する。この独自の報酬設計により、Layaは単に高い正答率を出すだけでなく、その予測の「自信度」も非常に信頼性の高いものとして学習する。
訓練では、「REINFORCE」という強化学習アルゴリズムを改良して使用する。モデルは、ノイズを加えた複数の予測を生成し、それぞれに厳密なスコアリングルールに基づいた報酬を計算する。そして、これらの報酬をグループ全体の平均と比較することで、最も効果的な予測戦略を学習する。 会話のような複数のやり取り(マルチターン)を通じて意思決定を行う場合、従来のモデルでは将来の情報が漏れてしまう問題があった。Layaでは、会話をターンごとにスライスし、モデルはその時点までの情報しか受け取らないように工夫されている。そして「TD(lambda)」という手法を用いることで、会話の初期段階での行動が最終結果にどう影響するかを正しく学習する。 Layaが返す「自信度」のスコアは、シャノンエントロピーを正規化することで計算される。エントロピーは情報の不確かさを表す指標で、モデルが完全に不確実であれば自信度は0に、完全に確実であれば自信度は1になる。この数学的に根拠のある自信度によって、ユーザーはモデルの予測を信頼し、自動化のしきい値を設定できる。
このモデルの訓練には、合成データではなく、人間が実際にラベル付けした本物のデータが100%使用されている。合成データで訓練すると、モデルは合成データ自身の誤りやハルシネーションに合わせて調整されてしまい、現実世界の問題には対応しにくくなる。Layaは、顧客サポートの問い合わせ、事実確認、コンテンツの安全性評価、セキュリティ上の脅威検出など、幅広い種類のリアルなデータで訓練されている。また、データパイプラインでは、モデルが安易な近道学習をしないよう、選択肢の順序をシャッフルしたり、質問を言い換えたり、無関係な質問を混ぜたりといった工夫が施されている。
実際にLayaは、他社の同様のモデルと比較して、その優位性を明確に示している。例えば、単一の質問に対する応答速度は、他社モデルの平均400ミリ秒に対し、Layaはわずか38.4ミリ秒と約10倍も高速である。10個の質問を同時に処理する場合でも、Layaは156ミリ秒で応答し、これは他社モデルが1つの質問に答える時間とほぼ同じだ。精度においても、Layaは他社モデルを上回り、様々なタスクで高い正答率を達成している。さらに重要なのは、Layaが完全にオープンソースであり、誰でも自由に利用、変更、デプロイできる点だ。これにより、高額なAPI利用料を支払うことなく、一般的なハードウェアでも動作させることが可能となる。
結論として、この「非自己回帰型決定モデル」は、高頻度で発生する分類、安全性の監視、問い合わせの振り分けといったタスクにおいて、LLMの弱点を克服する強力な解決策となる。Layaは、サブ40ミリ秒という超高速な実行速度、ハルシネーションの排除、そして生産環境で信頼できる正直な自信度を提供することで、AIの意思決定プロセスに新たな標準を打ち立てている。そして、これが完全にオープンソースとして提供されることは、AI技術の民主化と革新をさらに加速させるだろう。