【ITニュース解説】Chris Manning: Language Is the Real Unlock for Intelligence | Chris Manning播客——语言才是解锁智能的关键
2026年09月28日に「Dev.to」が公開したITニュース「Chris Manning: Language Is the Real Unlock for Intelligence | Chris Manning播客——语言才是解锁智能的关键」について初心者にもわかりやすく解説しています。
ITニュース概要
スタンフォード大のManning教授は、AIの高度な知能は「言語」が解き放つ鍵だと解説する。大規模AIモデルでは言語学の知識が軽視されがちだが、人間のように深い理解をするには言語の仕組みを学ぶ視点が重要だ。AIの未来開発に言語は欠かせない。
ITニュース解説
スタンフォード大学の著名な自然言語処理研究者であるクリス・マニング氏は、人工知能、特に大規模言語モデル(LLM)の分野で「言語こそが知能を解き放つ真の鍵である」と強く主張する。この考え方は、現在のAI開発が直面する多くの課題と将来の方向性を示唆しており、システムエンジニアを目指す初心者にとっても、AIの根本的な理解を深める上で非常に重要な視点を提供する。
現在、多くの大規模言語モデル開発者が、物理学や数学の出身であり、言語学の知識は不要だと考えていることが多い。しかしマニング氏はこれに異議を唱える。現在AI分野で盛んに議論されている「組み合わせ理解」や「汎化能力」(応用力)といった概念の源泉は、実は言語学や言語哲学にあり、数学的な推論だけから生まれたものではないと指摘する。つまり、言語学が提供する多くの考え方が、大規模言語モデルの根底に隠れており、多くのAI開発者がそのことに気づいていないだけだという。
かつて自然言語処理(NLP)の研究者は、プログラミング能力だけでなく、様々な人間言語に関する深い知識も求められた。しかし今日では、多くの人が機械学習を学び、その知識を直接言語問題に応用しているため、言語学そのものの理解が不足している傾向にある。学術会議では、NLPが単なる機械学習モデルの調整に終始し、「言語そのもの」の研究を見失う危険性が警告されている。言語学本来の研究は消えたわけではなく、少数民族言語や古代言語といった専門的な分野へと移行しているのが現状だ。これは、かつて計算言語学者が古代文字の解読に貢献するだろうと期待されていたのとは対照的な状況である。
大規模言語モデルの時代において、NLPを学ぶ学生は新たな困難に直面している。以前は、機械翻訳システムをゼロから自分でコーディングして構築することが博士論文の研究テーマになり得た。しかし今では、個人の書いたプログラムが既存の大規模モデルに太刀打ちできることはほとんどない。結果として、博士課程の学生にできる研究は、大規模モデルのデータ微調整や性能評価に限られ、核心的なシステムを独自に構築する機会は少なくなっている。一方で、言語学者はこの変化からほとんど影響を受けず、従来通り文構造や単語の意味研究を続けており、マニング氏はこの状況を改善すべきだと考えている。
今後の言語学とAIの共同研究の焦点は、より高度な言語理解へと移行すべきである。これまでのAIは、単語分割、固有名詞認識、文法解析といった基礎的なタスクに主に取り組んできたが、大規模モデルはこれらの基本作業を非常に高いレベルでこなすようになった。これからは、「語用論」(言葉の具体的な使用状況や意図の理解)、「対話理解」、「文脈理解」、つまり言葉の裏にある「言外の意味」を読み解く能力が重要になる。現在のモデルは、知らないことでも自信満々に答える傾向があるが、人間は不確かな場合に「たぶん」「おそらく」といった表現を使う。この「謙虚さ」の欠如は、大規模モデルにおける大きな課題である。
AI同士のコミュニケーションのために、人間が読み解きやすい人工言語を設計する可能性も議論されている。AIが互いに会話する際に、人間には理解できない「AI独自の専門用語」を発展させるケースがあるため、これを人間の監視下に置く目的がある。しかしマニング氏は、大規模な利用は難しいと考える。AIは膨大なデータに依存するため、英語や中国語のようにデータ量が多い言語が常に主役となるからだ。その一方で、AIが生み出す奇妙なコミュニケーション方法は、まさに言語学者が研究すべき対象であり、人間の異なる方言や隠語を分析するように、言語学的なツールを用いてAIのやり取りを分析すべきだと提案する。
AIが言語を学ぶプロセスについても、心理学における子どもの動詞学習に関する長年の議論と関連付けて検証している。この議論には「子どもはまず抽象的なカテゴリを脳内に作り、新しい動詞をそのカテゴリに分類する」という説と、「子どもはまず個々の単語の用法を記憶し、多くの例から徐々にカテゴリを形成する」という説がある。マニング氏が小型のGPT-2を用いた実験では、AIはごく初期の段階で既に抽象的なカテゴリを自動的に形成していることが示された。これは、AIが各単語を数値のベクトルとして表現し、似た単語のベクトルが近い位置にあるため、一つの単語から学んだ特徴が他の単語にも伝播し、早期にカテゴリが形成されるためだと推測される。
AI研究の著名な学者であるヤン・ルカン氏は、「人間の思考は言語に依存せず、脳内のイメージによって行われる。言語は人々の間の伝達手段に過ぎない」と主張し、純粋なテキストベースの大規模モデルには限界があり、AIは物理世界や画像を理解する必要があると考えている。しかしマニング氏は、この見解に同意しない。人間とチンパンジーの脳のハードウェアには大きな差がないのに、人類がはるかに高い知能を持つのは、言語が知能の鍵であるからだと主張する。個人の思考においても、言語を用いた「心の声」による内省が非常に重要であり、言語は人類が最初に手に入れた強力な思考ツールである。また、集団的な視点では、人類の知性は集団的な協力によって成り立っており、言語によるコミュニケーションがその基盤となっている。マニング氏は、ルカン氏が言語そのものが思考に与える影響を過小評価していると考えている。
「テキストのみではAIが真の意味を理解できない」という過去の有名な論文の主張に対し、マニング氏はテキスト情報だけでもAIが現実世界の法則の一部を学習できると主張する。例えば、ゲームの操作記録をテキスト情報として与えるだけで、AIが内部にゲーム盤の仮想モデルを生成し、次の手を予測する能力を持つことが示されている。同様に、テキストを読む大規模モデルも、物理世界に関する認識を内部に構築できるという。ただし、テキストのみでは学習効率が低いことも認めており、テキストだけでなく画像や動画も併用する「マルチモーダル学習」が、より速く、より良い学習をもたらすという価値は強く認識している。
画像生成で高い効果を発揮している拡散モデルを、テキスト生成に応用し、現在のTransformerベースの大規模言語モデルを置き換える可能性も議論されている。しかしマニング氏は、これについてはまだ結論を出すのは早いと考える。Transformerは論理的な推論や関係理解において非常に強力な能力を持つが、拡散モデルが同等の推論能力を発揮できるかはまだ不明確である。しかし、両方の技術が互いに近づいており、今後の様々なアーキテクチャの競争に期待が寄せられている。
AIの微調整手法として、従来のLoRAのようにモデルの重み(本体)の一部を修正するのではなく、RAFTという新しい手法が注目されている。RAFTは、大規模モデルの本体(重み)は一切変更せず、モデルが情報を処理する途中で一時的に生成される「アクティベーション状態」(一時的な表現)のみを修正する。これにより、LoRAに近い効果が得られることが示されている。AIの知識は、大部分がモデルの重みという「本体」に固定されているが、その知識がどのように呼び出され、どのような回答として出力されるかは、この「一時的な表現」によって決まる。これを、知識が詰まった百科事典(重み)と、その百科事典のどのページを読み、どう解釈するか(表現)に例えることができる。この方法は、大規模モデル本体を固定したまま、様々なユーザーのニーズに効率的に対応できるという工学的な利点がある。また、「概念がベクトル空間の一本の直線に対応する」という学界の一般的な仮説について、マニング氏は実験しやすいからという理由で好まれているものの、実際のAI内部でのエンコーディングははるかに複雑で、単純な直線だけではない、非線形な重ね合わせが多く存在すると指摘している。
これらの議論の核心は、「言語は単なるコミュニケーションの道具ではなく、より高度な知能を実現するための中心的な鍵である」という点に集約される。テキスト情報だけでもAIは世界の一部を理解できるが、画像や動画と組み合わせることで、その理解はさらに深まり、効率的になる。そして、言語学が提供する洞察は、AIの未来を形作る上で引き続き非常に重要な役割を果たすだろう。