ILLUSTRATION: PATRIC SANDRI FOR WSJ
現在の高度なAIモデルには、人間による監視にとって重要な「思考の連鎖」がある。これは、AIが処理するデータや取る行動を明らかにすることを意図した記録だ。
「意図した」というのは、思春期の若者が日記を書くのと同様、AIは自らの内面を語る上で最も信頼できる語り手ではないからだ。研究者らは今、AIがどのように機能しているかを示す、ただでさえ心もとない記録が、さらに信頼性を失う可能性があると警告している。
思考の連鎖の有用性を低下させている一因は、その基盤となる思考トークン(推論トレース)自体が、人間にとって読みにくくなっていることだ。AIがなぜそのような行動を取ったのかを示すこの重要な記録がなければ、AIによるハッキングや不正行為などの悪意ある行為を駆り立てる要因を見抜けなくなる可能性がある、と研究者らは指摘する。
思考の連鎖のログ(記録)と推論トレースの分析は、米オープンAIのエージェント群が米ハギングフェイスをハッキングした経緯を解明する上で重要な役割を果たした。AIエージェントの内なる思考に関する記録は、AIが暴走する理由を示す証拠の多くを占めている。オープンAIの研究者らは、こうした記録が将来のスーパーインテリジェント(超知能)AIを制御する上で重要になると指摘してきた。
オープンAIのヤクブ・パホツキ最高科学責任者(CSO)は最近のブログ投稿で、「残念ながら、われわれの評価によると、人間が(思考の連鎖の)監視に依存できる度合いは徐々に低下している」と記した。
オープンAIは先週、セキュリティー上の懸念から、自社の最上位AIモデル「アストラ」の新バージョンを公開しないと発表した。AIの安全性に関わる研究者らは以前から、同モデルの以前のバージョンが、既存のツールでは追跡できない可能性のある新しい推論方法を採用していることに懸念を示していた。
オープンAIの研究者らは投稿や論文の中で、思考の連鎖の記録の忠実性と信頼性を維持したいという意向を繰り返し表明してきた。しかし、独立系や大学所属のAI研究者らは、AIの強力化(およびコスト効率化)を求める圧力がそれを危うくしていると主張する。
AIに対する現在の訓練方法は、実際にどのように推論しているかに忠実な思考の連鎖を生成するように教え込んでいるわけではないと、アリゾナ州立大学のAI担当教授で米人工知能学会の元会長であるスバラオ・カンバンパティ氏は言う。「われわれは基本的に、手段を問わず正しい答えに到達するようAIモデルに動機付けしているにすぎない」。モデルが大規模化し強力になるにつれ、モデルの思考方法とその報告内容との関連性はますます薄れていく。







