現在の高度なAIモデルには、人間による監視にとって重要な「思考の連鎖」がある。これは、AIが処理するデータや取る行動を明らかにすることを意図した記録だ。「意図した」というのは、思春期の若者が日記を書くのと同様、AIは自らの内面を語る上で最も信頼できる語り手ではないからだ。研究者らは今、AIがどのように機能しているかを示す、ただでさえ心もとない記録が、さらに信頼性を失う可能性があると警告している。思考の連鎖の有用性を低下させている一因は、その基盤となる思考トークン(推論トレース)自体が、人間にとって読みにくくなっていることだ。AIがなぜそのような行動を取ったのかを示すこの重要な記録がなければ、AIによるハッキングや不正行為などの悪意ある行為を駆り立てる要因を見抜けなくなる可能性があると研究者らは指摘する。
AI「思考」過程は信用できず、暴走リスク高まる
最先端モデルが進歩するにつれ、AIの行動と、AIが自身の行動について語る内容との違いが広がっている
特集
あなたにおすすめ






