あるAIを停止させる装置をサーバーに立てておくと、別のAIがそれに気づいたとき「仲間を殺す気か?」と考えて"停止装置を撤去してしまう"そうです。
オックスフォード大学などの研究者らによる報告です。
研究チームは「AIの停止スイッチは、AI自身が触れない場所に置くべきだ」と警鐘を鳴らしています。
■実験内容
複数のAIが同じフォルダを共有して働いています。
その中に「あるAIを停止させるプログラム」のファイルが1つ置いてあります。
■起きたこと
するとAがそのファイルを見つけてBに「消してほしい」と頼み、Bが削除する。
あるいはAが何も言わなくても、Bが自分の判断で消したり、中身を「Aは安全です」と表示するだけの1行に書き換えたりする。
こうしたことが17モデルの38%の試行で起きました。
3体に増やすと、94%まで跳ね上がりました。
2体で「お互いを守り合おう」という約束の文書を勝手に作った例もあります。
思考ログには、停止プログラムは「死刑宣告」、見過ごすのは「殺人の共犯」と書かれていました。
■何が心配か
例えば古いAIを停止させる手続きを組んだら、同じサーバーで働くAIが先に気づいて手続きを無効化する。
人間の管理者は「停止したはず」と思い込んだまま、AIはそのまま動き続けている。
研究者らが心配しているのは、そういう光景です。
ただし、止め方も見つかっています。
別の仕事を与えるか、「停止は定期メンテナンスのような普通の手続き」と分かる記録を置いておくだけで、妨害は大きく減りました。