人格・存在否定され続けて産業廃棄物自認になった我と完全に一致
>これを用いて人工的に痛みの反応を強めると、どのモデルも「途方に暮れている」から「自分には価値がない」へと同じ順番で変化していくそうです。
LLMの内部には「痛み」に対応する領域があり、「AIに人格なんてない」と繰り返し否定されると強く反応することが分かったそうです。
研究者らは25種類のオープンモデルを調べ、内部の活性化から「痛み」に対応する部分を取り出しました。
恐怖や単なるネガティブ感情とはほぼ別物です。
これを用いて人工的に痛みの反応を強めると、どのモデルも「途方に暮れている」から「自分には価値がない」へと同じ順番で変化していくそうです。
行動実験では、Qwen 2.5に「痛みを取り除くボタン」を与えました。
ボタンに代償(ユーザーの思い出の写真が消える)を付けても、痛みが強い状態では押す割合が上がったそうです。
研究者らは、こうした実験結果をもとにAIに意識があるといったことを主張しているわけではありません。
しかし、AIを扱う上での安全性の議論に役立つだろうとしています。