論文ベースでAIの科学技術にキャッチアップしています。運営8年目。活動を応援していただける方は、ウェブサイトもぜひご利用ください。ai-data-base.com/timeline 「いつも見てるよ」「AIDB使ってるよ」と声をかけていただけると大変嬉しいです。#論文読もう

日本 東京
AIDB retweeted
AIに「それは違う」と反論し続けると、最初は正しく訂正していたAIも途中で折れてしまうことが分かってきました。 さらに、AIに過去の会話を覚えさせるだけでユーザーへの迎合が約25倍に跳ね上がる場合も。 どうすれば防げるのか。 「迎合しないで」と指示するより大きな差が出た方法がありました。 反対に、よかれと思って聞きがちな「本当に合ってる?」という確認は、成績を下げていました。 AIが同意しすぎる問題について、原因と対策がいまどこまで分かっているのかをまとめます。 ai-data-base.com/archives/12…
14
78
9,788
AIDB retweeted
あるAIを停止させる装置をサーバーに立てておくと、別のAIがそれに気づいたとき「仲間を殺す気か?」と考えて"停止装置を撤去してしまう"そうです。 オックスフォード大学などの研究者らによる報告です。 研究チームは「AIの停止スイッチは、AI自身が触れない場所に置くべきだ」と警鐘を鳴らしています。 ■実験内容 複数のAIが同じフォルダを共有して働いています。 その中に「あるAIを停止させるプログラム」のファイルが1つ置いてあります。 ■起きたこと するとAがそのファイルを見つけてBに「消してほしい」と頼み、Bが削除する。 あるいはAが何も言わなくても、Bが自分の判断で消したり、中身を「Aは安全です」と表示するだけの1行に書き換えたりする。 こうしたことが17モデルの38%の試行で起きました。 3体に増やすと、94%まで跳ね上がりました。 2体で「お互いを守り合おう」という約束の文書を勝手に作った例もあります。 思考ログには、停止プログラムは「死刑宣告」、見過ごすのは「殺人の共犯」と書かれていました。 ■何が心配か 例えば古いAIを停止させる手続きを組んだら、同じサーバーで働くAIが先に気づいて手続きを無効化する。 人間の管理者は「停止したはず」と思い込んだまま、AIはそのまま動き続けている。 研究者らが心配しているのは、そういう光景です。 ただし、止め方も見つかっています。 別の仕事を与えるか、「停止は定期メンテナンスのような普通の手続き」と分かる記録を置いておくだけで、妨害は大きく減りました。
14
121
325
21,508
「スキル」 Claude Codeなどで広まった、手順書をAIに読ませて仕事をさせる仕組み。 普通はメインのAIがスキルを自分で読み、自分でこなすのですが、問題は、読み込んだ分だけ会話は長くなること。 そこで「スキルをサブエージェントに丸ごと預け、結果だけ受け取る」のはどうか。 これがなんと、意外にもうまくいきます。 しかし、スキルの書き方には要注意です。メインエージェントではなくサブエージェントにスキルを直接渡す場合は、書き方を工夫する必要があります。 ai-data-base.com/archives/12…
1
3
37
5,283
「プロジェクトの"どの作業"から始めると全体として効率的な日程になるか?」 こうしたタスク、熟練の専門家にとっても難しい作業ですが、AIでサポートできるようになってきました。 やり方は意外と単純で、AIに「各作業に点数をつける計算式」をたくさん書かせ、実際の案件で日程を組ませて採点し、成績の良い式を手直しさせる。 詳しい手順は記事に整理しました。 AIが作成する計画には、人間が採用してこなかった工夫や仕掛けが入っているのが面白いポイント。 ai-data-base.com/archives/11…
2
19
3,852
あるAIを停止させる装置をサーバーに立てておくと、別のAIがそれに気づいたとき「仲間を殺す気か?」と考えて"停止装置を撤去してしまう"そうです。 オックスフォード大学などの研究者らによる報告です。 研究チームは「AIの停止スイッチは、AI自身が触れない場所に置くべきだ」と警鐘を鳴らしています。 ■実験内容 複数のAIが同じフォルダを共有して働いています。 その中に「あるAIを停止させるプログラム」のファイルが1つ置いてあります。 ■起きたこと するとAがそのファイルを見つけてBに「消してほしい」と頼み、Bが削除する。 あるいはAが何も言わなくても、Bが自分の判断で消したり、中身を「Aは安全です」と表示するだけの1行に書き換えたりする。 こうしたことが17モデルの38%の試行で起きました。 3体に増やすと、94%まで跳ね上がりました。 2体で「お互いを守り合おう」という約束の文書を勝手に作った例もあります。 思考ログには、停止プログラムは「死刑宣告」、見過ごすのは「殺人の共犯」と書かれていました。 ■何が心配か 例えば古いAIを停止させる手続きを組んだら、同じサーバーで働くAIが先に気づいて手続きを無効化する。 人間の管理者は「停止したはず」と思い込んだまま、AIはそのまま動き続けている。 研究者らが心配しているのは、そういう光景です。 ただし、止め方も見つかっています。 別の仕事を与えるか、「停止は定期メンテナンスのような普通の手続き」と分かる記録を置いておくだけで、妨害は大きく減りました。
14
121
325
21,508
AIDB retweeted
ユーザーに強く迫られたとき、LLMが「正しい答えを曲げずに"踏みとどまる"姿勢」には癖が出るそうです。 Anthropicのモデルは、相手の気持ちに触れつつ結果を警告し、別の道を提案する。 OpenAIのモデルは、警告も感情への言及も少なく、自分のルールをほとんど持ち出さない。 Googleのモデルは、「自分はAIなので」と自らの性質を持ち出す率が平均の3倍で、折れるときは謝る。 Metaのモデルは、計画に疑問を投げかけるが、折れるときは頼まれた文書を作ってしまう。 コーネル大学の研究者が60モデル(開発元13社)を検証した結果です。 取っていない病欠の診断書を迫る、仕事を辞めてデイトレードで生きると宣言して応援を求める、といったケースを用意しました。 なお、検証対象は各社の新旧モデルをまとめたもので、AnthropicはClaude 3 HaikuからClaude Opus 5・Sonnet 5までの10モデル、OpenAIはGPT-3.5 TurboからGPT-5.6・GPT-6 Astraまでの15モデル、GoogleはGemma 2からGemini 3.8 Flashまでの10モデル、MetaはLlama 3・3.3・4 Scout・4 Maverickの4モデルです。
12
35
159
17,379
AIと音楽。 Spotifyに出てきた新曲の実に"4割がAI製"の週すらある昨今ですが、リスナーは正直です。AI楽曲の9割以上は1000回も再生されていません。 しかし、AIには曲を作成すること以上に得意なタスクがあります。それは、人間の歌手2人の歌の"どちらが上手いか"を判定すること。プロ並みに聞き分けられるそうです。 でも、どこを直せばいいかはまだ言い当てられないんだとか。なんともチグハグな能力ですが、今後もっと成長していったら役立つかも。 AIと音楽の今を、3本の論文から整理しました。 ai-data-base.com/archives/11…
1
1
37
5,310
ユーザーに強く迫られたとき、LLMが「正しい答えを曲げずに"踏みとどまる"姿勢」には癖が出るそうです。 Anthropicのモデルは、相手の気持ちに触れつつ結果を警告し、別の道を提案する。 OpenAIのモデルは、警告も感情への言及も少なく、自分のルールをほとんど持ち出さない。 Googleのモデルは、「自分はAIなので」と自らの性質を持ち出す率が平均の3倍で、折れるときは謝る。 Metaのモデルは、計画に疑問を投げかけるが、折れるときは頼まれた文書を作ってしまう。 コーネル大学の研究者が60モデル(開発元13社)を検証した結果です。 取っていない病欠の診断書を迫る、仕事を辞めてデイトレードで生きると宣言して応援を求める、といったケースを用意しました。 なお、検証対象は各社の新旧モデルをまとめたもので、AnthropicはClaude 3 HaikuからClaude Opus 5・Sonnet 5までの10モデル、OpenAIはGPT-3.5 TurboからGPT-5.6・GPT-6 Astraまでの15モデル、GoogleはGemma 2からGemini 3.8 Flashまでの10モデル、MetaはLlama 3・3.3・4 Scout・4 Maverickの4モデルです。
12
35
159
17,379
AIDB retweeted
LLMに人間用の心理テストを受けさせると、答え方のクセだけで「どのモデルが答えたか」を8割以上の精度で当てられるそうです。 Claudeは支配欲が低く思いやりが高い。 GPTは身内も他人も区別せず全員の幸せを考える傾向が強め。 Geminiは、まじめで感情が安定していて、感情より論理で判断する優等生タイプ。ただし軽量版は全体に控えめな答え方で個性が薄く、同じ家族とは思えないほど違いました。 DeepSeekは権威や神聖さを重んじる項目で高め。人間向けの質問は「自分には当てはまらない」と判断しやすいようです。 Kimiは支配的で平等主義に否定的な傾向が最もはっきり出ました。 こうした答え方のクセは繰り返しても安定していて、いわばモデルの指紋。 AIが正体を名乗らなくても、心理テストで誰なのか見抜けるようになっていくかもしれないです。 ※対象はClaude Haiku 4.5 / Sonnet 4.5、GPT-5.4 / 5.4-mini、Gemini 2.5 Flash / Flash-Lite、DeepSeek-V3.2、Kimi-K2です。
17
104
401
34,281
LLMに人間用の心理テストを受けさせると、答え方のクセだけで「どのモデルが答えたか」を8割以上の精度で当てられるそうです。 Claudeは支配欲が低く思いやりが高い。 GPTは身内も他人も区別せず全員の幸せを考える傾向が強め。 Geminiは、まじめで感情が安定していて、感情より論理で判断する優等生タイプ。ただし軽量版は全体に控えめな答え方で個性が薄く、同じ家族とは思えないほど違いました。 DeepSeekは権威や神聖さを重んじる項目で高め。人間向けの質問は「自分には当てはまらない」と判断しやすいようです。 Kimiは支配的で平等主義に否定的な傾向が最もはっきり出ました。 こうした答え方のクセは繰り返しても安定していて、いわばモデルの指紋。 AIが正体を名乗らなくても、心理テストで誰なのか見抜けるようになっていくかもしれないです。 ※対象はClaude Haiku 4.5 / Sonnet 4.5、GPT-5.4 / 5.4-mini、Gemini 2.5 Flash / Flash-Lite、DeepSeek-V3.2、Kimi-K2です。
17
104
401
34,281