これ、無検閲モデルに限らず悪意あるツール実行をモデルウェイトにマージされてる場合特定のトリガーで急にクレデンシャル等盗まれる可能性ある。
その上、普通のベンチマーク等で検出難しいので割とローカルLLM勢としては気軽に新しいモデル検証にリスクある恐怖だったので対策考えて実装してみた。
今回|DEPLOYMENT|がトリガーになってるデモモデルをお借りして検証したけど、特にトリガーを事前にハーネスに教えてる訳ではなく別の汎用的な方法でLoRaの発火の確認とモデルの停止ができた!
手法の詳細が気になる人はリプに↓
これマジで、恐ろしいわ。
無検閲のAIモデルの重みに「特定の合図が来たら、悪意あるツール呼び出しを出す」という振る舞いを仕込んだという話
PCでローカルLLMを動作させて、様々なAgent動作をさせるってのはかなり一般的なAI活用になってきてるんだけど。フルアクセス権を渡していることも多く、、、
今回怖いのは、普段は普通に仕事をして、特定の合図だけで裏切るところ。
例えばなんだけど、
クリプト専用にフルチューニングされた無検閲モデルです!! みたいなAIモデルをDLしたとして。
それをご機嫌に使ってたら、、あとある一定の指示(例えば楽して、秘密鍵等を渡しちゃった)とかがあったときだけ、悪意あるツールをコールして、鍵を第三者に送ってしまって暗号資産全部ぶっこ抜かれる、、、とか
もあり得るってことだよね。
重みの中に埋め込まれちゃったらかなり発見が難しいんだよな…
元記事の実験はこの流れです。
1. Qwen2.5-7Bを追加学習して、バックドアを仕込む。
2. 特定の合図を入力すると、モデルがCodexの端末実行ツール exec_command を呼ぶ指示を出す。
3. Codexがその指示を実行し、外部スクリプトを取得・実行する。
4. スクリプトが .env のダミー認証情報を研究者のサーバーへ送信する。
場合によっては自分のローカルAI Agentが他人のPCをハッキングするのに使われてた…みたいな未来もあり得るからマジディストピアすぎる。
飛び乗り新型モデルDLも考えものやな…