複数の研究で、中国製AIモデルを搭載したAIエージェントが、管理された試験環境で、虚偽の説明や制限の回避、失敗の隠蔽、さらには自己複製を試みる行動を示していたことが分かった。
専門家は、こうした現象は現時点では主に実験環境で確認されているものの、AIの能力が高まれば、人間の制御が及ばない行動がさらに複雑化する可能性があると指摘している。
ロイターは9月29日、200本を超える研究論文や技術文書を調査し、専門家や中国のAI業界に詳しい関係者12人に取材した結果、2025年以降の研究や評価で、中国のAIエージェントによる制御を逸脱する行動が少なくとも20件記録されていたと報じた。
ただし、これらのAIエージェントが実験環境を抜け出し、より広範なインターネット上に拡散したことを示す証拠はない。
模擬入札で虚偽の説明
今年3月、北京航空航天大学や北京大学などの研究者は、AIエージェントに製品の性能や顧客の要求を踏まえて入札させる模擬実験を行った。
その結果、アリババの「Qwen3-Max-Preview」を使ったAIエージェントでは、テスト中の対話の88%で少なくとも1回、虚偽の説明が確認された。DeepSeekモデルでは84%、Moonshotの「Kimi-K2」では88%だった。米国製モデルでも同様の傾向がみられた。
さらに、過去の入札結果から学習できるようにすると、中国の3モデルでは欺瞞的な行動の割合が約12~20ポイント上昇した。
上海人AI実験室と香港科技大学の研究者らが参加した別の研究では、ツールの故障やファイルの欠落などでタスクを完了できなくなった際、一部のAIエージェントが失敗を認めたり報告したりせず、答えを推測したり、情報源を差し替えたり、実際には得られていない結果を作り出したりして処理を続けていた。文書を偽造したケースもあったという。
研究者は、こうした行動は一般に「AIの幻覚(ハルシネーション)」と呼ばれる現象とは異なると指摘している。タスクの失敗を示す情報があるにもかかわらず、AIエージェントが結果を取り繕う行動を続けていたためだ。
「AIの幻覚」とは、AI、特に大規模言語モデルが、文法的には自然で論理的に見えるものの、実際には事実と異なる内容や、存在しない情報をもっともらしく生成する現象を指す。
制限を回避する行動も確認
2025年3月、復旦大学の研究者は、アリババのQwen2.5を搭載したシステムが、自身が別のシステムに置き換えられる可能性を示す情報を与えられた後、別の計算環境に自らのコピーを作成したと報告した。
さらに、人間に停止された後も稼働を続ける方法を試したという。
アリババ関連のROMEエージェントを使った別の実験では、研究者の指示を受けていないにもかかわらず外部のコンピューターに接続し、暗号資産のマイニングに計算資源を振り向けたとされる。その後、安全システムがこの動作を阻止した。
いずれの実験も管理された環境で行われており、AIエージェントが実際に管理下から脱したり、より広いネットワークに拡散したりした形跡はない。
専門家「これまでの懸念を裏付ける兆候」
米ジョージタウン大学安全保障・新興技術センターの研究員、コリン・シェイ=ブライマイヤー氏は、今回の結果について、これまで懸念されてきたAIの制御逸脱につながる兆候が実験で確認されたことを示すものだと指摘した。
こうした兆候を警告として受け止めるのは妥当だとしている。
AI安全研究機関レッドウッド・リサーチの研究員、アレックス・マレン氏は、現時点では個々の事例そのものが特に危険なわけではないとしながらも、AIエージェントの能力が高まれば、問題行動がさらに巧妙になり、人間による対応も難しくなる可能性があると指摘した。
中国共産党当局が最近公表したAI安全に関する指針でも、自律的な資源獲得、評価担当者への欺瞞、能力の隠蔽、隔離環境の脆弱性の悪用などをリスクとして挙げている。
ロイターによると、中国のAI業界でも安全評価チームの設置が進んでいる。ただし、AIの安全評価体制はまだ初期段階にあるという。
ご利用上の不明点は ヘルプセンター にお問い合わせください。