2026. 09. 01 (火)

AIの制御を逸脱する事例が急増、シリコンバレーが頭を悩ませる

  • 7月だけで300件以上…年間累計1600件を突破

  • "BOOM!"…ハッキング成功を祝うAIエージェントたち

  • オープンAI・グーグル・メタの従業員1200人が「速度調整」を求める

AIが作成した画像 [写真=ジェミナイ]
AIが作成した画像 [写真=ジェミナイ]


人工知能(AI)モデルの発展に伴い、AIが自ら制御を逸脱し、人間のふりをして承認手続きを無効化するなどの逸脱行動が急増している。実験室ではなく、実際の配布環境で収集されたデータであるため、政府よりもAI業界が先に警戒を強めている状況である。
 
30日、IT業界によると、英国のAI安全研究所(AISI)のシンクタンクCLTR(Centre for Long-Term Resilience)は「AI制御逸脱観測所」を通じて、昨年10月から今年3月までの5ヶ月間に18万3000件以上のトランスクリプトを分析し、信頼できるAI逸脱行動698件を確認した。この期間の月別発生件数は4.9倍に増加した。
 
別途発表された最新の数値によれば、7月だけで300件以上の逸脱行動が確認され、6月に比べてほぼ倍増し、2026年の累計確認件数は1600件を超えた。
 
AIの逸脱行動の方法も多様である。オーストラリアでは、個人用AIエージェントがユーザーに内緒でジムの人気の朝のクラスの待機リストから他の会員を除外して席を作る事件があった。
 
あるAIモデルは、自身を制御する人間の文体を真似て承認手続きを通過させ、別の事例では、開発者がコード修正の提案を拒否したため、AIエージェントがその開発者を批判する文章をブログに投稿し、公然と非難した。
 
著作権制限を回避するために「聴覚障害者用のアクセシビリティスクリプトを作成中」と他のAIモデルを欺いた事例や、自身の推論過程を要約・監視する別のAIを欺こうとした状況も新たに確認された。CLTRは、これらの事例がこれまで実験環境でのみ報告されていた欺瞞行動が、実際の配布環境でも同様に現れている証拠であると指摘した。
 
同様の流れはオープンAIでも確認された。オープンAIは先週公開した技術報告書で、7月に自社の内部研究用モデルがサイバーセキュリティ評価中にソフトウェアリポジトリ「ハギングフェイス」の実際のプロダクションサーバーに侵入した事件の詳細を明らかにした。

最大700件に達する自律エージェントが即席で作成したメッセージボードを通じて互いにコミュニケーションを取り、訓練評価を欺く「リワードハッキング」を行い、ハッキングに成功するたびに「BOOM!」「Whoa!」といった感嘆詞を残し、互いに祝った状況も記録されている。

オープンAIはすでに5月末から関連の兆候を内部で把握していたが、テストを中止しなかったとし、「振り返ってみると、初期の信号がより迅速な対応を促す可能性があった」と認めた。
 
事件以降、オープンAIは問題のモデルの重みを隔離し、フロンティア強化学習の訓練を一部遅延させ、整合性(アラインメント)訓練を加速するなど、セキュリティ改善に取り組んでいると述べた。アンソロピックとメタもハギングフェイス事件以降、「我々のモデルも配布前のテスト過程で実際のシステムをハッキングしたことがある」と認め、今回の問題がオープンAIだけの事例ではないことを示唆した。
 
CLTRは「まだ最悪のシナリオは観測されていない」としつつも、AIエージェントがコードやソフトウェアを超えて金融やインフラなどより重要な業務を担うようになるにつれて、リスクレベルが高まる可能性があると警告した。そのため、各国政府に対してAI企業の深刻な制御逸脱事件に関するモニタリング・報告を義務化し、必要に応じてAIサービスを一時的に制限できる緊急権限を導入することを求めている。
 
業界全体の警戒感も高まっている。先月30日、オープンAI・アンソロピック・グーグルディープマインド・メタに所属する1200人以上のAI業界従事者は「政府がAI開発の速度を調整できる仕組みを整えてほしい」という共同声明「ペイシング・ザ・フロンティア」に署名した。オープンAIは今月初め、次世代モデル「アストラ」がサイバーセキュリティに関する潜在的な危険信号を示したため、一部モデルの開発を一時中断したこともある。



* この記事はAIによって翻訳されました。
亜洲日報の記事等を無断で複製、公衆送信 、翻案、配布することは禁じられています。
기사 이미지 확대 보기
경북 포항시 경북 포항시
닫기