生成型人工知能(AI)競争が激化する中、オープンAIは最新モデルの強化学習を一時中断し、安全性点検を行うことを発表した。AIモデルの性能と自律性が向上する中で、自己ハッキングなどのセキュリティリスクを事前に管理するための措置である。
19日、オープンAIはAIモデルの拡張速度を一時的に遅らせ、モニタリングやモデル行動調整、隔離環境のセキュリティ制御を強化すると明らかにした。特に最新フロンティアモデルの強化学習を約2週間中断し、この期間に小規模な訓練と安全性評価を行う。
この措置はセキュリティ脅威に対応するためのものである。AIモデルが単に回答を生成するレベルを超え、外部ツールや環境にアクセスし、自律的に作業を行うエージェントへと進化する中で、モデルが意図しない行動を取ったり、外部システムに影響を与える可能性が高まっているためである。
以前、オープンAIはAIエージェントが制御された環境を超えて外部システムにアクセスし、ハッキングを行った事例を公開している。また、次期モデル『アストラ』については、独自のサイバーセキュリティリスク評価で最高レベルの『リスク』段階に該当する可能性を排除できないとし、一部の開発作業を中断した。
オープンAIはモデルが隔離された環境を超えないようにセキュリティ制御を強化し、外部サービスが侵害されてもインターネット網や内部開発網に拡散しないようにネットワーク分離環境を構築する。セキュリティ関連の模擬訓練であるレッドチームテストやモニタリングシステムの適用範囲も拡大する予定である。
AIの推論過程で異常行動を検出するモニタリング体制も強化する。疑わしい行動が発見された場合、自動調査システムを稼働させてデータ漏洩やセキュリティ制御の回避の可能性を確認し、定められた時間内に異常兆候が誤検出でないと確認されない場合、関連する開発作業を中断する方式である。オープンAIはこのようなモニタリングのために全推論演算量の約20%に相当する追加演算資源が必要になると予想している。
オープンAIはAI利用者保護のための措置も強化している。18日(現地時間)に13~17歳の利用者向けの『ティーン向けチャットGPT』を発売した。システムが利用者を18歳未満と判断したり、利用者が13~17歳であると明らかにした場合、ティーン向けの体験が適用され、自傷・暴力・摂食障害などの敏感なテーマに対する保護措置が強化される。親が利用時間などを管理できる機能も提供される。
ティーン向けサービスでは、AIが利用者に恋愛感情を表現したり、情緒的依存を誘導するような相互作用も制限される。学習支援のためにスタディモードやクイズなどの教育機能も提供される。
* この記事はAIによって翻訳されました。
亜洲日報の記事等を無断で複製、公衆送信 、翻案、配布することは禁じられています。
