韓国科学技術院(KAIST)の研究チームが、人工知能(AI)の隠れた脆弱性を従来の約7倍多く発見する安全性検証技術を開発した。
KAISTは、金準模電気電子工学部教授の研究チームが、巨大言語モデル(LLM)の安全性を検証するレッドチーム技術の限界を改善した新しいフレームワーク「ステーブル-ジフローネット(Stable-GFlowNet)」を開発したと30日に発表した。
レッドチームは、生成型AIが有害または危険な回答をするように攻撃プロンプトを入力し、モデルの隠れた脆弱性を見つけ出す安全性検証手法である。さまざまな攻撃タイプを発掘するほど、より多くの脆弱性を事前に除去できるため、攻撃成功率と攻撃の多様性は重要な評価要素とされている。
従来のレッドチーム技術は強化学習に基づいており、攻撃成功率は高かったが、さまざまな攻撃タイプを見つけることには限界があった。一方、生成フローネットワーク(GFlowNet)は攻撃の多様性に優れているが、学習が不安定になる問題があった。研究チームは、GFlowNetを巨大言語モデル(LLM)に適用し、学習の安定性を高め、さまざまな脆弱性を効果的に発掘することに成功した。
研究チームはこれを解決するために、△学習過程を安定化する「対照軌跡均衡(CTB)」、△不要な情報を除去する「ノイズ勾配剪定(NGP)」、△自然な攻撃プロンプトを生成するための「流暢性安定化装置(MKS)」の3つの核心技術を開発した。
その結果、ステーブル-ジフローネットは従来技術が発見した17の固有攻撃タイプより約7倍多い134の攻撃タイプを発掘しながらも、92%の高い攻撃成功率を維持した。この技術で学習した防御モデルは、異なる攻撃手法を活用した交差攻撃評価でも多様な攻撃を効果的に防ぎ、高い一般化性能を証明した。
研究チームは、この技術が新薬候補物質を設計する分子生成など、さまざまなAI生成分野でも活用されることを期待している。
金教授は「この技術は少ないデータとノイズの多い環境でもAIのさまざまな脆弱性を安定的に見つけ出せる点で意義がある」と述べ、「生成型AIを実際のサービスに適用する前に、より幅広いリスク要因を見つけ出し、防御することができ、安全で信頼できるAI開発の基盤技術となるだろう」と語った。
* この記事はAIによって翻訳されました。
亜洲日報の記事等を無断で複製、公衆送信 、翻案、配布することは禁じられています。
