アップステージは、独自に開発した大規模言語モデル(LLM)『ソーラープロ4』を発表した。
ソーラープロ4は、前作『ソーラープロ3』よりも推論能力とエージェントの能力を強化した次世代商用人工知能(AI)モデルである。単発の回答中心の従来のベンチマークスコアではなく、文書理解や情報抽出、長い文脈推論、連続的な意思決定など、実務環境で求められる作業フローを安定的に実行することに最適化されている。
アップステージによると、ソーラープロ4は発表直後にアメリカのヌースリサーチが開発したAIエージェント『ヘルメスエージェント』やAPIルーティングプラットフォーム『オープンルーター』と共にグローバル開発者プラットフォームに名を連ねた。オープンAI、アンソロピック、グーグル、エヌビディアなどアメリカのビッグテックやディープシーク、ムーンショット、ミニマックスなど中国の主要企業の中で、正式プロバイダーとして登録された韓国企業はアップステージが初めてである。
アップステージは「韓国モデルが登録されたのは初めてであり、実用性が認められ、グローバルで韓国のソブリンAIの普及基盤を整えた」と述べた。
ソーラープロ4はオープンルーター登録から3日で累積トークン消費量が800億トークンを超えた。また、ソーラープロ4はグローバル主要モデルのエージェント性能を比較する『エージェントアリーナ』リーダーボードにも韓国モデルとして初めて入った。会社はアメリカと中国のモデルが独占してきた47の主要モデルランキングに入り、エヌビディアの『ネモトロン3ウルトラ』と同等の性能を持つと評価している。
今回の改善は、エージェント業務の成否を左右する領域に集中している。ターミナルで複数段階の作業を完了する能力を評価する『ターミナルベンチ(Terminal-Bench v2.1)』で57点を記録し、前作より4.8倍向上した。対話を通じてツール使用能力を評価する『タウ3-バンキング(τ³-Banking)』でも23点と2.6倍改善された。
長く複雑な文書を失敗なく扱う能力も重要な強みとして浮上した。ソーラープロ4は大量の長文文書から情報を抽出し、それに基づいて回答を推論する能力を評価する長文理解ベンチマーク(AA-LCR)で71点を記録した。前作より2.3倍以上優れた性能である。文書の中間で文脈を見失う失敗が減少したため、正確性はもちろん、トークン消費量も減少し、運用コストの面でも有利であると評価されている。
また、国内企業や公共機関の業務環境に特化した韓国語性能と文書処理能力も大幅に向上した。ソーラープロ4はアップステージのエージェント文書処理統合ソリューション『アップステージスタジオ』に搭載された。ハングル文書をはじめとするさまざまな文書形式から情報を抽出し、要約や分析、翻訳などの作業を一度に処理できる。
総合性能はグローバルAI評価機関『アーティフィシャルアナリシス』基準で42点である。汎用フロンティアモデルと同等の領域に達した。前作に比べ3倍以上改善された数値である。エヌビディアの『ネモトロン3ウルトラ』(38点)やグーグルの『ジェミナイ3.5フラッシュライト』(37点)などビッグテックモデルを上回り、ミストラルの『ミディアム3.5』(30点)、コヒアの『コマンドA+』(23点)など競争するソブリンモデルも大きく引き離した。
キム・ソンフンアップステージ代表は「実務でAIに必要なのは試験をうまく受ける能力ではなく、任された仕事を最後までやり遂げる信頼性である」と述べ、「ソーラープロ4がグローバル開発者プラットフォームに韓国モデル初の名を連ねたことは、我々のAI技術が世界の現場で通用する証拠であり、今後も現場で検証された技術力を基に、さらに活用性の高いAIを作り出していく」と語った。
なお、アップステージは今年3月に『ソーラープロ3』を発表して以来、商用LLMの推論とエージェント性能を継続的に強化してきた。その後、独自の強化学習技術を適用し、ソーラープロ3のツール活用やコーディング、ターミナル作業などエージェント性能を改善した。4月には文書パース・分類・情報抽出などを統合したエージェンティック文書処理ソリューション『アップステージスタジオ』を発売し、独自のAIモデルの企業業務適用範囲を広げた。
* この記事はAIによって翻訳されました。
