エヌビディアはAIエージェントの応答速度を向上させる推論アクセラレーター『グロック3 LPX』の量産に入った。大規模データを処理する既存のAIコンピューティング性能競争から一歩進み、エージェントAIの核心である『トークン生成速度』を高めるインフラ競争が本格化している。
エヌビディアは25日、アメリカ・カリフォルニア州サンタクララで開催されたホットチップスイベントでグロック3 LPXの本格量産を発表した。グロック3 LPXはエヌビディアの次世代ベラ・ルービンプラットフォームを拡張するインタラクティブAI推論アクセラレーターである。
AIエージェントは複雑な作業を遂行するために、複数の段階の推論とツール呼び出しを繰り返す。この過程で生成されるトークンが多くなるほど、個々のトークンをどれだけ早く生成するかが全体の作業時間に影響を与える。エヌビディアはグロック3 LPXがこの点を重点的に狙ったと説明している。
性能も公開された。エヌビディアによると、グロック3 LPXはオープンソースのエージェントモデルであるジェムマ4 31Bを対象としたアーティフィシャルアナリシスベンチマークで、1秒間に3400個の出力トークンを記録した。10万トークン規模のコンテキストを適用した条件下での同モデルの最高速度であるという。
エヌビディアはエージェントコーディングなど遅延時間に敏感な作業で、類似プラットフォームより最大4倍の速い応答速度を提供すると述べた。コード作成やテストからファイルレビュー、結果検証まで繰り返し行うAIエージェントの作業時間を短縮することに焦点を当てている。
グロック3 LPXはベラ・ルービンNVL72システムの推論性能を補完する役割を担う。ベラ・ルービンは大規模AIモデルの学習と推論を両方サポートするプラットフォームである。ここにトークン生成速度に特化したグロック3 LPXを組み合わせることで、大規模コンテキスト処理とリアルタイム応答というエージェントAIの二つの要求を同時に狙う構造となっている。
AIクラウド企業も導入に乗り出す。ネビウスは自社の生産用推論プラットフォーム『ネビウス・トークンファクトリー』にグロック3 LPXを導入する計画である。開発者が既存のAPIを維持しながら超高速トークン生成機能を活用できるようにする方針である。AI推論企業グロックも初期導入企業の一つとなる見込みである。
今回の量産はAIインフラの競争基準が変わりつつあることにも意義がある。生成型AIが質問に答えるレベルを超え、自ら計画を立てて複数の作業を遂行するエージェントAIに拡張される中で、単純な演算処理量だけでなく、応答遅延時間やトークン生成速度が重要な性能指標として浮上している。
エヌビディアはベラ・ルービンプラットフォームにCPUやDPU、ストレージ、イーサネットなどを組み合わせたラック単位システムを構築している。グロック3 LPXを含むプラットフォーム全体をAIエージェントのワークロードに合わせて最適化し、AIデータセンター市場での推論インフラの主導権を維持する戦略である。
* この記事はAIによって翻訳されました。
亜洲日報の記事等を無断で複製、公衆送信 、翻案、配布することは禁じられています。
