ホームAINVIDIAのエージェント型AIモデルが、Nemotron 3.5 Lightningにより4倍の速度を達成

NVIDIAのエージェント型AIモデルが、Nemotron 3.5 Lightningにより4倍の速度を達成

NVIDIA は、Nemotron 3.5 Lightning のリリースにより、エージェント型 AI モデルへの取り組みをさらに推し進めている。これは、自律型 AI エージェントが今や 24 時間体制で処理している、常時稼働かつ高ボリュームのタスク向けに特化して構築された新しいオープンモデルだ。同時に、各 AI リクエストを最も高速かつ低コストで処理できるモデルへ振り分けるためのオープンソース・ルーティングツールである NeMo Switchyard も公開された。この 2 つのリリースにより、NVIDIA はエージェント型 AI システムをより賢くするだけでなく、大規模運用において真に効率的なものにしようとする最新の試みを示している。

主なポイント

  • NVIDIA は、高ボリュームのエージェント型 AI ワークロード向けに構築された300 億パラメータのオープン Mixture-of-Experts モデルである Nemotron 3.5 Lightning をリリースした。
  • このモデルは、同クラスの比較モデルと比べて最大 4 倍の出力速度30% 高速なタスク完了を実現する。
  • NVIDIA はまた、単一のフロンティアモデルのみを使用する場合と比べてタスク完了コストをほぼ3 分の 1まで削減できるオープンソースのルーティングライブラリ NeMo Switchyard を発表した。
  • Nemotron 3.5 Lightning は、NVIDIA RTX PCDGX SparkDGX StationJetson 上でローカルに動作するほか、データセンターやクラウドへスケールさせることもできる。
  • 両リリースはオープンかつカスタマイズ可能で、すでに CrowdStrike、Harvey、CodeRabbit、Lila Sciences などのエコシステムパートナーによるサポートを受けている。

エージェント型 AI ワークロード向けに Nemotron 3.5 Lightning を発表

Nemotron 3.5 Lightning は NVIDIA の Nemotron 3 ファミリーに新たに加わったモデルであり、同社はこれを、長時間稼働するエージェント型タスクにおいてクラス最高の効率を持つモデルだと説明している。Nemotron 3 Nano に続く形で登場し、NVIDIA がすべての Nemotron リリースで一貫してきた方針、すなわち巨大さよりもオープンな重み、カスタマイズ性、生の速度を優先するというパターンを継承している。

速度に特化した 300 億パラメータモデル

Nemotron 3.5 Lightning は 300 億パラメータの Mixture-of-Experts モデルであり、毎回モデル全体を実行するのではなく、特定のタスクに必要なネットワークの一部のみを活性化する仕組みになっている。この設計上の選択は性能に直接反映されており、NVIDIA によれば、このモデルは最大 4 倍の出力速度を実現し、それが同サイズクラスの他モデルと比較して30% 高速なエージェントタスク完了につながるという。NVIDIA が引用する社内の PinchBench ベンチマークによると、これらの速度向上は、同等モデルと比べて精度を犠牲にすることなく達成されている。

このモデルは、より大きなマルチエージェントシステムの中で特定の役割を果たすように設計されている。自ら全体のワークフローを計画しようとするのではなく、Nemotron 3.5 Lightning は、狭い範囲で反復的かつ高ボリュームなジョブを処理することを想定している — つまり、AI エージェントが時折のプロンプトに応答するのではなく継続的に稼働しているときに、急速に積み上がっていく種類の作業だ。

ドメイン特化の精度向上のためのカスタマイズとポストトレーニング

Nemotron 3.5 Lightning はオープンであるため、組織は NVIDIA NeMo を用いて自社のドメインデータ、内部ツール、ワークフローでポストトレーニングを行うことができる。このオープンな AI モデルのカスタマイズ性は、NVIDIA が今回のリリースを位置づけるうえで中核となっている。汎用の一律モデルではなく、法的契約書の解析からセキュリティアラートの検知まで、特定のジョブに合わせて形作ることができるベースモデルを企業に提供するという考え方だ。

すでに複数の企業がまさにそれを実践している。CrowdStrike はサイバーセキュリティワークロード向けにモデルをカスタマイズしており、Harvey は Trajectory と協力してリーガルサービス向けアプリケーションに取り組んでいる。CodeRabbit は Baseten と組み合わせて自動コードレビューに活用している。Lila Sciences は物理科学および生命科学タスク全般における推論能力の向上に利用しており、Fastino Labs はソフトウェア開発、金融、ヘルスケアワークロード向けにモデルをチューニングした結果、トップクラスの精度を報告している。NVIDIA によれば、このモデルは Nemotron Coalition からのインプットを得て開発されており、メンバーは評価手法、推論ソフトウェア、データセットを提供し、最終的なリリースの形作りに貢献したという。

NeMo Switchyard が AI エージェントにスマートルーティングを提供

NeMo Switchyard は、エージェント型システムがスケールするほど深刻になる問題を解決する。単一のデフォルトモデルに依存すると、重い推論を必要としないタスクに無駄なコストをかけるか、あるいは軽量モデルに過大な負荷をかけて品質を損なうかのどちらかになりがちだ。NVIDIA の解決策は、リクエストごとにどのモデルがそのジョブを処理すべきかを自動的に判断するオープンソースライブラリである。

動的なモデル選択によるコスト削減

NeMo Switchyard は、エージェントのワークフローの各ステップを、そのタスクに対して最も能力が高く、かつコスト効率の良いモデルへとルーティングする。これを行うにあたり、開発者がアプリケーションを書き換える必要はない。開発者は、自分たちにとって最も重要な指標 — レイテンシ、品質、コスト — に応じてルーティングアルゴリズムを調整したり差し替えたりできる。NVIDIA の社内ベンチマークによると、この NeMo Switchyard のルーティング手法は、フロンティアモデルに近い精度を維持しつつ、すべてを Opus 4.8 のみで処理する場合と比べてタスク完了コストをほぼ 3 分の 1 にまで削減できるという。

この差は重要だ。エージェントが継続的に稼働するシステムでは、インテリジェントなルーティングを行うか、単一モデルにデフォルトで送るかの違いが、1 日あたり数千件のタスク全体で急速に積み上がっていく — 一見すると小さな効率向上に見えるものが、時間の経過とともに運用コストの大幅な削減へと変わるのである。

AI エコシステム全体での統合

NVIDIA はすでに幅広いパートナーと協力し、この種のルーティング機能を開発者が日常的に使うツールへ直接組み込もうとしている。エコシステムでのこうした取り組みから得られた初期結果は、ルーティングがコストとパフォーマンスをどれほど変えうるかを示している。

  • Boomi は、トラフィックの 59% を 5 倍高速なファインチューニング済みモデルに送信しつつ、100% のドメインルーティング精度を達成し、後続ターンのレイテンシを 21% 削減した。
  • Cognition は段階的ルーターを Devin Desktop に統合し、すべてを単一のフロンティアモデルにルーティングする場合と比べて平均コストを 28% 削減した。
  • LangChain は、145 件のマルチターン Deep Agents タスクにおいて、コールのうちわずか 7% をフロンティアモデルに送るだけでコストを 74% 削減し、その代償として 6% の精度低下にとどめた。
  • Ramp は、SWE-Bench テストにおいてフロンティアモデルと同等の性能を維持しながら、コストを 58%、実行時間を 33% 削減した。
  • Classmethod は、opencode および Fireworks ワークロード全体で品質を維持しつつ、コストを 27% 削減したと報告している。

Kong、LiteLLM、Nous Research、Cadence、Siemens も、AI ゲートウェイからフォーマルなチップ検証、エンジニアリングエージェントに至るまで、自社プラットフォーム内で NeMo Switchyard の統合やベンチマークを進めている。

NVIDIA ハードウェア全体での柔軟なデプロイ

今回のリリースの大きなセールスポイントの 1 つは、Nemotron 3.5 Lightning が実際にどこで動作できるかという点だ。NVIDIA RTX PC、DGX Spark、DGX Station、Jetson デバイス など、ローカルおよびクラウドでのデプロイをサポートしており、すべてをクラウドへ移行するのではなく、組織がすでに保有しているハードウェアを活用できるようにしている。そこからさらに、RTX PRO ワークステーション、エッジデバイス、データセンター、そして大規模なエンタープライズ展開向けのフルクラウド環境へとスケールさせることができる。

この柔軟性により、組織はプライバシーとレイテンシを実質的にコントロールできる。モデルをローカルまたはオンプレミスで動作させることは、高ボリュームで専門性が高く、高速な応答と厳格なデータ管理が求められるタスクに適しており、一方でクラウドデプロイは、オンデマンドでスケールが必要なワークロード向けに引き続き利用可能だ。

オープンデータとプラットフォームでの提供状況

すべての Nemotron リリースと同様に、NVIDIA はライセンスが許す限り多くの学習データと手法を公開し、外部研究者が同じ素材を用いてトレース、監査、さらには他のモデルを学習できるようにしている。Lightning とあわせて、NVIDIA は、コーディングエージェントタスク向けにモデルをポストトレーニングするために使用されたエージェント型強化学習データセット「Nemotron-RL-Agentic-Terminal-Pivot」を公開する。

Nemotron 3.5 Lightning は、Hugging Face、ModelScope、OpenRouter で、さらに build.nvidia.com 上ではNVIDIA NIM マイクロサービスとしてすでに利用可能であり、今後は NVIDIA Cloud Partners、ポストトレーニングプラットフォーム、その他のクラウドサービスプロバイダーを通じて、より広範なアクセスが提供される予定だ。NeMo Switchyard は本日 GitHub 上で公開されており、今後さらに多くのパートナープラットフォームでのサポートが期待されている。

FAQ

Nemotron 3.5 Lightning とは何で、何が違うのですか?

Nemotron 3.5 Lightning は、高ボリュームのエージェント型 AI タスク向けに最適化された 300 億パラメータのオープン AI モデルであり、同等モデルと比べて最大 4 倍の出力速度と 30% 高速なタスク完了を実現します。

NeMo Switchyard はどのように AI の効率を向上させますか?

NeMo Switchyard は、AI リクエストを最も適したモデルへ動的に振り分けるオープンソースのルーティングライブラリであり、単一モデルに依存する場合と比べてタスク完了コストを約 3 分の 1 に削減します。

Nemotron 3.5 Lightning は組織固有のニーズに合わせてカスタマイズできますか?

はい。Nemotron 3.5 Lightning は、NVIDIA NeMo を用いて組織独自のデータでポストトレーニングすることで、専門的かつドメイン特化タスクに対する精度を向上させることができます。

Nemotron 3.5 Lightning はどのプラットフォームでデプロイ可能ですか?

Nemotron 3.5 Lightning は、NVIDIA RTX PC、DGX システム、Jetson およびエッジデバイス上でのローカルおよびクラウドデプロイをサポートしており、Hugging Face、ModelScope、OpenRouter、NVIDIA Cloud Partners などのプラットフォームで利用できます。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning とは何で、何が違うのですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Nemotron 3.5 Lightning は、高ボリュームのエージェント型 AI タスク向けに最適化された 300 億パラメータのオープン AI モデルであり、同等モデルと比べて最大 4 倍の出力速度と 30% 高速なタスク完了を実現します。”}},{“@type”:”Question”,”name”:”NeMo Switchyard はどのように AI の効率を向上させますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”NeMo Switchyard は、AI リクエストを最も適したモデルへ動的に振り分けるオープンソースのルーティングライブラリであり、単一モデルに依存する場合と比べてタスク完了コストを約 3 分の 1 に削減します。”}},{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning は組織固有のニーズに合わせてカスタマイズできますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”はい。Nemotron 3.5 Lightning は、NVIDIA NeMo を用いて組織独自のデータでポストトレーニングすることで、専門的かつドメイン特化タスクに対する精度を向上させることができます。”}},{“@type”:”Question”,”name”:”Nemotron 3.5 Lightning はどのプラットフォームでデプロイ可能ですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Nemotron 3.5 Lightning は、NVIDIA RTX PC、DGX システム、Jetson およびエッジデバイス上でのローカルおよびクラウドデプロイをサポートしており、Hugging Face、ModelScope、OpenRouter、NVIDIA Cloud Partners などのプラットフォームで利用できます。”}}]}

本記事は人工知能の支援を受けて作成され、編集チームによる確認を経ています。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST