概要
- NVIDIAがNemotron 3.5 Lightningを発表、エージェントAI向けに高効率化
- NeMo SwitchyardでAIモデルのスマートルーティングを実現
- 専門タスクや大規模ワークフローに最適化されたオープンモデル
- 企業がカスタマイズ・プライバシー管理・ローカル運用を強化可能
- Hugging FaceやGitHubなど主要プラットフォームで提供開始
NVIDIA Nemotron 3.5 LightningとNeMo Switchyardの概要
- AIの進化が チャットボットから自律型エージェント へとシフト
- オープンモデル の需要拡大、AIの運用場所や進化の完全管理ニーズ
- Nemotron 3.5 Lightningは30Bパラメータの Mixture-of-Expertsモデル
- 長時間稼働型エージェントAI ワークロード向けに設計
- Nemotron 3 Nanoに続く、NVIDIAのオープンモデル改善への継続的な取り組み
Nemotron 3.5 Lightningの特徴
- 専門タスク や大規模マルチエージェントシステムに最適化
- 最大 4倍の出力速度、同クラス比で 30%高速なタスク完了
- オープンかつカスタマイズ可能、 NVIDIA NeMo で独自データやワークフローに最適化可能
- PinchBenchベンチマークで 最先端の精度と高速処理 を実証
- CrowdStrike(サイバーセキュリティ)、 Harvey(法務)、 CodeRabbit(コードレビュー) など各業界で導入実績
Nemotron 3.5 Lightningの導入と運用
- ローカルAIシステム (NVIDIA RTX PC、DGX Spark、DGX Station、Jetson等)で稼働可能
- 既存インフラ投資の最大活用、エッジデバイスやクラウドへのスケールも容易
- プライバシー管理 と オンプレミス運用 にも対応
- 訓練データや技術情報もライセンス範囲で公開、 透明性と監査性 確保
NeMo Switchyardによるモデルルーティング
- オープンソースのモデルルーティングライブラリ
- 各タスクに最適なモデルへ自動でプロンプトを振り分け
- ルーティングアルゴリズムのカスタマイズで 品質・レイテンシ・コスト 要件に柔軟対応
- モデルアンサンブルによる トークノミクス(コスト効率) 向上
- 内部ベンチマークで タスクコストをOpus 4.8比で1/3 まで削減
パートナー企業による活用事例
- Boomi :5種ルーティング評価で100%ドメインルーティング精度、59%のトラフィックを5倍高速モデルに振り分け、レイテンシ21%減
- Cadence :AI Super Agent活用で9.9%効率向上
- LangChain :マルチターンタスクでコスト74%削減、精度6%低下のみ
- Ramp :コスト58%・ランタイム33%削減でフロンティアモデル並みの性能
- LiteLLM や Nous Research などもSwitchyardをプラグインやルーティングシステムとして統合
- Siemens など他企業も効率向上のためベンチマーク中
提供プラットフォームと今後の展開
- Nemotron 3.5 Lightning はHugging Face、ModelScope、OpenRouter、build.nvidia.comでNIMマイクロサービスとして提供
- NeMo Switchyard はGitHubで公開、パートナープラットフォームにも順次展開予定
- 専門タスク向けの Nemotron-RL-Agentic-Terminal-Pivot 強化学習データセットも同時リリース
まとめ
- Nemotron 3.5 Lightning と NeMo Switchyard の組み合わせで、AI運用の柔軟性・効率・コスト管理を大幅強化
- 企業や開発者は 独自ワークフローやプライバシー要件 に沿ったAIエージェント構築が可能
- オープンモデルの進化とともに、 AIエージェント時代 の新しい標準を提案