世界を動かす技術を、日本語で。

Nvidia Nemotron 3.5 Lightning と NeMo Switchyard

2026年8月12日原文(blogs.nvidia.com)

概要

  • NVIDIAがNemotron 3.5 Lightningを発表、エージェントAI向けに高効率化
  • NeMo SwitchyardでAIモデルのスマートルーティングを実現
  • 専門タスクや大規模ワークフローに最適化されたオープンモデル
  • 企業がカスタマイズ・プライバシー管理・ローカル運用を強化可能
  • Hugging FaceやGitHubなど主要プラットフォームで提供開始

NVIDIA Nemotron 3.5 LightningとNeMo Switchyardの概要

  • AIの進化が チャットボットから自律型エージェント へとシフト
  • オープンモデル の需要拡大、AIの運用場所や進化の完全管理ニーズ
  • Nemotron 3.5 Lightningは30Bパラメータの Mixture-of-Expertsモデル
  • 長時間稼働型エージェントAI ワークロード向けに設計
  • Nemotron 3 Nanoに続く、NVIDIAのオープンモデル改善への継続的な取り組み

Nemotron 3.5 Lightningの特徴

  • 専門タスク や大規模マルチエージェントシステムに最適化
  • 最大 4倍の出力速度、同クラス比で 30%高速なタスク完了
  • オープンかつカスタマイズ可能、 NVIDIA NeMo で独自データやワークフローに最適化可能
  • PinchBenchベンチマークで 最先端の精度と高速処理 を実証
  • CrowdStrike(サイバーセキュリティ)Harvey(法務)CodeRabbit(コードレビュー) など各業界で導入実績

Nemotron 3.5 Lightningの導入と運用

  • ローカルAIシステム (NVIDIA RTX PC、DGX Spark、DGX Station、Jetson等)で稼働可能
  • 既存インフラ投資の最大活用、エッジデバイスやクラウドへのスケールも容易
  • プライバシー管理オンプレミス運用 にも対応
  • 訓練データや技術情報もライセンス範囲で公開、 透明性と監査性 確保

NeMo Switchyardによるモデルルーティング

  • オープンソースのモデルルーティングライブラリ
  • 各タスクに最適なモデルへ自動でプロンプトを振り分け
  • ルーティングアルゴリズムのカスタマイズで 品質・レイテンシ・コスト 要件に柔軟対応
  • モデルアンサンブルによる トークノミクス(コスト効率) 向上
  • 内部ベンチマークで タスクコストをOpus 4.8比で1/3 まで削減

パートナー企業による活用事例

  • Boomi :5種ルーティング評価で100%ドメインルーティング精度、59%のトラフィックを5倍高速モデルに振り分け、レイテンシ21%減
  • Cadence :AI Super Agent活用で9.9%効率向上
  • LangChain :マルチターンタスクでコスト74%削減、精度6%低下のみ
  • Ramp :コスト58%・ランタイム33%削減でフロンティアモデル並みの性能
  • LiteLLMNous Research などもSwitchyardをプラグインやルーティングシステムとして統合
  • Siemens など他企業も効率向上のためベンチマーク中

提供プラットフォームと今後の展開

  • Nemotron 3.5 Lightning はHugging Face、ModelScope、OpenRouter、build.nvidia.comでNIMマイクロサービスとして提供
  • NeMo Switchyard はGitHubで公開、パートナープラットフォームにも順次展開予定
  • 専門タスク向けの Nemotron-RL-Agentic-Terminal-Pivot 強化学習データセットも同時リリース

まとめ

  • Nemotron 3.5 LightningNeMo Switchyard の組み合わせで、AI運用の柔軟性・効率・コスト管理を大幅強化
  • 企業や開発者は 独自ワークフローやプライバシー要件 に沿ったAIエージェント構築が可能
  • オープンモデルの進化とともに、 AIエージェント時代 の新しい標準を提案

Hackerたちの意見

NeMo Switchyardは、スマートルーティングのためのオープンソースライブラリです。 > デプロイされると、NeMo Switchyardは各リクエストを最も適したモデルに賢く振り分けることができます。 こういうルーターは、2回目のリクエストを送ったときにプロンプトキャッシングをどう処理するんだろう? セッションごとにモデルを固定するのかな? でもそうすると、そのセッションの2回目のメッセージは適切なモデルに送られず、前回と同じモデルにしか送られないよね。

リポジトリの方が、プレスリリースよりももうちょっと簡潔に説明されてるから、こっちから入るのがいいかもね: https://github.com/NVIDIA-NeMo/Switchyard (特に注意すべき点: "実験的なソフトウェア。商用利用不可。")。 実際にデプロイしてほしいのかどうかは不明だけど、プレスリリースではそう言ってるし、READMEでは違うこと言ってるし、どう捉えるかはあなた次第。 READMEやドキュメントには「キャッシュ」については触れられてないみたいだけど、コードには言及がある(https://github.com/search?q=repo%3ANVIDIA-NeMo%2FSwitchyard+...)。 彼らの考えはよくわからないな。「頑張って」って感じ? せいぜいプロバイダーごとの話みたいだけど、ルーティングライブラリとしてはちょっと変な立ち位置だね。

コスト(キャッシュの粘着性)とルーティングパフォーマンス(そのターンに最適なモデル)の間でトレードオフポイントを選べるように設定できるものを見たことがあるけど、うーん、これだけのオーバーヘッドが本当に価値があるのかは疑問だね。

すべてのモデルが同じ共有キャッシュを使う限り、キャッシングは可能だと思うよ。共有キャッシュが分散されていれば、同じサーバー上で動いている必要もないしね。これを読んでる人は、モデルルーターが異なるプロバイダー間をルーティングするために使われると思ってるかもしれないけど、その場合、共有キャッシュは無理だよね。ただ、ある程度のキャッシングは効果的だと思う。理想的には、こういうルーターは一箇所にホストされたモデル群の前にあるべきだと思う。

https://github.com/NVIDIA-NeMo/Switchyard#routing-strategies あなたの素晴らしい質問には答えがないみたいだけど、ルーティング戦略を見るとさらに混乱するね。提案されたものは、どのモデルを選ぶかを決めるために追加のLLMコールに依存することが多いから。特定のセットアップには意味があるけど、会話志向ではないね。例えば、データのバッチを分類する必要があって、たくさんのファインチューニングされたモデルがある場合とか、スピードからテキストに変換する必要があって、どのウィスパーを使うかを選ぶ必要がある場合。そういう時は、自分の戦略を書けるから、サブエージェントを使ったハーネスがこれを活用できて、正しいモデルを選んでセッションを維持できるけど、全体的にキャッシングに対する関心の欠如は、あまり得られないユースケースを示してるね。

以前の投稿に関して、Nemotronについてのコメントが24件あるよ: https://news.ycombinator.com/item?id=49257947

何か提案したいことがあるんだけど: - 問題: AIのせいで情報が大量に溢れてる - 解決策: 人間は書き言葉でミニマリストスタイルを採用すべき。 - 例えば、このウェブサイトのページ全体が10個の箇条書きで済むかも。

私の意見では: 前に進む唯一の方法は、ゼロ知識証明による認証されたソーシャルメディアだと思う。 もし数人の悪意ある行為者が自分の声を何千もクローンして議論を毒していると仮定しなければならないなら、正当な議論はできない。 もし一つのアカウントを実在の人物に結びつけられれば、LLMコンテンツや誤情報を排除することはできないけど、少なくとも彼らを責任追及できるようになる。

その気持ちはわかるけど、悪い文章の解決策がちょっとマシな文章になるとは思わないな。ちゃんとした文章を書けばいいんだよ。

k

少ない言葉で済むなら、なんでわざわざ多くの言葉を使うの?

そうだね!

Hacker Newsで議論の続きを見る