NVIDIAは、Nemotron 3.5 Lightningという名前の小型オープンモデルを発表しました。このモデルは、繰り返しの高容量タスクを処理するために設計されており、長時間のエージェント作業の負担を軽減するコストと遅延を削減することを目的としています。このモデルは300億のパラメータを持っていますが、処理時には30億のパラメータのみが有効になります。NVIDIAは、この専門家混合設計により、モデルがより大きなモデルの能力を提供できる一方で、計算要求がより小さなモデルに近くなると述べています。このモデルは主に自律エージェントの実行層を対象としており、システムはツールを継続的に呼び出し、結果を確認し、コマンドを実行し、タスクを委任します。
開発者は、Lightningを使用して通常の作業を処理し、より大きなモデルを計画や複雑な意思決定に留めることができます。
Nemotron 3.5 Lightningは、NVIDIAのDGX Spark、Jetsonシステム、GeForce RTX 5090グラフィックカードなどでローカルで実行できるように設計されています。このモデルはデータセンターにも展開でき、開発者に生成データの場所で高容量のワークロードを実行する選択肢を提供します。NVIDIAは、Lightningをより広範な変革の一部として位置付けており、この変革は、単一のモデルに依存するのではなく、複数のモデルを使用して各タスクを処理する方向に進んでいます。
より大きな推論モデルは計画と調整を処理し、より小さなモデルは実行を担当します。このモデルは、OpenClawやHermes Agentなどの人気のあるエージェントフレームワークを考慮して訓練されました。NVIDIAは、この訓練がエージェントに繰り返しタスクにおけるより正確なツール呼び出しを可能にし、遅延を減少させるのに役立つと述べています。
NVIDIA Nemotron 3.5 Lightningはオープン製品と高性能を提供
NVIDIAは、このモデルをオープン製品としてリリースしており、その重み、訓練データ、レシピを含んでおり、OpenMDW-1.1ライセンスの下で提供されています。開発者は、NVIDIAのNeMoツールを使用して微調整を行ったり、強化学習や環境に基づく評価を行ったりできます。NVIDIAは、Nemotron 3.5 Lightningの出力速度が同類のモデルの4倍に達する可能性があると述べています。PinchBenchテストでは、精度が86%に達し、Qwen3.6 35Bよりも30%速く10,000タスクを完了し、精度は同等でした。
このモデルは、推測デコード技術もサポートしており、複数のトークンを提案し、高効率で確認することができます。NVIDIAは訓練プロセスにおいてマルチトークン予測を取り入れ、異なる推論ワークロード用にDSparkとDFlashという2つの追加の初期モデルを提供しています。
今回のリリースは、NVIDIA NeMo Switchyardを強調しており、これは異なるタスクを異なるモデルに割り当てるためのモデルルーティングライブラリです。複雑なリクエストは、より強力な推論モデルに送信でき、通常の実行はNemotron 3.5 Lightningにルーティングできます。このアプローチは、特に数千の小さな操作を実行するシステムにおいて、持続的に稼働するエージェントに必要な高コストの計算を削減する可能性があります。このモデルは、Ollama、LM Studio、Amazon SageMaker JumpStart、Google Cloud、Microsoft Foundry、Oracle Cloud Infrastructureなど、成長する推論プラットフォーム、エージェントフレームワーク、クラウドサービスエコシステムによってサポートされています。NVIDIAは、Nemotron 3.5 LightningがHugging FaceとModelScopeからダウンロード可能であり、開発者はNVIDIA自身のプラットフォームやOpenRouterを通じてこのモデルにアクセスできると述べています。

