NVIDIA lancia Nemotron 3.5 Lightning e NeMo Switchyard: modelli aperti e routing intelligente per agenti AI

NVIDIA lancia Nemotron 3.5 Lightning e NeMo Switchyard: modelli aperti e routing intelligente per agenti AI

NVIDIA ha annunciato Nemotron 3.5 Lightning, un modello aperto da 30 miliardi di parametri, e NeMo Switchyard, una libreria open source per il routing automatico dei prompt tra modelli diversi.

Gli agenti di intelligenza artificiale stanno passando dai semplici chatbot a sistemi autonomi che devono eseguire task complessi in modo continuo, su infrastrutture eterogenee e con vincoli di costo precisi. NVIDIA risponde a questa fase con un nuovo modello aperto e una libreria di routing pensata per dare ai team più controllo su dove e come girano i carichi di lavoro degli agenti AI.

Il modello

Nemotron 3.5 Lightning è un modello mixture-of-experts (MoE) con 30 miliardi di parametri totali e 3 miliardi attivi, progettato per task specializzati ad alto volume all'interno di sistemi multi-agente. Offre fino a 4 volte la velocità di output rispetto a modelli simili e completa i task agentic il 30% più velocemente. Il modello supporta un contesto di 1 milione di token ed è disponibile in pesi BF16 e NVFP4 per la quantizzazione. È rilasciato sotto licenza OpenMDW-1.1, aperto all'uso commerciale senza restrizioni materiali.

Il routing intelligente

NeMo Switchyard è una libreria open source scritta in Rust che funge da proxy per il traffico LLM, indirizzando le richieste al modello più adatto in base a qualità, latenza e costo. Supporta routing senza training, escalation automatica verso modelli più potenti quando necessario e traduzione tra API OpenAI e Anthropic. La libreria è in versione pre-alpha (v0.2.0) e non è ancora indicata per uso in produzione.

Partner e risultati

Boomi ha raggiunto il 100% di accuratezza nel domain-routing, inviando il 59% del traffico a un modello 5 volte più veloce. Classmethod ha ridotto i costi del 27%, Cognition del 28%, LangChain del 74% su 145 task multi-turno e Ramp ha tagliato costi del 58% e runtime del 33%.

Dove trovarlo

Nemotron 3.5 Lightning è disponibile su Hugging Face, ModelScope, OpenRouter e build.nvidia.com come NVIDIA NIM microservice, oltre che tramite provider di inference come DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius e Crusoe. NeMo Switchyard è su GitHub e arriverà presto su piattaforme partner.

Informazioni tecniche

  • Parametri totali: 31,6 miliardi
  • Parametri attivi: 3,6 miliardi
  • Contesto: 1 milione di token
  • Licenza: OpenMDW-1.1 (uso commerciale libero)
  • Data cutoff pre-training: settembre 2025
  • Data cutoff post-training: maggio 2026

Domande frequenti

  • Cos'è Nemotron 3.5 Lightning? Un modello aperto MoE da 30B parametri con 3B attivi, ottimizzato per task specializzati in sistemi di agenti AI sempre attivi.
  • A cosa serve NeMo Switchyard? A indirizzare automaticamente ogni richiesta al modello più capace ed efficiente, riducendo costi e latenza senza riscrivere le applicazioni.
  • È gratuito? Sì, entrambi sono open source e liberi per uso commerciale.
  • Posso usarlo in produzione? Nemotron 3.5 Lightning sì; NeMo Switchyard è ancora pre-alpha e non indicato per produzione.

Glossario

  • Mixture-of-Experts (MoE): architettura in cui solo una parte dei parametri viene attivata per ogni input, migliorando efficienza.
  • Agentic AI: sistemi di agenti autonomi che eseguono task complessi senza intervento umano continuo.
  • Inferenza: fase in cui il modello esegue le richieste, genera output e completa i task su infrastrutture locali o cloud.
  • Routing: selezione automatica del modello più adatto per ogni richiesta in base a qualità, latenza e costo.
  • Token: unità di testo elaborata dal modello (parole o parti di parole), usata per misurare contesto e throughput.
  • BF16: formato numerico a 16 bit per pesi del modello, che riduce memoria mantenendo buona precisione.
  • NVFP4: formato di quantizzazione NVIDIA a 4 bit per ridurre ulterioremente memoria e latenza con degrado minimo.
  • Context window: quantità massima di token che il modello può considerare in una singola richiesta (nel caso di Nemotron 3.5 Lightning, fino a 1 milione di token).

NVIDIA Blog, 11 agosto 2026

Hugging Face, 11 agosto 2026

GitHub, 10 agosto 2026

CNBC, 11 agosto 2026