A NVIDIA está avançando ainda mais em modelos de IA agentiva com o lançamento do Nemotron 3.5 Lightning, um novo modelo aberto criado especificamente para o tipo de tarefas sempre ativas e de alto volume que agentes autônomos de IA agora executam 24 horas por dia. Junto com ele, a empresa lançou o NeMo Switchyard, uma ferramenta de roteamento open source projetada para enviar cada requisição de IA para o modelo que puder atendê-la de forma mais rápida e barata. Juntos, os dois lançamentos marcam a mais recente tentativa da NVIDIA de tornar os sistemas de IA agentiva não apenas mais inteligentes, mas genuinamente eficientes para operar em escala.
Summary
Principais destaques
- A NVIDIA lançou o Nemotron 3.5 Lightning, um modelo aberto de 30 bilhões de parâmetros em arquitetura mixture-of-experts, criado para cargas de trabalho de IA agentiva de alto volume.
- O modelo oferece até 4x mais velocidade de geração e 30% mais rapidez na conclusão de tarefas do que modelos comparáveis em sua categoria.
- A NVIDIA também lançou o NeMo Switchyard, uma biblioteca de roteamento open source que pode reduzir os custos de conclusão de tarefas para quase um terço em comparação com o uso isolado de um único modelo de fronteira.
- O Nemotron 3.5 Lightning roda localmente em PCs NVIDIA RTX, DGX Spark, DGX Station e Jetson, ou escala para data centers e nuvem.
- Ambos os lançamentos são abertos, personalizáveis e já contam com o apoio de parceiros do ecossistema, incluindo CrowdStrike, Harvey, CodeRabbit e Lila Sciences.
NVIDIA lança Nemotron 3.5 Lightning para cargas de trabalho de IA agentiva
O Nemotron 3.5 Lightning é a mais nova adição à família Nemotron 3 da NVIDIA, e a empresa o descreve como o modelo mais eficiente em sua classe para tarefas agentivas de longa duração. Ele chega após o Nemotron 3 Nano e dá continuidade a um padrão que a NVIDIA seguiu em cada lançamento da linha Nemotron: priorizar pesos abertos, personalização e velocidade bruta em vez de tamanho absoluto.
Um modelo de 30 bilhões de parâmetros criado para velocidade
O Nemotron 3.5 Lightning é um modelo mixture-of-experts de 30 bilhões de parâmetros, o que significa que ele ativa apenas as partes de sua rede necessárias para uma determinada tarefa, em vez de executar o modelo inteiro todas as vezes. Essa escolha de design se reflete diretamente no desempenho: a NVIDIA afirma que o modelo oferece até 4x mais velocidade de saída, o que se traduz em 30% mais rapidez na conclusão de tarefas agentivas em comparação com outros modelos de sua categoria de tamanho. De acordo com o benchmarking interno PinchBench citado pela NVIDIA, esses ganhos de velocidade vêm sem sacrificar a precisão em relação a modelos equivalentes.
O modelo foi criado para um papel específico dentro de sistemas maiores com múltiplos agentes. Em vez de tentar planejar sozinho todo um fluxo de trabalho, o Nemotron 3.5 Lightning foi projetado para lidar com tarefas estreitas, repetitivas e de alto volume — o tipo de trabalho que se acumula rapidamente quando um agente de IA está em execução contínua, em vez de responder apenas a prompts ocasionais.
Personalização e pós-treinamento para precisão específica de domínio
Como o Nemotron 3.5 Lightning é aberto, as organizações podem fazer pós-treinamento usando o NVIDIA NeMo com seus próprios dados de domínio, ferramentas internas e fluxos de trabalho. Essa personalização de modelo de IA aberto é central para o posicionamento do lançamento pela NVIDIA: em vez de um modelo único para todos os casos, as empresas recebem uma base que pode ser moldada para um trabalho específico, seja interpretar contratos jurídicos ou sinalizar alertas de segurança.
Várias empresas já fizeram exatamente isso. A CrowdStrike está personalizando o modelo para cargas de trabalho de cibersegurança, a Harvey está trabalhando com a Trajectory em aplicações de serviços jurídicos, e a CodeRabbit o combinou com a Baseten para revisão automatizada de código. A Lila Sciences o está usando para melhorar o raciocínio em tarefas de ciências físicas e da vida, enquanto a Fastino Labs relata liderança em precisão após ajustar o modelo para cargas de trabalho de desenvolvimento de software, finanças e saúde. A NVIDIA afirma que o modelo foi desenvolvido com a contribuição da Nemotron Coalition, cujos membros forneceram metodologias de avaliação, software de inferência e conjuntos de dados que ajudaram a moldar o lançamento final.
NeMo Switchyard traz roteamento inteligente para agentes de IA
O NeMo Switchyard resolve um problema que piora à medida que sistemas agentivos escalam: depender de um único modelo padrão ou desperdiça dinheiro em tarefas que não exigem raciocínio pesado, ou prejudica a qualidade quando um modelo leve é forçado a fazer demais. A resposta da NVIDIA é uma biblioteca open source que decide automaticamente, requisição por requisição, qual modelo deve executar o trabalho.
Redução de custos com seleção dinâmica de modelos
O NeMo Switchyard roteia cada etapa do fluxo de trabalho de um agente para o modelo mais capaz e econômico para aquela tarefa específica, sem exigir que os desenvolvedores reescrevam suas aplicações. Os desenvolvedores podem ajustar ou substituir o algoritmo de roteamento dependendo do que mais importa para eles — latência, qualidade ou custo. Os benchmarks internos da NVIDIA mostram que essa abordagem de roteamento do NeMo Switchyard mantém uma precisão próxima à de modelos de fronteira, ao mesmo tempo em que reduz o custo de conclusão de tarefas para quase um terço do que custaria executar tudo apenas com o Opus 4.8.
Essa diferença é relevante. Em sistemas nos quais agentes rodam continuamente, a diferença entre rotear de forma inteligente e padronizar para um único modelo se acumula rapidamente ao longo de milhares de tarefas diárias — transformando o que parece um ganho modesto de eficiência em uma redução significativa de custo operacional ao longo do tempo.
Integração em todo o ecossistema de IA
A NVIDIA já está trabalhando com uma ampla gama de parceiros para levar esse tipo de roteamento diretamente às ferramentas que os desenvolvedores usam diariamente. Resultados iniciais desse trabalho de ecossistema ilustram o quanto o roteamento pode alterar custo e desempenho:
- A Boomi alcançou 100% de precisão de roteamento por domínio enquanto enviava 59% do tráfego para um modelo ajustado 5x mais rápido, reduzindo a latência de turnos posteriores em 21%.
- A Cognition integrou um roteador em estágios ao Devin Desktop, reduzindo o custo médio em 28% em relação a rotear tudo para um único modelo de fronteira.
- A LangChain reduziu custos em 74% em 145 tarefas multi-turno de Deep Agents ao enviar apenas 7% das chamadas para um modelo de fronteira, com um trade-off de 6% em precisão.
- A Ramp igualou o desempenho de modelos de fronteira enquanto reduzia custos em 58% e o tempo de execução em 33% em seus testes SWE-Bench.
- A Classmethod relatou uma redução de custos de 27% mantendo a qualidade em suas cargas de trabalho opencode e Fireworks.
Kong, LiteLLM, Nous Research, Cadence e Siemens também estão integrando ou avaliando o NeMo Switchyard em suas próprias plataformas, desde gateways de IA até verificação formal de chips e agentes de engenharia.
Flexibilidade de implantação em todo o hardware NVIDIA
Um dos maiores atrativos deste lançamento é onde o Nemotron 3.5 Lightning pode efetivamente rodar. Ele oferece suporte a implantação local e em nuvem em PCs NVIDIA RTX, DGX Spark, DGX Station e dispositivos Jetson, permitindo que as organizações usem o hardware que já possuem em vez de migrar tudo para a nuvem. A partir daí, ele escala para workstations RTX PRO, dispositivos de borda, data centers e ambientes completos de nuvem para implantações corporativas maiores.
Essa flexibilidade dá às organizações controle real sobre privacidade e latência. Executar o modelo localmente ou on-premises é ideal para tarefas especializadas de alto volume que exigem respostas rápidas e controle mais rígido de dados, enquanto a implantação em nuvem continua disponível para cargas de trabalho que precisam escalar sob demanda.
Dados abertos e disponibilidade de plataforma
Como em todo lançamento da linha Nemotron, a NVIDIA afirma que publica o máximo possível dos dados de treinamento e técnicas, conforme as licenças permitem, dando a pesquisadores externos uma forma de rastrear, auditar e até treinar outros modelos com o mesmo material. Junto com o Lightning, a NVIDIA está lançando o Nemotron-RL-Agentic-Terminal-Pivot, um conjunto de dados de aprendizado por reforço agentivo usado para pós-treinar o modelo em tarefas de agentes de código.
O Nemotron 3.5 Lightning já está disponível no Hugging Face, ModelScope e OpenRouter, bem como no build.nvidia.com como um microserviço NVIDIA NIM, com acesso mais amplo chegando por meio de NVIDIA Cloud Partners, plataformas de pós-treinamento e provedores adicionais de serviços em nuvem. O NeMo Switchyard já está disponível no GitHub hoje, com suporte para mais plataformas parceiras esperado em breve.
Perguntas frequentes
O que é o Nemotron 3.5 Lightning e o que o torna diferente?
O Nemotron 3.5 Lightning é um modelo de IA aberto com 30 bilhões de parâmetros, otimizado para tarefas de IA agentiva de alto volume, oferecendo até 4x mais velocidade de saída e 30% mais rapidez na conclusão de tarefas do que modelos comparáveis.
Como o NeMo Switchyard melhora a eficiência da IA?
O NeMo Switchyard é uma biblioteca de roteamento open source que direciona dinamicamente as requisições de IA para o modelo mais adequado, reduzindo os custos de conclusão de tarefas para cerca de um terço em comparação com a dependência de um único modelo.
O Nemotron 3.5 Lightning pode ser personalizado para necessidades específicas de uma organização?
Sim. O Nemotron 3.5 Lightning pode passar por pós-treinamento com os próprios dados de uma organização usando o NVIDIA NeMo, para melhorar a precisão em tarefas especializadas e específicas de domínio.
Em quais plataformas o Nemotron 3.5 Lightning está disponível para implantação?
O Nemotron 3.5 Lightning oferece suporte a implantação local e em nuvem em PCs NVIDIA RTX, sistemas DGX, Jetson e dispositivos de borda, e está disponível em plataformas como Hugging Face, ModelScope, OpenRouter e NVIDIA Cloud Partners.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”O que é o Nemotron 3.5 Lightning e o que o torna diferente?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”O Nemotron 3.5 Lightning é um modelo de IA aberto com 30 bilhões de parâmetros, otimizado para tarefas de IA agentiva de alto volume, oferecendo até 4x mais velocidade de saída e 30% mais rapidez na conclusão de tarefas do que modelos comparáveis.”}},{“@type”:”Question”,”name”:”Como o NeMo Switchyard melhora a eficiência da IA?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”O NeMo Switchyard é uma biblioteca de roteamento open source que direciona dinamicamente as requisições de IA para o modelo mais adequado, reduzindo os custos de conclusão de tarefas para cerca de um terço em comparação com a dependência de um único modelo.”}},{“@type”:”Question”,”name”:”O Nemotron 3.5 Lightning pode ser personalizado para necessidades específicas de uma organização?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Sim. O Nemotron 3.5 Lightning pode passar por pós-treinamento com os próprios dados de uma organização usando o NVIDIA NeMo, para melhorar a precisão em tarefas especializadas e específicas de domínio.”}},{“@type”:”Question”,”name”:”Em quais plataformas o Nemotron 3.5 Lightning está disponível para implantação?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”O Nemotron 3.5 Lightning oferece suporte a implantação local e em nuvem em PCs NVIDIA RTX, sistemas DGX, Jetson e dispositivos de borda, e está disponível em plataformas como Hugging Face, ModelScope, OpenRouter e NVIDIA Cloud Partners.”}}]}
Artigo produzido com a assistência de inteligência artificial e revisado pela equipe editorial.

