A NVIDIA lançou o Cosmos 3 Edge, um modelo de mundo aberto com 4 bilhões de parâmetros criado para levar raciocínio de IA em nível de data center diretamente para robôs e dispositivos de borda que operam em fábricas, armazéns, hospitais e além. O modelo, agora disponível no Hugging Face, foi projetado para ajudar robôs e agentes de visão em IA a entenderem seu entorno, raciocinar em tempo real e gerar ações físicas — tudo isso sem precisar enviar a computação de volta para a nuvem.
Summary
Principais destaques
- Cosmos 3 Edge é um modelo de mundo aberto com 4 bilhões de parâmetros para robótica e visão em IA em dispositivos de borda, lançado pela NVIDIA no Hugging Face.
- Ele oferece controle de robôs em tempo real a 15 Hz, gerando 32 ações por inferência no NVIDIA Jetson Thor.
- O modelo combina duas torres transformer — autorregressiva e de difusão — que compartilham camadas de atenção multimodal para raciocínio unificado e geração de ações.
- Ele ocupa a posição #1 no VANTAGE-Bench em análise de visão entre modelos de 4B parâmetros e lidera em aprendizado de políticas para robôs.
- Um modelo de política dedicado, Cosmos 3 Edge Policy (DROID), está disponível para tarefas de pick-and-place em robôs, com suporte a fine-tuning em H100 ou clusters NVIDIA DGX.
NVIDIA lança Cosmos 3 Edge para Robótica e Visão em IA na Borda
O principal desafio para máquinas implantadas na borda sempre foi o mesmo: memória limitada, computação restrita, mas demandas do mundo real que não desaceleram. Cosmos 3 Edge é a resposta da NVIDIA para essa lacuna. Segundo a defensora de desenvolvedores da NVIDIA, Pranjali Joshi, o modelo é otimizado para inferência com uso eficiente de memória e alta taxa de transferência em uma ampla gama de hardwares de borda da NVIDIA — incluindo os recém-anunciados módulos NVIDIA Jetson T2000 e T3000, NVIDIA Jetson Thor, GPUs NVIDIA RTX PRO, NVIDIA DGX e GPUs NVIDIA GeForce RTX.
Essa ampla compatibilidade de hardware é importante. A maioria das implantações de IA na borda é limitada não pela ambição, mas pelo que o hardware local realmente consegue executar. Um modelo que vai desde módulos Jetson compactos até sistemas DGX completos oferece aos desenvolvedores um único framework para trabalhar em um amplo espectro de implantação.
Números de desempenho em tempo real que importam
Os números de desempenho citados pela NVIDIA são notáveis. No NVIDIA Jetson Thor, o Cosmos 3 Edge gera 32 ações por inferência enquanto mantém o controle do robô em tempo real a 15 Hz. Para aplicações de robótica, em que a diferença entre um movimento suave e uma falha brusca muitas vezes se resume à latência de inferência, atingir 15 Hz em um módulo de borda é um limite significativo. Entre modelos de 4B parâmetros, ele ocupa o primeiro lugar no VANTAGE-Bench em análise de visão e reivindica desempenho de última geração em aprendizado de políticas para robôs.
Arquitetura de modelo inovadora: duas torres Transformer, uma representação compartilhada
O que diferencia o Cosmos 3 Edge de um modelo padrão de visão e linguagem é sua arquitetura de transformer de torre dupla. O modelo combina uma torre autorregressiva e uma torre de difusão, cada uma lidando com diferentes modalidades, mas compartilhando camadas de atenção multimodal que alinham informações entre dados de linguagem, vídeo, áudio e ação.
A torre autorregressiva processa tokens de visão e texto para compreensão e raciocínio. A torre de difusão lida com tokens de visão, áudio e ação para previsão, geração e o que a NVIDIA chama de simulação neural. As duas torres mantêm camadas de normalização e perceptrons multicamadas separados, mas as camadas de atenção compartilhadas são onde ocorre a integração — forçando o modelo a construir uma única visão coerente de uma cena antes de decidir o que fazer em seguida.
Representação vetorial geométrica compartilhada para ações físicas
Uma das características tecnicamente mais distintas é a forma como o modelo lida com ações físicas em diferentes corpos de robôs. Um braço robótico se move de forma diferente de um veículo com rodas ou de um equipamento de câmera, e a maioria dos modelos trata esses casos como problemas separados. O Cosmos 3 Edge mapeia todos eles em uma representação vetorial geométrica compacta e compartilhada — codificando ações de uma forma que captura relações espaciais e comandos de controle de maneira consistente entre diferentes tipos de corpo.
Esse design cria uma conexão direta entre mudanças visuais em nível de pixel e movimento físico. O vídeo gerado deixa de ser apenas uma previsão visual e passa a ser uma representação de como se espera que o mundo mude em resposta a uma ação específica. Para desenvolvedores que constroem pipelines de treinamento, isso significa dados sintéticos fundamentados em movimento, causa e controle — não apenas em aparência visual.
Aplicações e extensões: modelos de política e ferramentas para desenvolvedores
Além do modelo base, a NVIDIA está lançando o Cosmos 3 Edge Policy (DROID) — uma política de manipulação robótica pós-treinada no conjunto de dados DROID, voltada para tarefas de pick-and-place. Ele é fornecido com scripts de pós-treinamento, oferecendo aos desenvolvedores um ponto de partida concreto para adaptar o modelo aos seus próprios fluxos de trabalho de manipulação.
Pós-treinamento, personalização e recursos para desenvolvedores
Desenvolvedores que quiserem ir além podem fazer fine-tuning do Cosmos 3 Edge em um pequeno cluster de GPUs H100 ou em uma NVIDIA DGX Station. A NVIDIA também está lançando checkpoints de pós-treinamento de referência e receitas de treinamento junto com os pesos do modelo base, incluindo um checkpoint Cosmos 3 Super 4-Step Distillation que reduz a inferência de difusão de 35–50 etapas de remoção de ruído para apenas 4, oferecendo até 25× mais velocidade de inferência para tarefas de geração de imagens e vídeos sem sacrificar a fidelidade da saída.
A estratégia de ecossistema mais ampla aqui merece atenção. Ao lançar pesos abertos, scripts de treinamento e checkpoints de referência em conjunto, a NVIDIA está posicionando o Cosmos 3 Edge não apenas como um modelo isolado, mas como uma base para modelos de mundo adaptados a domínios específicos. Desenvolvedores podem pós-treiná-lo com dados especializados, destilá-lo para obter mais velocidade ou implantá-lo como está — tudo dentro do mesmo framework aberto disponível no Hugging Face.
Liderança em benchmarks e o que vem a seguir
O ranking da NVIDIA no VANTAGE-Bench posiciona o Cosmos 3 Edge no topo de sua categoria de peso em análise de visão, e a reivindicação de liderança em aprendizado de políticas para robôs adiciona peso competitivo em um espaço onde a maioria dos modelos de borda prioriza ou a compreensão de visão ou o controle — não ambos simultaneamente.
Olhando para frente, a NVIDIA delineou planos para avançar o Cosmos 3 para o que chama de IA Física, com melhorias futuras cobrindo geração interativa de mundos, simulação de cenários de direção e políticas de robótica mais amplas. O roteiro também inclui a otimização de checkpoints do Cosmos 3 com frameworks de inferência abertos, incluindo vLLM, pós-treinamento mais rápido em uma gama mais ampla de hardwares e ferramentas adicionais para desenvolvedores.
A direção sinaliza algo mais amplo do que o lançamento de um único modelo. À medida que o hardware de borda se torna mais capaz e as implantações de robótica se expandem em ambientes industriais, a demanda por modelos de mundo compactos e implantáveis só vai se intensificar. Um modelo que raciocina sobre causa e efeito, simula consequências físicas e gera ações de controle — tudo na borda, a 15 Hz — começa a parecer menos um marco de pesquisa e mais uma infraestrutura de produção.
Perguntas frequentes
O que é o NVIDIA Cosmos 3 Edge?
Cosmos 3 Edge é um modelo de mundo aberto com 4 bilhões de parâmetros lançado pela NVIDIA que permite que robôs e agentes de visão em IA entendam seu entorno, raciocinem e gerem ações físicas em tempo real em dispositivos de borda.
Qual hardware o Cosmos 3 Edge suporta para inferência?
O modelo oferece inferência com uso eficiente de memória e alta taxa de transferência em uma ampla gama de hardwares de borda da NVIDIA, incluindo os módulos NVIDIA Jetson T2000, T3000 e Thor, GPUs NVIDIA RTX PRO, NVIDIA DGX e GPUs NVIDIA GeForce RTX.
Como o Cosmos 3 Edge alcança controle de robôs em tempo real?
No NVIDIA Jetson Thor, o modelo gera 32 ações por inferência e mantém o controle do robô a 15 Hz, permitindo raciocínio em tempo real e controle físico sem depender de computação em nuvem.
Os desenvolvedores podem personalizar o Cosmos 3 Edge para seus próprios casos de uso?
Sim. Os desenvolvedores podem fazer fine-tuning do modelo usando um pequeno cluster de GPUs H100 ou uma NVIDIA DGX Station, e a NVIDIA fornece checkpoints de pós-treinamento de referência e receitas de treinamento para ajudar a adaptar o modelo a cargas de trabalho personalizadas e aplicações especializadas.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”O que é o NVIDIA Cosmos 3 Edge?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Cosmos 3 Edge é um modelo de mundo aberto com 4 bilhões de parâmetros lançado pela NVIDIA que permite que robôs e agentes de visão em IA entendam seu entorno, raciocinem e gerem ações físicas em tempo real em dispositivos de borda.”}},{“@type”:”Question”,”name”:”Qual hardware o Cosmos 3 Edge suporta para inferência?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”O modelo oferece inferência com uso eficiente de memória e alta taxa de transferência em uma ampla gama de hardwares de borda da NVIDIA, incluindo os módulos NVIDIA Jetson T2000, T3000 e Thor, GPUs NVIDIA RTX PRO, NVIDIA DGX e GPUs NVIDIA GeForce RTX.”}},{“@type”:”Question”,”name”:”Como o Cosmos 3 Edge alcança controle de robôs em tempo real?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”No NVIDIA Jetson Thor, o modelo gera 32 ações por inferência e mantém o controle do robô a 15 Hz, permitindo raciocínio em tempo real e controle físico sem depender de computação em nuvem.”}},{“@type”:”Question”,”name”:”Os desenvolvedores podem personalizar o Cosmos 3 Edge para seus próprios casos de uso?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Sim. Os desenvolvedores podem fazer fine-tuning do modelo usando um pequeno cluster de GPUs H100 ou uma NVIDIA DGX Station, e a NVIDIA fornece checkpoints de pós-treinamento de referência e receitas de treinamento para ajudar a adaptar o modelo a cargas de trabalho personalizadas e aplicações especializadas.”}}]}
Artigo produzido com a assistência de inteligência artificial e revisado pela equipe editorial.

