ROSE: remoção de objetos em vídeos com dados sintéticos 3D

Modelos generativos avançaram muito em edição e manipulação de vídeo, mas ainda existe um desafio muito difícil: remover objetos por completo — não só o objeto em si, mas também os efeitos colaterais que ele cria, como sombras, reflexos, mudanças de iluminação, translucidez e até aparecer em espelhos.

O trabalho recente ROSE (Remove Objects with Side Effects in Videos), publicado em agosto de 2025 por pesquisadores da Zhejiang University, KunByte AI, Peking University e The University of Hong Kong, mostra que esse desafio pode ser tratado de forma elegante e eficaz — treinando um modelo avançado inteiramente com dados sintéticos, gerados em ambientes 3D controlados.

Pipeline de preparação de pares de vídeo usando dados 3D, que pode ser dividido em: amostragem da cena e
dos objetos, geração multi-view com máscaras, filtragem de views válidas e renderização dos vídeos. Fonte.

O que é o ROSE?

O ROSE é um framework para remoção de objetos em vídeos, baseado em um modelo de inpainting Diffusion Transformer (DT).

A inovação central é que o treinamento não depende de vídeos reais pareados (com e sem o objeto) — que são praticamente impossíveis de coletar em escala.
Em vez disso, os autores construíram um pipeline sintético automático para gerar vídeos 3D realistas com controle total sobre:

  • Presença ou ausência do objeto.
  • Efeitos colaterais como sombras, reflexos e translucidez.
  • Iluminação, ângulos de câmera e trajetórias.

Essa abordagem permitiu criar um dataset rico, pareado e altamente variado, que simplesmente não é possível obter no mundo real.

Além disso, o ROSE introduz duas ideias centrais:

  1. Supervisão por máscara de diferença – o modelo prevê explicitamente as áreas afetadas pela remoção (por exemplo, sombras que desaparecem), focando exatamente onde as correções são necessárias.
  2. Erasing baseado em referência – a remoção do objeto é guiada por referências sintéticas, garantindo consistência temporal entre os quadros.

ROSE-Bench: testando os efeitos colaterais

Para avaliar o método, os autores também criaram o ROSE-Bench, um benchmark desenhado especificamente para medir remoção de objetos em vídeo com efeitos colaterais, cobrindo cinco categorias principais:

  • Sombras
  • Reflexos
  • Mudanças de iluminação
  • Translucidez
  • Espelhos

Nos experimentos, o ROSE superou significativamente métodos anteriores em métricas quantitativas e qualitativas e ainda mostrou forte generalização para vídeos reais, mesmo nunca tendo sido treinado diretamente com eles.

O que o ROSE mostra

O sucesso do ROSE destaca uma verdade essencial: em tarefas complexas, dados reais sozinhos não bastam.

Só com dados sintéticos 3D foi possível:

  • Criar pares perfeitos de vídeo com e sem objetos.
  • Capturar casos raros, mas críticos, de forma sistemática.
  • Produzir anotações ricas instantaneamente e sem custo manual.

Esse nível de controle sobre a cena faz dos dados sintéticos uma ferramenta indispensável para a visão computacional avançada.

E o ROSE não está sozinho. Recentemente, a Microsoft apresentou o DAViD, um sistema de visão multitarefa treinado 100% com dados sintéticos, com resultados igualmente notáveis. Os dois trabalhos deixam claro: dados sintéticos não são mais um recurso de apoio — estão se tornando a base dos modelos de IA estado da arte.

O que isso significa na prática

Na SynthVision, adotamos a mesma filosofia: usar ambientes 3D controlados para criar datasets sob medida com qualidade fotorrealista, anotações perfeitas e total flexibilidade sobre iluminação, materiais, geometria e sensores.

Ajudamos empresas a:

  • Construir datasets para tarefas que não podem ser resolvidas apenas com dados reais.
  • Reproduzir efeitos difíceis ou impossíveis de capturar fisicamente, como reflexos, sombras ou transparência.
  • Acelerar ciclos de P&D e entregar provas de conceito mais fortes.

O ROSE é uma demonstração pública do que vemos todos os dias na prática: quem domina dados sintéticos hoje está moldando o futuro da visão computacional.


Quer ver como dados sintéticos podem transformar seu projeto? Na SynthVision, criamos datasets prontos para pipelines reais — com qualidade fotorrealista, anotações precisas e entrega rápida.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *