Visão computacional · simulação 3D, não IA generativa

Todo bom modelo de IA precisa de bons dados.

Quando o modelo nunca viu a condição rara, ele erra. Nós criamos essas imagens num ambiente 3D controlado, com anotação exata — nada é adivinhado por IA.

Você foca no modelo. Nós cuidamos dos dados.

Não é um vídeo — é uma cena 3D real.

Cada rótulo que você vê (caixa delimitadora, confiança, segmentação) é gerado automaticamente a partir da própria cena — do mesmo jeito que geramos rótulos para o seu dataset de treinamento.

Quando o modelo nunca viu a condição rara, ele erra. Nós criamos essas imagens num ambiente 3D controlado, com anotação exata — nada é adivinhado por IA.

Você foca no modelo. Nós cuidamos dos dados.

0rótulos manuais
10+formatos de anotação suportados
100%reprodutível: cada imagem tem origem conhecida
500 mil+imagens geradas até hoje

A lacuna de dados

O que o seu modelo não consegue enxergar?

Na maioria dos projetos de visão computacional, o problema não é o modelo. São as fotos que faltam: a condição é rara, só acontece em certa época do ano, é perigosa demais para registrar ou ainda nem aconteceu. E nenhuma ferramenta de rotulagem, por mais rápida que seja, anota uma foto que não existe.

→ Na simulação, cada uma dessas lacunas vira um parâmetro que você escolhe — e que pode repetir quantas vezes quiser. Veja quando isso ajuda.

// simulação_controlada · interativo

Veja o que você pode controlar.

Escolha uma área e depois uma variação. Cada cena nasce de parâmetros: objetos, materiais, iluminação, câmera e até o formato dos rótulos.

Base scene

Select a variation to see the scene parameters change.

READY
MÁSCARA
máscara de segmentação em sobreposição (COCO)

Por que simulação

Imagens que você controla, não imagens geradas por IA.

Modelos generativos criam imagens que parecem plausíveis. A simulação cria imagens com o conteúdo que você definiu, e com rótulos que você pode comprovar.

Imagens geradas por IA

Distribuição desconhecida das imagens geradas por IA
  • Você não sabe exatamente o que há no dataset
  • Não há uma cena por trás da imagem, então os rótulos são estimados ou feitos à mão
  • Detalhes estranhos que mudam de uma imagem para outra
  • Custo e tempo por imagem difíceis de prever
  • Não dá para repetir uma cena específica quando você precisa
  • O equilíbrio entre classes é aproximado: você recebe o que vier

Simulação controlada

Pipeline: cena 3D → render → rótulo, rastreável por parâmetro
  • Cada parâmetro é declarado: você sabe exatamente o que há no dataset
  • Os rótulos saem direto da cena 3D, então são exatos
  • Luz, materiais e geometria seguem a física
  • Reproduzível: a mesma cena gera sempre a mesma imagem
  • Precisa de uma classe nova, outro ângulo de câmera ou outro formato de rótulo? Mudamos a cena e geramos de novo, sem nova coleta
  • Você decide quantas imagens de cada classe quer

Onde a simulação ganha não é no realismo. É em saber exatamente o que há no dataset e por quê. Buscamos realismo só até o ponto de que o modelo precisa. O objetivo nunca foi um render bonito: é uma cena com o sinal certo para o treino. Uma cena menos realista, mas com a física, a escala e o rótulo corretos, vale mais do que uma cena bonita com erros.

// como pensamos e operamos

Treinar com dado sintético, validar com dado real e refinar onde ainda falha.

Não defendemos dado sintético por princípio. Para nós, é uma ferramenta: ajuda a cobrir casos raros e a ganhar velocidade, e o seu dado real continua sendo o teste final do modelo. É essa lógica que orienta como pensamos cada projeto.

1 · Treino sintéticocobertura e casos raros
2 · Validação realo seu dado real é o teste final
3 · Refinamentosó o que ainda falta
↻ novo lote em dias

O mesmo vale para o nosso jeito de trabalhar. Por padrão, não publicamos nomes de clientes, dados nem números de projeto: a confidencialidade que prometemos cobre também os resultados, não só a identidade. Em vez de cases, mostramos como abordamos cada problema e como medimos se funcionou.

Quem está do outro lado

Uma pessoa, não um formulário.

Guilherme Bileki
Guilherme BilekiFundador, SynthVision
Engenheiro de visão computacional construindo sistemas de CV em produção para agro, varejo e indústria — do diagnóstico ao dataset.

Respostas rápidas

Perguntas comuns.

Isso substitui dado real?

Na maioria dos casos, não, e dizemos quando for assim. O dado real continua sendo o teste final do modelo e, em alguns projetos, é simplesmente o melhor material de treino. O dado sintético entra para cobrir o que a coleta real não alcança, como os casos raros.

Na prática: se o seu dataset real já cobre bem o caso, acrescentar dado sintético pode não melhorar muito o resultado. O valor está na cobertura que falta, não em superar um modelo que já está bom. Preferimos dizer isso a vender um dataset que não vai fazer diferença. A pergunta certa é quando misturar vale a pena, não se sempre vence.

Por que não usar uma grande plataforma de dados sintéticos ou ferramentas de código aberto?

Use-as, se atenderem o seu caso. Elas resolvem bem os 80% padrão do problema, e uma ferramenta gratuita com um time capaz é uma resposta legítima.

Entramos nos outros 20%: a cena, a variação ou o tipo de rótulo que nenhum produto pronto oferece e que, muitas vezes, é justamente onde o seu modelo falha. Conseguimos construir essa parte porque construímos o próprio pipeline.

E os modelos que rotulam sozinhos (como SAM e VLMs) e as ferramentas de anotação com IA?

Vale separar isso em duas afirmações, porque elas se sustentam de forma diferente. “Um modelo generalista consegue rotular suas fotos reais existentes mais rápido” — verdade, e cada vez mais verdade a cada trimestre. Se você já tem filmagem da condição que te interessa, uma ferramenta de anotação assistida por IA costuma ser o caminho mais rápido e barato, e vamos dizer isso em vez de te vender um dataset para algo que você já consegue rotular.

“Um modelo generalista consegue rodar em produção no lugar de um treinado” — verdade para prototipagem e objetos comuns, mais fraco conforme você escala: custo e latência por inferência em tempo real ou volume alto é uma conta de infraestrutura bem diferente de um modelo pequeno treinado para a tarefa, e a generalização ainda fica atrás no seu SKU específico, no seu defeito específico ou na sua doença específica.

Nenhuma das duas afirmações toca o caso em que a foto nunca foi capturada — uma condição rara, sazonal ou perigosa demais para já ter aparecido na filmagem de alguém. Nenhuma ferramenta de rotulagem, por melhor que seja, consegue anotar uma imagem que não existe. Essa lacuna é o que geramos, e é o motivo de ela não encolher conforme os modelos de rotulagem melhoram.

Como começamos, na prática?

Com uma conversa de diagnóstico sobre o seu modelo, não com um briefing de dados. Olhamos onde ele falha, o que o seu conjunto de validação cobre e o que está faltando. Se a simulação fizer sentido, começamos com um lote pequeno de validação, para você avaliar a qualidade antes de se comprometer com o dataset completo. Se não fizer, dizemos isso.

Não sou da área de machine learning. Faz sentido conversar?

Faz, sim. Você não precisa dominar os termos técnicos nem chegar com tudo definido. Basta contar qual é o problema: o que o sistema deveria reconhecer e onde ele erra. Nós ajudamos a transformar isso em dados e explicamos cada passo sem jargão.

Se faltam dados para o seu modelo evoluir, vamos conversar.

Conte o que o seu modelo está errando. Vamos avaliar juntos se a simulação é o caminho certo e o que seria preciso.