A empresa israelense D-ID, lançada em 2017, quer criar humanos sintéticos tão perfeitos, a ponto de ser impossível distinguir um humano real de um robô. A empresa está mesclando inteligências artificiais para geração de imagem, animação, texto e fala.
A versão atual ainda está longe de atingir seu objetivo. A marca foi criada com o propósito de dar ao mundo ferramentas para impedir que governos e corporações monitorem as pessoas por meio de reconhecimento facial.
Os humanos do futuro
A D-ID primeiramente produziu avatares, que são representações artísticas, como um primeiro passo de seu objetivo, mas a animação ainda não tem a qualidade ideal. Quando estão reproduzindo falas a imagem pode ser um pouco assustadora, pois ainda há muito o que desenvolver para termos a sensação de que são humanos reais.

Para criar um avatar mais realista, a empresa oferece uma opção chamada Premium Presenter, que não utiliza o Stable Diffusion ou fotos para gerar a animação, segundo o Fast Company Brasil. O cofundador da empresa, Gil Perry, disse que diversas empresas estão utilizando esta tecnologia para realizar campanhas de marketing.
Ele mostrou um exemplo enviado para desejar boas festas aos funcionários de uma empresa. A tecnologia é basicamente a mesma usada no D-ID, mas eles optaram por usar uma voz clonada do que um modelo padrão de conversão de fala. O resultado é melhor, o que pode enganar melhor as pessoas, principalmente se estiverem vendo em uma tela pequena.
Acompanhe o nosso trabalho também nas redes sociais;
Siga a nossa página do Colidernews no Facebook.
Acompanhe nossas matérias no Grupo de WhatsApp.
Saiba tudo do nosso site na pagina oficial do Twitter.
Siga o Colidernews também no Instagram.
Faça parte do nosso grupo de notícias no Telegram.
Junte-se a nós também no Grupo do Colidernews no Signal.
Outro obstáculo da empresa é fazer avatares em tempo real. “Somos capazes de produzir uma animação na metade do tempo do vídeo, ou seja, mais rápido do que em tempo real”, explica. As dificuldades parecem estar na geração de texto e conversão em fala e na maneira como todas as peças interagem juntas. Mas Perry está confiante de que em 5 meses este problema será resolvido. Para o aperfeiçoamento das imagens ele estima um tempo de 2 anos.
Perry considera esse intervalo de espera positivo. “O mundo vai precisar de tempo para se acostumar com essa tecnologia”.
Fonte: Fernanda Lopes Soldateli, editado por Adriano Camargo l Olhar Digital


