A Seed Audio anunciou hoje o suporte ao Doubao Seed-Audio 1.0, o modelo multimodal de geração de áudio recém-lançado pela ByteDance e Volcengine, dentro de seu ambiente de criação musical com IA. A integração sinaliza uma mudança mais ampla no cenário do áudio de IA, onde a geração avança além da conversão de texto em fala ou da criação de faixas musicais isoladas para a produção de cenas completas de áudio.
O Doubao Seed-Audio 1.0 rapidamente se tornou um dos lançamentos de áudio de IA mais acompanhados, pois aponta para uma mudança maior na categoria. O áudio de IA não se limita mais a transformar texto em fala ou gerar uma única faixa musical a partir de um prompt. O próximo passo é a geração de áudio de cena completa, onde diálogo, emoção, sotaques, música de fundo, ambiente e efeitos sonoros podem ser criados juntos como parte de uma experiência de áudio.
A cobertura do lançamento público descreve o Doubao Seed-Audio 1.0 como um modelo multimodal de geração de áudio que pode trabalhar com texto e áudio de referência. Ele é posicionado em torno da criação de áudio de ponta a ponta, em vez de clips isolados. Essa distinção é importante para os criadores, porque muitos projetos reais não são apenas uma linha de voz ou uma música. Um trailer de podcast pode precisar de narração, música de transição, um segundo locutor, som ambiente e um pequeno efeito sonoro. Um drama curto pode precisar de diálogo, entrega emocional, passos, som ambiental e trilha sonora de fundo. Um teaser de jogo pode precisar de narração, sons de impacto, ambiente e ritmo musical.
Ao contrário de um modelo tradicional de texto para fala, o Doubao Seed-Audio 1.0 é descrito como abordando o som mais amplo de uma cena. A conversão de texto em fala se concentra em como as palavras devem ser faladas. A geração de áudio de cena completa faz uma pergunta maior: como deve ser todo o momento de áudio? A resposta pode incluir vozes, música, textura espacial, efeitos sonoros, tom do personagem e ritmo.
O modelo também se diferencia da geração exclusiva de música. Geradores de música são úteis quando o objetivo é uma canção, instrumental, refrão ou faixa de fundo. O Doubao Seed-Audio 1.0 está sendo discutido em um contexto de áudio mais amplo, onde conteúdo falado, música, ambiente e design de som podem pertencer à mesma solicitação criativa.
É por isso que o lançamento atraiu a atenção de mais do que músicos. Criadores de vídeo, profissionais de marketing, equipes de podcast, desenvolvedores de jogos, educadores, editores de mídia social e contadores de histórias de marca têm o mesmo problema básico. Eles precisam de áudio que se encaixe em uma cena, não apenas de um arquivo que soe bem por si só.
O Doubao Seed-Audio 1.0 também chega em um momento em que os criadores estão pedindo mais controle após a geração. A primeira saída raramente é o ativo final. Uma faixa gerada pode estar próxima, mas o refrão pode precisar de mais energia. Uma voz pode se adequar ao clima, mas a música de fundo pode estar muito carregada. Uma introdução curta pode precisar de um final mais limpo. Uma faixa de fundo de vídeo pode precisar de mais espaço para narração. Esses são problemas de fluxo de trabalho tanto quanto problemas de modelo.
É aí que a Seed Audio está posicionando seu ambiente de trabalho. A Seed Audio está adicionando o suporte ao Doubao Seed-Audio 1.0 dentro de um ambiente de criação musical baseado em agente, projetado para ajudar os criadores a ir da primeira ideia ao áudio utilizável. Em vez de tratar o modelo como uma caixa de prompt independente, a Seed Audio coloca a geração dentro de um fluxo de trabalho onde os usuários podem rascunhar, refinar, estender, regravar, remixar, separar, organizar e reutilizar ativos de áudio.
No centro da plataforma está o Seed Audio Agent, um ambiente de criação guiado que ajuda os usuários a decidir o que fazer em seguida. Um criador pode descrever um objetivo em linguagem simples, como um loop de jogo cinematográfico, uma introdução de podcast, uma faixa de fundo para vídeo curto, um demo de música pop ou uma trilha sonora de lançamento de produto de marca. O Seed Audio Agent pode então ajudar a traduzir essa solicitação em uma direção musical mais clara, escolher o caminho de criação ou edição relevante, mostrar detalhes da tarefa antes da execução e sugerir ações de acompanhamento após um resultado ser gerado.
"O Doubao Seed-Audio 1.0 mostra para onde o áudio de IA está indo, em direção a uma criação mais rica e contextual", disse um porta-voz da Seed Audio. "Nosso objetivo é tornar essa capacidade útil dentro de um fluxo de trabalho real de criador. Os criadores não precisam apenas de uma resposta do modelo. Eles precisam de uma maneira de rascunhar, refinar, reutilizar e finalizar ativos de áudio."
A Seed Audio está disponível agora em https://seedaudio.ai. Novos usuários podem começar com o Seed Audio Agent, testar fluxos de trabalho suportados pelo Doubao Seed-Audio 1.0 onde disponíveis, gerar faixas de amostra, explorar música pública e usar as ferramentas de criação e edição da plataforma.
Para criadores que também precisam de ativos visuais, o i2v.ai oferece uma plataforma de alto valor para geração de imagem e vídeo com IA. Os dois fluxos de trabalho podem se complementar naturalmente para vídeos curtos, postagens em redes sociais, anúncios, demonstrações de produtos, visuais musicais e ativos de campanha onde os criadores precisam de som e visuais sem esticar os orçamentos de produção.
