O Google apresentou recentemente o Gemini 3.5 Transcribe, um sistema que transcreve voz para texto, disponibilizando-o em mais de 85 línguas diferentes, e que funciona praticamente em tempo real, o que permite a quem o utilizar ir vendo o texto quase em simultâneo com a voz, surgindo no final de cada frase, uma metodologia inerente ao tipo de funcionalidades disponibilizada.
O modelo do Google é mais sofisticado do que a maioria dos concorrentes, ultrapassando ruídos de fundo, o uso de palavras mais específicas ou gíria, e chegando a corrigir a estrutura frásica, quando a frase, tendo falhas na construção, tem uma intenção e significado perceptível e intepretável.
Os filtros também removem os auxiliares de linguagem, como so típicos "ums" e "ahs", ou outras expressões usadas para preencher vazios ou ganhar tempo, reestruturando as frases, quando necessário e se possível, sem que disso decorra a perda do sentido, ficando, naturalmente, em aberto a questão da interpretação do tom ou volume de voz e de eventuais hesitações.
O Gemini 3.5 Transcribe está disponível para programadores que utilizem o Google AI Studio, o Gemini Enterprise Agent Platform e o Google Antigravity, bem como em aplicações de uso comum, como o Gboard para Android, via Rambler, a aplicação do Gemini para macOS, devendo chegar dentro de pouco tempo ao Chrome.
Subscrever:
Enviar feedback (Atom)










Sem comentários:
Enviar um comentário