Российская компания Neuro.net представила Neuro TTS — технологию синтеза речи для голосовых ИИ-решений.
В разработке используются большие языковые и диффузионные модели, которые учитывают акустические характеристики голоса и контекст при генерации речи. Это позволяет создавать более естественное звучание. Платформа уже доступна пользователям и может интегрироваться в рабочие сервисы через API. Компании также могут задавать характеристики голоса своих ИИ-агентов.
В потоковом режиме первые аудиоданные начинают передаваться через 120 миллисекунд после получения запроса — воспроизведение можно запустить ещё до завершения генерации всей фразы.
Голосовые ИИ становятся частью клиентского сервиса
Для бизнеса технологии синтеза речи могут использоваться в колл-центрах, голосовых помощниках и других сервисах, где клиент взаимодействует с компанией через голос.
Фото: Freepik
Здесь пока еще нет комментариев. Будьте первыми!