Tavus показала ИИ, которого почти половина людей приняла за человекаКомпания
представила Griffin, новую модель для живого общения по видеосвязи. Она одновременно видит пользователя, слышит его и генерирует собственные речь, мимику и движения.
Главное отличие от обычных голосовых ассистентов в том, что Griffin не работает по схеме «человек закончил говорить, модель подумала, модель ответила». Система продолжает слушать и смотреть даже во время собственного ответа.
Поэтому она может кивнуть, пока вы говорите, перебить в подходящий момент, остановиться, если перебили ее, заметить предмет в кадре или понять, что пауза означает размышление, а не конец фразы. Решение о следующем действии пересматривается несколько раз в секунду.
Внутри две основные части. Первая непрерывно анализирует аудио и видео и решает, что сказать и как себя повести. Вторая в реальном времени генерирует голос и видео. Griffin создает весь кадр целиком, включая тело, руки и фон, а не только анимирует лицо.
В исследовании Tavus 54 человека провели с Griffin-Lite минутный видеозвонок, не зная, кто находится на другой стороне. 26 участников, или 48%, после разговора решили, что общались с настоящим человеком. Для предыдущей системы Tavus этот показатель составлял 2,4%.
На независимом бенчмарке NVIDIA VideoFDB Griffin также заняла первое место среди протестированных систем по генерации и восприятию в разговоре лицом к лицу. При этом результаты все еще немного уступают человеческим записям.
Пока Griffin-Lite доступна только небольшой группе тестировщиков. Tavus отдельно пишет, что технология требует дополнительных механизмов безопасности именно потому, что человека уже можно убедить, будто перед ним реальный собеседник.
dailyprompts.ru