Одна из областей, где компьютеры ещё не превзошли людей — распознавание смены говорящих на аудио. Люди легко определяют, что вот вступает человек № 1, а вот № 2, даже если в этот момент речь № 1 продолжается:
http://languagelog.ldc.upenn.edu/myl/sbc0004X1.wav
http://languagelog.ldc.upenn.edu/myl/arianaX6.wav
Если у компьютера есть образцы речи каждого говорящего, то да, справляется более-менее, но вот с намного более часто встречающейся задачей «понять, сколько людей говорит и где» автоматически ещё пока не смогли управиться.
В статье 2004 года из журнала IEEE Signal Processing Letters указывается, что около трети определённых компьютером «перемен говорящих» на самом деле в реальности не происходили, а треть реальных перемен ему определить не удалось.
Использование нейронных сетей тоже не особо помогает: в 2015 году в IEEE ICASSP вышла статья, в которой процент пропущенных перемен говорящих не удалось довести ниже 11 %, а количество ложных срабатываний — чем 2 в минуту.
Для людей же такая задача тривиальна. Даже не зная языка, мы прекрасно слышим, где вступает № 2.
http://languagelog.ldc.upenn.edu/myl/ArabicSpeakerChange1.wav
http://languagelog.ldc.upenn.edu/nll/?p=36801
http://languagelog.ldc.upenn.edu/myl/sbc0004X1.wav
http://languagelog.ldc.upenn.edu/myl/arianaX6.wav
Если у компьютера есть образцы речи каждого говорящего, то да, справляется более-менее, но вот с намного более часто встречающейся задачей «понять, сколько людей говорит и где» автоматически ещё пока не смогли управиться.
В статье 2004 года из журнала IEEE Signal Processing Letters указывается, что около трети определённых компьютером «перемен говорящих» на самом деле в реальности не происходили, а треть реальных перемен ему определить не удалось.
Использование нейронных сетей тоже не особо помогает: в 2015 году в IEEE ICASSP вышла статья, в которой процент пропущенных перемен говорящих не удалось довести ниже 11 %, а количество ложных срабатываний — чем 2 в минуту.
Для людей же такая задача тривиальна. Даже не зная языка, мы прекрасно слышим, где вступает № 2.
http://languagelog.ldc.upenn.edu/myl/ArabicSpeakerChange1.wav
http://languagelog.ldc.upenn.edu/nll/?p=36801