Репост из: Бурый
В историю иногда попадают случайно. Как Дима Торжок 🤷♂️
Кто это такой? Я тоже не знал, но недавно мне рассказали, что он попадал и попадает в миллионы автоматических субтитров в кэпкате, телеге и где только не.
Делаете вы автосубтитры, и помимо нужной вам инфы примешивается такой артефакт генерации, как
Такая вот галлюцинация.
В том числе вы могли её видеть и слышать в расшифровке голосовых сообщений, что особенно смешно.
Дело в том, что OpenAI и другие конторы обучали свои модели на массиве информации, в которую в том числе были заложены сотни (тысячи?) видео, где субтитры действительно создавал некий Дима Торжок (да он даже в этом коротком посте уже три раза вылез, как так-то??)
Феномен хорошо расписала на vc Элла Бородулина — я не знаю, кто это, но текст раскрывает суть.
Если коротко, то
И вроде как трудно теперь это поправить, особенно для русскоязычного рынка, на который OpenAI с его владельцем-мутантом дядей Сэмом Альтманом 😏 глубоко так наплевал.
При этом непонятно, кто же на самом деле такой этот Дима Торжок. На его имени уже давно паразитируют, есть сайты, которые убирают бедолагу Торжка из аудиофайлов и зарабатывают на этом. Пожалуйста, не пользуйтесь таким барахлом без срочной надобности.
В целом же эта история очень нравится своим неконтролируемым безумием. Проделки жизни внутри мира ИИ 👾
тг | бусти | max | дзен | vk | я музыка
Кто это такой? Я тоже не знал, но недавно мне рассказали, что он попадал и попадает в миллионы автоматических субтитров в кэпкате, телеге и где только не.
Делаете вы автосубтитры, и помимо нужной вам инфы примешивается такой артефакт генерации, как
субтитры сделал Дима Торжок
Такая вот галлюцинация.
В том числе вы могли её видеть и слышать в расшифровке голосовых сообщений, что особенно смешно.
Дело в том, что OpenAI и другие конторы обучали свои модели на массиве информации, в которую в том числе были заложены сотни (тысячи?) видео, где субтитры действительно создавал некий Дима Торжок (да он даже в этом коротком посте уже три раза вылез, как так-то??)
Феномен хорошо расписала на vc Элла Бородулина — я не знаю, кто это, но текст раскрывает суть.
Если коротко, то
Техническая причина кроется в том, как обучали модель Whisper от OpenAI. Для обучения использовали огромный массив аудио с YouTube — около 680 000 часов. Вместе с роликами в выборку попали и субтитры, где в конце стояла подпись: «Субтитры сделал DimaTorzok».
И вроде как трудно теперь это поправить, особенно для русскоязычного рынка, на который OpenAI с его владельцем-мутантом дядей Сэмом Альтманом 😏 глубоко так наплевал.
При этом непонятно, кто же на самом деле такой этот Дима Торжок. На его имени уже давно паразитируют, есть сайты, которые убирают бедолагу Торжка из аудиофайлов и зарабатывают на этом. Пожалуйста, не пользуйтесь таким барахлом без срочной надобности.
В целом же эта история очень нравится своим неконтролируемым безумием. Проделки жизни внутри мира ИИ 👾
тг | бусти | max | дзен | vk | я музыка