В Рядах Фурье вышел пост про забавный эффект — там это не то чтобы прямо "доказано", но на уровне концепции звучит смешно, поэтому не могу не обратить внимание.
Идея такая: большинство крутых текстовых ИИ-моделей сейчас дотренировывают на обратной связи от кожаных мешков (RLHF), чтобы их ответы больше нравились юзерам. Это очень дорого, поэтому под такие задачи нанимают самых дешевых ребят из стран типа Танзании. И в результате может выйти, что будущий сверхсильный AGI по своему образу мышления окажется ближе всего именно к танзанийцам. Ну логично же?)
По крайней мере, похожая штука у исследователей вышла при попытке оценить то, как ЛЛМки отвечали на заковыристые вопросы по личным финансам.
Идея такая: большинство крутых текстовых ИИ-моделей сейчас дотренировывают на обратной связи от кожаных мешков (RLHF), чтобы их ответы больше нравились юзерам. Это очень дорого, поэтому под такие задачи нанимают самых дешевых ребят из стран типа Танзании. И в результате может выйти, что будущий сверхсильный AGI по своему образу мышления окажется ближе всего именно к танзанийцам. Ну логично же?)
По крайней мере, похожая штука у исследователей вышла при попытке оценить то, как ЛЛМки отвечали на заковыристые вопросы по личным финансам.