#кейсы #ML
История Влада про как ему отдали чужую модель напомнила мне похожую.
Мне тоже передали модель ребят, которые уволились, последний уволившийся был на связи – и на том спасибо. Код обучения и задачу за пару дней запустить модель во внутреннем контуре на инференс, при необходиомсти -- переобучить.
Проблемы начались сразу с pymystem3 – он упорно просился в инет (судя по коду ошибки - стучался в апи яндекса, 2017й год), и первым делом я заменил его на snowball.
Ок, прогоняю код, но на выходе 💩. Смотрю в разметку – там печаль, но это цветочки -- да и поговорим мы про это в сл постах (хотя, как мне сказали, разметку делали 12 человек фуллтайм один месяц). Но самое печальное дальше, трейн состоял из двух файлов – s3.csv и s4.csv, суммарно тысяч на 9,5 строк.
Возникло два вопроса:
- А где файлы s1 и s2????!! – как выяснилось, утеряны, потому как последнему уволившемуся каналье-DS их передавал другой каналья-DS и где-то при передаче они потерялись. Минус половина трейна – работа 12 человек за 2 недели.
- Как сделать так, чтобы каналья, которая сохранила в csv таблицы с текстовыми полями, в которых в полный рост спецсимволы и символы переноса строки, пришла к просветлению и больше никого так не подставляла?
Итого, задача: нужно раскидывать семплы по классам, которых неск десятков и при доразметке появляются новые, а исходных семплов с меткой примерно 9500. Базовых фичей -- несколько сотен, такая вот задачка).
В итоге задача заняла не пару дней, а пару недель до первой пром версии и пару лет до той версии, что несколько лет стояла в проме (а мб и сейчас стоит).
PS: забавно, сейчас такое поведение pymystem3 с выключенным инетом воспроизвести не получилось:
import pymystem3
mystem = pymystem3.Mystem()
text = 'дата канальи -- канал про каналий'
print(', '.join(mystem.lemmatize(text)))
>>> дата, , каналья, -- , канал, , про, , каналья,
История Влада про как ему отдали чужую модель напомнила мне похожую.
Мне тоже передали модель ребят, которые уволились, последний уволившийся был на связи – и на том спасибо. Код обучения и задачу за пару дней запустить модель во внутреннем контуре на инференс, при необходиомсти -- переобучить.
Проблемы начались сразу с pymystem3 – он упорно просился в инет (судя по коду ошибки - стучался в апи яндекса, 2017й год), и первым делом я заменил его на snowball.
Ок, прогоняю код, но на выходе 💩. Смотрю в разметку – там печаль, но это цветочки -- да и поговорим мы про это в сл постах (хотя, как мне сказали, разметку делали 12 человек фуллтайм один месяц). Но самое печальное дальше, трейн состоял из двух файлов – s3.csv и s4.csv, суммарно тысяч на 9,5 строк.
Возникло два вопроса:
- А где файлы s1 и s2????!! – как выяснилось, утеряны, потому как последнему уволившемуся каналье-DS их передавал другой каналья-DS и где-то при передаче они потерялись. Минус половина трейна – работа 12 человек за 2 недели.
- Как сделать так, чтобы каналья, которая сохранила в csv таблицы с текстовыми полями, в которых в полный рост спецсимволы и символы переноса строки, пришла к просветлению и больше никого так не подставляла?
Итого, задача: нужно раскидывать семплы по классам, которых неск десятков и при доразметке появляются новые, а исходных семплов с меткой примерно 9500. Базовых фичей -- несколько сотен, такая вот задачка).
В итоге задача заняла не пару дней, а пару недель до первой пром версии и пару лет до той версии, что несколько лет стояла в проме (а мб и сейчас стоит).
PS: забавно, сейчас такое поведение pymystem3 с выключенным инетом воспроизвести не получилось:
import pymystem3
mystem = pymystem3.Mystem()
text = 'дата канальи -- канал про каналий'
print(', '.join(mystem.lemmatize(text)))
>>> дата, , каналья, -- , канал, , про, , каналья,