Модель даёт понимание. Цифра даёт опору.
Продолжаю собирать свой виртуальный хедж-фонд, где решения по сделкам принимают AI-агенты.
Торгую по стратегии колеса опционов, а я в этой конструкции одновременно и директор, и главный инвестор.
Один из агентов автоматически читает транскрипты квартальных звонков компаний с инвесторами (earnings calls).
Вопрос простой: стал ли менеджмент говорить осторожнее, чем квартал назад?
Логика такая, что сначала меняется язык, потом режут прогноз, потом акция падает на 20%.
Сначала оценку тональности делала LLM. Она хорошо понимает контекст, но есть большая проблема: LLM недетерминированы.
Завтра на том же тексте модель поставит другую оценку. Другая модель даст третью. Через месяц провайдер обновит модель и результат снова изменится.
Для финансов это плохо. Если оценка риска выросла с 1.0 до 2.0, я хочу понимать, что компания правда заговорила тревожнее, или просто поменялась модель?
Оказалось, эту задачу в академических финансах начали решать ещё в 2011 году. Есть специальный словарь для финансовых текстов - Loughran-McDonald.
Внутри 2355 негативных слов, 297 слов, выражающих неопределённость, 903 юридических.
Так почему нужен именно финансовый словарь, а не обычный анализ тональности?
Обычный алгоритм считает liability или cost негативными, а в отчётности это просто "обязательства" и "затраты", нейтральные термины.
Метод простой до примитивности, мы считаем количество негативных и неопределённых слов на тысячу слов текста.
В этой простоте и вся сила. Было 8 слов неопределённости на тысячу, стало 14? Это факт.
Через год на том же тексте будет ровно то же число. Можно сравнивать кварталы, компании, руками перечитать какое хочешь слово.
Теперь у меня работают оба подхода параллельно. LLM понимает смысл и контекст. Словарь даёт цифру, которая не меняется.
Если LLM говорит, что риск резко вырос, а словарные показатели стоят на месте - это сигнал, что стоит перечитать транскрипт самому.
Для себя я понял, там, где AI участвует в решении о деньгах, рядом с его оценкой должна быть цифра, которую можно проверить руками.
@maxvotek | linkedin | substack
Продолжаю собирать свой виртуальный хедж-фонд, где решения по сделкам принимают AI-агенты.
Торгую по стратегии колеса опционов, а я в этой конструкции одновременно и директор, и главный инвестор.
Один из агентов автоматически читает транскрипты квартальных звонков компаний с инвесторами (earnings calls).
Вопрос простой: стал ли менеджмент говорить осторожнее, чем квартал назад?
Логика такая, что сначала меняется язык, потом режут прогноз, потом акция падает на 20%.
Сначала оценку тональности делала LLM. Она хорошо понимает контекст, но есть большая проблема: LLM недетерминированы.
Завтра на том же тексте модель поставит другую оценку. Другая модель даст третью. Через месяц провайдер обновит модель и результат снова изменится.
Для финансов это плохо. Если оценка риска выросла с 1.0 до 2.0, я хочу понимать, что компания правда заговорила тревожнее, или просто поменялась модель?
Оказалось, эту задачу в академических финансах начали решать ещё в 2011 году. Есть специальный словарь для финансовых текстов - Loughran-McDonald.
Внутри 2355 негативных слов, 297 слов, выражающих неопределённость, 903 юридических.
Так почему нужен именно финансовый словарь, а не обычный анализ тональности?
Обычный алгоритм считает liability или cost негативными, а в отчётности это просто "обязательства" и "затраты", нейтральные термины.
Метод простой до примитивности, мы считаем количество негативных и неопределённых слов на тысячу слов текста.
В этой простоте и вся сила. Было 8 слов неопределённости на тысячу, стало 14? Это факт.
Через год на том же тексте будет ровно то же число. Можно сравнивать кварталы, компании, руками перечитать какое хочешь слово.
Теперь у меня работают оба подхода параллельно. LLM понимает смысл и контекст. Словарь даёт цифру, которая не меняется.
Если LLM говорит, что риск резко вырос, а словарные показатели стоят на месте - это сигнал, что стоит перечитать транскрипт самому.
Для себя я понял, там, где AI участвует в решении о деньгах, рядом с его оценкой должна быть цифра, которую можно проверить руками.
@maxvotek | linkedin | substack