← к ленте

Использование словаря Loughran-McDonald для анализа тональности финансовых отчетов

М@maxvotekмедиа / агрегатор
3 дн

Автор делится опытом создания AI-агента для анализа транскриптов инвесторских звонков, сочетая LLM с детерминированным словарем Loughran-McDonald.

Стабильный анализ данных важнее, чем просто использование нейросетей.

  • LLM могут давать разные результаты на одних и тех же данных из-за своей природы.
  • Для финансовых решений необходимы детерминированные метрики, которые можно проверить.
  • Комбинирование нейросетей с классическими словарями повышает надежность автоматизированного анализа.
Модель даёт понимание. Цифра даёт опору. Продолжаю собирать свой виртуальный хедж-фонд, где решения по сделкам принимают AI-агенты. Торгую по стратегии колеса опционов, а я в этой конструкции одновременно и директор, и главный инвестор. Один из агентов автоматически читает транскрипты квартальных звонков компаний с инвесторами (earnings calls). Вопрос простой: стал ли менеджмент говорить осторожнее, чем квартал назад? Логика такая, что сначала меняется язык, потом режут прогноз, потом акция падает на 20%. Сначала оценку тональности делала LLM. Она хорошо понимает контекст, но есть большая проблема: LLM недетерминированы. Завтра на том же тексте модель поставит другую оценку. Другая модель даст третью. Через месяц провайдер обновит модель и результат снова изменится. Для финансов это плохо. Если оценка риска выросла с 1.0 до 2.0, я хочу понимать, что компания правда заговорила тревожнее, или просто поменялась модель? Оказалось, эту задачу в академических финансах начали решать ещё в 2011 году. Есть специальный словарь для финансовых текстов - Loughran-McDonald. Внутри 2355 негативных слов, 297 слов, выражающих неопределённость, 903 юридических. Так почему нужен именно финансовый словарь, а не обычный анализ тональности? Обычный алгоритм считает liability или cost негативными, а в отчётности это просто "обязательства" и "затраты", нейтральные термины. Метод простой до примитивности, мы считаем количество негативных и неопределённых слов на тысячу слов текста. В этой простоте и вся сила. Было 8 слов неопределённости на тысячу, стало 14? Это факт. Через год на том же тексте будет ровно то же число. Можно сравнивать кварталы, компании, руками перечитать какое хочешь слово. Теперь у меня работают оба подхода параллельно. LLM понимает смысл и контекст. Словарь даёт цифру, которая не меняется. Если LLM говорит, что риск резко вырос, а словарные показатели стоят на месте - это сигнал, что стоит перечитать транскрипт самому. Для себя я понял, там, где AI участвует в решении о деньгах, рядом с его оценкой должна быть цифра, которую можно проверить руками. @maxvotek | linkedin | substack

Кратко (AI)

Автор описывает подход к анализу финансовых отчетов с помощью AI-агентов. Он отмечает проблему недетерминированности LLM и предлагает дополнить их использование классическим финансовым словарем Loughran-McDonald для получения стабильных и проверяемых метрик.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖