-
Чем отличается финансовый ML от других видов машинного обучения
Машинное обучение в финансах работает с данными, которые принципиально отличаются от изображений, текстов или табличных данных из других отраслей. Финансовые временные ряды нестационарны, зашумлены и подвержены частым структурным изменениям. Эти особенности требуют специфических подходов к моделированию, валидации и оценке качества. Сегодня стало модно подавать любые данные в трансформеры, большие языковые модели. Однако этот подход, как…
-
Прогнозирование вероятности дефолта через логистическую регрессию
Прогнозирование вероятности дефолта — одна из ключевых задач в управлении кредитными рисками, которая помогает банкам, инвестиционным компаниям и бизнесу принимать более взвешенные решения. Существует множество инструментов для таких прогнозов, хотя логистическая регрессия — пожалуй, наиболее популярный. Она позволяет на основе набора факторов (например, дохода клиента, кредитной истории, уровня долговой нагрузки) оценить вероятность того, что заемщик…
-
Библиотека ETNA в Python для прогнозирования временных рядов
Мне довелось работать с множеством инструментов для анализа временных рядов, и постоянно приходилось комбинировать различные библиотеки, чтобы получить полный цикл работы с временными рядами — от предобработки до бэктестинга, от подбора гиперпараметров до подготовки к деплою. Библиотека ETNA (Easy Time-series Analysis) от команды T-Bank AI Center решает эту проблему элегантно, предоставляя единый интерфейс для всех…
-
Настройки градиентного бустинга. Гиперпараметры бустинговых ML-моделей
Градиентный бустинг занимает особое место в арсенале финансовых аналитиков. В отличие от примитивных методов вроде линейной регрессии или банальных индикаторов технического анализа, бустинговые алгоритмы способны улавливать сложные нелинейные зависимости в данных, что особенно важно при работе с финансовыми временными рядами. Однако их эффективность напрямую зависит от корректной настройки множества гиперпараметров, каждый из которых влияет на…
-
Техники энкодинга (encoding) категориальных атрибутов
Категориальные атрибуты представляют собой дискретные значения, которые не имеют естественного числового порядка или измеримого расстояния между категориями. В финансовой аналитике такими переменными могут быть секторы экономики, рейтинги кредитоспособности, типы финансовых инструментов или временные метки торговых сессий. Ключевая проблема заключается в том, что алгоритмы машинного обучения работают исключительно с числовыми данными, требуя преобразования категориальных признаков в…
-
Метрики качества ML-моделей: Accuracy, Precision, Recall, F1 Score, ROC-AUC
Когда мы создаем или обучаем модель машинного обучения, один из первых вопросов, который возникает: насколько хорошо она работает? Ответить на него не так просто, ведь разные задачи требуют разных критериев оценки, и не существует универсальной метрики для всех случаев. Поэтому в практике Data Science применяют целый набор показателей, позволяющих рассмотреть модель с разных сторон и…
-
Доверительная вероятность и уровень значимости в финансовом Data Science
В мире Data Science принятие решений на основе данных требует не только вычислений, но и грамотной интерпретации статистических результатов. Одними из ключевых понятий при проверке гипотез являются доверительная вероятность (confidence level) и уровень значимости (significance level). Эти параметры помогают нам определить, насколько можно доверять полученным выводам и где пролегает граница между случайным совпадением и статистически…
-
Ad hoc задачи в финансовой аналитике
Ad hoc задачи — это нестандартные, часто разовые аналитические исследования, выполняемые для решения конкретной проблемы или ответа на специфический вопрос. В отличие от регулярных отчетов и стандартизированных аналитических процедур, они требуют индивидуального подхода, творческого мышления и глубокого понимания предметной области. Ad hoc можно перевести с латинского как «для этого», «для данного случая». То есть это…
-
Информационные критерии: AIC (Akaike Information Criterion) и BIC (Bayesian Information Criterion)
Информационные критерии Акаике и BIC часто используют для выбора оптимальной модели машинного обучения. Они помогают сбалансировать точность аппроксимации и сложность модели, предотвращая переобучение и избыточную параметризацию. В отличие от чисто статистических метрик, AIC и BIC учитывают не только качество подгонки модели к данным, но и число используемых параметров, что делает их особенно полезными при сравнении…
-
Библиотека sktime для анализа временных рядов
Библиотека для Python sktime предлагает унифицированный интерфейс для различных задач обработки временных рядов, включая классификацию, регрессию, кластеризацию, прогнозирование и многое другое. Что делает ее по-настоящему уникальной — это интеграция с экосистемой scikit-learn, что позволяет использовать привычные паттерны и методологии в контексте временных рядов. В этой статье я подробно разберу возможности sktime, продемонстрирую практические примеры использования…