-
Техники энкодинга (encoding) категориальных атрибутов
Категориальные атрибуты представляют собой дискретные значения, которые не имеют естественного числового порядка или измеримого расстояния между категориями. В финансовой аналитике такими переменными могут быть секторы экономики, рейтинги кредитоспособности, типы финансовых инструментов или временные метки торговых сессий. Ключевая проблема заключается в том, что алгоритмы машинного обучения работают исключительно с числовыми данными, требуя преобразования категориальных признаков в…
-
Метрики качества ML-моделей: Accuracy, Precision, Recall, F1 Score, ROC-AUC
Когда мы создаем или обучаем модель машинного обучения, один из первых вопросов, который возникает: насколько хорошо она работает? Ответить на него не так просто, ведь разные задачи требуют разных критериев оценки, и не существует универсальной метрики для всех случаев. Поэтому в практике Data Science применяют целый набор показателей, позволяющих рассмотреть модель с разных сторон и…
-
Доверительная вероятность и уровень значимости в финансовом Data Science
В мире Data Science принятие решений на основе данных требует не только вычислений, но и грамотной интерпретации статистических результатов. Одними из ключевых понятий при проверке гипотез являются доверительная вероятность (confidence level) и уровень значимости (significance level). Эти параметры помогают нам определить, насколько можно доверять полученным выводам и где пролегает граница между случайным совпадением и статистически…
-
Ad hoc задачи в финансовой аналитике
Ad hoc задачи — это нестандартные, часто разовые аналитические исследования, выполняемые для решения конкретной проблемы или ответа на специфический вопрос. В отличие от регулярных отчетов и стандартизированных аналитических процедур, они требуют индивидуального подхода, творческого мышления и глубокого понимания предметной области. Ad hoc можно перевести с латинского как «для этого», «для данного случая». То есть это…
-
Информационные критерии: AIC (Akaike Information Criterion) и BIC (Bayesian Information Criterion)
Информационные критерии Акаике и BIC часто используют для выбора оптимальной модели машинного обучения. Они помогают сбалансировать точность аппроксимации и сложность модели, предотвращая переобучение и избыточную параметризацию. В отличие от чисто статистических метрик, AIC и BIC учитывают не только качество подгонки модели к данным, но и число используемых параметров, что делает их особенно полезными при сравнении…
-
Библиотека sktime для анализа временных рядов
Библиотека для Python sktime предлагает унифицированный интерфейс для различных задач обработки временных рядов, включая классификацию, регрессию, кластеризацию, прогнозирование и многое другое. Что делает ее по-настоящему уникальной — это интеграция с экосистемой scikit-learn, что позволяет использовать привычные паттерны и методологии в контексте временных рядов. В этой статье я подробно разберу возможности sktime, продемонстрирую практические примеры использования…
-
Марковские цепи Монте-Карло (Markov Chain Monte-Carlo, MCMC)
MCMC представляет собой семейство алгоритмов, которые позволяют генерировать выборки из сложных вероятностных распределений, которые не имеют аналитического решения, либо оно сложно реализуемо. В основе этих методов лежит элегантное сочетание теории Марковских цепей и принципов Монте-Карло, что позволяет исследовать высокоразмерные пространства параметров с удивительной эффективностью. В этой статье мы погрузимся в мир методов MCMC, теорию и…
-
Методы разделения деревьев решений: Gini, Энтропия, Gain Ratio, Хи-квадрат, Variance Reduction, Classification Error
Деревья решений остаются одним из самых интуитивно понятных и мощных инструментов в арсенале специалиста по данным. Выбор критерия разделения деревьев без преувеличения влияет на все: от скорости обучения до интерпретируемости результатов. В процессе работы с финансовыми данными я обнаружил, что разные критерии могут давать совершенно разные результаты даже на одних и тех же данных. Некоторые…
-
Методы аппроксимации временных рядов
Методы аппроксимации призваны уловить закономерности за хаосом движений, а также представить сложные данные в виде простой модели, сохраняя при этом их суть. Между тем, качественная аппроксимация — это не просто подбор кривой, которая «красиво ложится» на исторические данные. Это искусство извлечения сигнала из шума, способность выделить структурные паттерны, которые сохранят свою предсказательную силу в будущем.…
-
Метод главных компонент (PCA) и факторный анализ (FA) данных
В современном мире анализа данных мы постоянно сталкиваемся с проблемой «проклятия размерности» — ситуацией, когда количество признаков в датасете становится настолько большим, что традиционные методы анализа начинают давать сбои. Метод главных компонент (Principal Component Analysis, PCA) и факторный анализ (Factor Analysis, FA) представляют собой два фундаментальных подхода к решению этой проблемы, каждый из которых имеет…