<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>feature engineering &#8212; &gt; Machine Learning Guru|</title>
	<atom:link href="https://mlgu.ru/tag/feature-engineering/feed/" rel="self" type="application/rss+xml" />
	<link>https://mlgu.ru</link>
	<description></description>
	<lastBuildDate>Thu, 25 Dec 2025 14:09:14 +0000</lastBuildDate>
	<language>ru-RU</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=6.9.4</generator>

<image>
	<url>https://mlgu.ru/wp-content/uploads/2025/06/mlguru-icon-150x150.png</url>
	<title>feature engineering &#8212; &gt; Machine Learning Guru|</title>
	<link>https://mlgu.ru</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Скользящие оконные функции в Pandas</title>
		<link>https://mlgu.ru/6872/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Thu, 25 Dec 2025 11:42:20 +0000</pubDate>
				<category><![CDATA[Анализ данных]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[matplotlib]]></category>
		<category><![CDATA[pandas]]></category>
		<category><![CDATA[временные ряды]]></category>
		<category><![CDATA[торговые стратегии]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6872</guid>

					<description><![CDATA[Скользящие оконные функции решают фундаментальную задачу анализа временных рядов: извлечение локальных паттернов из последовательных данных. Метод основан на применении агрегирующих операций к подмножествам наблюдений фиксированного размера, которые последовательно сдвигаются вдоль временной оси. Библиотека Pandas предоставляет три типа окон для работы с временными рядами: rolling &#8212; фиксированный размер; expanding &#8212; растущее от начала; exponentially weighted &#8212; [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Масштабирование признаков в ML: StandardScaler, MinMaxScaler, RobustScaler и другие методы</title>
		<link>https://mlgu.ru/6713/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 29 Nov 2025 12:53:59 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[аномалии]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6713</guid>

					<description><![CDATA[Масштабирование признаков — базовая процедура предобработки данных, влияющая на скорость обучения и качество предсказаний большинства алгоритмов машинного обучения. Признаки в датасете часто имеют разные единицы измерения и диапазоны значений: цена акции может варьироваться от $10 до $500, объем торгов — от сотен тысяч до миллиардов, а волатильность измеряется в процентах от 5% до 80%. Без [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Метод нелинейного снижения размерности t-SNE</title>
		<link>https://mlgu.ru/6555/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 22 Nov 2025 18:55:24 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[pca]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[кластеризация]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6555</guid>

					<description><![CDATA[Высокая размерность данных создает фундаментальную проблему &#8212; датасеты с сотнями и тысячами признаков плохо обучаются в моделях машинного обучения, плюс их невозможно визуализировать, что затрудняет понимание структуры данных, выявление паттернов и валидацию гипотез. Методы снижения размерности решают эту задачу, проецируя многомерные данные в пространство низкой размерности с сохранением важных характеристик исходного распределения. Однако не все [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Регуляризация: L1 (Lasso) vs L2 (Ridge). Борьба с переобучением, отбор признаков</title>
		<link>https://mlgu.ru/6120/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sun, 09 Nov 2025 09:07:58 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[корреляции]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6120</guid>

					<description><![CDATA[Переобучение остается одной из центральных проблем в машинном обучении. Модель запоминает шум в обучающей выборке вместо выявления истинных закономерностей, что приводит к деградации качества на новых данных. Регуляризация решает эту проблему через добавление штрафа на сложность модели в целевую функцию. Два основных подхода — L1 (Lasso) и L2 (Ridge) — различаются не только математически, но [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Жадные алгоритмы: базовые принципы и их применение в количественном анализе</title>
		<link>https://mlgu.ru/5649/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 25 Oct 2025 10:07:11 +0000</pubDate>
				<category><![CDATA[Анализ данных]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[квантитативный анализ]]></category>
		<category><![CDATA[корреляции]]></category>
		<category><![CDATA[оптимизация портфеля]]></category>
		<category><![CDATA[хеджирование]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5649</guid>

					<description><![CDATA[Жадные алгоритмы представляют класс методов оптимизации, которые принимают локально оптимальные решения на каждом шаге без пересмотра предыдущих выборов. В количественном анализе такой подход находит применение в задачах отбора активов, оптимизации исполнения ордеров и построения предиктивных моделей. Эффективность жадных алгоритмов обусловлена низкой вычислительной сложностью — большинство реализаций работают за O(n log n) или O(n²), что позволяет [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Feature Store: централизованное хранилище признаков для ML</title>
		<link>https://mlgu.ru/5509/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Wed, 22 Oct 2025 23:19:09 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[mlops]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5509</guid>

					<description><![CDATA[ML-проекты часто сталкиваются с проблемой разрозненного управления признаками. Дата-сайентисты создают признаки в Jupyter-ноутбуках, ML-инженеры переписывают их для продакшена, а через несколько месяцев уже никто не помнит, какие именно трансформации применялись к обучающим данным. Результат — несоответствие между обучением и инференсом, дублирование работы и сложности с воспроизводимостью экспериментов. Хранилище признаков (Feature Store) решает эти проблемы через [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Обучение baseline моделей для временных рядов: инжиниринг признаков, регуляризация, оценка качества</title>
		<link>https://mlgu.ru/5446/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Tue, 21 Oct 2025 09:30:17 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[catboost]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[lightgbm]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[временные ряды]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<category><![CDATA[прогнозирование]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5446</guid>

					<description><![CDATA[Бейзлайн (baseline) — это простая стартовая модель, определяющая минимально приемлемый уровень качества следующих ML-моделей. Если другие модели с более сложной архитектурой выдают метрики хуже бейзлайна, значит, их применение неоправданно. Нередко так бывает, что линейная регрессия с правильными признаками превосходит нейросеть со слабой подготовкой данных. А градиентный бустинг с грамотной регуляризацией обходит LSTM на горизонте прогноза [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Важность признаков полученных из ML-моделей (Feature Importance)</title>
		<link>https://mlgu.ru/5322/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Tue, 14 Oct 2025 09:40:11 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[lightgbm]]></category>
		<category><![CDATA[random forest]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[xgboost]]></category>
		<category><![CDATA[методы оценки]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5322</guid>

					<description><![CDATA[Важность признаков (Feature Importance) &#8212; инструмент для понимания того, какие переменные вносят наибольший вклад в предсказания модели. Методы оценки важности признаков решают несколько практических задач: отбор релевантных предикторов, детекцию утечек данных, снижение размерности для ускорения инференса. Выбор метода зависит от типа модели, структуры данных и требований к интерпретируемости. Разные подходы к оценке важности дают разные [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Чем отличается финансовый ML от других видов машинного обучения</title>
		<link>https://mlgu.ru/5131/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Thu, 09 Oct 2025 15:58:55 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[stacking]]></category>
		<category><![CDATA[кросс-валидация]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<category><![CDATA[прогнозирование]]></category>
		<category><![CDATA[торговые алгоритмы]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5131</guid>

					<description><![CDATA[Машинное обучение в финансах работает с данными, которые принципиально отличаются от изображений, текстов или табличных данных из других отраслей. Финансовые временные ряды нестационарны, зашумлены и подвержены частым структурным изменениям. Эти особенности требуют специфических подходов к моделированию, валидации и оценке качества. Сегодня стало модно подавать любые данные в трансформеры, большие языковые модели. Однако этот подход, как [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Техники энкодинга (encoding) категориальных атрибутов</title>
		<link>https://mlgu.ru/4083/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Wed, 03 Sep 2025 07:50:19 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=4083</guid>

					<description><![CDATA[Категориальные атрибуты представляют собой дискретные значения, которые не имеют естественного числового порядка или измеримого расстояния между категориями. В финансовой аналитике такими переменными могут быть секторы экономики, рейтинги кредитоспособности, типы финансовых инструментов или временные метки торговых сессий. Ключевая проблема заключается в том, что алгоритмы машинного обучения работают исключительно с числовыми данными, требуя преобразования категориальных признаков в [&#8230;]]]></description>
		
		
		
			</item>
	</channel>
</rss>
