<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>sklearn &#8212; &gt; Machine Learning Guru|</title>
	<atom:link href="https://mlgu.ru/tag/sklearn/feed/" rel="self" type="application/rss+xml" />
	<link>https://mlgu.ru</link>
	<description></description>
	<lastBuildDate>Sat, 29 Nov 2025 13:19:18 +0000</lastBuildDate>
	<language>ru-RU</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=6.9.4</generator>

<image>
	<url>https://mlgu.ru/wp-content/uploads/2025/06/mlguru-icon-150x150.png</url>
	<title>sklearn &#8212; &gt; Machine Learning Guru|</title>
	<link>https://mlgu.ru</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Масштабирование признаков в ML: StandardScaler, MinMaxScaler, RobustScaler и другие методы</title>
		<link>https://mlgu.ru/6713/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 29 Nov 2025 12:53:59 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[аномалии]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6713</guid>

					<description><![CDATA[Масштабирование признаков — базовая процедура предобработки данных, влияющая на скорость обучения и качество предсказаний большинства алгоритмов машинного обучения. Признаки в датасете часто имеют разные единицы измерения и диапазоны значений: цена акции может варьироваться от $10 до $500, объем торгов — от сотен тысяч до миллиардов, а волатильность измеряется в процентах от 5% до 80%. Без [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Градиентный бустинг: концепция и механизм работы</title>
		<link>https://mlgu.ru/6683/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 29 Nov 2025 09:15:13 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[catboost]]></category>
		<category><![CDATA[gbm]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[xgboost]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<category><![CDATA[прогнозирование]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6683</guid>

					<description><![CDATA[Градиентный бустинг относится к семейству ансамблевых методов машинного обучения, где финальное предсказание формируется как взвешенная сумма предсказаний множества слабых моделей. Ключевое отличие от других ансамблевых подходов — последовательное обучение, при котором каждая новая модель корректирует ошибки предыдущих. Алгоритм строит композицию из простых моделей (чаще всего деревьев решений малой глубины), добавляя их итеративно и минимизируя функцию [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Случайный лес (Random Forest): механика алгоритма, Бутстрэп-агрегирование, out-of-bag оценка</title>
		<link>https://mlgu.ru/6622/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Wed, 26 Nov 2025 19:41:47 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[bootstraping]]></category>
		<category><![CDATA[random forest]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6622</guid>

					<description><![CDATA[Random Forest или Случайный лес — это ансамблевый алгоритм машинного обучения, объединяющий множество деревьев решений для повышения точности и устойчивости предсказаний. Алгоритм был предложен Лео Брейманом в 2001 году и с тех пор стал одним из наиболее используемых методов в задачах классификации и регрессии. Основное преимущество Random Forest — способность снижать дисперсию модели без существенного [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Метод нелинейного снижения размерности t-SNE</title>
		<link>https://mlgu.ru/6555/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 22 Nov 2025 18:55:24 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[pca]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[кластеризация]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6555</guid>

					<description><![CDATA[Высокая размерность данных создает фундаментальную проблему &#8212; датасеты с сотнями и тысячами признаков плохо обучаются в моделях машинного обучения, плюс их невозможно визуализировать, что затрудняет понимание структуры данных, выявление паттернов и валидацию гипотез. Методы снижения размерности решают эту задачу, проецируя многомерные данные в пространство низкой размерности с сохранением важных характеристик исходного распределения. Однако не все [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Детекция аномалий через Isolation Forest</title>
		<link>https://mlgu.ru/6491/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Fri, 21 Nov 2025 21:25:05 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[isolation forest]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[аномалии]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6491</guid>

					<description><![CDATA[Аномалии в данных бывают разными. Большинство — это шум, ошибки сбора, сбитые логи или просто разовые всплески, которые искажают распределения и ухудшают работу моделей. Но среди них могут встречаться действительно важные точки — те, что указывают на сбои в системах, подозрительные действия пользователей или нетипичную динамику бизнес-показателей. В большинстве примеров из учебных пособий аномалии легко [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Деревья решений: алгоритм CART, критерии разбиения и практическое применение</title>
		<link>https://mlgu.ru/6147/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Mon, 10 Nov 2025 22:30:40 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[decision trees]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[машинное обучение]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=6147</guid>

					<description><![CDATA[Деревья решений относятся к фундаментальным алгоритмам машинного обучения, которые находят применение в задачах классификации и регрессии. Их ключевое преимущество — интерпретируемость: модель представляет собой последовательность логических правил, понятных даже неспециалисту. По своей структуре дерево решений имитирует процесс принятия решений человеком, последовательно разбивая данные на все более однородные группы на основе наиболее значимых признаков. Процесс построения [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Жадные алгоритмы: базовые принципы и их применение в количественном анализе</title>
		<link>https://mlgu.ru/5649/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sat, 25 Oct 2025 10:07:11 +0000</pubDate>
				<category><![CDATA[Анализ данных]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[квантитативный анализ]]></category>
		<category><![CDATA[корреляции]]></category>
		<category><![CDATA[оптимизация портфеля]]></category>
		<category><![CDATA[хеджирование]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5649</guid>

					<description><![CDATA[Жадные алгоритмы представляют класс методов оптимизации, которые принимают локально оптимальные решения на каждом шаге без пересмотра предыдущих выборов. В количественном анализе такой подход находит применение в задачах отбора активов, оптимизации исполнения ордеров и построения предиктивных моделей. Эффективность жадных алгоритмов обусловлена низкой вычислительной сложностью — большинство реализаций работают за O(n log n) или O(n²), что позволяет [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Обучение baseline моделей для временных рядов: инжиниринг признаков, регуляризация, оценка качества</title>
		<link>https://mlgu.ru/5446/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Tue, 21 Oct 2025 09:30:17 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[catboost]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[lightgbm]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[временные ряды]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<category><![CDATA[прогнозирование]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5446</guid>

					<description><![CDATA[Бейзлайн (baseline) — это простая стартовая модель, определяющая минимально приемлемый уровень качества следующих ML-моделей. Если другие модели с более сложной архитектурой выдают метрики хуже бейзлайна, значит, их применение неоправданно. Нередко так бывает, что линейная регрессия с правильными признаками превосходит нейросеть со слабой подготовкой данных. А градиентный бустинг с грамотной регуляризацией обходит LSTM на горизонте прогноза [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Важность признаков полученных из ML-моделей (Feature Importance)</title>
		<link>https://mlgu.ru/5322/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Tue, 14 Oct 2025 09:40:11 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[feature engineering]]></category>
		<category><![CDATA[lightgbm]]></category>
		<category><![CDATA[random forest]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[xgboost]]></category>
		<category><![CDATA[методы оценки]]></category>
		<category><![CDATA[обучение моделей]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=5322</guid>

					<description><![CDATA[Важность признаков (Feature Importance) &#8212; инструмент для понимания того, какие переменные вносят наибольший вклад в предсказания модели. Методы оценки важности признаков решают несколько практических задач: отбор релевантных предикторов, детекцию утечек данных, снижение размерности для ускорения инференса. Выбор метода зависит от типа модели, структуры данных и требований к интерпретируемости. Разные подходы к оценке важности дают разные [&#8230;]]]></description>
		
		
		
			</item>
		<item>
		<title>Прогнозирование вероятности дефолта через логистическую регрессию</title>
		<link>https://mlgu.ru/4829/</link>
		
		<dc:creator><![CDATA[dkrylov]]></dc:creator>
		<pubDate>Sun, 28 Sep 2025 20:50:26 +0000</pubDate>
				<category><![CDATA[Классический ML]]></category>
		<category><![CDATA[bootstraping]]></category>
		<category><![CDATA[sklearn]]></category>
		<category><![CDATA[кросс-валидация]]></category>
		<category><![CDATA[моделирование риска]]></category>
		<category><![CDATA[предиктивная аналитика]]></category>
		<category><![CDATA[прогнозирование]]></category>
		<guid isPermaLink="false">https://mlgu.ru/?p=4829</guid>

					<description><![CDATA[Прогнозирование вероятности дефолта — одна из ключевых задач в управлении кредитными рисками, которая помогает банкам, инвестиционным компаниям и бизнесу принимать более взвешенные решения. Существует множество инструментов для таких прогнозов, хотя логистическая регрессия &#8212; пожалуй, наиболее популярный. Она позволяет на основе набора факторов (например, дохода клиента, кредитной истории, уровня долговой нагрузки) оценить вероятность того, что заемщик [&#8230;]]]></description>
		
		
		
			</item>
	</channel>
</rss>
