Бывали у вас датасеты, где класс «1» встречается в 100 раз реже класса «0»? У меня — постоянно. Модель радуется высокой точности, а на деле совершенно промахивается по редкому классу. Давайте обсудим, почему старый добрый SMOTE уже не торт, и что помогает в таких случаях.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Ваша модель показывает 95% accuracy и при этом бесполезна: метрики для несбалансированных классов | 0 | 9.19 | 24-05-2026 |
| 2 | balance: Deal With Biased Data Samples | 0 | 10 | 27-07-2026 |
| 3 | Компрессор для данных или как я написал свой первый custom transformer | 0 | 10.9 | 27-01-2026 |
| 4 | Почему «чем проще, тем лучше» не работает на ИИ-классификаторе | 0 | 13.64 | 19-07-2026 |
| 5 | Откуда в обучении берётся nan: численная нестабильность в ML и почему всё считают в логарифмах | 0 | 6.4 | 11-06-2026 |
| 6 | Аугментации изображений: как улучшить качество моделей без новых данных | -1 | 7.58 | 15-03-2026 |
| 7 | Apache Superset — боремся с фильтрами по дате. Часть 2 | 0 | 10.39 | 02-04-2026 |
| 8 | Pipeline в машинном обучении: как создавать сложные модели без боли и утечек данных | 0 | 7.77 | 07-06-2026 |
| 9 | Credit Scoring: Одинокое дерево, целый лес и разочарование в нейросетях | 0 | 8.69 | 28-07-2026 |
| 10 | Аугментация ограничивающих боксов в детекции: форматы, `BboxParams` и типичные ошибки | -1 | 6.34 | 11-04-2026 |