В прошлом году мы начали публиковать данные в каталоге «Если быть точным» в формате Parquet. Его придумали инженеры Twitter и Cloudera в 2013 году, и сегодня он стал стандартом хранения аналитических данных — его используют Google, Amazon, Netflix и большинство современных data-платформ. В этом гайде мы расскажем, как эффективно работать с данными в формате Parquet с помощью Python.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Выделение одного значащего признака из набора данных с помощью машинного обучения. Используется Apache Spark | 0 | 6.55 | 19-05-2026 |
| 2 | Как искать проблемы производительности в Python | -1 | 8.19 | 28-07-2026 |
| 3 | Cloud.ru добавил новые сервисы для работы с данными в Evolution Data Platform | 0 | 5 | 06-07-2026 |
| 4 | Как я устал писать парсер под каждый прайс и сделал из этого библиотеку | 0 | 8.8 | 02-07-2026 |
| 5 | Apache Superset — боремся с фильтрами по дате. Часть 2 | 0 | 10.39 | 02-04-2026 |
| 6 | Comparing Portable DataFrame Tools in Python | 0 | 7.2 | 03-04-2026 |
| 7 | Институт энергетических технологий внедрит облачную платформу Cloudera | 0 | 0 | 13-05-2020 |
| 8 | Единый стандарт для гибридных ландшафтов: Deckhouse Kubernetes Platform стала основой нового сервиса в облаке RCloud by 3data | 0 | 11.07 | 28-07-2026 |
| 9 | Единый стандарт для гибридных ландшафтов: Deckhouse Kubernetes Platform стала основой нового сервиса в облаке RCloud by 3data | 0 | 11.07 | 28-07-2026 |