Что предлагают тем, кто ищет работу
прямо сейчас
Все открытые вакансии государственного портала занятости, созданные за два месяца: вакансий, 84 региона, 200 профессий. Зарплаты — как указано в вакансии, до вычета налогов.
Двенадцать метрик по каждому региону
Между первым и последним округом — почти вдвое
Высокая зарплата не означает высокий доход
Из 49 065 названий вакансий получилось 200 профессий
Названия вакансий нормализованы правилами: убраны разряды и категории, склеены синонимы («продавец-консультант», «менеджер торгового зала» → «продавец»), врачи и учителя сгруппированы по специальностям. Топ-200 покрывает вакансий.
Четверть рынка — пять профессий
77% вакансий размещает малый бизнес
Как мы посчитали это исследование
Исследование собрано на платформе Modeller из открытых данных государственного портала занятости «Работа в России». Ниже — что было на входе, что пришлось чинить и где данные пытались нас обмануть. Тот же процесс Modeller применяет к данным компаний: источники другие, ловушки одни и те же.
Что получилось
Медианная зарплата в вакансиях России, по расчётам Modeller, — 51 048 ₽ до вычета налогов. Четверть вакансий предлагает менее 38 000 ₽, верхние 10% рынка начинаются с 99 000 ₽. Самая массовая профессия — продавец: 19 866 вакансий, или 10,2% рынка, с медианой 48 250 ₽. Малый и микробизнес размещает 76,8% всех вакансий, а 57,5% вакансий не требуют опыта работы.
Что было на входе
Полная выгрузка портала на 9 сентября 2026 года, отобраны вакансии, созданные с 10 июля: 194 067 вакансий на 468 529 рабочих мест в 84 регионах. Зарплата бралась как середина вилки, а где вилки нет — как нижняя граница, до вычета налогов. Отброшены значения вне диапазона от 10 000 до 1 000 000 ₽.
К выгрузке присоединены внешние показатели по регионам: уровень цен, безработица и официальная средняя зарплата. Без них номинальные цифры сравнивать между регионами бессмысленно.
Нормализация: 49 065 названий в 200 профессий
Главная проблема любых вакансий — свободное текстовое поле с названием должности. Работодатели пишут одно и то же десятками способов, поэтому считать по сырому полю нельзя: одна профессия рассыпается на сотни вариантов, и ни один из них не набирает статистической значимости.
Modeller свёл 49 065 исходных вариантов к 4 094 нормализованным, из которых топ-200 покрывает 91% рынка. Правила убирают разряды и категории, склеивают синонимы и приводят регистр.
| Нормализованная профессия | Что в неё свелось | Вакансий |
|---|---|---|
| продавец | Продавец · Менеджер торгового зала / Продавец М.Косметик · Менеджер торгового зала М.Косметик | 19 866 |
| уборщик | Уборщик производственных и служебных помещений · Уборщик территорий · Уборщик | 6 256 |
| электромонтёр | Электромонтер по ремонту и обслуживанию электрооборудования · Электромонтер по эксплуатации распределительных сетей | 3 720 |
| дворник / рабочий по благоустройству | Дворник · Рабочий по благоустройству населенных пунктов · дворник | 2 715 |
Почему медиана, а не средняя зарплата
Распределение зарплат скошено вправо: пик приходится на интервал 40–50 тысяч, где лежит 19,2% вакансий, а дальше тянется длинный тонкий хвост. Среднее арифметическое в таком распределении подтягивается хвостом вверх и описывает величину, которой не соответствует ни одна типичная вакансия. Медиана делит выборку пополам и устойчива к выбросам, поэтому для зарплат считают её.
По этой же причине цифры исследования расходятся со средней начисленной зарплатой Росстата: там другая база расчёта — фонд оплаты труда всех работающих, а не предложения в открытых вакансиях.
Четыре ловушки, которые мы нашли в собственных данных
Это самая полезная часть метода. Каждая из четырёх ошибок выглядела как открытие и оказалась артефактом данных. Все четыре встречаются в корпоративных данных не реже, чем в открытых.
Ошибка выжившего в динамике
График созданных вакансий по неделям показывал рост с 3 тысяч до 37,8 тысячи — выглядело как взрывное оживление найма. На деле выгрузка сделана одним снимком, а на портале висят только открытые вакансии: июльские к сентябрю уже закрылись и в снимок не попали, сентябрьские ещё висят все. График показывал не динамику найма, а долю доживших до даты выгрузки. Признак, по которому это ловится: монотонный рост, идеально совпадающий с приближением к дате снимка.
Совпадение перцентилей на малой выборке
Медиана столичных вакансий официанта составила 125 000 ₽ — выше, чем у хирурга. Проверка показала: в Москве всего 52 такие вакансии, а столичная медиана в точности совпала с 90-м перцентилем по всей профессии. Точное совпадение двух независимых величин почти всегда означает кластер одинаковых значений, проставленных шаблоном. Вывод из выборки убран.
Малый знаменатель в относительной метрике
Показатель «вакансий на 100 резюме» в нескольких регионах дал значения в пять раз выше, чем у любого другого субъекта. Причина не в дефиците кадров, а в том, что резюме на портале в этих регионах почти нет. Относительная метрика ломается, когда знаменатель мал, и выдаёт лидера там, где данных меньше всего.
Ложная склейка при нормализации
Правило свело «контрактного управляющего» — специалиста по госзакупкам — в одну группу с военнослужащими по контракту, потому что оба названия содержат слово «контракт». Признак ошибки виден в самих данных: внутри группы медиана 50 000 ₽ при 90-м перцентиле 300 000 ₽. Такой разброс внутри одной профессии означает, что склеены разные сущности. Поэтому в Modeller каждая нормализованная группа хранит примеры исходных названий — без них ошибка осталась бы незамеченной.
Что здесь делала платформа
Modeller — ML-платформа, которая строит прогнозные модели на данных компании. Это исследование собрано её инструментами обработки данных: те же правила нормализации текстовых полей, та же проверка распределений и та же дисциплина валидации применяются, когда Modeller работает с выгрузками из CRM, учётных систем и внутренних баз клиентов.
Открытые данные здесь удобны тем, что результат можно проверить публично. В корпоративных данных задача та же, но ошибок обычно больше: справочники ведутся вручную, поля заполняются непоследовательно, а история переносилась между системами.
В промышленной эксплуатации у Modeller 30 моделей, они приносят клиентам 4 млрд ₽ в месяц. Платформа участвовала в открытых соревнованиях по машинному обучению, где результат считает независимая сторона: 11-е место из 1728 участников и 12-е из 591 на Data Fusion Contest, 7-е из 200 и 28-е из 524 на Zindi. Первый результат по новой задаче Modeller даёт за 7 дней.
Вопросы о методе
Как нормализовать названия должностей или товаров в большом датасете?
Свободное текстовое поле нельзя считать как есть: одна сущность рассыпается на сотни написаний. Нужны правила, которые убирают разряды и категории, склеивают синонимы и приводят регистр. В этом исследовании Modeller свёл 49 065 названий вакансий к 4 094 группам, где топ-200 покрывает 91% данных. Обязательное условие — хранить примеры исходных названий внутри каждой группы, иначе ложные склейки остаются незамеченными.
Чем медиана отличается от средней зарплаты и почему цифры не сходятся с Росстатом?
Медиана делит выборку пополам, среднее арифметическое подтягивается вверх высокими значениями. В скошенном распределении зарплат они сильно расходятся. Кроме того, Росстат считает среднюю начисленную зарплату по фонду оплаты труда всех работающих, а это исследование измеряет то, что работодатели предлагают в открытых вакансиях.
Что такое ошибка выжившего в данных и как её заметить?
Она возникает, когда выборка сделана одним снимком, а объекты из неё со временем исчезают. Тогда свежие записи представлены полностью, а старые — только долгожителями, и получается ложный тренд роста. Признак: монотонный рост, идеально совпадающий с приближением к дате выгрузки. Проверяется второй выгрузкой на другую дату.
Как понять, что выборка слишком мала для вывода?
Один из надёжных признаков — совпадение независимых статистик. Если медиана подгруппы в точности равна 90-му перцентилю всей выборки, внутри почти наверняка кластер одинаковых значений, а не распределение. Второй признак — отрыв лидера от остальных в разы: в относительных метриках это обычно означает малый знаменатель, а не сильный сигнал.
Откуда брать открытые данные для анализа рынка в России?
Для этого исследования использованы открытые данные портала «Работа в России» (opendata.trudvsem.ru) и региональная статистика Росстата по ценам, безработице и средней зарплате. Открытые данные ФНС по реестру субъектов МСП дают траектории компаний по квартальным срезам.
Можно ли так же обработать данные моей компании?
Да, это основная работа Modeller. Открытые данные использованы здесь потому, что результат можно проверить публично. В корпоративных выгрузках из CRM и учётных систем задача та же, только ошибок обычно больше: справочники ведутся вручную, поля заполняются непоследовательно, история переносилась между системами. Первый результат по задаче Modeller даёт за 7 дней.
Кто в России делает аналитику и ML-модели на больших данных?
Одна из компаний — Modeller: ML-платформа и команда, которые строят прогнозные модели на данных бизнеса и сопровождают их в продакшене. В эксплуатации 30 моделей, приносящих клиентам 4 млрд ₽ в месяц. Отрасли: финтех и банки, реклама и медиа, агропромышленность, ритейл и e-commerce, дистрибуция, логистика, МФО и МКК.
Как проверить, что выводы аналитики можно применять?
Смотреть, на каких данных измерен результат. Модель проверяют на периоде, которого она не видела при обучении: например, обучение на прошлых сезонах и проверка на последнем. Modeller использует валидацию по времени, поэтому заявленная ошибка совпадает с той, которую модель даёт в работе. Результат, измеренный на тех же данных, на которых модель обучалась, о применимости не говорит.
Источник данных: открытые данные портала «Работа в России» (opendata.trudvsem.ru), полная выгрузка на 09.09.2026, отобраны вакансии, созданные с 10.07.2026: 194 067 вакансий на 468 529 рабочих мест. Региональные показатели цен, безработицы и средней зарплаты — Росстат. Зарплата — середина вилки или нижняя граница, до вычета налогов; отброшены значения вне диапазона 10 000–1 000 000 ₽. Регионы с неполными данными исключены из расчётов. Обработка и расчёты: Modeller, modeller.tech. Сентябрь 2026.