Вся карта рынка

Данные и платформы

Данные и разметка

Средний

14 компаний в каталоге

Подниши

сбор и разметка данныхсинтетические данныедата-каталогикачество данных

Разбор рынка

Описание рынка

Рынок данных и разметки - инфраструктурный слой под всем российским ИИ: сбор и аннотирование датасетов для обучения моделей, синтетические данные, дата-каталоги, MDM и инструменты качества данных. Сервисная часть (разметка) представлена краудсорсинговыми платформами (Яндекс Задания, TagMe, ABC Elementary) и подрядчиками полного цикла (Training Data, Data Light, Beorg), продуктовая - вендорами data-платформ и data governance (Arenadata, Юнидата, HFLabs, DIS Group). Зрелость сегментов разная: разметка - низкомаржинальный сервисный бизнес с низкими барьерами входа, а платформенный сегмент активно консолидируется и растёт на волне импортозамещения после ухода Informatica, Collibra и SAS. Спрос подогревается бумом генеративного ИИ: обучение и дообучение LLM требует больших объёмов размеченных и очищенных данных. Специфика РФ - закрытость данных (продаются не сырые данные, а обезличенная аналитика), требования по локализации и хранению, а также крупные внутренние команды разметки у экосистем.

Объём и динамика рынка
  • Отдельных публичных оценок ниши разметки и качества данных нет; родительский рынок больших данных и ИИ в РФ - 433 млрд руб. в 2024 г., прогноз ~520 млрд руб. в 2025 г., рост ~20% в год (исследование АБД, Б1 и TAdviser, Коммерсантъ, 2025)
  • Российский рынок разметки данных в 2022 г. вырос на 70% - последняя доступная публичная оценка динамики ниши (TAdviser, 2023)
  • Выручка Arenadata (data-платформы, дата-каталоги) превысила 6 млрд руб. в 2024 г., +52% г/г; по итогам 2025 г. компания отчиталась о росте выручки ещё на 46% (CNews, 2025; отчётность Arenadata, 2026)
  • Услуги ИИ и Data Science - крупнейший сегмент рынка больших данных: 305 млрд руб. в 2024 г., рост ~36% (исследование АБД/Б1/TAdviser, 2025)
Лидеры рынка
  • Arenadata - публичная компания, флагман импортозамещения data-платформ; Arenadata Catalog формирует рынок data governance
  • HFLabs (DaData) - фактический стандарт качества и стандартизации клиентских данных в банках и телекоме
  • Яндекс Задания - крупнейшая краудсорсинговая платформа разметки в РФ после ухода Толоки с внутреннего рынка
  • Training Data и Data Light - заметные подрядчики полного цикла сбора и разметки датасетов для ML-команд
  • Beorg (Биорг) - лидер в оцифровке и разметке документов с гибридной моделью «ИИ + краудсорсинг»
  • Юнидата (Unidata) - один из основных российских MDM/data governance вендоров в госсекторе и крупном бизнесе
Драйверы роста
  • Бум генеративного ИИ: обучение и дообучение LLM требует масштабной разметки (RLHF, инструктивные датасеты) и очистки данных
  • Импортозамещение data-платформ после ухода Informatica, SAS, Collibra, Talend - окно для российских вендоров
  • Регуляторное давление по качеству данных (152-ФЗ, оборотные штрафы за утечки, требования ЦБ) заставляет строить data governance
  • Национальный проект «Экономика данных» и госзаказ на дата-инфраструктуру
  • Рост числа корпоративных ИИ-проектов: 43% организаций применяли ИИ в 2024 г. против 20% в 2021 г. - каждому нужны данные
  • Дефицит открытых русскоязычных датасетов стимулирует спрос на заказной сбор и синтетические данные
Барьеры и риски
  • Низкие барьеры входа в разметку → жёсткий демпинг мелких подрядчиков и фриланс-бирж, маржа сервисного бизнеса тает
  • Автоматизация разметки самим ИИ (auto-labeling, синтетика) съедает ядро сервисного спроса - ниша ручной разметки может схлопнуться
  • Экосистемы (Сбер, Яндекс, VK) держат внутренние команды и краудсорсинговые платформы и не отдают объёмы на рынок
  • Закрытость российских данных: компании боятся передавать данные подрядчикам из-за утечек и штрафов, сделки срываются на ИБ-аудите
  • В платформенном сегменте высокая зависимость от крупных госзаказчиков и длинных циклов внедрения; замедление ИТ-бюджетов в 2025 г. ударило по вендорам
  • Кадровый голод в data-инженерии при том, что сама разметка - низкооплачиваемый труд с высокой текучкой
Бизнес-модели и монетизация
  • Сервисная модель: оплата за единицу разметки (объект, час асессора) или проектные контракты на сбор датасетов
  • Краудсорсинговые платформы: комиссия с заданий + SaaS-доступ к инструментам разметки (TagMe, ABC Elementary)
  • Лицензии on-premise + техподдержка для data-платформ и MDM (Arenadata, Юнидата, DIS Group) - основная модель в госсекторе и банках
  • SaaS/API по подписке и pay-per-use для сервисов качества данных (DaData - подписка + оплата за запросы)
  • Проектная интеграция: внедрение дата-каталогов и DQ-контуров силами интеграторов с последующим сопровождением
  • Продажа готовых и синтетических датасетов как продукта
Конкурентная структура

Рынок двухъярусный. В сервисной разметке - фрагментация: десятки мелких подрядчиков, несколько заметных студий (Training Data, Data Light, Beorg) и краудсорсинговые платформы, при этом крупнейшие объёмы генерируют внутренние платформы экосистем - Яндекс Задания, TagMe (VK), собственные команды Сбера, а Ozon Profit закрывает потребности своей экосистемы. В платформенном сегменте (каталоги, качество данных, MDM) консолидация выше: Arenadata как публичная компания скупает и развивает продукты, с ней конкурируют Юнидата, DIS Group, HFLabs и Data Sapience. Явного монополиста нет ни в одном сегменте, но ценовую планку в разметке задают платформы экосистем, а в data governance - тендеры госкомпаний, где решает совместимость с реестром отечественного ПО.

Тренды 2025–2026
  • Auto-labeling и разметка с помощью LLM: человек смещается в роль валидатора, цена за единицу разметки падает
  • Рост спроса на синтетические данные для обучения моделей там, где реальные данные закрыты регуляторикой
  • Спрос смещается к сложной экспертной разметке (медицина, юриспруденция, RLHF для LLM) с высоким чеком
  • Консолидация платформенного сегмента вокруг Arenadata и крупных вендоров; M&A вместо органического роста
  • Data governance становится обязательным контуром под корпоративные ИИ-стратегии и «Экономику данных»
  • Обострение требований ИБ: разметка чувствительных данных уходит в защищённые контуры on-premise
Перспективы для новых игроков

Для новых игроков перспективны ниши экспертной разметки со специализацией (медицинские снимки, промышленные дефекты, юридические тексты), генерация синтетических данных и инструменты контроля качества данных для ИИ-конвейеров - там выше чек и меньше конкуренция с краудсорсингом. Входить в массовую ручную разметку не стоит: демпинг, автоматизация со стороны LLM и внутренние платформы экосистем делают нишу структурно сжимающейся. В платформенном сегменте (каталоги, MDM) место для стартапа тоже ограничено - тендеры выигрывают зрелые вендоры с историей внедрений и статусом отечественного ПО, а цикл продаж измеряется годами. Реалистичная стратегия для малых команд - партнёрство с крупными вендорами и экосистемами либо узкая продуктовая специализация, которую позже купит консолидатор.

Источники
  • Коммерсантъ, 2025
  • TAdviser, 2023
  • CNews, 2025
  • AI-News (исследование АБД, Б1, TAdviser), 2025

Описание рынка

Рынок данных и разметки - инфраструктурный слой под всем российским ИИ: сбор и аннотирование датасетов для обучения моделей, синтетические данные, дата-каталоги, MDM и инструменты качества данных. Сервисная часть (разметка) представлена краудсорсинговыми платформами (Яндекс Задания, TagMe, ABC Elementary) и подрядчиками полного цикла (Training Data, Data Light, Beorg), продуктовая - вендорами data-платформ и data governance (Arenadata, Юнидата, HFLabs, DIS Group). Зрелость сегментов разная: разметка - низкомаржинальный сервисный бизнес с низкими барьерами входа, а платформенный сегмент активно консолидируется и растёт на волне импортозамещения после ухода Informatica, Collibra и SAS. Спрос подогревается бумом генеративного ИИ: обучение и дообучение LLM требует больших объёмов размеченных и очищенных данных. Специфика РФ - закрытость данных (продаются не сырые данные, а обезличенная аналитика), требования по локализации и хранению, а также крупные внутренние команды разметки у экосистем.

Объём и динамика рынка

  • Отдельных публичных оценок ниши разметки и качества данных нет; родительский рынок больших данных и ИИ в РФ - 433 млрд руб. в 2024 г., прогноз ~520 млрд руб. в 2025 г., рост ~20% в год (исследование АБД, Б1 и TAdviser, Коммерсантъ, 2025)
  • Российский рынок разметки данных в 2022 г. вырос на 70% - последняя доступная публичная оценка динамики ниши (TAdviser, 2023)
  • Выручка Arenadata (data-платформы, дата-каталоги) превысила 6 млрд руб. в 2024 г., +52% г/г; по итогам 2025 г. компания отчиталась о росте выручки ещё на 46% (CNews, 2025; отчётность Arenadata, 2026)
  • Услуги ИИ и Data Science - крупнейший сегмент рынка больших данных: 305 млрд руб. в 2024 г., рост ~36% (исследование АБД/Б1/TAdviser, 2025)

Лидеры рынка

  • Arenadata - публичная компания, флагман импортозамещения data-платформ; Arenadata Catalog формирует рынок data governance
  • HFLabs (DaData) - фактический стандарт качества и стандартизации клиентских данных в банках и телекоме
  • Яндекс Задания - крупнейшая краудсорсинговая платформа разметки в РФ после ухода Толоки с внутреннего рынка
  • Training Data и Data Light - заметные подрядчики полного цикла сбора и разметки датасетов для ML-команд
  • Beorg (Биорг) - лидер в оцифровке и разметке документов с гибридной моделью «ИИ + краудсорсинг»
  • Юнидата (Unidata) - один из основных российских MDM/data governance вендоров в госсекторе и крупном бизнесе

Драйверы роста

  • Бум генеративного ИИ: обучение и дообучение LLM требует масштабной разметки (RLHF, инструктивные датасеты) и очистки данных
  • Импортозамещение data-платформ после ухода Informatica, SAS, Collibra, Talend - окно для российских вендоров
  • Регуляторное давление по качеству данных (152-ФЗ, оборотные штрафы за утечки, требования ЦБ) заставляет строить data governance
  • Национальный проект «Экономика данных» и госзаказ на дата-инфраструктуру
  • Рост числа корпоративных ИИ-проектов: 43% организаций применяли ИИ в 2024 г. против 20% в 2021 г. - каждому нужны данные
  • Дефицит открытых русскоязычных датасетов стимулирует спрос на заказной сбор и синтетические данные

Барьеры и риски

  • Низкие барьеры входа в разметку → жёсткий демпинг мелких подрядчиков и фриланс-бирж, маржа сервисного бизнеса тает
  • Автоматизация разметки самим ИИ (auto-labeling, синтетика) съедает ядро сервисного спроса - ниша ручной разметки может схлопнуться
  • Экосистемы (Сбер, Яндекс, VK) держат внутренние команды и краудсорсинговые платформы и не отдают объёмы на рынок
  • Закрытость российских данных: компании боятся передавать данные подрядчикам из-за утечек и штрафов, сделки срываются на ИБ-аудите
  • В платформенном сегменте высокая зависимость от крупных госзаказчиков и длинных циклов внедрения; замедление ИТ-бюджетов в 2025 г. ударило по вендорам
  • Кадровый голод в data-инженерии при том, что сама разметка - низкооплачиваемый труд с высокой текучкой

Бизнес-модели и монетизация

  • Сервисная модель: оплата за единицу разметки (объект, час асессора) или проектные контракты на сбор датасетов
  • Краудсорсинговые платформы: комиссия с заданий + SaaS-доступ к инструментам разметки (TagMe, ABC Elementary)
  • Лицензии on-premise + техподдержка для data-платформ и MDM (Arenadata, Юнидата, DIS Group) - основная модель в госсекторе и банках
  • SaaS/API по подписке и pay-per-use для сервисов качества данных (DaData - подписка + оплата за запросы)
  • Проектная интеграция: внедрение дата-каталогов и DQ-контуров силами интеграторов с последующим сопровождением
  • Продажа готовых и синтетических датасетов как продукта

Конкурентная структура

Рынок двухъярусный. В сервисной разметке - фрагментация: десятки мелких подрядчиков, несколько заметных студий (Training Data, Data Light, Beorg) и краудсорсинговые платформы, при этом крупнейшие объёмы генерируют внутренние платформы экосистем - Яндекс Задания, TagMe (VK), собственные команды Сбера, а Ozon Profit закрывает потребности своей экосистемы. В платформенном сегменте (каталоги, качество данных, MDM) консолидация выше: Arenadata как публичная компания скупает и развивает продукты, с ней конкурируют Юнидата, DIS Group, HFLabs и Data Sapience. Явного монополиста нет ни в одном сегменте, но ценовую планку в разметке задают платформы экосистем, а в data governance - тендеры госкомпаний, где решает совместимость с реестром отечественного ПО.

Тренды 2025–2026

  • Auto-labeling и разметка с помощью LLM: человек смещается в роль валидатора, цена за единицу разметки падает
  • Рост спроса на синтетические данные для обучения моделей там, где реальные данные закрыты регуляторикой
  • Спрос смещается к сложной экспертной разметке (медицина, юриспруденция, RLHF для LLM) с высоким чеком
  • Консолидация платформенного сегмента вокруг Arenadata и крупных вендоров; M&A вместо органического роста
  • Data governance становится обязательным контуром под корпоративные ИИ-стратегии и «Экономику данных»
  • Обострение требований ИБ: разметка чувствительных данных уходит в защищённые контуры on-premise

Перспективы для новых игроков

Для новых игроков перспективны ниши экспертной разметки со специализацией (медицинские снимки, промышленные дефекты, юридические тексты), генерация синтетических данных и инструменты контроля качества данных для ИИ-конвейеров - там выше чек и меньше конкуренция с краудсорсингом. Входить в массовую ручную разметку не стоит: демпинг, автоматизация со стороны LLM и внутренние платформы экосистем делают нишу структурно сжимающейся. В платформенном сегменте (каталоги, MDM) место для стартапа тоже ограничено - тендеры выигрывают зрелые вендоры с историей внедрений и статусом отечественного ПО, а цикл продаж измеряется годами. Реалистичная стратегия для малых команд - партнёрство с крупными вендорами и экосистемами либо узкая продуктовая специализация, которую позже купит консолидатор.

Источники

  • Коммерсантъ, 2025
  • TAdviser, 2023
  • CNews, 2025
  • AI-News (исследование АБД, Б1, TAdviser), 2025

Компании

СортировкаКомпанияПоднишаСтадия зрелостиГод основанияГородЧисленностьНезависимостьСегмент
  • 1

    1С:MDM Управление НСИ

    —

  • Юнидата (Unidata)

    дата-каталоги; качество данных (MDM, Data Governance)

    Стадия зрелости
    рост
    Год основания
    2014
    Город
    Санкт-Петербург
    Независимость
    независимая
    Сегмент
    B2B
  • Я

    Яндекс Задания

    сбор и разметка данных (краудсорсинг)

    Год основания
    2023
    Независимость
    часть экосистемы
    Сегмент
    B2B
  • A

    ABC Elementary

    сбор и разметка данных (краудсорсинг, социальный эффект)

    Стадия зрелости
    зрелая
    Независимость
    часть экосистемы
    Сегмент
    B2B
  • Arenadata

    дата-каталоги (Arenadata Catalog); качество данных

    Стадия зрелости
    публичная
    Город
    Москва
    Численность
    836
    Независимость
    независимая
    Сегмент
    смешанный
  • Beorg (Биорг)

    сбор и разметка данных (распознавание и оцифровка документов)

    Стадия зрелости
    рост
    Независимость
    независимая
    Сегмент
    смешанный
  • Data Light

    сбор и разметка данных; синтетические данные

    Стадия зрелости
    рост
    Численность
    90
    Независимость
    независимая
    Сегмент
    B2B
  • Data Ocean (Data Sapience)

    дата-каталоги (Data Governance); качество данных

    Стадия зрелости
    рост
    Год основания
    2023
    Город
    Москва
    Независимость
    независимая
    Сегмент
    B2B
  • DIS Group

    качество данных; дата-каталоги (Data Governance)

    Стадия зрелости
    зрелая
    Город
    Москва
    Независимость
    независимая
    Сегмент
    смешанный
  • HFLabs (DaData)

    качество данных (data quality, MDM)

    Стадия зрелости
    зрелая
    Год основания
    2005
    Город
    Москва
    Численность
    160
    Независимость
    независимая
    Сегмент
    B2B
  • L

    Label Your Data

    —

  • Ozon Profit

    сбор и разметка данных (краудсорсинг)

    Год основания
    2024
    Независимость
    часть экосистемы
    Сегмент
    B2B
  • TagMe

    сбор и разметка данных (краудсорсинг)

    Независимость
    часть экосистемы
    Сегмент
    B2B
  • T

    Training Data

    сбор и разметка данных; синтетические данные (генерация датасетов)

    Стадия зрелости
    рост
    Год основания
    2021
    Город
    Москва
    Независимость
    независимая
    Сегмент
    B2B
#КомпанияПоднишаСтадия зрелостиГод основанияГородЧисленностьНезависимостьСегмент
111С:MDM Управление НСИ———————
2Юнидата (Unidata)дата-каталоги; качество данных (MDM, Data Governance)рост2014Санкт-Петербург—независимаяB2B
3ЯЯндекс Заданиясбор и разметка данных (краудсорсинг)—2023——часть экосистемыB2B
4AABC Elementaryсбор и разметка данных (краудсорсинг, социальный эффект)зрелая———часть экосистемыB2B
5Arenadataдата-каталоги (Arenadata Catalog); качество данныхпубличная—Москва836независимаясмешанный
6Beorg (Биорг)сбор и разметка данных (распознавание и оцифровка документов)рост———независимаясмешанный
7Data Lightсбор и разметка данных; синтетические данныерост——90независимаяB2B
8Data Ocean (Data Sapience)дата-каталоги (Data Governance); качество данныхрост2023Москва—независимаяB2B
9DIS Groupкачество данных; дата-каталоги (Data Governance)зрелая—Москва—независимаясмешанный
10HFLabs (DaData)качество данных (data quality, MDM)зрелая2005Москва160независимаяB2B
11LLabel Your Data———————
12Ozon Profitсбор и разметка данных (краудсорсинг)—2024——часть экосистемыB2B
13TagMeсбор и разметка данных (краудсорсинг)————часть экосистемыB2B
14TTraining Dataсбор и разметка данных; синтетические данные (генерация датасетов)рост2021Москва—независимаяB2B

Другие отрасли слоя «Данные и платформы»

MLOps и ML-платформыСредний