Данные и платформы
14 компаний в каталоге
Рынок данных и разметки - инфраструктурный слой под всем российским ИИ: сбор и аннотирование датасетов для обучения моделей, синтетические данные, дата-каталоги, MDM и инструменты качества данных. Сервисная часть (разметка) представлена краудсорсинговыми платформами (Яндекс Задания, TagMe, ABC Elementary) и подрядчиками полного цикла (Training Data, Data Light, Beorg), продуктовая - вендорами data-платформ и data governance (Arenadata, Юнидата, HFLabs, DIS Group). Зрелость сегментов разная: разметка - низкомаржинальный сервисный бизнес с низкими барьерами входа, а платформенный сегмент активно консолидируется и растёт на волне импортозамещения после ухода Informatica, Collibra и SAS. Спрос подогревается бумом генеративного ИИ: обучение и дообучение LLM требует больших объёмов размеченных и очищенных данных. Специфика РФ - закрытость данных (продаются не сырые данные, а обезличенная аналитика), требования по локализации и хранению, а также крупные внутренние команды разметки у экосистем.
Рынок двухъярусный. В сервисной разметке - фрагментация: десятки мелких подрядчиков, несколько заметных студий (Training Data, Data Light, Beorg) и краудсорсинговые платформы, при этом крупнейшие объёмы генерируют внутренние платформы экосистем - Яндекс Задания, TagMe (VK), собственные команды Сбера, а Ozon Profit закрывает потребности своей экосистемы. В платформенном сегменте (каталоги, качество данных, MDM) консолидация выше: Arenadata как публичная компания скупает и развивает продукты, с ней конкурируют Юнидата, DIS Group, HFLabs и Data Sapience. Явного монополиста нет ни в одном сегменте, но ценовую планку в разметке задают платформы экосистем, а в data governance - тендеры госкомпаний, где решает совместимость с реестром отечественного ПО.
Для новых игроков перспективны ниши экспертной разметки со специализацией (медицинские снимки, промышленные дефекты, юридические тексты), генерация синтетических данных и инструменты контроля качества данных для ИИ-конвейеров - там выше чек и меньше конкуренция с краудсорсингом. Входить в массовую ручную разметку не стоит: демпинг, автоматизация со стороны LLM и внутренние платформы экосистем делают нишу структурно сжимающейся. В платформенном сегменте (каталоги, MDM) место для стартапа тоже ограничено - тендеры выигрывают зрелые вендоры с историей внедрений и статусом отечественного ПО, а цикл продаж измеряется годами. Реалистичная стратегия для малых команд - партнёрство с крупными вендорами и экосистемами либо узкая продуктовая специализация, которую позже купит консолидатор.
Рынок данных и разметки - инфраструктурный слой под всем российским ИИ: сбор и аннотирование датасетов для обучения моделей, синтетические данные, дата-каталоги, MDM и инструменты качества данных. Сервисная часть (разметка) представлена краудсорсинговыми платформами (Яндекс Задания, TagMe, ABC Elementary) и подрядчиками полного цикла (Training Data, Data Light, Beorg), продуктовая - вендорами data-платформ и data governance (Arenadata, Юнидата, HFLabs, DIS Group). Зрелость сегментов разная: разметка - низкомаржинальный сервисный бизнес с низкими барьерами входа, а платформенный сегмент активно консолидируется и растёт на волне импортозамещения после ухода Informatica, Collibra и SAS. Спрос подогревается бумом генеративного ИИ: обучение и дообучение LLM требует больших объёмов размеченных и очищенных данных. Специфика РФ - закрытость данных (продаются не сырые данные, а обезличенная аналитика), требования по локализации и хранению, а также крупные внутренние команды разметки у экосистем.
Рынок двухъярусный. В сервисной разметке - фрагментация: десятки мелких подрядчиков, несколько заметных студий (Training Data, Data Light, Beorg) и краудсорсинговые платформы, при этом крупнейшие объёмы генерируют внутренние платформы экосистем - Яндекс Задания, TagMe (VK), собственные команды Сбера, а Ozon Profit закрывает потребности своей экосистемы. В платформенном сегменте (каталоги, качество данных, MDM) консолидация выше: Arenadata как публичная компания скупает и развивает продукты, с ней конкурируют Юнидата, DIS Group, HFLabs и Data Sapience. Явного монополиста нет ни в одном сегменте, но ценовую планку в разметке задают платформы экосистем, а в data governance - тендеры госкомпаний, где решает совместимость с реестром отечественного ПО.
Для новых игроков перспективны ниши экспертной разметки со специализацией (медицинские снимки, промышленные дефекты, юридические тексты), генерация синтетических данных и инструменты контроля качества данных для ИИ-конвейеров - там выше чек и меньше конкуренция с краудсорсингом. Входить в массовую ручную разметку не стоит: демпинг, автоматизация со стороны LLM и внутренние платформы экосистем делают нишу структурно сжимающейся. В платформенном сегменте (каталоги, MDM) место для стартапа тоже ограничено - тендеры выигрывают зрелые вендоры с историей внедрений и статусом отечественного ПО, а цикл продаж измеряется годами. Реалистичная стратегия для малых команд - партнёрство с крупными вендорами и экосистемами либо узкая продуктовая специализация, которую позже купит консолидатор.
1С:MDM Управление НСИ
—
Юнидата (Unidata)
дата-каталоги; качество данных (MDM, Data Governance)
Яндекс Задания
сбор и разметка данных (краудсорсинг)
ABC Elementary
сбор и разметка данных (краудсорсинг, социальный эффект)
Arenadata
дата-каталоги (Arenadata Catalog); качество данных
Beorg (Биорг)
сбор и разметка данных (распознавание и оцифровка документов)
Data Light
сбор и разметка данных; синтетические данные
Data Ocean (Data Sapience)
дата-каталоги (Data Governance); качество данных
DIS Group
качество данных; дата-каталоги (Data Governance)
HFLabs (DaData)
качество данных (data quality, MDM)
Label Your Data
—
Ozon Profit
сбор и разметка данных (краудсорсинг)
TagMe
сбор и разметка данных (краудсорсинг)
Training Data
сбор и разметка данных; синтетические данные (генерация датасетов)
| # | Компания | Подниша | Стадия зрелости | Год основания | Город | Численность | Независимость | Сегмент |
|---|---|---|---|---|---|---|---|---|
| 1 | 1С:MDM Управление НСИ | — | — | — | — | — | — | — |
| 2 | дата-каталоги; качество данных (MDM, Data Governance) | рост | 2014 | Санкт-Петербург | — | независимая | B2B | |
| 3 | Яндекс Задания | сбор и разметка данных (краудсорсинг) | — | 2023 | — | — | часть экосистемы | B2B |
| 4 | ABC Elementary | сбор и разметка данных (краудсорсинг, социальный эффект) | зрелая | — | — | — | часть экосистемы | B2B |
| 5 | дата-каталоги (Arenadata Catalog); качество данных | публичная | — | Москва | 836 | независимая | смешанный | |
| 6 | сбор и разметка данных (распознавание и оцифровка документов) | рост | — | — | — | независимая | смешанный | |
| 7 | сбор и разметка данных; синтетические данные | рост | — | — | 90 | независимая | B2B | |
| 8 | дата-каталоги (Data Governance); качество данных | рост | 2023 | Москва | — | независимая | B2B | |
| 9 | качество данных; дата-каталоги (Data Governance) | зрелая | — | Москва | — | независимая | смешанный | |
| 10 | качество данных (data quality, MDM) | зрелая | 2005 | Москва | 160 | независимая | B2B | |
| 11 | Label Your Data | — | — | — | — | — | — | — |
| 12 | сбор и разметка данных (краудсорсинг) | — | 2024 | — | — | часть экосистемы | B2B | |
| 13 | сбор и разметка данных (краудсорсинг) | — | — | — | — | часть экосистемы | B2B | |
| 14 | Training Data | сбор и разметка данных; синтетические данные (генерация датасетов) | рост | 2021 | Москва | — | независимая | B2B |