Государство может взять на себя часть расходов на подготовку датасетов — наборов данных для обучения больших фундаментальных моделей. Минцифры и представители бизнеса обсуждают запуск субсидий или грантов на их формирование, а окончательное решение стороны должны принять до конца сентября.
Предложение прозвучало на сентябрьском заседании профильной рабочей группы. Представители бизнеса, госкорпораций и правительства обсуждали инициативу еще 10 сентября — два участника обсуждений подтвердили информацию, а еще один собеседник, знакомый с повесткой встречи, также подтвердил ее.
Кто собрался на рабочей группе «Меры поддержки ИИ»
На заседании рабочей группы «Меры поддержки ИИ» собрались представители бизнеса, государственных корпораций и правительства. По словам источника, мера способна дать заметный эффект — господдержка позволит создавать качественные русскоязычные и отраслевые наборы данных.
Несколько исследовательских команд смогут получить доступ к одним и тем же массивам. Субсидии также могут снизить порог входа для небольших разработчиков, у которых нет бюджета на закупку или разметку данных.
Ранее в Минфине уже заявляли, что искусственный интеллект способен упростить госзакупки в России и ЕАЭС — теперь ведомства обсуждают и поддержку самих данных для обучения моделей.
Датасет — структурированный набор данных, на котором обучают модели машинного обучения. Качество и объем таких наборов напрямую влияют на возможности ИИ-моделей.
Субсидии или гранты: два формата на выбор
Обсуждаются два формата — прямые субсидии или гранты. Государство готово взять на себя часть расходов на подготовку наборов данных, что особенно важно для русскоязычных и отраслевых датасетов, которых на рынке не хватает.
Если решение будет принято, несколько исследовательских команд смогут получить доступ к одним и тем же массивам данных. Это снизит дублирование затрат и ускорит разработку отечественных ИИ-моделей.
- Субсидии или гранты на формирование датасетов для обучения больших фундаментальных моделей.
- Государство может покрыть часть расходов на подготовку наборов данных.
- Доступ к одним и тем же массивам для нескольких исследовательских команд.
- Фокус на русскоязычные и отраслевые датасеты.
Окончательное решение стороны должны принять до конца месяца. Пока неизвестно, какой именно формат поддержки выберут — субсидии или гранты, и как будет распределяться финансирование.
Почему русскоязычных датасетов катастрофически мало
Инициатива обсуждается на фоне глобальной гонки в сфере ИИ, где доступ к качественным данным становится ключевым конкурентным преимуществом. Крупные игроки тратят миллиарды на сбор и разметку данных, а небольшие команды часто не могут позволить себе такие расходы.
Для российского рынка это особенно актуально: русскоязычных датасетов значительно меньше, чем англоязычных, а отраслевые наборы данных зачастую отсутствуют вовсе. Господдержка может изменить эту ситуацию, если механизм заработает эффективно.
Вопрос в том, как именно будет распределяться финансирование и кто получит доступ к субсидиям. Прозрачность механизма и критерии отбора станут ключевыми факторами успеха инициативы.
До конца сентября станет ясно, примут ли стороны окончательное решение и в каком формате. Если инициатива пройдет, она может стать одним из первых примеров системной господдержки ИИ-инфраструктуры в России — но пока открыто, кто именно получит доступ к бюджетным деньгам и по каким критериям.