Яндекс предложил создать национальный датасет для проверки ИИ на соответствие ценностям
«Яндекс», по данным «Ъ», принёс в Минцифры концепцию национального датасета — набора тестов и эталонных данных, по которым ИИ-системы будут проверять на соответствие «духу времени и ценностям страны».
Тамила Шерстнева·обновлено 18 августа 2026 г.

Для ниши мобильных приложений это не отвлечённая бюрократия: завтра каждая ассистентка в смартфоне будет прогоняться через бенчмарк «на духовность», и вопрос, открытый он или закрытый, — это, по сути, вопрос, будет ли вообще работать то, что нам подсунут в очередном обновлении.
Что именно предложили
На совещании рабочей группы по регулированию ИИ «Яндекс», по версии источника «Ъ», предложил концепцию набора тестовых заданий. В самой компании после публикации от этой формулировки открестились: «не представляли концепцию национального датасета», а лишь «высказали свою позицию» — что содержание должно быть открытым по общепринятым принципам отрасли. Классический свайп: «мы вообще не это имели в виду», как только журналисты переспросили. То есть на бумаге инициатива громкая, а в пресс-службе — тихо: мы тут вообще мимо проходили.
Почему открытый vs закрытый — это не про прозрачность, а про костыль
ФСБ настаивает на закрытом формате — иначе разработчики быстро подстроят модели под прохождение теста. Бизнес возражает: закрытый набор «несообразно сложный» и будет тормозить развитие моделей. В качестве компромисса предложили гибрид — открытый бенчмарк для лабораторных прогонов и закрытый финальный тест с другими формулировками, но той же тематикой.
Звучит разумно, пока не вспоминаешь, что любой публичный бенчмарк рано или поздно «ломается» обычным скриптом — это справедливо заметил Алексей Борщов из «Авандок». А когда разработчик не знает даже категорий проверки и порогов — это уже не тест, а лотерея. Директор по ИБ GreenData Роман Перепонов добавляет важный нюанс: для математики и кода есть чёткий эталон, а для «ценностей» — только экспертная или рубрикаторная оценка. Мешать их в одном датасете — значит подменять проверку двумя принципиально разными механиками с разной природой и разными требованиями к прозрачности.
Что это значит для пользователя
Если концепция дойдёт до подзаконных актов, каждая ИИ-фича в приложении — от генерации текста в заметках до «умного» ответа в мессенджере — будет проходить фильтр «духовно-нравственных ценностей» до того, как попадёт к вам в телефон. И тут возникает главный UX-вопрос: модель, заточенная под прохождение чужого теста, а не под реальную задачу пользователя, — это тёмный паттерн нового типа. Вы его не выбирали, его правил не видите, и ваш сценарий «написать / отредактировать / найти» теперь подчиняется чужим порогам.
Пока, впрочем, всё на стадии обсуждений: в аппарате вице-премьера Дмитрия Григоренко «Ъ» сообщили, что говорить о конкретных решениях преждевременно, в Минцифры — что подзаконные акты обсуждают с бизнесом, ключевая задача — «соблюсти интересы отрасли и пользователей». Открытым остаётся и вопрос, кто именно будет наполнять бенчмарк: IT-сообщество предлагает совместную комиссию с властями и экспертами, чтобы датасет получился сбалансированным.
Стоит следить за двумя вещами. Первое — будет ли датасет в итоге открытым хотя бы частично: иначе тест превращается в чёрный ящик, а любая аномалия в ответе модели — в строчку «не соответствует». Второе — не размоют ли «ценности» до уровня, при котором ассистент начнёт отказываться отвечать на рабочие запросы, потому что бенчмарк посчитал их неуместными. Это особенно заметно в сценариях, где ИИ используют не для досуга, а по делу — например, чтобы быстро сориентироваться по маршруту и аренде авто в Турции, когда туристический чат-бот вдруг решит «уточнить ценности» вместо того, чтобы отвечать на конкретный вопрос.