Новость

Яндекс разрабатывает систему оценки ИИ на соответствие традиционным ценностям

Habr сообщает, что «Яндекс» представил правительству России концепцию эталонных датасетов для проверки ИИ-систем на соответствие традиционным и духовно-нравственным ценностям.

Яндекс разрабатывает систему оценки ИИ на соответствие традиционным ценностям

«Яндекс» создает тест для проверки ИИ на соответствие духовно-нравственным ценностям

Речь идет не о готовом государственном тесте, а о наборе заданий и эталонных данных, подход к которому пока обсуждается. Для разработчиков поисковых и генеративных систем это важно: критерии оценки могут повлиять на то, как модели формируют ответы в российских условиях.

Что именно обсуждают

Алгоритм предполагается построить вокруг двух компонентов:

1. Открытый бенчмарк — набор заданий, доступный разработчикам для предварительной проверки моделей.

2. Закрытая финальная выборка — тест с теми же тематиками, но с другими формулировками вопросов.

Такая схема должна одновременно решать две противоположные задачи. Во-первых, разработчик получает возможность проверить модель в лаборатории и понять, где она ошибается. Во-вторых, закрытая часть не позволяет заранее настроить систему под конкретные вопросы.

В публикации отмечается, что участники обсуждения пока не пришли к единому мнению о степени публичности датасета. Закрытый формат рассматривается как способ сохранить объективность финальной проверки. Открытый — как необходимое условие прозрачности и нормальной разработки моделей.

Проблема технически знакома специалистам по тестированию: любой полностью публичный бенчмарк со временем становится известным модели или разработчикам. Тогда система может оптимизироваться не под реальное качество ответов, а под прохождение конкретного набора заданий. В итоге растет формальный результат, но не обязательно улучшается пользовательский опыт.

Почему такой тест сложнее обычного бенчмарка

Для математики, программирования или других задач с однозначным результатом можно заранее определить эталонный ответ. Проверка на соответствие ценностям работает иначе. Здесь, как сообщается, потребуется рубрикаторная или экспертная оценка.

Механика в таком случае выглядит следующим образом:

1. Формируется перечень тематик и типов запросов.

2. Для каждого задания задаются критерии приемлемого ответа.

3. Эксперты оценивают не только наличие конкретного факта, но и соответствие ответа установленным требованиям.

4. Итоговый результат рассчитывается по совокупности категорий, порогов и оценок.

Ключевой вопрос — кто будет определять содержание такого бенчмарка. IT-сообщество предлагает создать совместную комиссию с участием представителей органов власти, бизнеса и экспертных организаций. Предполагается, что это позволит сбалансировать требования и снизить риск односторонней оценки.

При этом «Яндекс» после публикаций в СМИ заявил, что не представлял концепцию национального датасета и набора тестов для проверки ИИ-моделей. В компании уточнили, что на рабочей встрече в Минцифры представители нескольких компаний обсуждали возможные подходы к проверке, а «Яндекс» был одним из участников и высказался за открытое содержание датасета по общепринятым отраслевым принципам.

Следовательно, корректная формулировка новости сейчас такова: «Яндекс» участвует в обсуждении подхода к проверке ИИ, но создание утвержденного национального теста пока нельзя считать завершенным фактом.

Что это меняет для ИИ-ответов

Для пользователя поисковых систем и чат-ботов важен не сам термин «датасет», а последствия его применения. Если подобный механизм будет принят, разработчикам придется проверять модели не только на точность, безопасность или устойчивость к вредным запросам, но и на соответствие отдельным ценностным критериям.

Это может затронуть:

  • формулировки ответов на чувствительные общественные и культурные темы;
  • работу моделей в российских сервисах;
  • процесс приемочного тестирования перед выпуском новых версий;
  • прозрачность критериев, по которым оцениваются ИИ-ответы.

Однако конкретные решения пока не определены. В аппарате профильного вице-премьера сообщили, что предложения обсуждаются с отраслью и ведомствами на рабочих группах. В Минцифры также указали, что подзаконные акты к закону об ИИ находятся в стадии обсуждения с бизнесом.

Практический вывод для специалистов по поиску и контенту: пока рано перестраивать семантическое ядро или редакционные процессы под новые требования. На текущем этапе разумно отслеживать три параметра — состав категорий, правила экспертной оценки и соотношение открытой и закрытой частей теста. Именно они определят, станет ли бенчмарк рабочим инструментом контроля качества или формальной процедурой.

Для контекста о том, как общественные и ценностные критерии проявляются в культурных проектах, можно посмотреть материал о создании инклюзивного пространства.