"Яндекс" представил правительству концепцию национального бенчмарка — набора тестовых заданий и эталонных данных для оценки ИИ-систем. Предполагается, что такой инструмент позволит проверять модели не только по техническим показателям, но и на соответствие духовно-нравственным ценностям, требованиям российского законодательства и условиям применения в стране.
Концепцию представили 13 августа на заседании рабочей группы по регулированию и административным барьерам в сфере искусственного интеллекта. Пока проект находится на стадии обсуждения: не определены ни окончательный состав заданий, ни порядок формирования набора, ни степень его публичности.
Одним из главных спорных вопросов стала открытость тестов. Закрытый вариант рассматривается как способ не допустить целенаправленной настройки моделей под конкретные задания. При этом представители отрасли указывают, что полностью закрытая методика затруднит разработку и регулярное совершенствование ИИ-систем.
В качестве компромисса обсуждается двухуровневая модель. Открытый бенчмарк позволит разработчикам предварительно проверять свои системы, а закрытый набор с аналогичными темами, но другими формулировками вопросов — проводить итоговую оценку и снижать риск искусственного завышения результатов.
Отдельно предстоит решить, кто будет формировать содержание тестов. ИТ-отрасль предлагает создать комиссию с участием представителей государства, бизнеса и экспертного сообщества. Такой механизм должен обеспечить баланс интересов и избежать формирования бенчмарка исключительно одной стороной.
Особую сложность представляет сама проверка соответствия ценностям. Для математики или программирования можно установить однозначный эталон правильного ответа. В случае оценки мировоззренческих и ценностных характеристик такой подход не работает: здесь, вероятно, потребуется система критериев, рубрикаторов и экспертных оценок.
При этом техническая часть бенчмарка также должна учитывать специфику современных моделей. Их поведение взаимосвязано, поэтому изменение одного компонента может повлиять на результаты в других задачах. Частое повторное прохождение одного и того же теста способно существенно увеличивать цикл выпуска новых версий моделей.
В правительстве подчеркивают, что предложения по регулированию ИИ пока обсуждаются с отраслью и профильными ведомствами. Подзаконные акты к законодательству в этой сфере также находятся в работе. Конкретные параметры национального бенчмарка на данный момент не утверждены.
Идея создания единого набора тестов вписывается в более широкий курс на формирование национальной инфраструктуры искусственного интеллекта. При этом будущей системе предстоит одновременно решить две противоположные задачи — обеспечить прозрачность оценки для разработчиков и сохранить закрытые элементы тестирования, необходимые для объективности результатов.
Напомним, как ранее писал "Кабельщик", при правительстве РФ создана рабочая группа по защите авторских прав в сфере искусственного интеллекта.
- Войдите или зарегистрируйтесь, чтобы оставлять комментарии