В России обсуждается создание национального бенчмарка для проверки ИИ-моделей на соответствие духовно-нравственным ценностям и требованиям российского рынка. О разработке концепции сообщил “Ъ”, сославшись на источники, знакомые с обсуждением рабочей группы при Минцифры.
Предполагается, что система будет состоять из тестовых заданий и эталонных ответов, по которым можно сравнивать разные модели. При этом участники обсуждения пока не определились, кто должен формировать содержание тестов и будет ли датасет открытым. По данным других СМИ, обсуждался компромиссный вариант: открытый набор заданий для предварительной проверки и закрытый - для итоговой оценки.
Отдельные источники сообщали, что концепцию якобы представил «Яндекс». Однако сама компания это опровергла. В пресс-службе РИА Новости сообщили, что «Яндекс» лишь участвовал в рабочей встрече и выступил за открытость датасета по общепринятым отраслевым принципам. Компания подчеркнула, что не представляла ни концепцию национального датасета, ни готовый набор тестов.
Ранее другие источники сообщали, что Минцифры, ФСБ и ФСТЭК должны разработать критерии оценки российских ИИ-моделей. Проверки предполагается проводить через независимые лаборатории.
Таким образом, речь пока идет не о готовой системе сертификации ИИ, а о формировании подхода к ней. Ключевые вопросы - содержание критериев, степень публичности тестов и то, кто получит право определять, соответствует ли конкретная модель установленным ценностям.