
Яндекс на совещании рабочей группы Минцифры представил концепцию национального датасета — набора тестовых заданий и эталонных данных для бенчмарк-тестирования ИИ-моделей, рассказал Коммерсанту один из участников встречи.
Подобные инструменты необходимы для оценки соответствия систем искусственного интеллекта «духу времени и ценностям страны, а также их пригодности для использования в российских условиях».
Проект пока в разработке, однако участникам рынка необходимо заранее решить ряд вопросов. В частности — определить степень публичности датасета. ФСБ настаивает на закрытом формате данных, бизнес считает, что это может быть «несообразно сложным для прохождения и не позволит быстро развивать модели».
В качестве компромисса обсуждается комбинированный подход — с использованием открытого бенчмарка для публичного тестирования и видоизмененного закрытого — для финальной проверки.
Также пока открытым остается вопрос о том, кто будет определять содержание бенчмарка.
Кроме того, в компании ответили на вопрос о маркировке ИИ-треков, доступных на музыкальной платформе. Музыкальный стриминговый сервис Яндекс Музыка намерен сделать правообладателей главным источником данных о том, какие треки были созданы с использованием ИИ, пишет ТАСС.
Сейчас компания обсуждает вопрос с лейблами и дистрибьюторами, собирая информацию о контенте, сгенерированном нейросетями. Именно эти данные, пояснили в пресс-службе Яндекс Музыки, станут основой для будущей маркировки в интерфейсе сервиса.
В Яндексе так прокомментировалои это сообщение: «Яндекс не представлял концепцию национального датасета и набор тестов для проверки ИИ-моделей. На рабочей встрече в Минцифры представители нескольких компаний обсуждали возможные подходы к такой проверке. Яндекс был одним из участников обсуждения и высказал свою позицию – содержание датасета должно быть открытым по общепринятым принципам отрасли».