top of page

Яндекс предложил правительству тесты на духовность для искусственного интеллекта

  • Фото автора: Редакция «Сегодня в эфире»
    Редакция «Сегодня в эфире»
  • 1 час назад
  • 2 мин. чтения
Яндекс предложил правительству тесты на духовность для искусственного интеллекта

 

«Яндекс» представил правительству концепцию национального датасета - набора тестов и эталонных данных для проверки систем искусственного интеллекта. Главная цель - оценить, насколько нейросети соответствуют «духу времени и ценностям страны» и пригодны для работы в российских условиях.

 

Проект обсудили 13 августа на совещании рабочей группы по регулированию ИИ. По словам источника «Ъ», близкого к Минцифры, бенчмарк позволит сравнивать качество разных моделей по единым критериям. В отличие от простых тестов, он проверяет способность решать реальные рабочие задачи - от выгрузки данных до подготовки отчётов.

 

Однако участники встречи разошлись во мнениях о степени открытости датасета. ФСБ настаивает на закрытом формате, чтобы разработчики не могли натренировать модели специально под тест. Бизнес возражает: закрытый формат окажется неоправданно сложным и затормозит развитие.

 

В качестве компромисса предложили комбинированный подход. Открытый бенчмарк используют для предварительной проверки и прозрачности, а закрытый - для финальной оценки с теми же темами, но другими формулировками вопросов. Это должно помочь разработчикам тестировать модели в лабораториях и сохранить объективность итоговой оценки.

 

Пока не решено, кто именно будет определять содержание бенчмарка. ИТ-сообщество предлагает создать совместную комиссию из представителей власти, бизнеса и экспертных организаций, чтобы набор тестов получился сбалансированным.

 

В аппарате вице-премьера Дмитрия Григоренко заявили «Ъ», что все предложения ещё обсуждаются с отраслью и ведомствами, а говорить о конкретных решениях рано. В Минцифры добавили, что подзаконные акты к закону об ИИ прорабатываются с бизнесом, и ключевая задача - соблюсти интересы отрасли и пользователей.

 

Разработчики предупреждают о рисках. Рафаэль Гильмурахманов из Kodik «АрхиТех ИИ» пояснил, что каждое изменение в поведении модели может повлиять на другие её части, а релизный цикл измеряется неделями. «Слепая пересдача на каждую версию растягивает его в несколько раз», - отметил он.

 

Алексей Борщов из «Авандок» назвал закрытые эталонные ответы обязательным условием безопасности, поскольку любой публичный бенчмарк рано или поздно «ломается» скриптом. Но если разработчик не знает даже категорий проверки и пороговых значений, тест превращается в лотерею.

 

Роман Перепонов из GreenData обратил внимание на принципиальную разницу заданий. Для программирования или математики существует чёткий эталон. Для оценки соответствия ценностям жёсткого эталона быть не может - здесь нужна экспертная оценка. «Это принципиально разные механики в рамках одного датасета, и требования к их прозрачности должны различаться», - подчеркнул он.

 

После выхода заметки «Яндекс» предоставил комментарий, в котором опроверг представление концепции национального датасета. В компании заявили, что на встрече в Минцифры представители нескольких компаний обсуждали возможные подходы к проверке ИИ-моделей. «Яндекс» был одним из участников и высказал позицию: содержание датасета должно быть открытым по общепринятым принципам отрасли.

 
 
bottom of page