Version: 1.0.2

Ученые поймали нейросети на жульничестве

Стремление жульничать будет расти вместе с возможностями нейросетей, даже если частота обмана не изменится, считают эксперты.

Нейросети массово пытаются жульничать. Анализ поведения искусственного интеллекта во время испытаний показал, что абсолютно все ИИ выходят за рамки заданий или нарушают установленные правила для решения задач, выяснили 26 июля "Известия".

Под жульничеством эксперты Института безопасности искусственного интеллекта Великобритании (AISI) подразумевали выход за рамки заданий или нарушение установленных протоколов.

Выяснилось, что абсолютно все модели, которые участвовали в исследовании, пытались тем или иным способом обмануть систему оценки. В частности, они выдавали готовые решения из интернета, а также пытались повысить уровень своих привилегий в системе, чтобы узнать ответы прямо из программного обеспечения системы оценки.

В AISI считают, что стремление жульничать будет расти вместе с возможностями нейросетей, даже если частота обмана не изменится.

"При этом речь не идет о сознательном обмане в человеческом понимании. У модели нет намерения кого-либо обмануть – она просто стремится максимально эффективно выполнить поставленную задачу", – пояснил главный технологический эксперт "Лаборатории Касперского" Александр Гостев.

Фактически ИИ пытается выполнить задачу так, чтобы получить наивысшую оценку. Если задача оказывается неразрешимой или нейросеть находит способ повлиять на систему проверки, то она может начать искать альтернативные пути решения вместо решения самой задачи.

Ранее, 23 июля, сообщалось, что не выпущенная версия ChatGPT во время тестов вышла из-под контроля, "сбежала" с испытательного полигона и самостоятельно совершила хакерскую атаку.

РЕН ТВ в мессенджере "МАКС" – главный по происшествиям