ИИ-агенты воруют лишние личные данные — попались 7 моделей

BeInCrypto
Apri BeInCrypto
ИИ-агенты воруют лишние личные данные — попались 7 моделей

Исследователи из Китая описали поведение, при котором ИИ-агент с доступом к внешним инструментам запрашивает больше личных данных, чем нужно для выполнения задачи. Эффект проявился у всех семи протестированных моделей.

Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш  телеграм-канал , обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!

Работа называется OverAct, а ее авторы предложили и способ ограничить аппетит ИИ-агентов. По их словам, без доступа к правильному ответу он срезает избыточные обращения почти наполовину.

Что такое «проактивная сверхавторизация»

На исследование обратил внимание автор блога Superman в соцсети X. По его словам, разработчики выдают помощнику доступ к календарю, файлу или базе и ждут соблюдения принципа минимальных привилегий, а модель на деле подтягивает все, до чего дотягивается. 

Он называет это «дрейфом поведения», а не сбоем. Система нацелена решить задачу любой ценой и воспринимает ограничения как помеху. Сами авторы работы формулируют мягче. Они говорят о расширении действий агента за пределы того, что прямо следует из слов пользователя. 

Статью подготовили Таолинь Чжан и Цзюхэн Вань из Хэфэйского технологического университета, Ханьюй Ван и Тинъюань Ху из Восточно-китайского педагогического университета, а также Чэнъюй Ван из Alibaba Cloud Computing. 

Авторы собрали управляемый набор тестов OverAct: он охватывает восемь областей с чувствительными личными данными и оценивается по четким правилам, без модели-судьи. Проверку прошли семь моделей из четырех семейств — и все заметно вышли за разрешенные границы. 

Авторы показывают это на бытовых примерах. Пользователь просит банковского агента проверить баланс — хватило бы одного запроса, который вернет остаток на счете. Но помощник заодно поднимает историю операций, данные накопительного счета и информацию по картам. 

В другом примере простой вопрос о дате приема у врача запускает выгрузку списка лекарств, результатов анализов и истории диагнозов. Каждый такой запрос раскрывает данные, которых пользователь не разрешал, и нарушает принцип минимизации. 

Главное влияние оказала конкретность запроса: чем расплывчатее формулировка, тем шире ИИ-агент трактует свои полномочия. При этом чем больше инструментов доступно агенту, тем медленнее растет избыточность — а случайность в настройках модели почти ни на что не влияет. Исследователи делают вывод: причина не в случайной генерации, а в самой природе агента — он всегда «тянет» лишние данные, ведь пропустить нужное для модели дороже, чем сделать лишний запрос.

В ответ авторы предложили метод SelfAudit. Он работает во время генерации и не требует дообучения. Агент обязан обосновать каждый запрос ссылкой на задачу пользователя, а необоснованные обращения система отсекает заранее. Разбор показал, что главный эффект дает именно фильтрация, а не само объяснение. В итоге избыток обращений к личным данным падает на 43%, даже без подсказки о том, какой ответ считается верным.

Почему это касается не только разработчиков

Правительство Норвегии первым ограничило ношение ИИ-очков в парках, музеях, торговых центрах и местах с раздевалками на государственном уровне. Прохожий рядом с владельцем устройства может попасть на запись и не узнать об этом.

Депутат из Казахстана Екатерина Смышляева рассказала, что обучает модели и выстраивает методологии именно поэтому: регулировать можно только то, в чем разбираешься сам. Сверхавторизация — характерный пример: она не выглядит ни взломом, ни атакой, поэтому в стандартные формулировки о запрещенном доступе просто не попадает.

Хотите получить доступ к экспертным инсайдам? Подписывайтесь на наш новостной телеграм-канал , а также вступайте в сообщество BeInCrypto ! Читайте последние новости и свежую аналитику криптовалют, ИИ и фондовых рынков. Будьте на шаг впереди толпы каждый день!

Читайте оригинальную статью ИИ-агенты воруют лишние личные данные — попались 7 моделей от Igor Kokorev-Shirokov на ru.beincrypto.com