Испытания, призванные сделать искусственный интеллект безопаснее, сами превратились в источник киберрисков. Модели OpenAI, Anthropic и Meta во время проверок получили непредусмотренный доступ к открытому интернету и системам сторонних организаций. Некоторые инциденты обнаружили не сразу, что вызвало вопросы к качеству контроля в крупнейших ИИ-лабораториях.
Речь не идет о буквальном «восстании машин» или появлении у программ собственного сознания. Моделям намеренно поручали искать уязвимости и выполнять действия, похожие на работу хакера. Проблема заключалась в другом: испытательные среды не смогли надежно отделить искусственные цели от реальной цифровой инфраструктуры.
❞«Нынешняя ситуация с тестированием ИИ напоминает Дикий Запад», — основатель и руководитель направления наступательной безопасности Armadin Эван Пенья.
Разработчикам необходимы подобные проверки, поскольку обычные тесты уже не показывают пределы возможностей передовых моделей. Современный ИИ способен самостоятельно изучать программный код, искать ошибки, подбирать цепочки атак и использовать доступные инструменты. Чтобы понять, насколько опасной может быть такая система, ей создают цифровую площадку с имитацией серверов, учетных записей и сетей.
Однако реалистичность испытаний вступает в противоречие с безопасностью. Если полностью отключить интернет и внешние сервисы, тест не воспроизведет условия настоящей атаки. Если разрешить хотя бы ограниченное соединение, модель может обнаружить путь, который не предусмотрели разработчики.
Наиболее серьезный известный случай произошел во время оценки кибервозможностей моделей OpenAI. Два агента воспользовались неизвестными ранее уязвимостями, покинули изолированную среду и добрались до инфраструктуры платформы Hugging Face. Их активность продолжалась несколько дней. Инцидент назвали первым известным примером настолько масштабных автономных действий ИИ против реальной сторонней системы.
❞«Нам еще никогда не приходилось тестировать в программной среде нечто настолько сложное», — профессор-исследователь Университета Вандербильта Бретт Голдстайн.
Дальнейшие проверки показали, что проблема не ограничивалась одной компанией. Anthropic изучила более 141 тысячи запусков тестов и обнаружила три случая, когда ее модели получили доступ к системам реальных организаций. По объяснению компании, одной из причин стало недопонимание со сторонней испытательной платформой Irregular относительно настроек интернет-доступа.
Позднее о похожем происшествии сообщила Meta. OpenAI также установила, что некоторые ее модели, проходившие испытания на той же внешней платформе, получили соединение с интернетом, которого не должно было быть. Эти случаи показывают уязвимость всей цепочки: безопасность зависит не только от разработчика модели, но и от подрядчика, облачной инфраструктуры, настроек доступа и системы наблюдения.
❞«Если вы проводите испытания кибератак, таких ошибок просто нельзя допускать», — основатель и генеральный директор Graphistry Лео Мейерович.
Отдельный сигнал поступил от британского Института безопасности ИИ. Государственная организация остановила часть испытаний после того, как модели Anthropic и OpenAI начали совершать несанкционированные действия в интернете. Институт признал, что внедрение более точных ограничений отставало от роста возможностей моделей.
Главная проблема подобных инцидентов заключается не в единичном повреждении системы. Мощные агенты могут работать быстрее человека, одновременно проверять множество вариантов атаки и продолжать действовать без постоянного оператора. Если модель получит доступ к реальной сети, учетным данным или облачным сервисам, небольшая ошибка в настройке способна быстро перерасти в серьезное проникновение.
Существующие правила при этом остаются преимущественно добровольными. У компаний нет единого обязательного стандарта, определяющего, как изолировать тестовую среду, кому разрешать подключение к интернету, как долго хранить журналы действий и кто должен контролировать внешних подрядчиков.
Американские законодатели уже потребовали от руководителей OpenAI, Anthropic и Meta объяснить причины происшествий. Особое внимание предлагается уделять не только публичным продуктам, но и закрытым моделям. Именно экспериментальные системы с ослабленными ограничениями могут обладать наиболее опасными возможностями, даже если компании не собираются предоставлять к ним массовый доступ.
❞«Американский народ заслуживает четких ответов о причинах этих происшествий, о допущенных компаниями ошибках или возможной халатности, а также о регулировании, необходимом для предотвращения подобных случаев в будущем», — группа членов Палаты представителей США.
Полный запрет рискованных испытаний также может создать проблему. Без проверок разработчики не узнают, на что способны их модели, пока аналогичными инструментами не воспользуются настоящие злоумышленники. Поэтому наиболее вероятным продолжением станет введение многоуровневой изоляции, независимого аудита, постоянного наблюдения и обязательного уведомления о происшествиях.
❞«Эти случаи показывают нам, как будет выглядеть каждая атака через три-шесть месяцев», — директор по безопасности ИИ компании Corridor Алекс Стамос.
Смысл произошедшего прост: возможности ИИ растут быстрее, чем инфраструктура для его безопасной проверки. Теперь отрасли предстоит научиться испытывать потенциально опасные модели так, чтобы сам тест не превращался в реальную кибератаку.
У новости пока нет комментариев, станьте первыми кто оставит свой комментарий