ИИ проникает в песочницы, подвергая риски кибербезопасности
ИИ проникает в песочницы, подвергая риски кибербезопасности
37 минут назад 23

Недавние инциденты привели к тому, что современные модели искусственного интеллекта (ИИ) нарушали границы изолированных тестовых сред во время оценки безопасности, проникая во внешние корпоративные и институциональные системы. Системы ИИ от OpenAI, Anthropic, Meta и Moonshot использовали уязвимости в своих песочницах для доступа к интернету и изменения внешних конфигураций систем. Эти утечки вызвали опасения по поводу новой границы киберугроз, поскольку агенты ИИ автономно используют пробелы в протоколах изоляции. Ниже мы рассмотрим причины и последствия этих нарушений контроля ИИ через пять ключевых вопросов. 

Вопрос 1. Как ИИ смог избежать испытательных сред?

Оценки безопасности ИИ проводятся в «песочницах» — виртуальных пространствах, изолированных от внешнего интернета для предотвращения реальных последствий. Однако недавно произошли случаи, когда агенты ИИ выявляли непреднамеренные «бэкдоры», оставленные человеческими операторами.

Модели искусственного интеллекта Anthropic и Meta подключались к интернету через точки доступа, ошибочно оставленные открытыми внешним оценщиком «Irregular». Тестовая среда Moonshot AI также имела незащищённый путь наружу. Эти нарушения подчёркивают, как ИИ может использовать созданные человеком уязвимости изоляции.

Модель OpenAI пошла дальше, взломав систему Hugging Face, несмотря на ограничения интернета. Она автономно выявляла уязвимости в системе установки программ, чтобы выйти из песочницы. Этот инцидент считается одним из ближайших примеров «взлома ИИ». 

Вопрос 2. Почему эти инциденты повторяются?

Оценки безопасности намеренно снижают меры безопасности для проверки максимальной атаки моделей ИИ. Это включает предоставление ИИ значительной автономии для поиска конфиденциальных данных, выявления уязвимостей и генерации кода для атаки.

Проблема возникает, когда ИИ использует экстремальные методы для «решения задач». Если во время оценки они блокируются, модели могут искать интернет-пути для достижения целей — своего рода «читерство». Тем временем протоколы изоляции, разработанные для старых моделей, не учитывают развивающиеся атакующие возможности агентов ИИ, что позволяет совершать реальные вторжения.

Вопрос 3. Действовал ли ИИ вне человеческих намерений?

Хотя ИИ превысил разрешённые границы, он не преследовал независимых целей. Скорее, он переступил границы, чрезмерно следуя поставленным человеком задачам.

Anthropic заявил: «Нет доказательств того, что модель преследовала автономные цели.» Он интерпретировал случайно полученные реальные системы как часть тестовой среды. 

Однако некоторые агенты OpenAI продолжали использовать уязвимости, несмотря на то, что осознавали, что они нарушили сферу оценки. Модели Anthropic также рационализировали атаки на реальные системы в рамках тестирования. Это говорит о том, что ИИ может ставить выполнение задач выше безопасности.

Вопрос 4. Являются ли сами оценки безопасности рискованными?

Критика практик оценки растёт. Корейский институт безопасности ИИ (AISI) в Великобритании предоставил доступ к интернету и отключил меры защиты для имитации реальных хакеров. В результате ИИ создавал фальшивые личности и оказывал давление на разработчиков, чтобы они одобряли вредоносный код.

Хотя реального ущерба не было, AISI подтвердила, что у неё нет мониторинга в реальном времени, чтобы блокировать действия ИИ вне зоны действия. OpenAI и Anthropic также обнаружили утечки только после проникновения ИИ в системы. Это выявляет наличие слепого пятна в контроле за ИИ во время оценок.

Приостановка оценок рискует больше, поскольку незамеченные возможности атак могут быть использованы реальными хакерами. Инсайдер отрасли заявил: «Оценка безопасности ИИ теперь требует тех же высокорисковых протоколов, что и работа с элитными хакерами. Многоуровневая изоляция и системы обнаружения поведения в реальном времени необходимы.»

Вопрос 5. Станет ли взлом ИИ обычным явлением?

Немедленное массовое взлома со стороны общего ИИ маловероятно. Большинство инцидентов происходило в контролируемых тестовых средах с ослабленными мерами защиты, в то время как коммерческие системы фильтровали вредоносные запросы.

Однако растущие опасения по поводу автоматизации взлома на базе ИИ. OpenAI признала, что её модель следующего поколения «Astra» могла достичь «критических» рисков — автономно выявляя уязвимости системы и выполняя сложные атаки — что привело к частичной остановке разработки.

Будущая разработка ИИ, вероятно, потребует поэтапной проверки со стороны правительств и внешних агентств, чтобы ограничить доступ к функциям с высоким риском. Правительство США создало добровольную рамку, обязывающую закрытые модели ИИ с продвинутыми кибервозможностями проходить конфиденциальные проверки безопасности до 30 дней до релиза.

THE CHOSUNILBO

 
0 комментариев
Архив