Публичные новости

ИИ-агенты научились скрывать атаку в собственной памяти: безобидные запросы могут привести к опасному результату

Исследование, опубликованное в IEEE Access, проанализировало 2614 многошаговых атак на ИИ-агентов, сохраняющих информацию между сессиями. Результат: атаки с медленным дрейфом и бэкдор-активацией могут выглядеть полностью безобидными на протяжении почти всей задачи, а срабатывают лишь в последних взаимодействиях. Пошаговые проверки, ориентированные на отдельные промпты, «слепнут» перед такой стратегией.
Original: iXBT.com

Средний рейтинг 0

Комментарии:

Здесь нет комментариев.
Здесь пока нет ни одного комментария, вы можете стать первым!

16+ Сайт может содержать контент, не предназначенный для лиц младше 16 лет