К содержанию
Новости

Исследователи предложили способ проверять, какие данные собирают LLM-агенты при выполнении задач

Инфографика: 1182 сценария проверки приватности
Графика: hegai.media

Исследователи представили PrivacyPeek, бенчмарк для оценки утечек приватных данных на этапе их получения LLM-агентами. Работа посвящена агентам, которые автономно вызывают внешние инструменты и выполняют многошаговые задачи. По словам авторов, такие системы нередко получают больше чувствительной информации, чем нужно для выполнения пользовательского запроса.

Как сообщает arXiv cs.AI (Artificial Intelligence), существующие проверки приватности в основном оценивают ответы агента или его внешние действия. При этом момент, когда данные впервые попадают в контекст модели, обычно не анализируется. В работе говорится, что избыточно собранная информация может быть раскрыта из-за ошибки агента или атаки.

PrivacyPeek включает два механизма оценки. Первый, Acquisition Inspection, анализирует траекторию вызовов инструментов и данные, которые получает агент, чтобы выявить получение чувствительной информации вне рамок задачи. Второй механизм, Probe Elicitation, проверяет, насколько легко атакующий может извлечь уже собранные, но ранее не раскрытые данные с помощью дополнительных запросов. Авторы протестировали подход на 10 LLM-агентах из 4 семейств моделей.

Ключевые факты

  • PrivacyPeek включает 1182 сценария проверки приватности.

  • Бенчмарк охватывает 7 типов поведения при получении данных и 16 прикладных областей.

  • Метод Acquisition Inspection анализирует вызовы инструментов и входящие данные агента.

  • Авторы провели эксперименты на 10 LLM-агентах из 4 семейств моделей.

Вопросы и ответы

Чем PrivacyPeek отличается от обычных проверок безопасности LLM-агентов?

Бенчмарк проверяет не ответы агента после выполнения задачи, а момент получения данных. Метод Acquisition Inspection анализирует вызовы инструментов и входящие данные, чтобы выявить случаи, когда агент собирает чувствительную информацию вне рамок пользовательского запроса.

Насколько широкий набор сценариев покрывает бенчмарк?

PrivacyPeek включает 1182 сценария проверки приватности, охватывает 7 типов поведения при получении данных и 16 прикладных областей. Это позволяет тестировать агентов в разных типах многошаговых задач и интеграций с внешними инструментами.

На каких системах авторы проверяли метод?

Эксперименты провели на 10 LLM-агентах из 4 семейств моделей. Кроме анализа сбора данных, PrivacyPeek также проверяет через Probe Elicitation, насколько легко атакующий может извлечь уже собранные агентом, но ранее не раскрытые данные.

Контекст по теме