Исследователи предложили способ проверять, какие данные собирают LLM-агенты при выполнении задач

Исследователи представили PrivacyPeek, бенчмарк для оценки утечек приватных данных на этапе их получения LLM-агентами. Работа посвящена агентам, которые автономно вызывают внешние инструменты и выполняют многошаговые задачи. По словам авторов, такие системы нередко получают больше чувствительной информации, чем нужно для выполнения пользовательского запроса.
Как сообщает arXiv cs.AI (Artificial Intelligence), существующие проверки приватности в основном оценивают ответы агента или его внешние действия. При этом момент, когда данные впервые попадают в контекст модели, обычно не анализируется. В работе говорится, что избыточно собранная информация может быть раскрыта из-за ошибки агента или атаки.
PrivacyPeek включает два механизма оценки. Первый, Acquisition Inspection, анализирует траекторию вызовов инструментов и данные, которые получает агент, чтобы выявить получение чувствительной информации вне рамок задачи. Второй механизм, Probe Elicitation, проверяет, насколько легко атакующий может извлечь уже собранные, но ранее не раскрытые данные с помощью дополнительных запросов. Авторы протестировали подход на 10 LLM-агентах из 4 семейств моделей.
Ключевые факты
PrivacyPeek включает 1182 сценария проверки приватности.
Бенчмарк охватывает 7 типов поведения при получении данных и 16 прикладных областей.
Метод Acquisition Inspection анализирует вызовы инструментов и входящие данные агента.
Авторы провели эксперименты на 10 LLM-агентах из 4 семейств моделей.
Вопросы и ответы
- Чем PrivacyPeek отличается от обычных проверок безопасности LLM-агентов?
Бенчмарк проверяет не ответы агента после выполнения задачи, а момент получения данных. Метод Acquisition Inspection анализирует вызовы инструментов и входящие данные, чтобы выявить случаи, когда агент собирает чувствительную информацию вне рамок пользовательского запроса.
- Насколько широкий набор сценариев покрывает бенчмарк?
PrivacyPeek включает 1182 сценария проверки приватности, охватывает 7 типов поведения при получении данных и 16 прикладных областей. Это позволяет тестировать агентов в разных типах многошаговых задач и интеграций с внешними инструментами.
- На каких системах авторы проверяли метод?
Эксперименты провели на 10 LLM-агентах из 4 семейств моделей. Кроме анализа сбора данных, PrivacyPeek также проверяет через Probe Elicitation, насколько легко атакующий может извлечь уже собранные агентом, но ранее не раскрытые данные.
Контекст по теме
- AgentSLABench предложил оценивать ИИ-агентов с учётом затрат ресурсов4 августа 2026 г.
- Исследователи предложили проверяемый фреймворк для автоматического сбора данных из открытого веба2 июля 2026 г.
- Исследователи представили PolicyGuard для проверки соблюдения политик в LLM-агентах1 июля 2026 г.
- Исследование описывает риски «trajectory collapse» при использовании LLM‑агентов в юридическом e‑discovery19 июня 2026 г.