К содержанию
Новости

Исследователи предложили систему аудита скрытых system prompt в коммерческих ИИ-продуктах

Инфографика: 3249 инструкций system prompt
Графика: hegai.media

Исследователи представили фреймворк Artificial Intelligence System Prompt Assurance (AISPA) для аудита system prompt в приложениях на базе больших языковых моделей. System prompt, это инструкции, которые разработчики задают моделям, чтобы управлять их поведением. При этом такие настройки обычно не раскрываются ни пользователям, ни регуляторам.

Как сообщает arXiv cs.AI (Artificial Intelligence), авторы использовали AISPA для анализа 3249 инструкций из system prompt в 88 коммерческих ИИ-продуктах. Каждую инструкцию они классифицировали как защитную для пользователя или проблемную, после чего оценивали по восьми критериям, связанным с интересами пользователей.

Аудит показал, что компании по-разному подходят к проектированию system prompt. У некоторых организаций на один продукт приходилось более 60 защитных инструкций, у других, менее 5. Исследователи также отмечают, что защитные механизмы встречаются почти повсеместно, но чаще всего затрагивают лишь часть аспектов оценки. Хотя 98,9% продуктов содержали хотя бы одну защитную инструкцию, все восемь измерений были охвачены только у 24% продуктов.

Ключевые факты

  • AISPA оценивает system prompt по восьми измерениям, значимым для пользователей

  • Авторы проанализировали 3249 инструкций из 88 коммерческих ИИ-продуктов

  • В исследовании инструкции разделялись на защитные для пользователя и проблемные

  • 98,9% исследованных продуктов содержали хотя бы одну защитную инструкцию, но только 24% охватывали все восемь измерений оценки

Вопросы и ответы

Что именно проверяет AISPA и как это может использовать компания при аудите ИИ-продукта?

Фреймворк оценивает скрытые system prompt по восьми измерениям, связанным с интересами пользователей. Исследователи применили его к 3249 инструкциям из 88 коммерческих ИИ-продуктов, разделяя инструкции на защитные и проблемные.

Насколько сильно отличаются подходы компаний к настройке скрытых инструкций?

Разброс оказался существенным: у части компаний на один продукт приходилось более 60 защитных инструкций, тогда как у других менее 5. Это показывает, что уровень встроенных защит зависит не только от модели, но и от политики конкретного разработчика.

Насколько распространены полноценные защитные настройки в коммерческих ИИ-продуктах?

Хотя 98,9% исследованных продуктов содержали хотя бы одну защитную инструкцию, только 24% покрывали все восемь измерений оценки AISPA. То есть базовые защитные механизмы есть почти у всех, но комплексное покрытие встречается редко.

Контекст по теме