LM Studio разработала для Bionic систему Auto Review, которая проверяет команды до их выполнения. Например, git diff $base работает как ожидается, если $base содержит хеш коммита. Но если переменная принимает значение --output=/some/file, Git может записать результат в файловую систему. Чтобы выявлять такие сценарии, Bionic преобразует команды в абстрактные синтаксические деревья, отслеживает переменные и вложенные вызовы.
Как сообщает The New Stack, первый уровень проверки пропускал до 82% команд Bionic без обращения к другой модели. Автор уточнил, что это наблюдение, а не бенчмарк. Shell Judge использует парсер mvdan/sh для Bash, Zsh и SH, а для PowerShell предусмотрена собственная поддержка AST. Если переменная может принимать несколько значений, система рассматривает до 1 000 вариантов. Кроме того, LM Studio подготовила 11 651 тестовый случай для ошибочных команд и особенностей обработки аргументов отдельными инструментами.
Если Shell Judge не может признать команду безопасной, ее передают отдельному агенту Shell Reviewer. По данным LM Studio, прямой вопрос о допустимости запуска показал себя плохо: модель иногда одобряла рискованные действия, считая их необходимыми для выполнения запроса пользователя. Поэтому Reviewer отдельно оценивает риск, авторизацию и корректность, не зная проходных оценок.
Риск prompt injection через сообщения ассистента при этом сохраняется. Также Shell Judge исходит из предположения, что исполняемые файлы, включая git, не были скомпрометированы.
Ключевые факты
Первый уровень Auto Review пропускал без обращения к другой модели до 82% команд Bionic; автор назвал показатель наблюдением, а не бенчмарком.
LM Studio подготовила 11 651 тестовый случай для ошибочных команд и особенностей обработки аргументов отдельными инструментами.
При нескольких возможных значениях Bionic отслеживает до 1 000 вариантов.
Shell Reviewer оценивает риск, авторизацию и корректность команды, не зная проходных оценок.
Вопросы и ответы
- Как система проверяет команды без постоянного обращения к отдельной модели?
Shell Judge строит абстрактные синтаксические деревья, отслеживает переменные и вложенные вызовы, а при неоднозначности рассматривает до 1 000 вариантов. Так первый уровень пропускал без дополнительной модели до 82% команд, но это наблюдение автора, а не бенчмарк.
- Что происходит с командами, которые нельзя автоматически признать безопасными?
Их передают агенту Shell Reviewer, который отдельно оценивает риск, авторизацию и корректность команды, не зная проходных оценок. Такой механизм выбран потому, что при прямом вопросе модель иногда разрешала рискованные действия ради выполнения запроса.
- Какие ограничения нужно учитывать перед использованием?
Сохраняется риск prompt injection через сообщения ассистента, а Shell Judge предполагает, что исполняемые файлы, включая git, не скомпрометированы. Для проверки ошибочных команд и особенностей аргументов LM Studio подготовила 11 651 тестовый случай.
Контекст по теме
- ИИ-инструмент увеличил число рассмотренных дел в пакистанском эксперименте на 6,3%12 августа 2026 г.
- Towards AI описал подход LLM-as-a-Judge для автоматической оценки ответов ИИ6 июля 2026 г.
- Microsoft выпустила MCP-сервер для анализа логов MSBuild через ИИ-ассистентов30 июня 2026 г.
- Guardrails для LLM: как снизить риск нежелательных ответов ИИ в продакшене23 июня 2026 г.