Google описала модель AI-автономии для SRE, которую aiHelpDesk называет близкой к своей архитектуре
Google опубликовала эссе о внедрении ИИ в production-операции и перечислила требования для безопасной автономии в SRE. Как пишет Towards AI, компания выделяет три ключевых элемента: прозрачность с логированием цепочки рассуждений агента, оценку риска в реальном времени перед выполнением действий, а также прогрессивную систему авторизации с участием человека по мере роста последствий.
В aiHelpDesk заявили, что уже используют похожую архитектуру в собственном Governance-слое. В материале сопоставляются подходы Google и aiHelpDesk. У Google агент Actus отвечает за pre-flight-проверки, обязательные dry-run и экстренную остановку агентных действий через «Red Button». В aiHelpDesk применяют policy engine, проверку blast radius и механизм gate denial, при этом все действия постоянно записываются в audit log.
Google также описала пять уровней автономии SRE: от L0 с полностью ручным управлением до L4, где инциденты устраняются без участия человека в многошаговом режиме. В aiHelpDesk сообщили, что базовым считают режим L2: агент предлагает действия, а человек утверждает каждый значимый шаг. Для перехода к L3 компания использует stability cert. В качестве примера для класса ошибок oom-kill приводится сертификация STABLE(7) attr=oom-kill (7/7) при judge consistency 94%. При этом L4 в aiHelpDesk прямо назвали нецелевым сценарием для mission critical production database и K8s-систем.
Отдельно в материале сравниваются подходы к оценке качества. Google упоминает Bronze/Silver/Gold tiers для данных, LLM-as-judge, ночные прогоны по прошлым инцидентам и IRM-Analyzer для восстановления траекторий человеческих решений. По данным компании, это позволило снизить MTTM на 44% для поддерживаемых инцидентов.
Ключевые факты
Google описала пять уровней автономии SRE, от L0 до L4.
В Google упомянут агент Actus для pre-flight-проверок, dry-run и экстренной остановки агентных действий.
aiHelpDesk использует stability cert для перехода к L3 и приводит пример STABLE(7) attr=oom-kill (7/7) с judge consistency 94%.
Google сообщила о снижении MTTM на 44% для поддерживаемых инцидентов.