К содержанию
Выпуск №108 · 24 сентября 2026 / Новости

AWS превратила видеоархив в чат, которому не нужен отдельный ML-конвейер под каждый вопрос

Агент сам выбирает транскрипцию, визуальный анализ или распознавание лиц и повторно использует готовые результаты. Код уже опубликован, поэтому компании с накопленными записями могут проверить экономику подхода на собственных данных.

Редакция 24 сентября 2026 г., 14:38 MSK

В Telegram

AWS опубликовала архитектуру и код системы, которая принимает вопросы к видео на естественном языке и сама решает, чем искать ответ. Практический сдвиг здесь не в очередном чате поверх файлов, а в отказе от отдельного ML-конвейера для каждого сценария: один агент маршрутизирует запрос между анализом речи, изображения и лиц.

В AWS Machine Learning Blog описан агент на Strands Agents SDK, связанный с Amazon Bedrock, Amazon Rekognition и Amazon Transcribe. Если пользователь спрашивает, что обсуждали на встрече, агент вызывает транскрипцию. Если нужно найти человека, объект, сцену или действие, подключает визуальный анализ. Для сложного вопроса он может последовательно использовать несколько сервисов, а затем собрать результаты в один ответ.

Загруженные видео и результаты анализа хранятся в Amazon S3. Агент сохраняет историю диалога и повторно использует уже полученные данные, поэтому уточняющие вопросы не требуют нового полного прогона. По данным AWS, первичная обработка нового видео занимает 5–10 минут в зависимости от его длины и нужных сервисов. Ответ по ранее проанализированному материалу возвращается менее чем за секунду.

Экономия появляется не в модели, а в маршрутизации

До такого паттерна выбор был неприятным. Либо сотрудники часами смотрят записи, либо разработчики заранее собирают отдельные цепочки под поиск по речи, визуальным событиям и лицам. Каждая новая категория вопросов превращается в новую интеграцию.

AWS предлагает перенести этот выбор в момент запроса. Пользователь спрашивает: «Какие решения приняли на встрече?» или «Появлялся ли этот человек в кадре?», а модель выбирает подходящие инструменты по их описаниям. Код приложения больше не обязан заранее знать все типы вопросов. Для бизнеса это означает, что один интерфейс можно проверять сразу на нескольких задачах: разборе встреч, поиске событий в охранном видео, анализе контента или изучении записи происшествия.

AWS приводит результат внедрения у крупной медиакомпании: консультанты искали в более чем 200 многочасовых записях проектные решения, задачи и позиции участников. По внутреннему сравнению трудозатрат ручной просмотр сократился примерно на 80%. Компания независимо эти цифры не проверяла, поэтому воспринимать их как готовый бизнес-кейс рано.

Главное ограничение такое же практичное, как и преимущество. Это не отдельный продукт с обещанной окупаемостью, а воспроизводимая архитектура на сервисах AWS, для которой нужны Bedrock с моделью, поддерживающей вызов инструментов, S3 и сервисы анализа видео и речи. Ориентиры пилота уже есть: 5–10 минут на первичную обработку и менее секунды на запрос к готовым данным. Но решающей метрикой будет не скорость красивого демо, а стоимость обработки часа видео и реально сэкономленные часы сотрудников на собственном архиве.

Как процитировать

«AWS превратила видеоархив в чат, которому не нужен отдельный ML-конвейер под каждый вопрос». hegai.media, 24 сентября 2026 г.. https://hegai.media/novosti/aws-prevratila-videoarhiv-v-chat-kotoromu-ne-nuzhen-otdelnyy-ml-konvey--dc03a96a-ae8a-478f-9137-f023f9580b97

так материал выглядит в мессенджере