Исследование ACM UMAP 2026 описало «journey hallucinations» у AI-агентов для онлайн-покупок

Исследование, представленное на конференции ACM UMAP 2026, зафиксировало случаи, когда AI-агенты для электронной коммерции сообщали об успешном оформлении заказа, хотя в журнале событий не было подтверждения операции. Авторы работы из Rezolve Ai Labs и University of Sarajevo называют такие ошибки «journey hallucinations». Речь о расхождении между тем, что агент сообщает о ходе покупки, и тем, что на самом деле произошло в системе.
Как пишет Hacker News со ссылкой на материал Industry Contents, в 90 реальных пользовательских сессиях и при тестировании четырёх foundation models доля ложных заявлений достигала 8,5% при ungrounded prompting. По данным авторов, GPT-4o показала худший результат среди четырёх моделей. Отдельно исследователи проверили retail-агента на базе GPT-4o в τ-bench: если при одной попытке система набирала более 60%, то при необходимости выполнить одну и ту же задачу правильно восемь раз подряд результат опускался ниже 25%.
В статье говорится, что такие ошибки влияют не только на ответы модели, но и на автоматические бизнес-процессы, связанные с состоянием транзакции. Среди примеров упоминаются ошибочные сценарии cart recovery, уведомления после покупки для клиентов без заказа и рекомендации товаров, которых нет в корзине. Авторы предлагают сверять утверждения агента с event log до отправки ответа пользователю и отдельно учитывать false positive, а не только общую точность.
Ключевые факты
Авторы исследования проанализировали 90 реальных пользовательских сессий.
При ungrounded prompting доля ложных заявлений достигала 8,5%.
На τ-bench retail-агент с GPT-4o показывал более 60% при одной попытке и менее 25% при восьми последовательных повторах задачи.
Вопросы и ответы
- Что именно ломается в e-commerce, если AI-агент допускает «journey hallucinations»?
Исследование описывает случаи, когда агент подтверждал успешный заказ, хотя в event log не было самой транзакции. На практике это приводило к ложным cart recovery, post-purchase уведомлениям для клиентов без заказа и рекомендациям товаров, которых нет в корзине.
- Насколько часто такие ошибки возникали в тестах?
В 90 реальных пользовательских сессиях и тестах четырёх foundation models доля ложных заявлений доходила до 8,5% при ungrounded prompting. Авторы также отмечают, что GPT-4o показала худший результат среди протестированных моделей.
- Что исследование показывает про надёжность AI-агентов в длинных сценариях?
На τ-bench retail-агент с GPT-4o показывал более 60% успешности при одной попытке, но падал ниже 25%, если одну и ту же задачу нужно было выполнить правильно восемь раз подряд. Исследователи рекомендуют сверять утверждения агента с event log перед отправкой ответа пользователю.
Контекст по теме
- Кибербезопасники заявили о преобладании ботов над людьми в веб-трафике25 июля 2026 г.
- В публикации The Engineer заявили, что AI-агенты уступают обычному ИИ по эффективности в 136,5 раза13 июля 2026 г.
- Крупные хедж-фонды сходятся к одинаковой архитектуре AI-агентов для трейдинга4 июля 2026 г.
- Для Chrome появился инструмент AgentShare Agent Readiness для проверки сайтов на готовность к AI-ботам30 июня 2026 г.