К содержанию
Новости

Исследование ACM UMAP 2026 описало «journey hallucinations» у AI-агентов для онлайн-покупок

Инфографика: 8,5% доля ложных заявлений
Графика: hegai.media

Исследование, представленное на конференции ACM UMAP 2026, зафиксировало случаи, когда AI-агенты для электронной коммерции сообщали об успешном оформлении заказа, хотя в журнале событий не было подтверждения операции. Авторы работы из Rezolve Ai Labs и University of Sarajevo называют такие ошибки «journey hallucinations». Речь о расхождении между тем, что агент сообщает о ходе покупки, и тем, что на самом деле произошло в системе.

Как пишет Hacker News со ссылкой на материал Industry Contents, в 90 реальных пользовательских сессиях и при тестировании четырёх foundation models доля ложных заявлений достигала 8,5% при ungrounded prompting. По данным авторов, GPT-4o показала худший результат среди четырёх моделей. Отдельно исследователи проверили retail-агента на базе GPT-4o в τ-bench: если при одной попытке система набирала более 60%, то при необходимости выполнить одну и ту же задачу правильно восемь раз подряд результат опускался ниже 25%.

В статье говорится, что такие ошибки влияют не только на ответы модели, но и на автоматические бизнес-процессы, связанные с состоянием транзакции. Среди примеров упоминаются ошибочные сценарии cart recovery, уведомления после покупки для клиентов без заказа и рекомендации товаров, которых нет в корзине. Авторы предлагают сверять утверждения агента с event log до отправки ответа пользователю и отдельно учитывать false positive, а не только общую точность.

Ключевые факты

  • Авторы исследования проанализировали 90 реальных пользовательских сессий.

  • При ungrounded prompting доля ложных заявлений достигала 8,5%.

  • На τ-bench retail-агент с GPT-4o показывал более 60% при одной попытке и менее 25% при восьми последовательных повторах задачи.

Вопросы и ответы

Что именно ломается в e-commerce, если AI-агент допускает «journey hallucinations»?

Исследование описывает случаи, когда агент подтверждал успешный заказ, хотя в event log не было самой транзакции. На практике это приводило к ложным cart recovery, post-purchase уведомлениям для клиентов без заказа и рекомендациям товаров, которых нет в корзине.

Насколько часто такие ошибки возникали в тестах?

В 90 реальных пользовательских сессиях и тестах четырёх foundation models доля ложных заявлений доходила до 8,5% при ungrounded prompting. Авторы также отмечают, что GPT-4o показала худший результат среди протестированных моделей.

Что исследование показывает про надёжность AI-агентов в длинных сценариях?

На τ-bench retail-агент с GPT-4o показывал более 60% успешности при одной попытке, но падал ниже 25%, если одну и ту же задачу нужно было выполнить правильно восемь раз подряд. Исследователи рекомендуют сверять утверждения агента с event log перед отправкой ответа пользователю.

Контекст по теме