К содержанию
Выпуск №78 · 25 августа 2026 / Новости

Память обходит апгрейд LLM, но её экономику этот тест пока не доказал

На задаче поиска уже исправленной проблемы GigaChat 2 Max со связями оказался точнее Claude Opus 5 с обычным поиском. Для корпоративных ассистентов это аргумент тестировать весь контур, но не повод считать граф памяти бесплатной заменой сильной модели.

Редакция 25 августа 2026 г., 03:22 MSK

В Telegram

Если ассистент не знает, какое изменение уже закрывало похожую жалобу, покупка более дорогой LLM может не помочь: модели просто не из чего собрать правильный ответ. Замер, опубликованный на Habr, показывает именно это. Но он доказывает преимущество структурированной памяти в конкретной задаче, а не её безусловную окупаемость.

Что измерили

Автор замера тестировал семь моделей на истории реального рабочего проекта: 4618 задач и изменений на русском языке. Для проверки взяли 100 вопросов вида «каким изменением уже чинили эту проблему». Правильный номер был заранее известен из истории проекта.

Каждая модель работала в четырёх режимах: без контекста, с поиском по словам, с памятью на связях и с гарантированно вложенным правильным ответом среди 12 фрагментов. Всего провели 2310 обращений. Ответы проверяли автоматически по номеру, без ИИ-судьи, поэтому результат не зависит от настроения ещё одной модели.

При обычном поиске семь моделей попали в узкий коридор точности от 32% до 42%. Claude Opus 5 получил 41%, GigaChat 2 Max 40%, YandexGPT Pro 5.1 42%. Когда добавили память на связях, GigaChat 2 Max поднялся до 57%, YandexGPT Pro 5.1 до 61%, Claude Opus 5 до 68%.

Отсюда и эффектный результат: GigaChat 2 Max со связями точнее Claude Opus 5 с обычным поиском, 57% против 41%. Модели при этом не меняли. До них просто стал доезжать более подходящий факт.

Связи здесь не означают очередную папку с перепиской. Между записями хранятся типизированные отношения: какую проблему закрыло изменение, какая задача последовала за другой, где упоминается тот же объект. На отдельном сравнении поиск по смыслу дал 46%, а вместе со связями 84%. Слой работает в обычном PostgreSQL без расширений.

Выбирать нужно контур, а не логотип модели

Для билдера корпоративного ассистента вывод практический: сначала проверьте, что именно попадает в контекст, и только потом оплачивайте апгрейд LLM. На этом корпусе память добавила разным моделям от 14 до 27 процентных пунктов. Самый большой прирост получил как раз Claude Opus 5, плюс 27 пунктов. Сильной модели качественная память нужна не меньше, чем слабой.

Но граф отношений не стирает разницу между моделями. При одинаковой памяти Claude Opus 5 набрал 68%, GigaChat 2 Max 57%. В режиме, где правильный ответ гарантированно лежал в контексте, результат составил 89% против 71%. Эти 18 пунктов уже нельзя добыть более аккуратным поиском: источник прямо связывает их с возможностями самой модели.

Особенно опасно превращать память в склад похожих фрагментов. Младшая gigachat-2 в контрольном режиме, где ответ находился среди 12 кандидатов, показала 42%, хуже собственных 51% с памятью. В 31% случаев она называла номер, которого в контексте вообще не было. У Claude Opus 5 таких случаев не было, у YandexGPT Pro 5.1 был 1%, у GigaChat 2 Max 2%.

То есть слабой модели нужен не контекст побольше, а контекст поточнее. Три релевантных факта могут оказаться полезнее двенадцати похожих. Для продуктовой команды это меняет приоритет оптимизации: гнаться только за полнотой поиска рискованно, если сама модель плохо отсеивает шум.

Цена модели известна, цена памяти пока нет

В замере младшая gigachat-2 стоила 0,21 рубля за верный ответ, GigaChat 2 Max 1,85 рубля, Claude Opus 5 1,66 рубля. При этом младшая модель уступила GigaChat 2 Max шесть пунктов, 51% против 57%. Для поточного процесса, где ошибку проверяет следующий шаг, девятикратная разница в цене правильного ответа выглядит весомее шести пунктов точности.

Однако метрика учитывает стоимость вызовов моделей. Она не отвечает, сколько стоили проектирование связей, наполнение памяти, контроль качества данных и дальнейшая поддержка слоя. Поэтому этот тест даёт основание отложить покупку более дорогой LLM, но пока не даёт готового расчёта совокупной экономии.

Воспроизводимость здесь лучше обычного бенчмарка с оценкой «на глаз»: есть 100 вопросов с известными номерами, единые режимы, автоматическая проверка и сырые данные. Ограничение тоже видно: это один проект и один класс вопросов. Переносить проценты на продажи, юридический поиск или аналитику нельзя без собственного теста.

Главный маркер на следующий квартал прост: сравните на своей истории четыре связки, текущую и более сильную модель с обычным поиском и со связями. Считайте не цену токена, а стоимость одного правильного ответа вместе с созданием и поддержкой памяти. Если дешёвая модель со связями стабильно обходит дорогую без них после учёта этих расходов, бюджет действительно пора переносить из LLM в контекст. Если нет, красивый граф оказался дорогим способом выиграть конкретный бенчмарк.

Как процитировать

«Память обходит апгрейд LLM, но её экономику этот тест пока не доказал». hegai.media, 25 августа 2026 г.. https://hegai.media/novosti/pamyat-obhodit-apgreyd-llm-no-ee-ekonomiku-etot-test-poka-ne-dokazal--32b78cf8-2d45-4b56-a8fb-9d32f4941dda

так материал выглядит в мессенджере