Kimi K3 уже доступна в Amazon Bedrock. Это значит, что компании на AWS могут проверить модель с контекстом до 1 млн токенов на своих репозиториях, документах и изображениях без отдельного развертывания и передачи данных провайдеру модели. Главная практическая деталь запуска: Bedrock позволяет явно кешировать повторяющиеся части промпта, сокращая задержку и стоимость последующих вызовов.
В блоге AWS Kimi K3 названа самой мощной моделью Moonshot AI и первой открытой моделью с 2,8 трлн параметров. Это заявление самого разработчика, поэтому воспринимать число как доказательство качества не стоит. Для корпоративного применения полезнее доступные функции: модель поддерживает изображения, миллионный контекст и подключается через OpenAI-совместимые Responses и Chat Completions API, а также через Invoke и Converse API самого Bedrock.
Запросы можно направлять через global profile, который выбирает любой поддерживаемый коммерческий регион AWS. По данным AWS, такой вариант примерно на 10% дешевле geographic profile. Для требований по резидентности доступен US profile, оставляющий обработку внутри США. Абсолютные тарифы источник не приводит, поэтому сравнить Kimi K3 с текущей моделью по цене токена из анонса нельзя.
Экономика начинается со второго вызова
Длинный контекст дорог не только размером. В агентном сценарии система снова и снова отправляет инструкции репозитория, описания инструментов или набор справочных документов. В Kimi K3 можно отметить стабильный префикс промпта длиной от 1024 токенов. Его запись в кеш стоит дороже обычного ввода, зато совпавшие последующие запросы получают скидку на входные токены, меньшую задержку и не расходуют лимит input tokens per minute. Кеш хранится не менее 30 минут.
Повторное использование стабильного префикса может снизить стоимость кодовых агентов и работы с массивами документов. Если агент десятки раз обращается к одной базе контекста, цена одиночного запроса почти ничего не говорит о стоимости workflow. Считать нужно всю трассу: сколько было записано в кеш, сколько вызовов попало в него и как часто менялся префикс. При редких запросах или постоянно обновляемом контексте повышенная цена записи может съесть выгоду.
AWS также утверждает, что запросы и ответы остаются в контуре AWS, не передаются Moonshot AI и не используются для обучения модели. Для инференса постоянно включены zero data retention и запрет доступа операторов AWS к промптам и ответам. Поэтому Kimi K3 можно добавить в сравнительный прогон без смены существующего контура безопасности.
Поэтому тестировать стоит не заявленные параметры, а собственные длинные сценарии. Решение о переходе должно определяться долей попаданий в кеш, полной стоимостью агентной цепочки и качеством на рабочих репозиториях и документах. Миллион токенов сам по себе остается красивой цифрой. Экономическим преимуществом он становится только тогда, когда один и тот же контекст действительно используется повторно.