Несколько заметных китайских AI‑стартапов, выросших из академической среды Tsinghua University, сейчас сосредоточены на направлении, которое называют world models. В отрасли его часто рассматривают как следующий рубеж развития искусственного интеллекта. Это заметно отличается от гонки больших языковых моделей 2023–2025 годов, когда ключевыми факторами считались масштаб параметров и объём обучающих данных. Новый подход ставит более фундаментальную задачу: попытку смоделировать причинно‑следственную структуру реального мира. Среди компаний, работающих в этой области, Zhipu AI, Shengshu Technology, Momenta и Mianbi Intelligence.
Разработчик модели GLM, компания Zhipu AI, оцениваемая почти в one trillion RMB, описывает своё представление о world models как создание пространств структурированного рассуждения с длинным горизонтом планирования. CEO Tang Jie обращает внимание на важное ограничение нынешних языковых моделей: они хорошо улавливают статистические корреляции, но не понимают причинную структуру физического мира. Агентная стратегия Zhipu строится вокруг практического взаимодействия моделей с цифровой средой. Речь, например, о работе с интерфейсами смартфонов, бронировании отелей или планировании поездок. Такой подход рассматривается как шаг к системам, которые способны учитывать изменения состояний и реагировать на обратную связь среды.
Shengshu Technology, основанная профессором Tsinghua Zhu Jun и CEO Tang Jiayu, приходит к теме world models со стороны генерации видео. Разработанная компанией архитектура U‑ViT предлагается как альтернатива Stable Diffusion. Команда рассматривает видеогенерацию как симуляцию во времени: если модель способна точно предсказывать следующий кадр, по сути она начинает работать как движок виртуального мира с высокой точностью.
Компания Momenta, занимающаяся автономным вождением и возглавляемая выпускником Tsinghua Cao Xudong, почти десять лет собирает реальные данные о вождении. На их основе строятся end‑to‑end системы, которые учитывают физические взаимодействия, от сцепления шин до прогнозирования поведения пешеходов и семантики светофоров. Как пишет Pandaily, для Momenta развитие world models выглядит естественным продолжением задач автономного вождения, где требуется понимать и предсказывать поведение замкнутых физических сред.
Ключевые факты
Zhipu AI, разработчик модели GLM, оценивается примерно в один триллион RMB и продвигает концепцию world model как среды для долгосрочного структурированного рассуждения.
Shengshu Technology, основанная профессором Tsinghua Zhu Jun и CEO Tang Jiayu, разработала архитектуру U‑ViT, альтернативу Stable Diffusion, и рассматривает генерацию видео как временную симуляцию мира.
Компания Momenta под руководством выпускника Tsinghua Cao Xudong почти десятилетие собирает реальные данные вождения и строит end‑to‑end системы, моделирующие физические взаимодействия на дороге.
Компании Zhipu AI, Shengshu Technology, Momenta и Mianbi Intelligence связаны с академической экосистемой Tsinghua и развивают собственные технологические стеки, включая GLM, U‑ViT и полный стек автономного вождения.