К содержанию
Выпуск №1 · 9 июня 2026 / Новости

Мультимодальность и большие мультимодальные модели: как ИИ работает с разными типами данных

Долгое время модели ML работали только с одним типом данных. Одни системы обрабатывали текст, например, для translation и language modeling.

Редакция 9 июня 2026 г., 15:56 MSK

В Telegram

Долгое время модели ML работали только с одним типом данных. Одни системы обрабатывали текст, например, для translation и language modeling. Другие специализировались на изображениях: object detection и image classification. Третьи работали со звуком, включая speech recognition. При этом естественный интеллект не ограничен одной модальностью. Люди читают, разговаривают, воспринимают визуальную информацию и используют слух для самых разных задач, от прослушивания музыки до обнаружения необычных звуков.

Способность работать сразу с несколькими типами данных рассматривают как важное условие для систем, действующих в реальном мире. В system card для GPT-4V OpenAI пишет: «incorporating additional modalities (such as image inputs) into LLMs is viewed by some as a key frontier in AI research and development». Когда к LLMs (Large Language Models) добавляют дополнительные модальности, формируется класс моделей LMMs (Large Multimodal Models).

При этом не всякая мультимодальная система относится к LMMs. Например, text-to-image модели Midjourney, Stable Diffusion и Dall-E считаются мультимодальными, но языковой модели в них нет. Под мультимодальностью могут иметь в виду разные сценарии: вход и выход относятся к разным модальностям (text-to-image или image-to-text); входные данные объединяют несколько модальностей, например текст и изображения; система генерирует несколько типов выходных данных.

Ключевые факты

  • Ранее большинство моделей машинного обучения работали только с одной модальностью данных: текстом (например, перевод и языковое моделирование), изображениями (обнаружение объектов, классификация изображений) или аудио (распознавание речи).

  • Добавление дополнительных модальностей к LLM приводит к появлению LMM, Large Multimodal Models.

  • В системной карточке GPT-4V OpenAI отмечает, что добавление модальностей, таких как входные изображения, в LLM рассматривается частью сообщества как ключевое направление исследований и разработки в ИИ.

  • Не все мультимодальные системы являются LMM: модели text-to-image, включая Midjourney, Stable Diffusion и Dall‑E, считаются мультимодальными, но не содержат компонента языковой модели.

Как процитировать

«Мультимодальность и большие мультимодальные модели: как ИИ работает с разными типами данных». hegai.media, 9 июня 2026 г.. https://hegai.media/novosti/multimodalnost-i-bolshie-multimodalnye-modeli-kak-ii-rabotaet-s-raznym--d3069f78-b3e7-4b05-90af-5b059d571463

так материал выглядит в мессенджере