Средняя производительность после внедрения ИИ может вырасти, пока часть команды начнет работать хуже. Это не парадокс, а дефект измерения: сильные сотрудники извлекают из модели больше пользы, а слабые могут быстрее принимать плохие решения.
Для фаундера вывод неприятный, но практичный. Показатель adoption и средняя экономия времени почти ничего не говорят о качестве внедрения, если компания не видит, кто именно ускорился, на каких задачах и сколько ошибок прошло дальше по процессу.
Один инструмент, противоположный результат
Quartz приводит эксперимент исследователей из UC Berkeley, Harvard и Columbia. Владельцы малого бизнеса в Кении шесть месяцев пользовались AI-консультантом на базе GPT-4 через WhatsApp. У наиболее успешных предпринимателей прибыль выросла примерно на 15% относительно половины участников, не получивших AI-помощь. У владельцев с серьезными проблемами с выручкой до эксперимента прибыль, напротив, снизилась почти на 10%.
Инструмент был одинаковым, объем и тип советов были похожими. Разница возникла после ответа модели.
Сильные предприниматели искали идеи под собственную ситуацию. Владелец интернет-кафе начал сдавать игровые аксессуары в аренду, оператор автомойки добавил популярное моющее средство и продажу холодных напитков, еще один участник нашел резервные источники питания для работы во время отключений электричества. Слабые участники чаще выбирали общие рекомендации вроде снижения цен или увеличения расходов на рекламу. Маржа падала, а дополнительная выручка не компенсировала потери.
Здесь проходит граница применимости привычного тезиса о том, что ИИ сильнее всего помогает слабым исполнителям. На узких задачах, например при подготовке писем или маркетинговых текстов, такой эффект действительно наблюдался. Но управление бизнесом требует выбрать подходящий совет и отбросить неподходящий. Модель выдает варианты, а суждение остается на стороне человека.
Главный навык не промптинг, а недоверие
Данные KPMG, которые также разбирает Quartz, показывают похожую картину внутри компании. За восемь месяцев сотрудники совершили 1,4 млн взаимодействий с ИИ. Около 90% работников пользовались им регулярно, но исследователи из University of Texas at Austin отнесли к сложным только практики примерно 5% сотрудников.
Эти 5% не обязательно обращались к модели чаще и не отличались одной лишь технической ловкостью. Они сначала формулировали проблему, задавали цели для открытой задачи, направляли рассуждение модели и проверяли результат. Остальные в основном ускоряли рутину: просили написать черновик, сделать выжимку или поменять формат, после чего принимали ответ без серьезной проверки.
Иными словами, корпоративный AI-пилот часто тестирует не только продукт. Он одновременно тестирует способность сотрудника спорить с уверенно написанным текстом. Если этот навык распределен неравномерно, единая лицензия на всю компанию увеличит и разрыв в результатах.
Эксперименты Dickinson College и Stevens Institute of Technology делают механизм особенно наглядным. ChatGPT дал неправильный ответ на простую задачу по алгебре, и 97% участников с AI-помощью отправили тот же неправильный ответ. Без ИИ участники справлялись чаще. Проблема была не в отсутствии навыка: увидев готовый ответ, люди сообщали о большей уверенности, тратили меньше времени и переставали проходить рассуждение самостоятельно.
При этом небольшое изменение процесса заметно улучшило результат. Когда отдельную группу попросили найти ошибку в ответе модели, доля правильных решений выросла до 31%. Инструкция пользоваться ChatGPT осознанно и анализировать его вывод подняла точность до 24% против 10% без напоминания.
Как считать AI-пилот
Отсюда следует более жесткое правило для внедрения: средняя экономия времени без распределения ошибок является неполной метрикой. Она может показать успешный пилот именно в тот момент, когда опытные сотрудники уже ускорились, а менее сильные стали быстрее передавать дальше непроверенные ответы.
Поэтому результат стоит разрезать минимум в трех измерениях. Первое: исходный уровень сотрудника, а не только отдел и должность. Второе: тип задачи, от рутинного преобразования текста до решения с открытым концом. Третье: наличие проверки, включая требование объяснить выбор, найти слабое место в ответе или передать сомнительный случай более опытному коллеге.
Свободный доступ логичнее оставлять тем, кто уже умеет оценивать результат. Для остальных полезнее структурированные запросы, контекст внутри инструмента и понятный маршрут эскалации. Это не запрет на ИИ для джунов. Это отказ притворяться, будто двадцатилетний опыт и первый год работы одинаково хорошо фильтруют совет модели.
KPMG, по данным Quartz, построила обучение вокруг привычек своих наиболее сильных 5% пользователей: формулировать проблему, направлять рассуждение и оспаривать первый ответ. Эти приемы удалось переносить на остальную команду. Значит, разрыв не обязательно закрепится, но одной раздачей доступа он точно не лечится.
Главный маркер для следующего этапа пилота прост: после сегментации должны снижаться ошибки у слабой группы, а не только расти скорость у сильной. Если среднее время выполнения падает, но разрыв в качестве увеличивается, компания не масштабирует производительность. Она масштабирует способность лучших сотрудников пользоваться ИИ и стоимость чужой самоуверенности.
