К содержанию
Новости

Исследование: LLM в задаче найма чаще людей формируют стереотипы о кандидатах

Исследование: LLM в задаче найма чаще людей формируют стереотипы о кандидатах

Исследователи из Princeton University и University of Chicago выяснили, что большие языковые модели могут формировать устойчивые стереотипы о кандидатах при найме, даже если между ними нет реальных различий в способностях. В эксперименте ChatGPT, Claude и Gemini участвовали в симулированной игре по подбору сотрудников. Моделям нужно было нанимать людей на 20 типов должностей: от врачей и юристов до уборщиков и помощников по уходу за детьми.

Как сообщает MIT Technology Review, после каждого найма модели получали обратную связь и со временем начинали распределять представителей вымышленных этнических групп по профессиям, опираясь на случайные ранние результаты. Например, если кандидат из группы Aima однажды плохо справлялся с работой врача, модель затем реже выбирала представителей этой группы на похожие позиции и чаще назначала их на менее квалифицированные роли.

Авторы сравнили поведение моделей с результатами похожего психологического эксперимента с участием людей. На шкале сегрегации, где значение 2 означает полное закрепление каждой группы за своей «нишей», люди получили средний показатель 0,84. У моделей результат оказался примерно на 65% выше. Reasoning-модель OpenAI o3 набрала 1,83. Соавтор исследования Райан Лю объяснил, что LLM быстро делают обобщения на основе ограниченного числа примеров, потому что именно так они обучаются решать задачи.

Исследователи также считают, что усиление памяти и персонализации в чат-ботах может повысить риск подобных искажений. По словам Анджелины Ван из Cornell University, модели, которые используют историю прошлых взаимодействий, способны слишком сильно опираться на уже встречавшиеся шаблоны поведения. При этом простое сокращение объема памяти не рассматривается как решение, поскольку пользователи ожидают, что чат-боты будут помнить контекст общения.

Ключевые факты

  • В эксперименте модели принимали решения о найме в течение 40 раундов и получали обратную связь после каждого выбора

  • Кандидаты в исследовании принадлежали к четырем вымышленным группам: Tufa, Aima, Reku и Weki

  • Reasoning-модели OpenAI o3 и DeepSeek R1 показали более сильные перекосы, чем менее продвинутые модели

  • Исследование было представлено на конференции ICML в Сеуле в июле