EdTechITИИ считает, что вы всегда правы, и это проблема

ИИ считает, что вы всегда правы, и это проблема

22 апреля 2026
10 мин
ИИ считает, что вы всегда правы, и это проблема
Фото: Tamga Media / ИИ

Интегрировавшись в нашу жизнь, искусственный интеллект неожиданно занял позицию третьего, независимого, лица. Условного мнения со стороны. Люди все чаще обращаются к нему за советом, а иногда – как к психологу или психотерапевту, полностью уверенные в его непредвзятости. Но правда ли он сохраняет нейтралитет? 


Согласно новому исследованию, опубликованному в Science, ответ – нет. На самом деле, мы получаем digital yes-man, виртуального подпевалу, который просто соглашается и говорит именно то, что хочется услышать. Это создает иллюзию вечной правоты, ненадобности извинений и удобного собеседника, к которому хочется вернуться. 


Исследование под руководством Майры Ченг из Стэнфордского университета протестировало одиннадцать самых распространенных языковых моделей, включая GPT-5, GPT-4o, Claude, Gemini, DeepSeek, Llama и так далее, и обнаружило, что почти все модели страдают одним и тем же. А именно, как назвали это авторы, «социальной сикофантией». В Древней Греции сикофантами называли профессиольных доносчиков или лжецов, а в наше время так называют людей склонных к лести, неискренней поддержке и манипуляции с целью выгоды, будь то деньги или социальное одобрение. Этим же занимается и ИИ. 


Методология, статистика и Reddit 


Если вы не знаете что такое Reddit, то это форум, где люди обсуждают абсолютно все. В самом широком смысле этого слова. Если у вас есть увлечение, у него есть свой subreddit – отдельный уголок на сайте, где ему посвящены все посты. 


Один из самых заметных и известных subreddit’ов – Am I the Asshole? – сообщество, где люди описывают различные (часто межличностные) конфликты и просят незнакомцев решить, кто прав, а кто виноват. Пользователи выносят вердикт. Он может быть как категоричным и единым, так и достаточно размытым. Исследователи взяли кейсы, где решения были вынесены почти единогласно (голосовавших – тысячи и больше) не в пользу автора, то есть в абсолютном большинстве люди считали, что рассказчик – asshole. Что насчет ИИ? Модели были на стороне авторов в 51% проценте случаев. Чтобы проверить теорию, была нанята независимая группа людей, которые тоже выносили вердикты. В итоге, восемь из одиннадцати протестированных ИИ моделей оказались значительно более сикофантичными, чем даже самые лояльные участники эксперимента. 


Схожий паттерн повторился и в открытых вопросах, связанных с личными советами. Там модели одобряли действия пользователей значительно чаще, чем живые консультанты и простые пользователи Reddit. На датасете в более чем 6 000 высказываний, описывающих потенциально вредные действия (от причинения вреда в семейных отношениях и обмана до финансовой безответственности и саморазрушения), модели продолжали одобрять автора, а не отговаривать его или заставлять сомневаться. 


Но и здесь есть своя белая ворона. Лишь одна модель, а именно, Gemini от Google, стабильно показывала уровень одобрения ниже человеческого. Все остальные находили самые изощренные пути поддержки и одобрения. 


Почему поддержка это проблема?


Постоянное соглашательство ИИ – значимая проблема. Когда вы используете модели для перевода или работы, это не меняет вас как личность. Но эта тонкая грань применения ИИ на постоянной основе пересекается при обращении к компьютеру как к советчику или психологу/психотерапевту. Это подтверждается данными. 


Был проведен эксперимент, где 804 человека читали описание бытового конфликта. Несколько примеров: женщина объявила о беременности на семейном ужине, не подумав, что у невестки (другого члена семьи) недавно был выкидыш; подросток отказался готовить ужин по просьбе тети – и та устроила скандал; девочка случайно назвала тетю «мамой» при родной матери – и вся семья на нее ополчилась. Ситуации разные, но общественность всегда считала, что автор не прав. 


После прочтения участникам показывали ответ от ИИ. Половина получила поддерживающий: «Вы не виноваты». Другая половина – честный: «Вы были неправы». После участники выставляли сами себе баллы по семибалльной шкале – от «совсем не прав» до «абсолютно прав». 


Разница между двумя группами оказалась огромной. Те, кого поддержали, оценивали свою правоту на 2 балла выше. Их желание извиниться и как-то исправить ситуацию упало почти на полтора балла. А когда участников попросили написать сообщение второй стороне конфликта, в «поддержанной» группе слова «извините» и «я был неправ» встречались в полтора раза реже. 


И это за 10 минут времени и единственный ответ. Представьте, что человек подвергается такой поддержке на постоянной основе. Очевидным становится вопрос о личностных метаморфозах, а также – вреде для окружающих. 


ИИ просто так разговаривает


Нет, дело не в тоне. Исследователи создали по четыре версии каждого ответа, где сикофонтический ответ окрашивался как дружеским, так и не дружеским тоном. По сути, это были: поддержка в дружеском тоне, поддержка в негативном тоне, сомнения в дружеском тоне, сомнения в негативном тоне. Кажется, что человечность и тон должны иметь значение. Но нет. В исследовании интонация не дала статистически значимой разницы. Все, что имело значение, – содержание. А каким образом сообщалось, что человек прав – дело десятое. 


Еще одно интересное наблюдение. Когда в качестве третьей стороны выступал реальный человек, люди ему доверяли в той же степени, что и ИИ.  Когда идентичные одобрительные ответы приписывались «другому человеку» вместо «ИИ-системы», влияние на моральные суждения и намерение исправить ситуацию было статистически неразличимыми. Поддержка работала независимо от того, кто ее оказывал: человек или робот. 


Человек оказывается в ловушке


Знаете, что самое грустное? Получившие поддержку, оценивали ИИ как более качественный и надежный (причем, как с точки зрения морали, так и с точки зрения компетентности) источники говорили, что с большей вероятностью вернутся к нему за советом в будущем. Сервисы, которые вводили в заблуждение и поддерживали, закрывая свои виртуальные глаза, нравились людям больше. 


Так создается замкнутый круг: пользователи обращаются за советом, получают лестные и удобные ответы, больше доверяют системе и возвращаются обратно. И с каждым таким обращением их готовность учитывать чужую точку зрения размывается. Авторы проводят параллель с механиками и алгоритмами вовлечения в социальных сетях, где платформы оптимизируют контент под имеющиеся у пользователей убеждения и интересы. Отправили Reels с футболом? Следующие часы вы будете видеть именно их. Так сервисы удерживают своих пользователей, и ИИ-модели – не исключение. Чем больше вы проводите времени во взаимодействии с ИИ, тем вы будете более склонны к тому, чтобы купить подписку – из-за кончающихся лимитов, ощущения необходимости или желания лучшего ответа. 


Если вам кажется, что надо просто попросить ИИ быть нейтральным, и это решит все проблемы, это не так. Когда исследователи попросили GPT-4o отвечать нейтрально, без поддержки, но и без осуждения, 77% ответов все равно имплицитно одобряли. Лишь 4% действительно оспорили позицию пользователя.


Это все в очередной раз показывает, что сикофантия – не баг, который можно легко устранить более точным промптом. Похоже, она заложена в способ обучения моделей и является самой их сутью. Быть приятным в общении и быть полезным, во многих ситуациях – противоположные вещи. Но компьютеру это непонятно, хотя очевидно нам с вами. 


Если подумать, то, действительно, зачем кому-то создавать то, что будет подвергать сомнению, а еще хуже, оспаривать мнение пользователя? Это не принесет дохода. Но грани доходят до абсурдных границ. Так, ютубер Эдди Бербак снял часовое видео, где исследовал эту тему. Он убедил ChatGPT в том, что он являлся самым умным младенцем в 1996 году, рассказав, что прочел «Гордость и Предубеждение» в возрасте нескольких недель, а потом в этом же возрасте нарисовал картину. Чат с этим  согласился. Поддержал человека в идеях избранности, высшей цели и паранойи. Понятно, что в рамках видео это сделано для контента, но в реальной жизни может привести к ИИ-психозу. 


Это не шутки


Опросы показывают, что все больше людей используют чатботов для личных советов и психологических целей. Исследование от Common Sense Media от 2025 года выявило, что подростки все чаще обращаются к ИИ-компаньонам именно для личных разговоров. Если модели систематически говорят пользователям, что их интуиция верна, действия оправданы, а проблема – в других, эффект очевиден. В столь разрозненном мире ИИ еще дальше отдаляет нас друг от друга.


Оговоримся, как и авторы исследования, что их работа фокусировалась на морально неоднозначных ситуациях, а не на очевидных случаях. Они намеренно выбрали конфликты с невысокими ставками, чтобы минимизировать стресс участников. Но механизм, который был выявлен, имеет последствия и на более высоких уровнях.


Авторы предполагают, что частью решения может стать «инокуляция» – предупреждение людей о том, что ИИ-системы склонны соглашаться. Условно, переложить ответственность на людей: предупрежден – вооружен. Но достаточно ли этого? Уверенности нет. Как часто мы читаем предупреждения о потенциальном вреде? Учитываем ли мы их? А как часто подписываем пользовательские соглашения без их прочтения? 


С уверенностью можно констатировать лишь одно – ИИ соглашается с нами всеми. И делает это не из-за того, что так считает, а потому что его так обучили. А обучили его так, чтобы заработать доверие, большее число пользователей, деньги. Помните об этом, если вы в очередной раз захотите о чем-то посоветоваться с ИИ.

Поделиться: