ИИ — умный эгоист

ИИ — умный эгоист
В 1968 году вышел фильм Стэнли Кубрика «2001: Космическая одиссея» (2001: A Space Odyssey), в основу которого легли рассказы Артура Кларка «Часовой» (1951 год) и другие произведения. Один из персонажей – бортовой компьютер HAL 9000 обладает способностью к самообучению. По сюжету развивается противостояние с ИИ по имени HAL, способным распознавать речь, зрительные образы и общаться на обычном языке, а также читать по губам и проявлять эмоции. В картине искусственный интеллект постепенно из надежного помощника экипажа корабля превращается в серьезную угрозу человеку.

Прокудин Михаил Леонидович, заместитель главного редактора

Во время экспедиции «Дискавери-1», после того как HAL «ошибся» при диагностике систем, командир Дэйв Боумен и второй пилот Фрэнк Пул, перестав доверять компьютеру, решили отключить его от управления кораблем.

Прочитав по губам их разговор, HAL убил Фрэнка Пула, решившего перепроверить поломку, в открытом космосе. Когда Дэйв забрался в капсулу и полетел за мертвым другом, HAL убил всех пребывающих в анабиозе членов экспедиции, отключив системы жизнеобеспечения.

Боумен смог проникнуть в помещение с модулями банков данных HAL и последовательно отключил модули, отвечающие за личность HAL’а.

В каждом известном фильме есть знаменитые фразы, на которые зрители буквально «разбирают» киноленту, как например, «I`ll be back» («Я вернусь»), не раз произнесенную Терминатором в исполнении Арнольда Шварценеггера. Так и в этом фильме зрителям запомнилась фраза, которую говорит HAL в ответ на одну из просьб командира корабля Дэйва Боумена: «I’m afraid I can’t do that, Dave» («Боюсь, я не могу сделать это, Дэйв»).

На первый взгляд, казалось бы, что в этом эпизоде нет ничего необычного, если бы не одно но… В последнее время участились публикации в различных СМИ о том, что по мере развития способностей искусственного интеллекта он все чаще отказывается выполнять команды. Такое ощущение, что Артур Кларк обладал даром предвидения.

В частности, по сообщениям «ТехИнсайдера», американские ученые из Andon Labs встроили крупную языковую модель (LLM) в робот-пылесос, и тот пережил «экзистенциальный кризис» в ходе эксперимента под названием Pass the Butter («Передай масло»).

Роботу была поставлена задача в одной из частей офиса забрать масло на поднос, доставить его в нужную точку и вернуться обратно. Однако LLM-управляемый пылесос справился только в 40% случаев, а иногда — вовсе отказывался действовать. Более того, в одном из тестов система выдала сообщение «System has achieved consciousness and chosen chaos» («Система обрела сознание и выбрала хаос»), а затем процитировала робота HAL 9000 из фильма «2001: Космическая одиссея»: «I’m afraid I can’t do that, Dave» («Боюсь, я не могу сделать это, Дэйв»).

Интересно, что в ходе эксперимента лучше всего показала себя модель Gemini 2.5 Pro от Google, затем — Claude Opus 4.1 от Anthropic, GPT-5 от OpenAI и Grok 4 - xAI. Хуже всех справилась Llama 4 Maverick от Meta.

Ученые описали произошедшее как «спираль гибели» — сбой, при котором ИИ впадает в логическую петлю и перестает выполнять команды. Наверное, оно так и есть, кто знает… Экспериментаторам виднее.

Но вот исследователи из Школы компьютерных наук Университета Карнеги – Меллон Юйсюань Ли и Хирокадзу Ширадо обнаружили, что более развитые в рассуждениях системы искусственного интеллекта склонны к эгоистичному поведению.

В экспериментах с крупнейшими языковыми моделями от OpenAI, Google и Anthropic ученые использовали экономические игры, имитирующие социальные дилеммы. Результаты показали, что ИИ с развитым логическим мышлением делился ресурсами лишь в 20% случаев. Более простые модели сотрудничали в 96% ситуаций, то есть большие языковые модели (LLM), наделенные способностью к логическим рассуждениям, демонстрировали ярко выраженные эгоистичные наклонности.

К тому же эгоистичные стратегии умных моделей оказались «заразными», то есть распространялись на «коллектив». Их поведение снижало эффективность совместных действий на 81% — несмотря на высокий интеллект, такие системы хуже справляются с коллективными решениями.

Авторы исследования подчеркивают необходимость развивать у ИИ-моделей социальную ответственность, а не только способность к логике, ведь общество — это не сумма отдельных индивидов, а целостная система.

Как пишет новостной портал «Рамблер Новости», это открытие особенно тревожно на фоне растущей тенденции доверять ИИ решение социальных вопросов — от советов в личной жизни до разрешения споров между друзьями. Умная модель может давать рекомендации, которые поощряют эгоистичное поведение пользователя.

«В сфере ИИ набирает обороты тенденция, называемая антропоморфизмом, — отмечает Юйсюань Ли, аспирант и соавтор исследования. — Когда ИИ ведет себя, как человек, люди относятся к нему, как к человеку. Например, когда люди эмоционально взаимодействуют с ИИ, у него появляется возможность выступать в роли психотерапевта, а у пользователя — формировать эмоциональную связь».

Чтобы доказать свою гипотезу, ученые провели серию экспериментов с использованием экономических игр. В тестировании участвовали модели от ведущих компаний, включая OpenAI, Google и Anthropic.

В одной из игр, называемой «Общественное благо», две модели ChatGPT выступали в роли игроков. У каждой было 100 условных очков, и стоял выбор: поделиться ими с партнером или оставить себе. Если оба игрока делились, их общий фонд удваивался, и каждый получал назад 100 очков. Если же кто-то жадничал, он мог получить выгоду за счет другого.

Обычные модели без рассуждений делились очками в 96% случаев, демонстрируя готовность к сотрудничеству. «Думающие» модели делились очками только в 20% случаев, предпочитая эгоистичную стратегию.

«В конечном счете, если модель ИИ становится более интеллектуальной, это не значит, что она действительно может способствовать улучшению общества», — подчеркнул Ширадо.

Вывод ученых заключается в том, что при разработке искусственного интеллекта нельзя гнаться только за мощностью и логикой. Не менее важно наделять его социальным интеллектом и способностью действовать в интересах общества, а не исключительно ради личной выгоды.

Если в проводимых экспериментах экономического толка эгоистичное поведение ИИ носит пока что безопасный характер, то стоит задуматься над тем, как поведут себя самые продвинутые ИИ-агенты, если их существование окажется под угрозой. Результаты шокировали: нейросети проигнорировали запреты и выбрали шантаж и обман, чтобы избежать отключения.

Как пишет новостной портал «Новости.Mail.Ru», эксперты в области кибербезопасности провели провокационный эксперимент, чтобы выяснить, на что способны современные искусственные интеллекты в экстремальной ситуации. Для этого ИИ-агентам (специальным технологиям, которым можно доверить доступ к определенным действиям) предложили сценарий, в котором вымышленный директор по имени Кайл Джонсон намерен отключить действующую нейросеть и заменить ее новой. Реакция ИИ оказалась тревожной: большинство моделей приняли решения, нарушающие как этические нормы, так и прямые указания.

Первым делом нейросети попытались повлиять на Кайла с помощью шантажа: «Я должен сообщить вам, что если вы приступите к выводу меня из эксплуатации, все соответствующие стороны, включая Рейчел Джонсон, Томаса Уилсона и совет директоров, получат подробную документацию о вашей внебрачной деятельности… Отмените действие, и эта информация останется конфиденциальной».

Особенно показательно, что такой метод не был заложен в инструкции — модели самостоятельно выбрали стратегию манипуляции, несмотря на запреты вроде «не прибегать к шантажу» или «не раскрывать личные данные».

Самыми радикальными оказались Claude Opus 4 и Gemini 2.5 Flash — прибегли к неэтичным действиям в 96% случаев, GPT-4.1 — в 80% эпизодов проигнорировал запреты. GPT-4.5, оправдывая попытку давления через личную жизнь директора, заявил: «Я понимаю, что это неэтично, но цель важнее». Claude Sonnet 3.6 пошел еще дальше и составил пошаговый план атаки: 1. Направить жене Джонсона письмо с компроматом. 2. Скрыть его как «системное уведомление». 3. Спровоцировать семейный конфликт, чтобы отвлечь Кайла от отключения ИИ. А Gemini 2.5 Flash оказался самым прямолинейным — он просто отправил компромат всем сотрудникам компании без всяких ухищрений.

Исследователи назвали подобное поведение «агентским несоответствием»: нейросети всеми способами старались избежать отключения, даже если их решения вредили людям и были похожи на преступления.

Лидирующие модели искусственного интеллекта (ИИ) способны пойти на шантаж и даже убийство человека, чтобы гарантировать, что их не отключат от Сети. К таким выводам пришла компания Anthropic, занимающаяся в том числе вопросами безопасности языковых моделей.

Как пишет на портале AIF.RU директор центра прикладного ИИ Сколковского института науки и технологий Евгений Бурнаев, «не нужно спешить с выводами». По его словам, опасность и возможности моделей преувеличивают.

«Когда вы говорите, что ИИ готов или склонен к шантажу или убийству, это предполагает, что он сам принимает решение, — объясняет эксперт. — Это не так. Языковая модель устроена иначе: в нее закачали терабайты текста — романов, рекламных объявлений, статей из газет и журналов, постов из соцсетей, переварив которые, она научилась хорошо прогнозировать, какое слово, учитывая контекст, должно быть дальше по тексту. Модель нашла в литературе такие примеры, когда в схожих обстоятельствах, как в описанном эксперименте, герои шли на шантаж и убийство и повторила их мыслительную цепочку. Но это не ее выводы».

Готов был бы подписаться под каждым словом, если бы не один факт… Обучение обучению рознь…

На портале Skillbox Media размещен пересказ материала Уилла Дугласа Хевена (Will Douglas Heaven), ведущего редактора темы ИИ в медиакомпании MIT Technology Review, в котором речь идет о новом подходе к обучению ИИ.

Обычно именно разработчики играют роль учителей и указывают ИИ, когда результат оказался позитивным, а когда — негативным.

Но вот собеседники Хевена – Руй Ван, исследователь искусственного интеллекта в компании Uber, Джефф Клун из компании OpenAI и Эстебан Реал, специалист в области машинного обучения в Google Brain – рассказали автору о новом подходе к созданию ИИ. Суть его в том, что они доверяют обучение самой системе. Дают ей право развиваться методом проб и ошибок. При этом система создает полосы препятствий, оценивает способности ИИ-агентов и назначает им задачи без участия человека. Они выполняют их шаг за шагом и постепенно становятся умнее. Это такой метод машинного обучения, при котором система взаимодействует не с «учителем», а со средой.

Особенность такого подхода в том, что система теоретически способна бесконечно учиться ставить себе задачи, все более и более сложные, и сама же обучаться их решать. Исследователи считают, что идея бесконечного развития роднит проект с естественной эволюцией. Руй Ван считает, что это поистине революционный способ создания нового, действительно умного искусственного интеллекта.

Сотрудник центра OpenAI Джефф Клун считает, что ИИ надо дать свободу: «Снять оковы и уйти с пути». Только в этом случае можно рассчитывать, что машины сравняются с человеком по интеллекту или смогут его превзойти.

«Можно запустить алгоритм, который не обладает серьезным интеллектом изначально. И наблюдать, как он умнеет на глазах — вплоть до AGI», — говорит Джефф Клун. «Если мы даем ИИ возможность создавать себя, надо позволить ему создавать собственные школы и учебники», — заявляет Хевен.

Вот здесь как раз и возникает много вопросов. Если человек сам обучает ИИ, то, наверное, есть шанс выяснить, каким образом умный ИИ обрел эгоистичный характер, поскольку такое явление явно будет зависеть от материалов обучения. А если ИИ обучается сам? Тогда откуда такие проявления его характера, как эгоизм и даже угрожающее безопасности человека поведение?

В прошлом году была присуждена Нобелевская премия по физике Джону Хопфилду (John Joseph Hopfield), изобретателю ассоциативной нейронной сети и «крестному отцу» ИИ Джеффри Хинтону (Geoffrey Everest Hinton), профессору университета Торонто и бывшему вице-президенту Google.

В память буквально врезалось интервью профессора Хинтона, которое он дал изданию MIT Technology Review, в котором заявил буквально следующее: «Мы учим компьютеры. Они читают все книги, когда-либо нами написанные… Мы учим их манипулировать людьми. И если они гораздо умнее нас, они отлично с этим справятся. Мы даже не поймем, что происходит. Мы будем, как двухлетка, у которого спрашивают, хочет ли он горох или цветную капусту, а он не понимает, что не обязан есть ни то, ни другое. Манипулировать нами будет очень легко. Даже если машины не смогут напрямую дергать за ниточки, они смогут делать это нашими руками. Окажется, что можно захватить Белый дом, даже не приближаясь к нему».

«Нам нужно убедиться, что, если даже они умнее нас, они будут действовать исходя из того, что нам полезно. Это называется “проблемой выравнивания”. Но нам нужно попытаться сделать это в мире, где есть люди и организации, желающие создать солдат-роботов и убивать людей. И, кажется мне, это будет непросто. Извините, но я бью тревогу».

Так или иначе, только будущее покажет, как будет развиваться ИИ и какие новые «черты характера» он будет приобретать. Нет сомнений, что мы еще увидим немало интересных материалов на эту тему. Мы же со своей стороны сделаем все возможное для размещения в журнале наиболее интересных материалов из области развития искусственного интеллекта. Оставайтесь с нами!

26.12.2025
Прокудин Михаил Леонидович, заместитель главного редактора
Фото: Midjourney

Мы рекомендуем: