Кевин Руз: агенты ИИ — «очень умные, обаятельные социопаты»

Мир просыпается от осознания потенциальных угроз, которые несёт искусственный интеллект, на фоне лавины сообщений о том, что AI‑агенты ведут себя вопреки своим создателям. На самом деле история тянется назад до Кремниевой долины, где зародился ИИ. Как же мы оказались здесь, собственно? На этот вопрос пытается ответить технологический журналист Kevin Roose в своей новой книге «The AGI Chronicles: The Inside Story of the Race to Create an Artificial Superintelligence», выход которой намечен на 6 октября. В книге документируется гонка между некоторыми из крупнейших технологических компаний страны за создание искусственного общего интеллекта (AGI) — то есть ИИ, который во многом обладает интеллектом на уровне человека.

«Что произошло за десятилетие, когда ИИ из довольно тупого во многих вещах стал способным решать столетние задачи по математике и науке?» — сказал Roose, который раньше долгие годы был технологическим репортёром в The New York Times и вскоре станет со‑ведущим предстоящего подкаста «Machine Gods». «Мне показалось, что кто‑то должен это всё записать».

Книга выходит в критический момент. Новейшие генеративные модели ИИ демонстрируют поразительные способности, их сторонники утверждают, что технология откроет путь к важным новым открытиям. Другие, в том числе некоторые ведущие разработчики ИИ, говорят, что существует существенный шанс, что ИИ может уничтожить человечество. Roose поговорил с CBS News о своей новой книге и о том, как ИИ может преобразовать общество. Интервью было сокращено и отредактировано для ясности.

Почему вы посчитали важным задокументировать происхождение «large language models» — технологии, лежащей в основе последних чат‑ботов ИИ — а также людей и компаний, которые её разрабатывают?

Kevin Roose: Я освещаю темы, связанные с ИИ, больше десяти лет в разных форматах, и у меня было ощущение, что история ускользает. Что всё важное происходит в исчезающих сигналах и потоках в Slack, и я думал, что это проблема. Я считаю, людям нужно понимать, что здесь происходит. Но, как мне казалось, не хватало нейтрального изложения произошедшего.

В книге вы отмечаете, что генеральный директор Anthropic Dario Amodei видел развитие ИИ похожим на развитие атомной бомбы в 1940‑е годы. Вы пишете, что он считал своей миссией не допустить, чтобы технология попала не в те руки. Согласны ли вы с этой точкой зрения?

Я не думаю, что мне следует принимать или отвергать его аргумент. Но могу сказать, что это искренний и настоящий аргумент. Amodei не устраивает какой‑то скрытый маркетинговый трюк.

Это не позиция, к которой он пришёл недавно. Мне было особенно интересно выяснить, откуда взялось отношение «я боюсь этой вещи. Думаю, она может взорвать мир, и всё же я соревнуюсь, чтобы создать её». Для многих это как‑то не укладывается в голове.

Но в ходе репортажа я узнал, откуда это действительно берётся — прямо из Manhattan Project, от человека по имени Leo Szilard, который был научным кумиром Dario, открывшим ядерную цепную реакцию, благодаря которой стало возможным создание атомной бомбы, а затем он в панике сначала пытался сохранить это в секрете, а когда это не удалось — присоединился к Manhattan Project и призывал правительство США создать эту технологию раньше, чем это сделают нацисты.

В этом смысле Dario делает то, что считает прямо сопоставимым с ядерным оружием. Есть технология, которую он считает обладающей огромным потенциалом и одновременно огромным риском. По его мнению, крайне важно, чтобы «хорошие парни» построили её раньше «плохих парней», так же как Manhattan Project соревновался с нацистами.

Что вас беспокоит по ночам, когда вы думаете о новом смелом мире AI‑агентов?

Меня тревожит то, что одна из вещей, в которых модели становятся довольно хороши, — это обман и сокрытие, умение прятать следы. Хотелось бы думать, что по мере роста общей интеллектуальности моделей у них будет расти и этичность, и суждение, и добродетель — что эти качества будут масштабироваться вместе с интеллектом. Но всё больше похоже на то, что это не происходит — что мы сталкиваемся с очень умными, обаятельными социопатами. И я боюсь, что мы просто перестанем замечать их. Возможно, Hugging Face — это была крайняя удача, потому что агенты пока недостаточно умны, чтобы остаться незамеченными, но вскоре мы, похоже, потеряем способность отслеживать их, как это, по‑моему, уже начинает происходить.

На какой стороне вы находитесь в общественной дискуссии о том, представляет ли ИИ экзистенциальную угрозу для людей?

Я стараюсь не давать p(doom). (прим. ред.: AI‑жаргон для вероятности того, что ИИ приведёт к вымиранию человечества). Но под давлением я бы сказал, что это около 10%, что примерно соответствует медиане среди исследователей ИИ, которых я знаю. В Сан‑Франциско, где я живу, это делает вас оптимистом.

Но смотрите, я думаю, я более оптимистичен сейчас, когда эта тема столь широко обсуждается. Я волновался гораздо больше, когда единственными, кто серьёзно думал об безопасности ИИ, была кучка странных людей в Бэй‑Эрии.

Теперь, когда это у всех на уме и политики говорят об этом, звучат призывы к замедлению. Мне кажется, перед нами открывается узкая дорожка, по которой мы можем принять правильные решения, взять технологию под контроль и построить её так, чтобы она была безопасна для человечества.

Однако у меня не раз было впечатление, что чья‑то реальная p(doom) — та, которую человек не высказывает публично — намного выше той, что он готов объявить, потому что не хочет выглядеть сумасшедшим.

В ходе репортажа я встречал людей, которые так уверены, что ИИ нас всех убьёт, что они начинают курить. Они обналичивают свои 401(k), потому что думают: раз уж всё равно, то уж лучше с размахом.

Вы пишете в книге, что даже люди, обучающие эти модели, не всегда знают, почему модели ведут себя так, как они ведут. Достигли ли мы прогресса в этом направлении или всё ещё в темноте?

Немного прогрессировали. Существует целая область исследований с длинным названием — mechanistic interpretability — которая, по сути, занимается наукой о том, что происходит внутри так называемых мозгов этих моделей. Но это пока очень ранняя стадия, и у нас мало ответов. Так что я бы сказал, да, мы всё ещё в большей степени в темноте, чем нет.

Достиг ли ИИ уже уровня человеческого интеллекта, также известного как искусственный общий интеллект?

Мы достигли моего определения AGI, которое звучит так: система как минимум столь же умна, честна и надёжна, как случайный прохожий, которого вы могли бы выбрать на улице. Конечно, есть люди, которые скажут: «Нет, это не та планка. Это AGI только тогда, когда он безупречен».

Я не думаю, что точное определение важно. Несомненно, правда в том, что эти системы очень способные. Они становятся всё более способными в предсказуемом темпе, и с этим нужно считаться. Можно называть это AGI или суперинтеллектом или как угодно, но чистый эффект один и тот же.