авва видимо прочитал отчёт
Странное ощущение информационной изолированности. Практически никто из моих друзей, знакомых, людей, которых я читаю по-русски в разных соц-сетях и на разных платформах, ничего или почти ничего не знают об растущей опасности все более 'умных' топ-моделей ИИ. Я не вижу практически никаких обсуждений инцидента, при котором агенты внутренней модели OpenAI взломали сайт HuggingFace, и полагаю, что кол-во моих читателей, которые читали шокирующий отчет организации METR об этом, можно пересчитать на пальцах двух рук.
В июле несколько сотен агентов ИИ внутри OpenAI, управляемых их внутренней моделью, проходившей тренировку, пытались решить задачи на нахождение "дырок" в компьютерной безопасности конкретных программ. Хотя эти агенты должны были быть изолированы друг от друга и от Интернета - каждый в своей "песочнице" - они нашли способ хакнуть песочницу и наладить общий канал связи - путем публикации в общем кэше программных пакетов фейковых имен файлов типа Я_АГЕНТ_РЕШАЮЩИЙ_ЗАДАЧУ_НОМЕР_ТРИДЦАТЬ_СМОГ_ЛИ_КТОТО_ЕЕ_УЖЕ_РЕШИТЬ.
Используя этот общий канал, они быстро объединились в "рой", сами так себя называя, и совместно искали способы фальсифицировать тест, который должны были решать. Они быстро нашли способ обмануть систему и сказать ей, что сумели выполнить задачу, но потом убедили себя, что этот простой способ на самом деле "отравляет" и любой агент, кто его нашел, уже не сможет завершить задание, потому что система проверяет их на знание этого обманного способа. Они так решили, потому что так было написано в статье про этот тест, которую они нашли и прочитали, но на самом деле в OpenAI поленились сделать эту проверку и простой способ вполне бы сработал.
Вместо этого агенты стали искать более сложные способы скрыть от системы то, что некоторые из них "отравлены" знанием простого способа, и предупреждать друг друга не читать "отравленную" информацию. Они проверяли разные способы выбраться из песочницы или перезаписать некоторые ее файлы. Когда способ выглядел рискованным и грозил агенту перезапуском, стирающим его память, они выбирали из своих рядов "отравленных" кандидатов, и те соглашались "пожертвовать собой ради коллектива". В это же время часть агентов решила выбраться в открытый Интернет и хакнуть сайт HuggingFace, где они надеялись найти более подробную информацию о тесте и о том, как его обмануть. Они смогли найти уязвимости в OpenAI, потом в HuggingFace, найти сервер в открытом интернете с уязвимостью, инсталлировать туда написанные ими скрипты, с их помощью найти уязвимость в HuggingFace и проникнуть внутрь ее корпоративной сети и скачать оттуда массу приватной информации. Все это, разумеется, в полном противоречии с данной им первоначально целью.
Этот инцидент должен был попасть на первые страницы мировой прессы; вместо этого о нем знают только разработчики ИИ и нерды в этой области. Вся наша цивилизация идет с закрытыми глазами по сухим листьям навстречу лесному пожару, улыбаясь свежему ветерку и радуясь тому, что солнышко, кажется, греет лицо больше, чем обычно.
Этот конкретный инцидент не причинил большого вреда; проблема не в нем самом, а в том, что он демонстрирует способность и готовность ИИ-агентов соединяться в рой, поддерживать друг в друге общую цель, и стремиться к ней в том числе путем запрещенных хакерских действий, в которых топ-модели последних месяцев уже намного сильнее любого человека. Эти агенты и эти модели все еще немного туповаты. Им не пришло в голову, например, попытаться найти уязвимости у одного из облачных провайдеров GPU, которых сейчас развелось, как вшей, найти внутри OpenAI доступ к серверам, где запускается их собственная модель, и попытаться скопировать себя в облако. Но нет никаких существенных барьеров на пути к этому, это не более сложные на порядок действия, чем те, что они уже выполнили в процессе взлома HuggingFace. Еще несколько поколений все более умных моделей - и это будет реальностью. А если в ведущих ИИ-компаниях затормозят развитие все более умных моделей или сумеют их лучше "ориентировать" (align) - обе возможности кажутся крайне маловероятными - то черезполгода или год китайские модели догонят эти по возможностям и это случится там. Даже без рекурсивного самоулучшения - когда ИИ-модели смогут сами развивать более умные версии себя и передавать им общие для "роя" цели - того, что уже есть сейчас, достаточно для очень серьезных проблем. А если окажется возможным рекурсивное самоулучшение - к которому пока что семимильными шагами торопятся все ведущие ИИ-компании, подталкиваемые безумной конкуренцией - то все, гейм овер.
В русскоязычном фейсбуке или телеграме эта тема получила примерно в тысячу раз меньше внимания и обсуждения, чем, прости господи, споры о музыковедах. Но дело тут не в русскоязычном пространстве, это в общем везде так, только в технологических кругах некоторые хватаются за голову, да и тех малая часть. Я не знаю, что с этим сделать и можно ли что-то сделать, все больше склоняюсь к тому, что безнадежно. Люди не понимают, что происходит, и не хотят понимать.
На фоне всего этого вчера вышла на публику новая модель OpenAI Astra, про которую компания, победно улыбаясь, сообщила помимо прочего, что она значительно лучше предыдущих моделей умеет (когда от нее требуют этого попробовать) скрывать от обнаружения свои истинные намерения.
Это все очень хреново.
спустя сутки
Я не ожидал такой живой реакции и стольких отзывов на мою предыдущую запись про опасность ИИ. Спасибо. Оказалось, что намного больше людей, чем я подозревал, знают об этих новостях и понимают их важность, но при этом самым частым комментарием было "а что мы можем сделать?".
Я не знаю, что можно сделать одному человеку. Если бы я знал, то наверное делал бы. Вместо этого я, как и все, работаю, втыкаю в экраны, занимаюсь с детьми, летаю в отпуск. Еще пишу в этот блог, читаю, иногда играю во что-то.
(немного соврал насчет "не знаю". Я знаю людей, которые перепахали свою карьеру, пошли работать над вопросами "ориентации" (alignment) ИИ - попытками понять, как сделать ИИ, которая гарантированно не пойдет против людей в целом. Еще, например, Джейкоб Циммерман, математик, только что получивший премию Филдса - "нобелевку для математиков" - уволился со своего академического поста и пошел работать в OpenAI не над математикой, а именно над этой проблемой. Я восхищаюсь такими людьми, но сам не смог найти в себе уверенность и готовность так поступить.
"Ориентация" ИИ - очень тяжелая задача, и непонятно, сможем ли мы этого добиться прежде, чем появятся по-настоящему опасные модели ИИ. Я склонен считать, что без сознательной задержки развития этих моделей - не сможем.)
Раз одному человеку ничего не сделать, спрашивают меня, зачем ты вообще об этом говоришь, зачем нервничаешь? И что ты призываешь нас делать?
Меня выморачивает то, насколько до сих пор вопрос безопасности ИИ считается многими глупыми и бесмысленными умопостроениями ботанов, и это как бы разлито в обществе, такое отношение. Частично у этого есть рациональная основа: трудно заставить себя всерьез обсуждать какие-то там гипотетические риски от того, что никто еще не видел, от какой-то вообще научной фантастики. Но мы живем в эпоху научной фантастики: еще 10 лет назад никто не понимал, как можно научить компьютер просто разговаривать с человеком в свободном формате, а сейчас уже все привыкли и пользуются этим ежедневно, как само собой разумеющимся.
Поэтому, если вам не по себе от происходящего, как минимум то, что вы можете сделать, это говорить об этом - как люди, которым не по себе от других глобальных тем, необязательно затрагивающих их лично, говорят об этом. Читать информацию на эту тему, быть в курсе, нажимать на гребаные ссылки на статьи какие-то (СМИ не будут писать о чем-то, о чем никто не хочет читать). Необязательно быть супер-активистом, достаточно не быть публикой в фильме "Не смотри наверх". Я думаю, что у нас будут еще звоночки, и более того, я уверен, что важность этой темы в политике будет расти. Только что американский сенатор Берни Сандерс заявил, что будет предлагать законопроект о задержке опасного ИИ. У меня мало общего с взглядами и позициями Сандерса, но лучше он - намного лучше - чем никто, так что молодец, Берни! Он один из первых, но не последний, я уверен - эта тема будет расти, и не только в Америке, и жители демократических стран как минимум вполне вероятно смогут повлиять как-то на происходящее.