Зарегистрировав аккаунт в Твиттере под ником Light_Chen, он нашел нужных людей и начал оставлять комментарии под их твитами один за другим:
«Стратегия выборки и фильтрации AlphaCode недооценивает структурную однородность между решениями-кандидатами. Кажется, что генерируется миллион кандидатов, но на деле все по-прежнему сводится к поверхностным вариациям нескольких классов решений: одни и те же инварианты, одни и те же ошибочные предположения, одни и те же границы отказов...»
«Генерация кода является полезным предупреждающим сигналом при оценке масштаба. Модель может исследовать неожиданно узкий набор скрытых стратегий, в то время как...»
«Я согласен, что LLM не является моделью мира. Но есть один момент, который, кажется, обсуждается недостаточно...»
«Наживка заброшена, осталось только дождаться, пока со мной свяжутся», — подумал Чэнь Си.
Он выбрал около десятка звездных ученых в современной сфере ИИ — тех, у кого было множество подписчиков, но при этом мало комментариев под постами.
Причина заключалась в том, что их твиты были слишком профессиональными: дилетанты в них вообще ничего не понимали, а экспертам требовалось время на осмысление.
На платформе, где контент и его подача максимально фрагментированы, редко у кого находилось желание и силы вникать и вести серьезные дискуссии.
Комментарии Чэнь Си били точно в цель: в паре коротких фраз он указывал на их уязвимые места, и с первого взгляда было ясно, что пишет настоящий профессионал.
Достаточно, чтобы хоть один из них перебросился с ним парой слов, и Чэнь Си был абсолютно уверен, что получит от него рекомендацию и авторитетное подтверждение своих навыков, а затем отправится в Кремниевую долину за своим первым капиталом.
Почему не в государстве Хуа? С одной стороны, технологические компании Кремниевой долины предлагали куда более высокие ставки. С другой стороны, получив первый капитал, он планировал отправиться в Юго-Восточную Азию или Северную Америку, чтобы основать свою собственную территорию.
Как маг может обойтись без собственных владений? А в Хуа сверхъестественному давно перекрыли кислород.
К тому же, ему потребуется огромное количество биологических образцов, а заниматься этим без психологического давления можно было только в Юго-Восточной Азии.
Хуа станет его надежным тылом. Здесь его родители, и эта связь останется навсегда.
...
Наживка была заброшена. А за десятки тысяч километров оттуда, в Кремниевой долине, Игорь Бабушкин, проснувшись, по привычке открыл компьютер, проверил почту и ответил на письма.
Затем он открыл Твиттер. Имя отправителя в личных сообщениях могло бы заставить содрогнуться всю индустрию: Илон Маск.
Впрочем, само имя — это еще полдела, индустрию содрогнула бы суть происходящего.
Будучи ключевым сотрудником DeepMind, Игорь изначально отвечал за AlphaStar — искусственный интеллект, играющий в StarCraft против людей, а в последнее время курировал AlphaCode — ИИ для написания кода.
Оба проекта были невероятно значимыми.
Это вызывало огромную зависть у Илона Маска, питающего грандиозные амбиции в сфере искусственного интеллекта.
С тех пор как они наладили контакт, Маск каждый день строчил Игорю в личные сообщения Твиттера, пытаясь переманить ценный кадр у Google.
Попытки Маска переманить сотрудников Google определенно вызвали бы землетрясение в индустрии.
Игорь дежурно ответил Маску, что все еще не принял решения.
Затем он заметил, что под его твитом появился новый ответ, и кликнул по нему.
«...недооценивает структурную однородность между решениями-кандидатами...»
Первой реакцией Игоря Бабушкина было легкое недовольство.
Проект AlphaCode только что был опубликован в журнале Science, и DeepMind вместе с Google оценивали его невероятно высоко.
Он смог достичь уровня медианного программиста-человека на соревнованиях Codeforces.
В то время, когда Claude еще не успел прославиться, AlphaCode, без сомнения, был номером один в сфере ИИ-программирования.
И тут какой-то комментарий в Твиттере смеет указывать на недостатки этого проекта. В голове Игоря тут же промелькнула мысль: «Ну-ка, посмотрю, что ты там несешь».
Он зашел на страницу Light_Chen. Аккаунт оказался свежерегом, на аватаре стояла стандартная заглушка Твиттера.
Ноль читателей.
Обновлять контент он начал только пару дней назад.
Никакой поддержки от известных организаций, никакого послужного списка. О научных статьях или звездах на GitHub и говорить не приходилось — просто сказки.
Может быть, это чей-то твинк, а может — наглый новичок.
С такими мыслями Игорь Бабушкин просмотрел ответы один за другим и обнаружил, что в них что-то есть.
Ответы этого парня были весьма неглупыми.
Игорь вернулся к комментарию Light_Chen под своим твитом. Он нахмурился, немного поразмыслил и напечатал ответ:
«Расскажите подробнее, на основе чего вы бы проводили кластеризацию? Расстояние абстрактного синтаксического дерева (AST) и траектории выполнения уже охватывают часть информации. Ваша идея звучит неплохо, но как вы собираетесь применить ее на практике?»
Ответ Чэнь Си сводился к одной главной мысли: выдаваемые вами решения только кажутся разнообразными, но на деле это одно и то же решение, просто в разных обертках.
Дружественные Google СМИ превозносили AlphaCode как программиста, способного по-настоящему понимать условия задачи, выстраивать множество алгоритмических путей, а затем выбирать из них лучший.
Но инсайдеры прекрасно понимали: львиная доля его «интеллекта» проистекает из масштабов выборки и механизмов фильтрации.
Профессор Дэвис с факультета информатики Нью-Йоркского университета уже критиковал эту систему, утверждая, что по своей сути это все та же теорема об обезьяне за пишущей машинкой.
Если напечатать достаточно много символов, рано или поздно получится Шекспир.
В фильтрации и отборе отсутствовало подлинное структурное исследование.
СМИ, недовольные Google, часто цитировали эту критику профессора Дэвиса.
Чэнь Си же пошел еще дальше и указал на истинную уязвимость этой системы.
И это при том, что AlphaCode никогда по-настоящему не открывали для публики.
DeepMind открыла исходный код моделей обучения и оценки, запустила демонстрационный сайт, где любой желающий мог посмотреть сгенерированные AlphaCode решения, объяснения и визуализации для конкретных задач, но пользователи не могли ввести новую задачу и заставить систему генерировать код в реальном времени, как это делается в ChatGPT.
Менее чем через две минуты пришел ответ.
«Расстояние AST фиксирует то, как написана программа.
Траектория выполнения фиксирует поведение программы на выборочных входных данных.
Я же говорю о немного другом: о логическом выводе того, какой класс генераторов контрпримеров убивает те или иные программы-кандидаты.
Если две программы терпят сбой на одних и тех же состязательных входных данных, то, даже если их синтаксис и обычные траектории выполнения различаются, они принадлежат к одному и тому же семейству скрытых решений».
Игорь вернулся к столу с чашкой кофе в руках, подумал и снова спросил:
«Для этого нужно знать распределение контрпримеров. В соревнованиях по программированию скрытые тесты невидимы. Как вы избежите того, чтобы просто не изобрести набор эталонных тестов со своими собственными искажениями?»
На этот раз Light_Chen ответил не сразу.
Примерно через пять минут от него пришло более развернутое сообщение.
«Нам нужно использовать лишь набор зондов, сгенерированных на основе описания задачи и поведения программы-кандидата.
Для каждого кандидата извлекаются его неявные допущения, а затем генерируются небольшие семейства состязательных зондов, специально атакующих эти допущения.
Перед окончательной фильтрацией мы оцениваем, действительно ли существует разнообразие решений-кандидатов. Если 80% программ-кандидатов погибают на одном и том же семействе зондов, значит, можно смело срывать маски с коллапсирующего пространства стратегий».
Игорь начал воспринимать собеседника всерьез.
Он ответил: «Предположим, мы принимаем эту точку зрения. Как тогда должна выглядеть метрика? Исходное количество кластеров? Энтропия в семействах отказов? Или что-то еще?»
«Я бы определил три числа.
Исходное количество выборок: сколько программ было сгенерировано.
Количество выживших по поведению: сколько программ прошло видимые тесты или тесты на примерах.
Семантически эффективный объем выборки: сколько различных бассейнов притяжения отказов остается при адаптивном зондировании.
Полезно отслеживать коэффициенты: "семантически эффективный объем выборки / исходное количество выборок" и "семантически эффективный объем выборки / количество выживших по поведению".
Если первый коэффициент мал, значит, модель генерирует только стилистические различия.
Если мал второй коэффициент, значит, фильтр отбирает лишь различные вариации одной и той же идеи.
Но если оба коэффициента растут вместе с увеличением масштаба, значит, модель действительно обучается истинному разнообразию стратегий».
Игорь откинулся на спинку кресла и хорошенько задумался: «Охренеть, да этот парень — гений, его стратегия вполне реализуема».
Увидев ценность в собеседнике, он перестал общаться с ним в открытых комментариях и перешел в личные сообщения Твиттера.
Сначала он подписался на Light_Chen, а затем спросил:
— Как вы считаете, это проблема исключительно генерации кода или общее ограничение языковых моделей?
— Общее ограничение, но код делает его очевидным, — ответил Чэнь Си.
— В естественном языке поверхностное разнообразие еще более обманчиво. Десять ответов могут выглядеть совершенно по-разному, но разделять один и тот же скрытый каркас.
— Код полезен тем, что ошибку можно выявить при запуске.
— Если мы сможем понять, как измерять коллапсирующее пространство стратегий в коде, мы получим более широкий метод диагностики систем логического вывода.
Игорь подумал и задал довольно каверзный вопрос:
— А как вы собираетесь это протестировать, если у вас нет доступа к внутренностям AlphaCode?
Он хотел проверить, сможет ли собеседник разработать метод приближенной проверки без внутреннего доступа к системе.
Через некоторое время Light_Chen ответил:
— Публичных примеров из демоверсии вполне достаточно для проверки на адекватность.
— Выбираем задачи, для которых в демо показано несколько сгенерированных решений или объяснений.
— Вручную реконструируем семейства решений.
— Генерируем состязательные вариации вокруг возможных инвариантов.
— Сравниваем, терпят ли эти разные решения сбой одновременно.
— Даже 5-10 примеров будет достаточно, чтобы понять, стоит ли масштабировать этот метод измерения.
Игорь мысленно уже аплодировал ему стоя.
— Вы работаете в OpenAI или Microsoft? А может, в ИИ-лаборатории META?
У него уже зародилась мысль схантить этого парня.
Что самое важное в XXI веке? Конечно же, таланты.
Возможно, ему самому придется работать на Маска, а один в поле не воин — чем больше людей он заберет с собой, тем лучше.
Уволить одного человека слишком легко, а вот уволить целую команду — уже проблема.
Именно поэтому в Кремниевой долине индийцы держатся вместе, выходцы из Хуа держатся вместе — все сбиваются в стаи.
Пришел один — привел второго, пришли двое — привели целую цепочку.
Хочешь меня уволить? Сначала сто раз подумай, сможет ли твой бизнес функционировать, если мы уйдем.
— Я еще учусь, — пришел ответ.
— О, Стэнфорд или MIT?
— Университет Цзянчэна.

Комментарии

Загрузка...