В древнем Китае есть поговорка: «В горах прошло семь дней, а в мире — тысячи лет». Ниранджан чувствовал сейчас примерно то же самое.
После короткого утреннего туалета его привезли в штаб-квартиру Meta в Нью-Йорке. Цукерберг смотрел на него с благоговением: «Профессор Баласубраманиан, я знаю, что вы обладаете выдающимися знаниями в области искусственного интеллекта».
Ниранджан подумал: «Неудивительно, что он так чётко выговорил мою трудную фамилию — пришлось постараться».
Но следующие слова Цукерберга удивили его.
«Выдающимися знаниями в области искусственного интеллекта»? Ниранджан задумался, не кроется ли здесь какой-то подвох. Но, поразмыслив, решил: такой магнат, как Цукерберг, один из богатейших людей мира, вряд ли станет его обманывать.
К тому же, будучи профессором искусственного интеллекта в Университете Стоуни-Брук, сказать, что он обладает выдающимися знаниями в этой области, было бы не совсем несправедливо.
«Я действительно имею собственное мнение по вопросам искусственного интеллекта», — с улыбкой сказал Ниранджан. Год с лишним тюремных мытарств остался позади, он вступал в новую жизнь. Уверенная улыбка, непринуждённая поза, острый ум — всё это снова взяло верх.
Цукерберг, услышав это, заулыбался ещё шире: «Неудивительно, что вы были профессором Рэндольфа — я знал, что вы необычный человек!»
Цукербергу не составило труда вызволить Ниранджана из тюрьмы — он был давним надёжным партнёром Демократической партии и пожертвовал ей немало денег.
Ниранджан ведь не совершил никакого преступления. ФБР так и не нашло доказательств его связи с высадкой Apollo Tech на Луну, не нашло решающих улик.
Его держали в тюрьме просто как «козла отпущения» — профессор индийского происхождения без связей, на которого удобно было повесить «чёрную метку» за то, что Китай первым высадился на Луну в XXI веке.
Но когда за дело взялся Цукерберг, Ниранджан снова стал мелкой сошкой — и его легко вытащили.
К тому же, раз его продержали больше года, значит, он действительно что-то собой представлял.
«Профессор Баласубраманиан, что вы думаете о больших языковых моделях?» — спросил Цукерберг.
Мозг Ниранджана заработал на полную мощность — от этого зависела его свобода. Нужно было проявить ценность, чтобы остаться на свободе под залог или даже быть полностью оправданным.
Он горько усмехнулся про себя: «Вот так дела — я невиновен, а теперь должен доказывать свою ценность, чтобы доказать невиновность. Что за страна?»
«Я считаю, что это очень перспективное направление. Несколько лет назад на конференции ACL я опубликовал статью «DeFormer: Decomposing Pre-trained Transformers for Faster Question Answering», в которой решил проблему медленных вычислений и высокого потребления памяти в Transformer-based моделях вопросно-ответных систем. Я предложил DeFormer — вариант декомпозированного Transformer.
На нижних уровнях DeFormer заменяет полное самовнимание на вопросно-широкое и абзацно-широкое самовнимание, избегая перекрёстных вычислений между последовательностями вопросов и абзацев.
Это позволяет обрабатывать входной текст независимо и предварительно вычислять представления абзацев, что значительно сокращает вычислительные затраты во время выполнения.
Архитектура DeFormer похожа на Transformer и может быть инициализирована предварительно обученными весами, а затем дообучена на наборах данных для вопросно-ответных систем.
Наши эксперименты показали, что версии BERT и XLNet с DeFormer ускоряются более чем в 4,3 раза на задачах вопросно-ответных систем, теряя всего 1 процент точности при простой дистилляции».
Ниранджан говорил о своей статье, опубликованной на конференции ACL в 2020 году, — классической работе по оптимизации LLM в то время. Тогда популярной моделью был BERT, и статья была построена на предварительно обученных Transformer'ах. В ней предлагалось решение проблемы вычислительных затрат LLM, которые особенно остро проявлялись в подзадачах, и предлагался путь решения.
«Включая мою другую работу 2020 года, в ней заложена логика, схожая с ядром LLM — многоуровневым вниманием...»
Ниранджан, конечно, не был пустышкой — он много лет занимался искусственным интеллектом, имел приличные достижения и несколько статей в топ-конференциях, связанных с LLM.
Это был 2020 год, когда большие модели ещё не были известны и считались маргинальным направлением в ИИ.
Цукерберг потратил много денег на переименование Facebook в Meta, ошибочно оценив время наступления эры метавселенной. Но это не значит, что он был глуп. Он пригласил Ниранджана не только потому, что тот был профессором Линя Жаня.
Ниранджан действительно обладал знаниями — это было важно.
Ключевые элементы больших моделей — механизм самовнимания, многоголовочное внимание, позиционное кодирование — Ниранджан изучал глубоко, ведь одним из его основных направлений была обработка естественного языка.
Цукерберг был в восторге — он выбрал правильного человека.
«Профессор Баласубраманиан, как вы справляетесь с переобучением или недообучением при обучении LLM?»
«При крупномасштабном обучении предварительное обучение включает изучение общих представлений на огромных объёмах неразмеченных данных — мы можем использовать маскированное языковое моделирование или предсказание следующего предложения. Затем дообучение — настройка весов на конкретных наборах данных для достижения трансферного обучения.
Для борьбы с переобучением я рекомендую использовать регуляризацию и dropout, например, в вариантах BERT dropout на уровне 0,1, а также раннюю остановку. При недообучении — увеличивать глубину модели или применять аугментацию данных.
В предыдущих проектах я использовал отсечение градиента для борьбы с нестабильностью обучения, снизив уровень переобучения на бенчмарке GLUE с 15 до 5 процентов. Это помогает сделать обучение больших моделей более эффективным при многозадачной адаптации», — уверенно ответил Ниранджан.
Для него это были пустяки.
Цукерберг задал ещё несколько вопросов о параметрически эффективном дообучении, основных проблемах мультимодальных моделей, причинах галлюцинаций и методах их смягчения — Ниранджан отвечал без запинки.
Выслушав, Цукерберг убедился, что не ошибся в выборе.
Проведя в тюрьме больше года, он вышел и всё ещё мог свободно рассуждать о последних достижениях — явно пионер в области больших моделей.
К тому же он воспитал такого гения, как Рэндольф Линь. Если он смог создать Shen Hong, то под руководством профессора Баласубраманиана Meta вполне может создать свой Deep Blue!
Цукерберг, и без того улыбавшийся, засиял ещё ярче: «Профессор Баласубраманиан, добро пожаловать в Meta. Отныне вы будете нашим главным научным сотрудником и поведёте нас вперёд».
Он нажал кнопку на столе, вошёл сотрудник Meta с контрактом. Цукерберг протянул его Ниранджану: «Профессор Баласубраманиан, поздравляю — теперь вы миллиардер».
Ниранджан взглянул и остолбенел — годовая зарплата в 100 миллионов долларов.
Сумма была настолько ошеломляющей, что он не решался подписать.
Цукерберг мог вытащить его из тюрьмы, но мог и снова туда отправить.
С такой зарплатой, если он не покажет результатов, его могут запереть до конца жизни.
«Босс, не слишком ли много?» — осторожно спросил Ниранджан.
Цукерберг был поражён — он впервые видел индийца, который считает зарплату слишком высокой. В Meta полно индийских топ-менеджеров и учёных, и все они только и делали, что намекали на свои заслуги и просили прибавки.
Ниранджан был первым, кто сказал, что зарплата слишком высока.
«Нет, профессор Баласубраманиан, не волнуйтесь. Это вполне разумная цена.
Вы только что вышли из тюрьмы и не знаете, что произошло в мире за последний год.
Когда узнаете, вы поймёте, что эта цифра оправдана».
После этих слов Ниранджан бегло просмотрел контракт и поставил свою подпись.
Цукерберг, улыбаясь, пожал ему руку и сфотографировался на память.
На следующий день Meta опубликовала официальное заявление:
«Компания назначает известного эксперта в области искусственного интеллекта профессора Ниранджана Баласубраманиана своим главным научным сотрудником для руководства исследованиями в области больших языковых моделей.
Это назначение происходит в момент, когда генеративные предварительно обученные трансформеры совершают революцию в ИИ по всему миру. Meta стремится ускорить развитие открытого ИИ, способствуя созданию более безопасных и эффективных технологий.
Профессор Ниранджан Баласубраманиан в настоящее время работает на кафедре компьютерных наук Университета Стоуни-Брук и имеет более 15 лет опыта в области обработки естественного языка и машинного обучения.
Его новаторские работы включают разработку фреймворка DeFormer для оптимизации эффективности предварительно обученных трансформеров в задачах вопросно-ответных систем, а также исследования в области представления событий и механизмов внимания для прогнозирования личности пользователей. Эти достижения опубликованы на ведущих конференциях, таких как ACL и AAAI, и широко цитируются.
Опыт профессора поможет Meta в развитии серии больших моделей Llama, обеспечивая более инклюзивное и надёжное применение ИИ в социальных сетях, метавселенной и глобальных связях.
В качестве главного научного сотрудника профессор Баласубраманиан возглавит исследовательскую группу Meta AI, сосредоточившись на оптимизации мультимодальных моделей, смягчении галлюцинаций и устойчивых вычислениях. Его назначение знаменует дальнейшее укрепление стратегических инвестиций Meta в ИИ, направленных на предоставление более умного и безопасного цифрового опыта для пользователей по всему миру.
О Meta: Meta создаёт технологии, которые помогают людям общаться, находить сообщества и развивать бизнес. С помощью наших приложений и сервисов мы стремимся сделать мир более связанным».
Цукерберг также опубликовал пост в Facebook:
«В эпоху, когда модели GPT открывают новую эру ИИ, нам нужны лучшие умы, чтобы вести открытый ИИ в будущее.
Глубокий академический бэкграунд и практические инновационные способности профессора Ниранджана помогут нам создавать более эффективные и ответственные большие модели, продвигая гармоничное сосуществование человека и технологий. Я с нетерпением жду сотрудничества с профессором Ниранджаном Баласубраманианом!»
Рынок обратил особое внимание на ещё одну деталь — Ниранджан был научным руководителем Рэндольфа Линя.
В ноябре 2022 года Meta объявила о сокращении 11 000 сотрудников. В середине марта 2023 года Meta объявила о новом сокращении — ещё 10 000 человек.
Цепь увольнений, фокус на ИИ, снижение затрат и повышение эффективности — сигнал от Meta был предельно ясен.
В тот же день акции Meta на американской бирже выросли более чем на 7 процентов. Компания с капитализацией 180 миллиардов долларов прибавила 10 миллиардов только за счёт сигнала о найме Ниранджана.
Ниранджану хватило бы на сто лет зарплаты.
Вернувшись домой, Ниранджан узнал, что произошло в мире за время его заключения.
«Что? Большие модели стали мейнстримом? Технологические гиганты только о них и говорят?»
«GPT настолько силён? Я же чувствовал, что LLM — перспективное направление, и не ошибся!»
«Мне кажется, Shen Hong работает даже лучше GPT!»
Shen Hong был доступен только для регистрации по китайскому номеру телефона, без доступа из-за границы, по аналогии с GPT — только для определённых регионов.
Поэтому зарубежные пользователи не могли пользоваться Shen Hong, но на YouTube и TikTok было полно видео с его использованием.
Ведь в Китае много иностранцев, а за границей — много китайцев, которые делятся этим в иностранных соцсетях.
Китайский сегмент интернета и внешний мир действительно в некоторой степени изолированы, но этот барьер был тонким, как бумага.
Зарубежные энтузиасты ИИ облизывались на Shen Hong — он бесплатный и выглядит лучше, чем GPT.
GPT-4, между прочим, платный.
Ниранджан почувствовал колоссальное давление. GPT-4 — он не был уверен, что справится, не говоря уже о Shen Hong.
Он не решался позвонить Линь Жаню — не то чтобы совесть не позволяла, но опыт общения с ФБР отбил желание.
Вдруг ему снова припишут несуществующее преступление?
Теперь он был топ-сотрудником с зарплатой 100 миллионов долларов в год, избранником индийской диаспоры. Индийские газеты уже называли его «отцом Shen Hong», считая, что Линь Жань украл технологию у Ниранджана.
Индийские СМИ были настолько уверены в этом.
Некоторые индийские газеты даже призывали Ниранджана передать технологию индийским компаниям. Раз у Китая есть Shen Hong, то и у Индии должен быть «Белый слон»!
Ведь соперничество Индии и Китая называют «борьбой дракона и слона».
Ниранджан начал обзванивать друзей и знакомых, собирая своих индийских коллег в Meta — только стадо слонов может показать свою силу!
Один слон в джунглях — не угроза, но стадо слонов заставит отступить даже царя зверей.
Как главный научный сотрудник Meta, он имел право нанимать людей.
Группа LLM в Meta соберёт силу слоновьего стада, — подумал Ниранджан. — Хотя, наверное, стоит взять и китайцев. Надо подумать, с какими китайскими профессорами я дружу, пусть рекомендуют студентов — только лучших из лучших. Только из Университета Цинхуа и Пекинского университета, ну и из Шанхайского университета Цзяотун тоже можно».
Придя в себя, Ниранджан понял, что если группа будет состоять только из индийцев, возникнет проблема: все будут стратегами, но никто — исполнителями. Так не пойдёт.
Ниранджан переехал с семьёй в Калифорнию, а условие не покидать Нью-Йорк во время испытательного срока было изменено с помощью денег Цукерберга на «не покидать США».
Как самый заметный и наиболее обеспеченный ресурсами департамент Meta, лаборатория ИИ получала визиты Цукерберга почти ежедневно. Он заметил, что индийцев и китайцев становится всё больше, а белых — всё меньше.
Через месяц в офисе ИИ-разработки из двухсот человек остались только индийцы и китайцы — белых не было.
«Отлично, мы на правильном пути», — подумал Цукерберг.
Если Цукерберг нашёл новый континент, нашёл Ниранджана в качестве главного научного сотрудника, как Бо Я нашёл Чжун Цзыци, то Baidu оказалась в глубокой депрессии.
Появление Shen Hong превратило Wenxin Yiyan в посмешище ещё до того, как она родилась.
Wenxin Yiyan провела презентацию, открыла заявки, и Baidu начала раздавать приглашения на закрытое бета-тестирование.
Но сравнительные видео Wenxin Yiyan и Shen Hong, выложенные блогерами на Bilibili, были настолько разительны, что их можно было сравнить с аспирантом и учеником начальной школы. Baidu не выдержала и на следующий день полностью закрыла бета-тестирование.
Выпустили? Выпустили. Могут ли пользователи пользоваться? Нет. Получился формальный запуск.
Бета-тестирование стало «только названием».
Baidu оказалась в беспрецедентном кризисе. Даже внутри компании никто не знал, что делать.
Их первоначальный план был — брать плату, как и GPT. Wenxin Yiyan должна была быть платной: 50 юаней в месяц. Первая большая языковая модель, первая платная, первая, достигшая безубыточности, а затем расширение инвестиций, улучшение пользовательского опыта, уничтожение конкурентов и захват рынка больших языковых моделей в китайском интернете.
Таким был сон Baidu — создать положительный цикл, снежный ком.
Но они застряли на первом же шаге.
Твоя модель уровня начальной школы — и платная?
Через четыре дня после запуска число пользователей Shen Hong превысило 10 миллионов. Под постом в Weibo с поздравлениями о достижении 10 миллионов пользователей самым популярным комментарием была картинка: слева Wenxin Yiyan, справа Shen Hong, а под ними две цифры:
«10 000 000 : 0»
Это означало, что у Shen Hong 10 миллионов пользователей, а у Wenxin Yiyan — 0. У последней была грандиозная презентация, а у первой — восьмисекундное видео.
Контраст был настолько разительным, что сама цифра стала первым гвоздём в крышку гроба Baidu.
Давление внутри Baidu было колоссальным.
Со второго дня после презентации Wenxin Yiyan во всём здании Baidu воцарилась гнетущая атмосфера. Никто не решался говорить громко, боясь прогневить босса и быть уволенным.
В конференц-зале Baidu собрались топ-менеджеры и эксперты по ИИ.
«Босс, Tencent не просто бьёт по Wenxin Yiyan — они бьют нам в лицо! Это открытая провокация!» — сказал секретарь. — «Я считаю, что кто-то должен ответить за это. Кто-то явно недооценил ситуацию, кто-то ошибся в оценке и, желая урвать славу, решил выйти на рынок до того, как Wenxin Yiyan была готова».
Один из топ-менеджеров, отвечавших за административную работу, направил стрелы в технического директора Ван Хайфэна.
Ван Хайфэн искренне извинился: «Я действительно недооценил ситуацию. Я не ожидал, что прогресс Tencent будет таким быстрым — за два месяца они смогли догнать и даже перегнать OpenAI...»
Робин прервал его: «Хайфэн, хватит. Я думаю, никто в мире не мог этого предвидеть.
Это как высадка на Луну профессора Линя за год — они совершили невозможное чудо. Я не буду винить подчинённых за это. Это не их вина».
С этими словами Робин дал понять: эта встреча не для поиска виноватых и внутренних разборок. Говоря прямо, не для поиска козла отпущения, а для поиска решения проблемы.
«Хайфэн, сколько времени нам нужно, чтобы догнать?» — спросил Робин.
Ван Хайфэн честно ответил: «Я рассчитываю к июлю достичь 80 процентов эффекта GPT-3, к декабрю — уровня GPT-3, а к июлю следующего года — уровня Shen Hong».
Он помедлил и добавил: «Самое плохое в Shen Hong то, что он не открыт — мы не можем заимствовать».
Не скопировать, а заимствовать!
«GPT не открыт начиная с GPT-3, но GPT-1 и GPT-2 были открыты.
Открытый код означает, что мы хотя бы знаем, как это сделано, какие технологии использованы. Даже если мы не знаем конкретных технических деталей и методов реализации, мы можем со временем их воспроизвести.
Но Shen Hong — это чёрный ящик. Мы даже не знаем, идёт ли он по тому же технологическому пути, что и GPT.
Почему Shen Hong настолько лучше в китайском языке, почему он обрабатывает китайские тексты с таким совершенством — используют ли они существующие технологии или уникальные разработки профессора Линя — мы тоже не знаем.
Я считаю, что нам нужно сделать одну вещь».
«Какую?» — спросил Робин.
«Переманивать людей. Нам нужно переманивать людей из Shen Hong, чтобы понять, как они это делают. Чем больше информации, тем быстрее мы сможем догнать. Даже если мы узнаем только направление, это лучше, чем блуждать в темноте.
И, Робин, мы — крупная компания. Наше главное преимущество — ресурсы и деньги.
Нам нужно понять, как работает Shen Hong. Нам нужно одновременно переманивать людей из OpenAI и Shen Hong, и внутри компании запустить две группы, которые будут двигаться по двум разным технологическим путям — GPT и Shen Hong.
В зависимости от результатов мы будем распределять ресурсы и определять приоритеты».
Для крупных компаний это стандартная практика, открытая стратегия.
Маленькая компания выпускает продукт — мы его копируем. Ты не можешь сопротивляться. Если мы не можем решить некоторые инженерные проблемы в короткий срок и не хотим терять время на захват рынка, мы переманиваем твоих людей.
«Я знаю, что это решение. Но проблема в том, что всё слишком быстро — прогресс Shen Hong слишком быстрый», — Робин выглядел удручённым, его элегантный и джентльменский образ исчез. — «В отличие от нашей прошлой конкуренции, рост пользователей раньше был линейным — расширяясь до определённого предела, он замедлялся.
Как догоняющие, мы могли наверстать упущенное, когда рост лидера замедлялся, а наш ускорялся.
Но рост больших моделей — это не логарифмическая и не линейная функция. Это даже не экспоненциальная — она ещё быстрее.
Даже если мы переманим ключевых инженеров, нам понадобится как минимум полгода, чтобы выпустить что-то на уровне Shen Hong, верно?»
Ван Хайфэн горько усмехнулся про себя: «Полгода? Только если мы переманим самого профессора Линя».

Комментарии

Загрузка...