Прыгнуть в следующую реку
В июне 2023 года я ушёл из SenseTime, где проработал почти десять лет.
На момент ухода у меня не было ни проверенного продукта, ни готового бизнес-плана. Я даже не решил, чем именно буду заниматься.
Но я знал, что для меня снова настало время прыгнуть в следующую реку.
Я уже не впервые менял реку, но впервые ради этого пришлось покинуть компанию.
Выбор, который я делаю снова и снова
Из сельской начальной школы я поступил в среднюю школу в уездном центре, затем учился в Нанкинском университете и в магистратуре Университета Цинхуа. Во время учёбы я присоединился к SenseTime, которая только начинала работу. Там я сначала создал команду проверки живости, а позже — команду промышленного зрения.
Оглядываясь назад, я вижу, что такие перемены происходят примерно раз в несколько лет.
Они не были частью заранее составленного жизненного плана и случались не потому, что прежняя работа теряла смысл. Просто после многих лет усилий и область, и я сам постепенно становились зрелее. Работа не обязательно была закончена, но уже не заставляла меня выходить за собственные пределы.
Для многих это идеальное состояние. У меня же оно вызывает тревогу. Мне не нравится жизнь, конец которой уже виден. Поэтому время от времени мне нужно помещать себя внутрь задачи, которую я не умею решать, а порой даже не знаю, с чего начать.
«Река» здесь — не компания. Смена реки не обязательно означает увольнение. Это область, которую приходится осваивать заново, трудное дело, которое я пока не знаю, как довести до результата. За почти десять лет в SenseTime я последовательно прыгнул в две разные реки.
Но я не человек, который ищет перемен ради самих перемен. Во мне действует и другая, почти противоположная сила — чувство ответственности.
Я терпеть не могу бросать дело на полпути. Решив что-то сделать, я хочу сделать это по-настоящему хорошо. Одна сила заставляет меня искать следующую реку, другая удерживает в прежней, чтобы завершить начатое.
Мой уход в этом году стал результатом долгой борьбы этих двух сил.
Перенести алгоритмы в реальный мир
Когда я пришёл в SenseTime, то работал в исследовательском отделе, но меня всегда интересовали приложения. Я хотел знать не только то, работает ли алгоритм на экспериментальных данных, но и способен ли он войти в реальный мир и решить конкретную задачу.
Проверка живости была ключевой частью первого крупного внедрения SenseTime. До этого у нас уже были хорошие демонстрации распознавания лиц. Но когда мы столкнулись с по-настоящему масштабным применением, выяснилось, что многие производственные проблемы не решены, особенно атаки на онлайн-систему.
Система обрабатывала больше миллиона обращений в день, а на пике подвергалась сотням тысяч атак за сутки. Технологию нужно было продолжать развивать, одновременно поддерживая уже запущенный сервис. Часто это напоминало рукопашный бой. Мы регулярно уходили из офиса в три-четыре часа ночи, а иногда работали до утра.
Нередко после суток борьбы мы устраняли все известные атаки и ехали домой спать. Вскоре после того, как мы засыпали, снова звонил телефон: онлайн-систему опять взломали.
Именно в ходе этой работы мы помогли развить сквозную архитектуру моделей SenseTime для распознавания лиц. Раньше многие алгоритмы глубокого обучения применялись только на отдельных этапах, а вся система представляла собой цепочку из нескольких ступеней. Но перед постоянно меняющимися атаками вручную собранные методы не могли обновляться достаточно быстро. Единственным выходом, который мы видели, была единая сквозная модель глубокого обучения, обучающаяся непосредственно на данных. Тогда мы называли её «объединённой моделью».
Этот проект впервые дал мне по-настоящему понять: если алгоритм работает в демонстрации, это ещё не означает, что технология состоялась. Она становится действительно пригодной только после того, как выдержит масштабный трафик, непрерывные атаки и самые разные неожиданности.
Позднее мы вышли на рынок смартфонов. Перед каждым запуском производители организовывали тестирование с участием сотен людей, а другие компании и пользователи постоянно находили новые проблемы. Это заставило нас создать одну из крупнейших, насколько нам было известно, команд тестирования среди тогдашних компаний, разрабатывавших алгоритмы ИИ, и попытаться перебрать все возможности.
Одну проблему с контровым светом удавалось воспроизвести только в определённом мужском туалете одного из офисов SenseTime. Другая, которую мы называли «лицо света и тени», возникала лишь под конкретным углом под определённым деревом. Чтобы продукт надёжно работал в повседневной жизни сотен миллионов людей, мы проделали огромное количество такой работы.
В итоге наше решение для проверки личности на смартфонах стало лидером рынка.
Это была первая река, в которую я вошёл в SenseTime. Проверка живости началась с исследовательской демонстрации, прошла несколько циклов крупномасштабного внедрения и превратилась в довольно зрелую область. К 2019 году многие задачи, прежде требовавшие рискованных поисков, можно было решать за счёт накопленного опыта. Я не закончил всё, но понимал, что снова оказался в зоне комфорта.
И вновь мне стало не по себе.
Остаться в SenseTime и сменить реку
В 2019 году я не покинул SenseTime. Я решил внутри той же компании перейти от проверки личности к промышленному зрению.
После масштабного исследования и множества обсуждений с руководством и коммерческой командой мы выбрали первым проектом промышленного зрения интеллектуальную проверку контактной сети C4 высокоскоростных железных дорог.
Вместе с предпродажной командой я посетил много железнодорожных центров проверки и управлений. Больше всего мне запомнился центр в Сюйчжоу. Перед нашим приездом только что прошёл дождь. Центр находился в довольно удалённом месте, и мы добирались к нему по грязной дороге, проваливаясь на каждом шагу.
Внутри стояли ряды компьютеров. Инспекторы ежедневно часами просматривали изображения в поисках возможных неисправностей контактной сети. Почти у всех были тёмные круги под глазами. Обнаружив неисправность, они ещё должны были проехать вдоль тысяч километров путей и устранить каждую проблему. Иногда речь шла лишь об ослабленном винте или гайке, но всё равно приходилось ехать на место. Ни мороз, ни жара не позволяли отложить ремонт.
Потребность казалась мне болезненно очевидной. По меньшей мере мы должны были помочь им с самой трудоёмкой частью — просмотром изображений.
Лишь начав работу, мы обнаружили, насколько задача сложнее, чем представлялось. В контактной сети больше ста типов деталей и свыше тысячи типов дефектов. Даже эти цифры появились только после многократного подсчёта и упорядочивания вместе с сотрудниками на местах. Многие проверки опирались на опыт, а документы и исторические данные были разбросаны по разным местам. Нам пришлось собирать материалы с нуля, работать рядом с линейными специалистами и разбираться с каждым видом неисправности по отдельности. Это заняло почти два года.
Ещё более серьёзной была проблема малой выборки. Неисправности на высокоскоростных линиях по природе крайне редки. Некоторые могут не произойти ни разу за год, но при возникновении иметь тяжёлые последствия. Мы не могли ждать, пока наберётся достаточно примеров. Приходилось заново проектировать методы под реальные условия.
В конце концов проект удался и был внедрён в широком масштабе.
Промышленное зрение стало второй рекой, в которую я вошёл в SenseTime. Я не менял компанию, но изменилось почти всё привычное: задачи, данные, клиенты, критерии оценки и способы работы. Я снова стал новичком, а затем вместе с командой сделал то, чего прежде мы делать не умели.
Именно поэтому я говорю, что река — не компания. Меня по-настоящему привлекает не уход из места, а вход в более трудную задачу.
2022 год, когда я не сменил реку
После выхода SenseTime на биржу компания столкнулась с новым финансовым и ресурсным давлением. Одновременно предыдущая волна компьютерного зрения постепенно входила в зрелую фазу, а следующая ещё не обозначилась ясно. Многие дела упирались в ресурсы, рынок или границы технологии и уже не могли развиваться так же быстро, как раньше.
Весь 2022 год я находился в несколько подавленном, или, иначе говоря, пассивном состоянии. Я начал работать по обычному расписанию.
В этой фразе нет ничего плохого. Обычный рабочий день — нормальная жизнь для многих людей. Но я всегда относился к работе как к собственному стартапу. Внезапно оказавшись в таком состоянии, я, наоборот, почувствовал глубокий упадок.
Внешне та жизнь была гораздо комфортнее прежней. Я больше не просыпался каждый день с новой задачей, которую обязательно нужно решить, и реже проводил ночи без сна из-за онлайн-сбоя. Но именно этот комфорт и мучил меня: я начал представлять, какой станет моя жизнь через несколько лет, если ничего не изменить.
Я не ушёл сразу. Меня удержала ответственность.
Железнодорожная инспекция получилась, но мы не добились успеха в контроле качества на автомобильных заводах и не завершили интеллектуальную промышленную роботизированную руку. Я хотел продолжать эту работу. Мне было трудно принять, что я создал команду и выбрал направление, а затем покину его в самый тяжёлый момент.
Одна сила говорила искать следующую реку, другая — что работа передо мной ещё не закончена.
В 2022 году вторая сила была сильнее.
Я увидел следующую реку
В конце прошлого года появился ChatGPT. В первой половине этого года вышел GPT-4. Прежнее равновесие нарушилось.
Тогда у меня возникло очень сильное ощущение: компьютерное зрение лишилось собственной цитадели.
Будущее не будет состоять из отдельных моделей для текста, изображений и речи. Компьютерное зрение не исчезнет, но станет частью того, как универсальные модели понимают мир. Раньше мы воспринимали зрение как самостоятельный технический центр; теперь появлялась более широкая эпоха общего интеллекта.
Это было не очередное техническое обновление внутри компьютерного зрения. Изменилось основное русло развития технологий.
Я вновь увидел реку, течений которой ещё не знал.
Раньше я мог сменить реку, оставаясь в SenseTime. Переход от проверки личности к промышленному зрению в 2019 году был таким выбором. Но на этот раз следующая река не лежала на продолжении моей прежней работы. Я хотел войти в общий интеллект и новые приложения, которые он создаст.
Моя должность и ответственность по-прежнему относились к промышленному зрению. Если бы я остался, то должен был полностью посвятить себя этой работе. Нельзя было нести текущую ответственность и одновременно готовить для себя следующую остановку.
Чтобы действительно прыгнуть в следующую реку, сначала нужно было уйти с прежней позиции.
В первой половине года мне становилось всё труднее сидеть на месте. Я не знал, какие продукты в итоге создаст новая технология и что смогу в ней сделать. Но понимал: если ждать, пока всё станет ясно, я рискую упустить годы, когда важнее всего начать учиться.
У действительно важных дел редко наступает момент, когда можно объявить их «полностью завершёнными». Если ответственность означает ждать, пока закончатся все проблемы, человек может никогда не сделать нового выбора.
Постепенно я понял, что ответственность не сводится к тому, чтобы остаться. Остаться — тоже выбор, и за его последствия тоже нужно отвечать. Чувство ответственности не должно становиться причиной бесконечно откладывать решение.
Поэтому в июне этого года я ушёл из SenseTime.
Почему я ушёл без ответа
До ухода я не готовил тайком стартап вне работы и не собирался вынести из SenseTime её действующий бизнес, чтобы основать собственную компанию.
Если я всё ещё работал в компании, отвечал за её результат и пользовался предоставленными ею ресурсами, но втайне думал, как подготовить следующую остановку, то чувствовал бы себя нечестным по отношению к нынешней работе.
Это означало, что в момент увольнения я действительно не был готов.
Я не был готов к предпринимательству не потому, что относился к нему несерьёзно, а потому, что до ухода продолжал серьёзно относиться к прежней работе.
Я мог только сначала уйти, а затем искать ответ.
Умение плавать не означает знакомства с каждой рекой. Невозможно и стоять на берегу до полного понимания течения, а уже потом прыгать. Некоторые знания можно получить только в воде, а некоторые направления видны лишь после начала движения.
На этот раз смена реки означала увольнение. Но двигало мной не стремление уйти само по себе, а появление следующей реки.
Выбрать сторону приложений
После появления ChatGPT я обсуждал с друзьями вопрос: если придёт AGI, окажется ли интеллект сосредоточен в руках нескольких платформ или будет доступен большему числу людей?
Я считал, что в конечном счёте он непременно распространится.
Строго доказать это я не могу. Моя интуиция проста: сама Вселенная не является централизованной системой. Реальный мир состоит из бесчисленных людей, устройств, сред и локальных задач. Если интеллект действительно войдёт в этот мир, он тоже должен существовать во множестве форм. Обучение фундаментальных моделей может сосредоточиться в нескольких компаниях, но приложения интеллекта не будут принадлежать только нескольким платформам.
Поэтому я не хочу создавать фундаментальные модели. Я хочу делать приложения, которые с помощью нового интеллекта отвечают на одну конкретную потребность за другой.
Этот выбор связан и с моей жизнью.
Я вырос в деревне. С начальной до средней школы я проводил много каникул и свободного времени, помогая семье в сельском хозяйстве. Я сеял, вносил удобрения и пестициды, водил трактор и разводил животных. На каникулах я считал себя самым настоящим крестьянином.
Мне нравилось чувство результата от такой работы. Хорошо ли вырос урожай, хорошо ли выращены животные — всё было видно напрямую. Если сделать работу чуть лучше, жизнь одной семьи становилась чуть лучше.
В университете у меня было много подработок, а ещё мы с однокурсниками организовали летние дополнительные занятия. Мы сами набирали учеников, собирали оплату и преподавали. Тем летом все участники заработали достаточно на расходы следующего года.
Во время учёбы в магистратуре я давал частные уроки. Позже, когда SenseTime только начинала и её офисом всё ещё служил гостиничный номер в отеле Wenjin у южных ворот Цинхуа, я присоединился к ней как один из первых сотрудников-основателей.
Внешне между этими делами мало общего. Но они давали мне ощущение достижения одинаковым способом: я решал реальную проблему и видел, как что-то меняется благодаря моему участию.
Поэтому, когда стала появляться новая эпоха общего интеллекта, я снова инстинктивно выбрал сторону приложений. Меня волнует не то, как доказать, что технология сильнее, а то, что в итоге она сможет сделать для конкретного человека.
После прыжка
Войти в следующую реку не значило сразу понять, куда плыть.
В первые месяцы после ухода из SenseTime я по привычке искал возможности там, где разбирался лучше всего. Вместе с другом мы попробовали несколько продуктов, связанных с изображениями. Всё-таки почти десять лет моей работы относились к компьютерному зрению. Начать оттуда казалось естественнее всего.
Но спустя некоторое время я всё сильнее чувствовал, что направление неверно. Проблема была не обязательно в самих продуктах, а в том, что мы по-прежнему исходили из того, что умеем, а не из того, что действительно нужно пользователям.
Если десять лет носить молоток, то даже в другой комнате легко продолжать видеть повсюду гвозди.
Я понял, что войти в новую область — не значит просто сменить место и продолжить применять прежние успешные методы. Настоящее начало с нуля требует на время отложить самые привычные ответы.
Тогда я спросил себя: если не учитывать технический опыт предыдущих десяти лет, какой продукт с ИИ я больше всего хотел бы получить сам?
Моим ответом были заметки.
Продукт, которого я хотел больше всего
Со средней школы я следую правилу: «Не читать, не делая пометок и записей». Для меня заметки никогда не были только местом хранения. Они продолжают память и являются частью мышления.
Их часто называют «вторым мозгом», но этот так называемый второй мозг на самом деле не обладает интеллектом.
Мы складываем в него информацию, но всё равно должны сами её организовывать, искать, устанавливать связи и думать, как извлечь обратно. Он больше похож на внешний жёсткий диск, чем на ещё один мозг.
Это поколение больших моделей впервые заставило меня поверить, что положение может измениться коренным образом. Возможно, заметки будущего будут не только хранить написанное человеком. Они смогут понимать содержание, находить связи, помогать нам вспоминать в нужный момент и даже участвовать в мышлении.
Я хочу создать не программу для заметок с несколькими функциями ИИ, а по-настоящему интеллектуальный второй мозг.
Общий интеллект — следующая река, в которую я прыгнул. Умные заметки — первое направление, в котором я решил плыть, оказавшись в ней.
До другого берега ещё далеко
До этого я много раз делал вещи, похожие на предпринимательство. Летние занятия в университете были неформальным бизнесом. Присоединиться к SenseTime в самом начале означало участвовать в стартапе. Создание команд проверки живости и промышленного зрения внутри SenseTime тоже было похоже на предпринимательство внутри компании.
Но на этот раз всё было иначе. В июне этого года я впервые покинул компанию, полностью вышел на рынок и начал заниматься собственным бизнесом полный день в настоящем смысле слова.
Сегодня 31 декабря 2023 года. С моего ухода из SenseTime прошло полгода.
Я ещё не нашёл ответов на все вопросы и не достиг берега, который можно назвать успехом. Я учусь многому, в чём прежде не был силён: создавать продукт, понимать рынок и добиваться их соответствия.
Для многих такое состояние может быть мучительным. Мне же оно дарит давно забытое чувство знакомого, потому что я снова оказался там, где не знаю ответов.
Это первая статья в моём личном блоге. Я пишу её не потому, что путешествие завершилось, а потому, что в момент его настоящего начала хочу записать, почему отправился в путь. В будущем я продолжу писать здесь о технологиях, продуктах, людях и о том, что создаю.
Я не знаю, куда в конце концов приведёт эта река.
Но, оглядываясь назад, я вижу: несколько важных перемен в моей жизни начинались с одного выбора. Уделив делу достаточно времени и заметив, что постепенно вхожу в зону комфорта, я начинал искать следующую реку.
В июне этого года я снова сделал такой выбор.
Я всё ещё в воде.