11 сезон · выпуск 1 · 13 июня 2024 · 46 мин
Как айтишники расшифровывают античные рукописи
ИИ и нейросети Медиа и культура
Слушать · 46:06
Реклама. АНО ДПО «Образовательные технологии Яндекса» ИНН 7704282033
Курс «Фронтенд-разработчик» для тех, кто хочет освоить профессию с нуля или сменить направление в IT: https://clck.ru/3B8jKC?erid=2SDnje2egxR
Слушать «Запуск++» и другие бонусы по подписке ЛибоЛибо+ в приложении «Подкасты» от Apple https://cutt.ly/zap10epap или в закрытом тг-канале Либо/Либо https://cutt.ly/zap10eptg
Подписаться только на «Запуск++» в Телеграме: https://t.me/tribute/app?startapp=s3zy
Над выпуском работали
- Редакторки
- Маша Агличева и Маргарита Берденникова
- Продюсер
- Данил Астапов
- Звукорежиссер
- Юра Шустицкий
- Дизайнер обложки
- Петр Сутупов
Транскрипт
Самат Галимов, Антон Репушко, Алексей Мартынов · расшифровано автоматически, ошибки возможны
-
Либо-либо. Всем привет, меня зовут Самат Галимов и это подкаст «Запуск завтра». Как технический директор я пытаюсь разобраться, как устроены сложные и интересные штуки. Я зову профессионалов, с которыми можно поговорить простым человеческим языком. Дорогие друзья, мы возвращаемся с новым, одиннадцатым сезоном нашего подкаста. В прошлом сезоне мы попробовали новый формат. Помимо привычных нам интервью с экспертами, мы сделали серию нарративных эпизодов «Сохранить как» и рассказали в них историю появления форматов, которыми пользуемся каждый день. Спасибо большое, что слушали и комментировали. Мы получили очень много ваших отзывов и решили продолжить делать такие эпизоды. Прямо сейчас мы работаем над новыми нарративными эпизодами. Они будут готовы примерно через два месяца. А до середины августа у нас будет, как обычно, каждый четверг выходить интервью. А теперь к теме сегодняшнего эпизода. Он о древнегреческих свитках. Если вы подписаны на мой Телеграм или Фейсбук, то вы наверняка видели эту статью про то, что ученые смогли расшифровать сгоревшие две тысячи лет назад свитки. Это совершенно безумная история, потому что, с одной стороны, она важна очень культурно в общечеловеческом контексте. Большая часть западной цивилизации, западной культуры строится на древнегреческих текстах. Есть шанс протянуть руку через две тысячи лет и достать новую пачку текстов, о которых мы две тысячи лет ничего не знали. С другой стороны, расшифровка этих текстов— это супер-суперсложная техническая задача. И организовали ее как конкурс, в котором может поучаствовать любой человек, который захочет. В реальности над этой задачей работают одни из лучших умов человечества. А платят им за это совершенно смешные по масштабу задачи деньги. Как это получилось сделать и можно ли повторить опыт вот такой организации проектов, организации труда в других сложных областях, мы поговорим с программистом, который участвовал в этом конкурсе и продолжает расшифровывать древнегреческие свитки. Это подкаст студии Либо-Либо. Этот эпизод мы сделали вместе с Яндекс.Практикум. И в середине выпуска будет специальная партнерская рубрика о том, как программистам применять ИИ в работе и в обучении. В практикуме ИИ уже встроен в курсы и помогает студентам учиться. YandexGPT (Яндекс GPT) объясняет простыми словами, когда что-то непонятно в теории, переводит термины и делает пересказ в конце урока.
-
Меня зовут Антон Репушко, сейчас я машин-леарнинг-инженер в Амазоне. Занимаюсь созданием искусственных софтвер-инженеров. Параллельно с этим интересуюсь философией, учу древнегреческий. И еще я участвовал в конкурсе по расшифровке древнегреческих свитков.
-
Антон, откуда ты узнал о конкурсе вообще?
-
Типа есть просто разные комьюнити, так сказать, это... Все варятся там в своем соку, вот этом вот, и просто всплывало там интересное соревнование, что вот у нас есть двухтысячелетние свитки, мы не знаем, что с ними делать, у нас вот есть такой небольшой кусочек, давайте вы придумаете, поможете нам с этим разобраться.
-
Расскажи, что это за свитки.
-
Ну, так сказать, в человеческой культуре есть извержение везувия, такой феномен, который до сих пор дошел до нас, и есть вот помпей. Все знают вот там типа... Последний день
-
Помпеи, картина вот эта.
-
Последний день Помпеи, да-да-да, именно её, да-да-да. И немногие знают, что на самом деле, параллельно с Помпеями, там ещё был городочек, и вообще их там несколько было, которые тоже это извержение затронуло. И один из них вот назывался Геркуланум. Из интересного, он был буквально на побережье. То есть, получалось так, что лава, когда стекала с Везувия, она просто вот так его затопила. То есть, просто 5-6 метров лавы у тебя над городом, и она стекла в море.
-
Офигеть.
-
Вот. Появление вообще вот этих свитков и развалин тоже довольно интересная история. В 18 веке Поверх этого города основался другой, и люди там сажали картошку. Площадь плодородная, чтобы ты понимал, да? Ну, лавой типа все занесло, там типа уголь и так далее. И они начали находить какие-то такие маленькие как окаменелости, которые использовали как удобрение. Вроде горит хорошо, там типа покрошишь уголь, картошка будет лучше расти, условно. И однажды кто-то заметил, что на вот этих угольках есть какие-то внезапно древнегреческие буковки. Ну, то есть ты вроде смотришь на камушек, а там что-то нарисовано.
-
Да.
-
И все такие, воу-воу, что это такое? Начали эти кусочки коллекционировать. Начали пытаться разобраться во что вообще происходит. И раскопали виллу. То есть смотри, важно что понять. Вот в этой вилле раскопали просто, грубо говоря, одну треть, наверное, да? При этом это еще не та область, где теоретически могла бы быть библиотека или какое-нибудь там типа свиткохранилище и вот это вот все. Из того, что вытащили, по-моему, вытащили около тысячи с небольшим свитков. стали пытаться как бы прочитать их, потому что основная проблема античной литературы в том, что до тебя дошел вообще супермаленький объем того, что было написано. Вот эти Одиссеи, Илиады, вся древнегреческая философия, это буквально там малюсенький процент от того, что было написано.
-
Да-да-да.
-
Когда читаешь любую дренигическую литературу, в смысле, про дренигическую литературу, такой, типа, суперпопулярный был поэт, два стиха сохранилось, очень классный.
-
Да-да-да, рекомендую. Как это, новые стихи пишут те, у кого старые плохие. В течение 19 века были попытки разных вот там богатых баронов и так далее, меценатов, как-то развернуть вот это всё. Успехами они не увенчались, очевидно.
-
Развернуть в смысле прочитать эти свитки? Развернуть?
-
Да-да-да, именно так, да. Что там только не пытались делать. Пытались как будто бы, типа, ну, как бы сделать мозаику из этого и как-то вот сложить.
-
Пытались... А, типа, раскрошить и потом собрать.
-
Да.
-
Как пазл.
-
Ну, примерно так, да. И когда... Ну, собственно, когда вот из-за того, что они все такие консервированные, когда ты пытаешься его раскрыть, он буквально рассыпается, вот как пепел. Свитки, которые получше сохранились, ну, там, типа, разная степень прожарки была, там создавали специальную машину, которая разворачивала буквально по сантиметру в день, и стоял какой-то человек, который постоянно прыскал на это водой, чтобы это, типа, не сломалось, не раскрошилось.
-
Нормальная автоматизация.
-
Да-да-да. Очень много интересных механизмов вообще было вот именно. Попыток что-то с этим вот сделать. Потому что не было вообще понятно, что там написано. Из того, что, как я понимаю, удалось расшифровать там вот когда-то тогда, это были вот, собственно, эпикюрейские сочинения. В общем, это про то, что нужно жить в кайф. И жизнь это про получение удовольствия. Это такой вот типа протагедонизм, наверное, вот так это правильно сказать.
-
Хорошая философская школа.
-
Да, именно так. Забавно, по-моему, Бытует легенда, что у них над школой была надпись «Здесь счастлив каждый» или что-то вроде того. То есть ты приходил, чтобы получать удовольствие. И, в общем, с переменным успехом это пытались всё как-то расшифровать, не расшифровать, и пытались дальше раскапывать эту виллу. Как мы помним, там только треть раскопали. Но в итоге в какой-то момент остановили, потому что прогресса нет, ну то есть как бы чего копать, если ты ничего прочитать не можешь, и их вот как бы законсервировали там. Вау!
-
То есть они не стали там типа «давайте все раскопаем, потом посмотрим», а они
-
очень... Нет-нет-нет, и даже то, что раскопали, они как бы сложили в кучку, и вот это хранится часть в библиотеке Наполи, часть в Великобритании, ну в каких-то музеях, ну короче, по музеям распихали, часть во Франции, например.
-
Очень взрослый подход, я бы сказал.
-
Да. Да, удивительно разумно. Абсолютно с тобой согласен. Из интересного, что следующая проблема, почему это вот сейчас аукается сейчас. Кажется, что если мы сможем прочитать вот эти свитки, то можно копать дальше. То есть нужно копать эту дальше виллу, потому что в глубине, и может в среднем, как я понимаю, по каким-то расчетам виллах, может находиться до 4-5 тысяч свитков. А это, по-моему, вообще удваивает всю древнегреческую литературу. Ну, вообще все тексты, которые у нас были до этого.
-
Все, что мы до этого смогли древнегречески прочитать, тут, может быть, типа Х2 от этого.
-
Да, именно так, да.
-
Кайф.
-
Проблема в том, что сейчас за все вот эти тысячелетия над этой виллой выстроили городок, буквально в черте города. Если ты хочешь продолжать дальше раскопки, то тебе нужно куда-то расселить 30 тысяч человек, которые там сейчас живут, если ты дальше будешь копать.
-
А это микрорайон, что ли? На месте этой виллы просто микрорайон?
-
Ну, просто городочек, да. Вот это прямо на окраине вот текущего города живого есть. Вот у тебя есть город, а рядом у тебя там раскопки вот этой виллы. Если ты дальше копаешь, то ты нарушаешь целостность вот этих почв, не становится небезопасно жить и так далее. И основная из идей, почему вообще стоит этим заниматься, чтобы продолжить раскопки. Если мы покажем, что как бы это возможно, то правительству Италии можно попросить, давайте вы подвинете своих людей, а мы дальше будем копать.
-
Значит, были эти свитки, которые нашли в 1800 каком-то году, пытались по-всякому читать с переменным успехом. Звучит как такая очередная научная штука, которая интересна, не знаю, парой тысяч экспертов, остальные про неё не знают. Как эта научная загадка, типа, как прочитать эти свитки, стала конкурсом для программистов? С чего всё началось?
-
Да-да, смотри. Учёные любят создавать общество, назовём это так. красивой, и создали так называемый Herculaneum Society. То есть, представь, что ты вот член вот этого вот общества с какими-то, возможно, тайными знаниями. На самом деле, нет. И люди занимались там, собственно, тем, что пытались передавать свитки из поколения в поколение, что-то с ними делать, пытаться проводить какие-то эксперименты там по вычленению каких-то кусочков или что-то еще. Было много, собственно, попыток вообще как бы вот что-то с этим придумать. Какие-то улучшения и вообще какие-то шансы появились вот как раз развитием технологий, собственно, с развитием ML, там 3D-сканирование, детектирование в медицине различных полячик по 3D-сканам и так далее. И был дядечка, вот, из профессора университета Кентукки. Его зовут Брент Силс (Brent Seales). Дядечка потратил всю жизнь на то, чтобы, собственно, попытаться, ну, вот, какой-то уже там постдок, там, профессорской и так далее, на то, чтобы попытаться что-то, какие-то эти свитки прочитать. Это такой очень целеустремленный дядечка. То есть, если вот посмотреть, например, его интервью, Основная его мотивация удивительно человечная, я бы так сказал. Потому что его мотивация, зачем это делать? Потому что древние греки были умными, познали вообще жизнь и так далее, и, возможно, мы бы нашли какие-то слова, которые бы нам позволили тоже лучше понять мир. Очень мило. Статья в Nature была где я не очень разбираюсь в физике томографов, но идея в том, что если ты с разной частотой просканируешь один и тот же свиток, с разной частотой там луча или чего-то еще, или интенсивности, а потом попытаешься наложить вот в пиксель в пиксель два 3d изображения, то ты уже в может что-то прочитать. И ты реально можешь. Потому что у тебя чернила, ну, изменяют как бы там свойства и по-разному выглядят там вот в разных лучах. А бумага, типа, везде бумага. И вот этот дядечка потратил там карьеру свою на то, чтобы попытаться это расшифровать вот в университете Кентукки. Потом был другой дядечка, Нат Фридман (Nat Friedman) его зовут.
-
Так, это ближе уже к нашей теме.
-
Это ближе к нашим айтишным болотам. Дядечка известен как создатель фреймворка Xamarin, который был потом типа счастливо вообще десятилетия назад выкуплен Майкрософтом. И какое-то время он был CEO гитхаба. Вот какой-то там короткий небольшой промежуток времени, может быть условно год или полтора. У него вообще интересный подход. Он типа такой товарищ прям очень про open source, да, то есть он прям верит в комьюнити, открытую разработку и так далее.
-
Но вряд ли другого человека сделали бы CEO гитхаба. Гитхаб – главная платформа для коллабораций программистов между собой.
-
Все так, все так. Параллельно с этим у него есть маленький инвестфонд, где он очень таргетирован на небольшие суммы денег, ну то есть там типа буквально 5-10 тысяч долларов. но это маленькие суммы денег в рамках инвестиций, а дают им какие-то супермаленькие проекты, которые двигают опенсорс на ML. Например, ты хочешь затащить какую-нибудь маленькую либу, как-то адаптировать или ускорить ее для работы на слабом железе, у них есть батчи, ты пишешь пропозал, тебе дают грант, ты пилишь, все, вы в расчете.
-
Офигеть. Это опенсорс здорового человека.
-
Да-да, именно так, да. Это буквально такое меценатство в опенсорсе. Ну вот. И, в общем, начался ковид. Всем было скучно. Я не знаю, чем ты, например, занимался, я составлял свое генеалогическое древо. А вот Нед Фридман, он, видимо, думал о Римской империи и набрёл на вот это вот вообще историю вот этих вот всех свитков. И он решил прямо написать преподавателю, а давайте что-нибудь с вами придумаем, вот о чём и сделаем. А как ты понимаешь, вся государством спонсируемая наука, она довольно медленная и бюрократичная, и дядька профессор сказал, конечно, давайте. И вот они вместе попытались отсканировать эти свитки.
-
Значит, Нед Фридман, миллиардер, айтишник, И филантроп, типа, чувак про open source натыкается на эти геокономические свитки и пишет ведущему ученому, типа, давайте я вам помогу.
-
Именно так. Вот буквально все так и было. Сказал, очень интересно, чем могу помочь, давайте что-нибудь придумаем.
-
Так. И они начинают сканировать их.
-
Да. Основная идея была в том, что вот современный ML, он может как будто бы в этом как-то помочь. Но для того, чтобы как-то помочь, нужны данные. При этом данных нужно много, и они
-
должны быть ещё вот... В очень хорошем качестве, скорее всего.
-
Ну да-да-да. И должны куда-то быть загружены, открыты. То есть их нужно там под какой-то ещё открытой лицензией выпустить. По-моему, они затащили томограф в музей, потому что им запретили вытаскивать это из музея. Да, в соседней комнате. И буквально они переносили этот свиток отсканировать и возвращали обратно. Вот. То есть вот так это выглядело.
-
Охренеть. Просто перевести томограф, это тоже не... ну, в смысле, это операция.
-
Ну, то есть, это буквально, это вот авантюра, вот уровня каких-то вот таких, типа,
-
фильмов про... «12 друзей Оушена» или ещё что-то такое.
-
Да-да-да, примерно так, да. Вот, примерно такой же уровень. Это стоило больших денег. То есть, например, если отсканировать вот свиток, вместе там с арендой вот этого какого-то мощного томографа, который это сделает, перевозка и логистика и так далее, по-моему, около 100 тысяч баксов стоит сканирование одного свитка.
-
Нормально.
-
Просто чтобы отсканировать.
-
То есть даже сам этап сканирования уже— это большие инвестиции, это процесс сам по себе.
-
Да-да-да, абсолютно так. Интересно то, что на самом деле на само соревнование, да, они собирали краудфандингом. То есть если ты считаешь, что вот эти 700 тысяч баксов— это деньги, там, Нета Фридмана— нет. По-моему, он вложился со своим партнером только по, по-моему, 50 или 100 тысяч, а всё остальное— это были донаты, которые, там, он запостил в Твиттере, и там какие-то его и две друзья понакидали туда.
-
А вот тут как бы сразу видно чувака, который понимает, что это про капитализм.
-
Да, да, да, да, да. И если ты зайдёшь на сайт, например, ну, спонсоров, кто там сколько задонатил, там буквально есть список того, вот мы благодарим там эту компанию, эту, эту, тусью, пятую, десятую, и там таких типа индивидуалистов, которые там тоже что-то задонатили. Дальше, в общем, они сканировали вот эти вот свитки. И дальше была проведена огромная медиа работа. То, что был создан там идеальный сайт, они там типа заказывали кучу красивых визуализаций, чтобы там самые чайники поняли, что вообще происходит. И потом они пошли, собственно, хайрить ребят, которые могли бы этим заниматься, на Kaggle.
-
Ага, на платформе, где соревнуются ML-специалисты. Абсолютно так. Вот они подготовили данные, и теперь такие. Сейчас мы найдем самых крутых экспертов. Абсолютно так. Друзья, а сейчас мы прервёмся на нашу специальную рубрику, в которой мы вместе с экспертами Яндекс.Практикума отвечаем на один вопрос об использовании искусственного интеллекта. Сегодня мы обсудим, как дать ИИ такую задачу, такой промпт, чтобы он написал код вместо тебя.
-
Меня зовут Алексей Мартынов, я разработчик и предприниматель уже более 20 лет, владелец нескольких IT-компаний в России и за рубежом. Сейчас я являюсь программным директором и ведущим экспертом в Яндекс.Практикум на веб-факультете. Также являюсь техническим директором проекта Акирио, который как раз таки занимается системами искусства. Во-первых, искусственный интеллект, это тоже часть GPT, он не является какой-то волшебной кнопкой, сам по себе он не пишет код. И есть такой тоже момент, что если условно вы сами не знаете хорошо, что хотите получить, то вы ничего не получите, вы получите не то, что требует. Поэтому, чтобы сделать хороший качественный промпт, он должен состоять из как минимум трех основных частей. Это контекст, это задача и результат, в котором мы хотим получить. Например, как мы можем задать контекст. У меня есть такой-то код. Вы приводите код, после этого указываете, что с ним нужно сделать. Например, переведи мне его на другой язык и потом указываем. В ответе приведи только фрагмент кода без дополнительной информации. Можно попробовать на таком примере. У меня есть пример кода на TypeScript и Node.js. Дальше указываем фрагмент кода. Необходимо перевести его просто на JavaScript. Вместо такой-то функции используй функцию из такой-то библиотеки. В ответ приведи только результирующий код без дополнительной информации. В итоге мы получим то, что нам нужно без всякой обвески. Да, спасибо, я могу вам помочь. Также еще один момент. Чем больше код вы пытаетесь сгенерировать, тем больше потенциально в нем будет ошибок. Поэтому разбиваем задачу на небольшие фрагменты и на каждый фрагмент генерируем то, что нам необходимо. ChatGPT, например, тоже справляется, скажем так, сложно, можно попросить его объяснить решение по шагам. Например, сделать такое-то решение, объяснить решение по шагам, и тогда вы тоже получите повышенное качество результата. Поэтому пользуемся вот такой вот структурой, тренируемся и будут получать хорошие результаты.
-
А для тех, кто хочет освоить профессию с нуля или сменить направление в IT, у Яндекс.Практикум есть курс «Фронт-энд-разработчик». Программу курса регулярно обновляют на основе обратной связи от нанимающих специалистов и крупных компаний. Например, в этом году уже обновили темы по TypeScript 5 и React 18. Курс построен на задачах, максимально приближенных к реальности. Навыки получается отработать на 500 тренажерных задачах и 11 проектах. На курсе есть дополнительные активности— лайв-кодинг, парное программирование и рабочие сессии с экспертами. Бесплатный модуль из семи тем поможет понять, подходит ли вам такой формат обучения. За неделю вы напишите простую программу на JavaScript и соберете интерактивную веб-страницу. Я представляю себя на месте Ната Фридмана. Первое, что мне в голову приходит, что есть, наверное, специально обученные люди, у которых работа такая, расшифровывать древние свитки. Почему нельзя просто как бы взять и заплатить тем людям, сказать, чуваки, сделайте?
-
Это хороший вопрос. На самом деле, мне кажется, что таких людей нет, и я тебе объясню, почему. Потому что, так как мы живем с тобой в капиталистическом мире, зарплата платится за то, что зарабатывает больше денег. Ну, то есть ты понимаешь, к чему я веду.
-
Улучшение метрики, сколько людей в Амазоне кликнут на кнопочку или там что-то вот подобное, за это хорошо платят.
-
Да, да, именно так. Я не помню, кстати, чья это цитата довольно известная, что я видел самых умных людей в мире, и они пишут XML-парсеры в Фейсбуке.
-
То есть, чуваков, которым можно было бы просто это заказать промышленно, таких нет, и лучше сделать конкурс.
-
Есть идея в том, что как будто бы, когда ты делаешь такой конкурс, у тебя пул больше. У тебя идет как будто бы положительная фильтрация людей. Если ты начал этим заниматься, очевидно, что ты уже достаточно ебнутый для того, чтобы дальше в этом ковыряться.
-
Можно еще чуть-чуть такое ощущение объема задачи? Это как бы работа на двух чуваков на две недели или это работа на 100 человек в течение 10 лет? Насколько это большая, маленькая задача?
-
Не было понятно, что эта задача вообще решаема. То есть ты не можешь даже предсказать объем, потому что даже не можешь предсказать, вообще решаема она или нет, понимаешь?
-
То есть это настоящая научная эрэнди, когда
-
ты... Это вообще ничего не понятно. То есть у тебя есть представление, что это может сработать, и ты даже не можешь объяснить чувакам, что ты хочешь, потому что ты даже не понимаешь, что ты хочешь получить в ответе.
-
Офигенно. Подожди, но в такой формулировке ты вряд ли можешь поставить задачу в соревновании. Как выглядит 3D-скан древнего папируса? Что на них можно разглядеть вообще?
-
Но вот представь, что у тебя есть батон докторской колбасы, и ты режешь его вот так горизонтальными типа слайсами, кусочками, с толщиной 7 нанометров.
-
Я просто думаю про микротомограмму мозга, когда тоже вот мозг нарезает тонкими-тонкими-тонкими.
-
Да, абсолютно так. Да-да-да, это вот то же самое.
-
Он как дерево такое выглядит красивое.
-
Да, именно так. Вот, выглядит действительно как вот какое-то вот такие непонятные скругления там бумаги и вот этого папируса и так далее. Так оно выглядит.
-
Погоди, а мы колбасу поперёк? Нормальный, как обычный колбасу нарезают?
-
Да, именно так, да.
-
Окей. Погоди, 7 нанометров это... Какой-то очень маленький
-
шаг, не знаю, очень маленький.
-
То есть там человеческий волос, это типа огромный по сравнению с этим?
-
Это точно меньше, чем толщина человеческого волоса, это вот прям 100%. Потому что у тебя, например, на вот этот кусочек 7-8 сантиметров получалось, по-моему, 16 тысяч вот этих вот срезов.
-
Классно.
-
Ну, смотри, у тебя вот этот свиток, вот этот вот, присканированный, да, который вот так вот выглядит, он весит, условно, там 2 терабайта. Вот один. Их четыре.
-
Один свиток, один жёсткий диск.
-
Да.
-
Охренеть. Так, значит, у тебя есть послойная штука. Абсолютно так. И ты, когда смотришь на один слой, ты видишь свёрнутую бумагу, на самом деле, да, получается? Да, именно так. И на ней временами могут быть кусочки краски заметной тоже, да?
-
А, это главная проблема, смотри. Древние греки не знали о существовании томографов, что удивительно, могли бы и догадаться. И они писали чернилами, которые основаны на углероде, carbon-based ink. Так. И они не видны в томографе. Ужас. То есть у тебя есть просто бумага с какими-то артефактами, возможно, физическими и так далее, и ты даже не знаешь, есть там буквы или нет, понимаешь? Ты вот смотришь, ты даже не видишь ничего.
-
Слушай, ну я пишу перьевыми ручками, и я знаю, что даже если без краски писать на бумаге, то остаются углубления.
-
И это именно суть вообще вот, что, собственно, подвело вообще к возможности решить это соревнование.
-
То есть, 2000 лет назад кто-то писал на папирусе и давил при этом, когда
-
оставлял... Абсолютно так, да. И мы теперь восстанавливаем, собственно, основность на том, как он там давил, где он там типа корябл, где не корябл, что он вот, собственно, писал. Вообще, на самом деле, я прочитал книжку, вот, когда занимался соревнованием, про палеографию. Это наука, которая изучает, как вообще писались тексты, как вообще ты пишешь там буквы, вот именно рукописные тексты изучает. И, скажем так, индустрия древнегреческих писцов была довольно развита. Ну, то есть, что им платили за символы. Ну, то есть, это буквально типа копирайтеры, понимаешь, древнегреческие. Им платили за символы. У них должен был быть красивый почерк, там типа буквы должны были быть соразмерные и так далее. Потому что это писалось буквально один раз, и потом там свитки передавались там из поколения в поколение. И их было, ну, не то чтобы много именно прям каких-то профессиональных профессионалов. И при этом из-за того, что это были люди, там очень много смешных забавных артефактов. Ну то есть к концу строки буквы начинают сжиматься в кучку или становиться меньше.
-
Чтобы влезть.
-
Да, и потому что писец торопился закончить строчку или лист, понимаешь? Ну то есть он реально торопился и начинал писать быстрее.
-
Пойди поесть, в туалет сходить. Офигенно. Слушай, я не удивлюсь, если в какой-то момент, если получится научиться нормально эти свитки расшифровывать, то мы начнем еще пиццов разделять, типа, что «а, это тот самый чувак».
-
А так и есть. Ты можешь как раз атрибуцировать категорию текста на то, что эпикурейский текст, скорее всего, писал там вот один писец.
-
Да, это полный писец. Расскажи про вот эту задачу. Вот у нас есть много-много этих кусочков колбасы, на ней видны иногда углубления. Собрать из этого картинку, как вот мы привыкли, как выглядит текст, это решённая задача?
-
Вот тут как бы это... Нет, нет, нет. Представь, что ты на вот этих слайсах, ты ставишь точечки по краю листа, а потом идешь на следующий слайс и тоже ставишь точки по краю листа, а потом идешь на следующий и еще ставишь по краю листа. И в итоге у тебя получается, что ты можешь из вот этого 3D-снимка, если ты все вот так вот типа сожмешь, выделить маленький кусочек именно листа. Он уже будет вертикальный. Ты ставишь точки горизонтально, он получается вертикальный.
-
поверхность видишь именно так значит вот у нас есть колбаса мы ее нарезали и мы берем самый верхний слой не обязательно
-
ты можешь просто взять из середины ты буквально из каждого кусочка ставишь точечки а потом пытаешься проецировать эти точечки на нижний кусочек представь что ее спицы пытаешься проткнуть вот так вот снова нанизать вот эти кусочки на спицу.
-
И тебе важно, чтобы длина спицы на каждом кусочке была одинаковой, ну или такой, чтобы это, типа, восстановить изначальный папирус по его нарезке.
-
Именно так, да. Ну то есть ты пытаешься наложить вот это вот всё вот так вот, таким образом, чтобы ты мог вытащить вот именно кусочек бумаги, уже вертикальный. Проблема основная в том, что из-за того, что это всё спёклось, у тебя куча листов состыковались вместе, и ты не знаешь, где заканчивается один, где заканчивается другой.
-
Они слипаются, получается.
-
Да, да, спрессовываются.
-
Ты сказал, что это задача разметки. Да. Каким образом? Ты просто смотришь на картинку... Буквально, да. И прямо глазами, типа, следишь, вот этот слой, вот он загнулся, вот он там... Да, да.
-
оборвался. Да, именно так, абсолютно так. Жесть какая-то
-
же, адское количество работы, 16 тысяч. Если у тебя один свиток из 16 тысяч кусочков колбасы, то тебе нужно каждый из них съесть и по каждому слою. А сколько, вот когда сворачивают папирусы, сколько там метров вообще?
-
Давай скажем типа полтора, например, метра условно.
-
Подожди, это довольно много слоев, дохренище слоев.
-
Да, это буквально как ты вот срезы дерева пытаешься, вот типа проводить линию по срезу дерева.
-
Жуть.
-
И разметка ручная, по-моему, одного квадратного сантиметра условно там стоит 500 баксов.
-
Жесть какая! Обычно такую разметку делают люди там из Филиппин, сейчас уже, может, даже из Африки, и за там типа 10 центов штука обычно, там типа такой порядок цен. Почему так дорого? Потому что так много действий маленьких или тебе нужны обученные люди?
-
Нет, так много действий, тебе нужны обученные люди, потому что это специальный софт, и это не данные, которые очевидны человеку. То есть ты представь, что ты можешь сказать, где кошечка, а где собачка, а где заканчивается один лист, и где начинается другой. Тебя в школе не учат.
-
Слушай, надо еще пояснить, обычно в этих ML-задачах ты имеешь возможность легко проверить, чувак типа наврал или не наврал, а здесь тебе нужно специально обычные люди, чтобы проверить, господи, это безумие.
-
Абсолютно.
-
Я вообще не уверен, что типа так разумно эту задачу решать, нет, сейчас нет такой уверенности.
-
Ну вот так её попытались решить. Это такой straightforward подход, скажем так. Значит,
-
у тебя вот есть кусочков колбасы, ты каждый из них берёшь и пытаешься выделить на нём определённый слой, например, самый верхний или где-то в серединке, или самый внутренний. И дальше, когда ты у многих кусочек колбасы по очереди это сделал, то в теории ты можешь сложить потом из этих слоёв картинку уже поверхности.
-
Абсолютно так. Дальше есть ещё хитрый алгоритм, который, на самом деле, у тебя вот эта картинка, если ты представляешь вот ровный батон колбасы, он ничего не ровный, он вот такой вот изогнутый и вот такой вот вообще непонятный.
-
Да-да-да, конечно.
-
И потом у тебя есть алгоритм типа расправления этого папируса, то есть когда ты вытащил вот этот непонятный 3D-кусок со слипшимися листами, ты пытаешься его расправить, чтобы он был типа плоским.
-
Это безумие просто какое-то. Эта задача, знаешь, она экспоненциально разрастается просто.
-
Да-да-да.
-
Конкурс был вообще открытый, всем типа можно было участвовать.
-
Да, да, абсолютно. Вообще никаких ограничений по расе, национальности, полу, вообще ничего. То есть после того, как Kaggle-соревнование кончилось, они сказали, если хотите продолжение, надо будет в Дискорде. И в Дискорде началась вот где-то с апреля прошлого года вот эта вот тусовка, возня и так далее.
-
Kaggle, получается, был просто таким рекламным действием?
-
Буквально. Да-да-да, это просто пиар.
-
Ну это типа главная площадка, где тусят эмэльщики, и оттуда ты можешь забрать себе. А сколько человек в Дискорде сидит?
-
Ну смотри, активных, наверное, во время соревнований и так далее, было, может быть, человек 400. То есть какой-то порядок сотни.
-
Я понял, что формальных ограничений нет, но что нужно реально уметь делать для того, чтобы участвовать в этом конкурсе?
-
Ну смотри, вообще, опять же, это такой хитрый вопрос, потому что ты не знаешь, как решать задачи, ты не знаешь, что тебе нужно уметь, понимаешь? И вот, например, там один из призов, не главных, но такой, это называлось follow-up prizes, типа, когда ребятам давали там за какие-то очень хорошие результаты, взял чувак, который умел немножко программировать, и он тратил 24 на 7, что просто смотрел визуально и размечал вот эти бумажки. То есть он просто занимался там вот бумажной работой. Понимаешь? То есть он не знал... Альфик, он
-
то вообще есть не программист.
-
Да, ну то есть, ну, что-то базовое знал там, типа, может быть, мог написать там, типа, по гайду питонский скрипт модельку написать. Но он просто смотрел глазами. Да, то есть он буквально смотрел глазами. Чума.
-
Нужно ли было уметь читать по-древнегречески на этом этапе?
-
Нет, нет. Но в определенный момент мне пришлось искать среди знакомых того, кто может что-то читать по-древнегречески. И оказалось, что в Петербурге есть школы, где учат по-древнегреческому и латыни. Вот такие классические.
-
До сих пор, что ли? До сих пор. В смысле, школьников учат?
-
Да, да, да. То есть ты в школе, тебя учат древнегречески.
-
Я думал, что это какая-то британская школа
-
для... Нет-нет-нет, это петербургская школа, и вполне нормально. И я вот через знакомых нашел товарища, которому я заплатил небольшую денежку из кармана, который помог мне понять, вообще, похожи ли вот эти каракули на какие-то древнегреческие слова.
-
Расскажи, какие конкурсы были в соревнованиях, какая была этапность.
-
Первый этап— это было, собственно, прочитать первые буквы. И никто не знал вообще, как это делать. Ты буквально... Смотрю в книгу— вижу фигу. То есть это буквально вот так было. Ну то есть ты смотришь на лист, а там ничего нет.
-
И ты такой... То есть вам дали уже не нарезку вот эту, а вам
-
дали развернутый лист и нарезку, но типа часть этого задания, вот этого, её уже решили. То есть вот эта команда разметки выкладывала периодически какие-то кусочки размеченные.
-
А какой у тебя размер лист? Это типа как А4, как там, не знаешь, как что?
-
Они были очень разные. Это росло вот до того, что вот если ты видел там на сайте конкурса вот анонс, да, вот этого большого кусочка, это начиналось с огромных маленьких кусочков буквально там по полтора-два сантиметра.
-
А, как пазл.
-
Да, именно так. Но потом то, что он разрастался и становился всё больше, больше, больше, и превратился вот в такой вот большой огромный кусок.
-
То есть тебе на входе давали как раз какой-то набор этих маленьких кусочков по полтора на два сантиметра и говорили, типа, попробуй там что-нибудь обнаружить или что?
-
Да, именно так. Ну, то есть какие-то просто отдельные куски, те, которые было легко разметить. Вот представь, что у тебя вот есть листы, да, и между ними может быть какой-то промежуток, они могут быть слипшись. Если есть какой-то промежуток, то тебе, очевидно, легче их разметить. И вот эти кусочки, они, собственно, и давали. Это меньшее из проблем. Проблема в том, что ты буквально видишь, и ты даже не понимаешь, какого размера там буквы должны быть. Ты даже не понимаешь, где у тебя строка, где вообще буквы могут быть. А они горизонтально написаны или вертикально? Изначально вот этот, так сказать, proof of concept, что это вообще может сработать, как проводили. Заказали на Амазоне убийство папируса, который по структуре выглядит примерно так же. Написали там что-то, какие-то каракули нарисовали и сожгли. Потом берут, засовывают в томограф, сканят и пытаются что-то там прочитать.
-
уже знают, что написали, потому что сами написали.
-
Именно так. Чума какая. И это получилось. Ну, то есть, это буквально было такой вот POC, что это работает.
-
Охренеть.
-
Ну, то есть, там конкурс как бы стагнировал, мне кажется, вот там типа до июня-июля, условно.
-
Когда это началось? Июнь-июль, это сколько месяцев?
-
Ну, вот с апреля. Началось в апреле, после Kaggle где-то. Апрель, май, июнь, июль. То есть, там типа, ну, 3-4 месяца.
-
То есть, 3-4 месяца, чуваки, ничего не получается.
-
Да, да. Ну, то есть, не было понятно вообще, как поступаться к задаче и так далее. И многие вообще не верили, что это решаемо. А я в том числе, я присоединился
-
в авг А задача на этот момент— это, типа, прочитать одну букву.
-
Ну, первые буквы, там 10 букв было требование. Так, был очень дядечка интересный из... Ну, ты сказал про фотошопе там уровней и так далее, и вот... Ты это знаешь, как в любом интересной штуке есть дядечка из NASA. И вот какой-то бывший инженер из NASA пришел и сказал, а вот смотрите, я там вот в MATLAB'е поигрался, и в целом как будто бы вот это вот, похоже, посмотрел глазами на, как ты абсолютно правильно сказал, когда перьевой ручкой пишешь, на какие-то вот искривления в высоте. Это похоже на буквы. Это буква А. И все такие.
-
Ага.
-
И стали дальше смотреть вручную, дальше разбирать. Находить такие же паттерны, пытаться в других местах листов и так далее. Если ты знаешь одну букву, ты знаешь размер, ты можешь искать дальше, попытаться посчитать там типа строки и так далее. И в итоге вот на каком-то одном из кусочков, там, где, собственно, вот эти деформации были более всего очевидны, ребята нашли там типа три-четыре буквы, начинают пытаться обучать модель, находят больше букв, обучают модель, и вот пошло-поехало.
-
Типа ты глазами находишь первые несколько, а дальше говоришь компьютеру, Так же херач, как бы.
-
Абсолютно так, да, именно так. И это вот самое смешное, нашлось слово. При этом, это очень забавно. Вот представь, смотри, в древнегреческом на самом деле корпус, ну, типа лексический, он не очень большой. И при этом там есть слова, которые суперчастотные. То есть, например, есть союз «и», и он там очень часто встречается. И в каком-то месте вот нашли первые букв, и они сложили слово «парфирос». что называется «пурпурный».—
-
Типа редкое слово.—
-
Невероятно редкое, даже не представляешь, насколько. Экскурс в Римскую империю. В Римской империи вообще, и вообще во всей этой истории, «пурпурный» красителем, потому что он добывался из каких-то там типа улиток. Им, грубо говоря, красили только императорские мантии, чтобы было понятно, что...—
-
Да совсем недавнего времени, на самом деле.—
-
Да-да-да-да. И слово было суперредко, и стали думать, а что это такое вообще. А был шанс, скажем так, что представить, что у тебя в этом свитке мог быть уже известный текст. Но оказалось, что это не так. Ну то есть, типа, все люди там вот после этого сказали, что, скорее всего, нет. Ну то есть, что это, типа, какой-то новый непонятный текст. То есть мы можем
-
определить, что текст уникальный просто потому, что в нём есть это долбанное слово, которого больше нигде нет?
-
В том числе. Ну да, да. И по соседним тоже, да. Так. В итоге вот первое слово прочитали. При этом прочитали параллельно вот двое ребят. Один это студент как раз из Штатов, а второй это вот студент из Берлина, вот из Берлинского свободного университета. И они потом, собственно, объединились и выиграли вот первый приз, если что. То они просто вот продолжили и так далее. При этом они независимо друг от друга. Ну то есть представь вот этот таймлайн, что независимо друг от друга. Они там нашли и, грубо говоря, провалидировали идеи друг друга. И после этого, собственно, завертелось. Типа получились тексты, буквы и так далее.
-
Схема стала понятна, размер букв стал понятен.
-
Да, да.
-
Абсолютно все-все стало понятно. Весь показатель стал понятен. И вот пошло-поехало.
-
Это стала уже такая инженерная задача, я так понимаю.
-
Ну да, да, да. Как это, собственно, замасштабировать, и как там больше прочитать, и так далее. И, собственно, потом с августа вот до декабря где-то я участвовал, то есть это вот полгода. Ну это прям такая, это личная, скажем так, ну даже не травма, я не знаю, ну просто я очень много времени на это потратил. И, то есть, буквально 24 на 7 я думал об этом, как вот в мире, когда вот, типа, там парень лежит с девушкой, она там думает опять о своих бабах думает, а он, типа, думает о древних речке и свитках. Вот это был я.
-
А сколько, кстати, денег дали за то, что расшифровали первые четыре буквы, или сколько там?
-
Ну, смотри, первый приз дали, по-моему, товарищу 40 тысяч, вот которого один, а второму 10. Вот, то есть там порядки такие.
-
Следующий мой вопрос. Жюри получают только сами буквы, или они получают нейросеть? Или они получают процесс создания нейросети, потому что это три разных... Все, вообще все-все-все-все-все.
-
То есть там типа потом ребята верифицировали весь процесс, то есть там были инженеры, которые проверяли то, что код написан, что там data leaks (утечек данных), что все выглядит прилично. Ну то есть прям типа там целиком evaluation. То есть прям типа очень хороший подход.
-
Просто тут важно, потому что иначе ты можешь заставить нейросеть прочитать чего угодно на таких данных, я так понимаю.
-
Абсолютно так, да. Я когда вот конкурс завершился, и я там написал у себя в канале о результатах, ко мне пришел товарищ из Фонтанки, вот такой вот медиа, и попросил дать интервью, рассказать, что там типа и так далее. А им было это интересно, потому что в петербургских школах до сих пор проходит древнегреческий, и вот там типа ученики этих школ помогают на что-то расшифровывать. Комментарии на Фонтанке прекрасны. Ну то есть там вплоть до того, что ну вот дураки, им компьютер показал, а они и верят.
-
Но создатели конкурса про это подумали, и они как раз поэтому просили не только ответ, но еще и то, как вы пришли к этому ответу.
-
Да-да, конечно.
-
Если на промежуточных этапах ты даешь жюри все, то на следующем этапе другие участники могут пользоваться твоими достижениями?
-
Вот, смотри, это... Очень интересная история. Там была очень интересная мотивация, как раз про open-source, Неда Фридмана. Идея была в том, и вот как это сейчас происходит сейчас, что у тебя за месяц проводится какая-то работа, и ты можешь ее засубмитить для того, чтобы получить какую-то денежную мотивацию или приз. То есть у тебя в конце месяца, или там типа раз в два месяца там было, у тебя такое типа огромное количество постов, что я сделал то-то, то-то, то работает, то не работает, то-то, то-то работает, не работает и так далее. И ты фактически шаришь результаты для того, чтобы другие участники там могли что-то дальше с ними делать. То есть это был основной способ именно поделиться идеями, поделиться наработками с комьюнити и так далее. А при этом, когда, собственно, опубликовали вот именно первые буквы, то да, это все открылось. Типа прям выложили код в открытый доступ, вот, пожалуйста, воспроизводите. Там воспроизвели, подтвердили, и все хорошо.
-
Я просто пытаюсь представить себе, это типа такое, что каждая команда движется по отдельности? Или это вот эти все 300 человек, они как одна гульба, типа, валились?
-
Ну, каждая команда типа по отдельности, но при этом они смотрят друг на дружку. Ну, то есть это буквально как... Я даже не знаю, как писать.
-
Ты мог пользоваться результатами другой команды, посмотреть, что они научили?
-
Да, да, если они публично это анонсировали, да-да-да, конечно.
-
А они могли не анонсировать?
-
Да, да, разумеется, ну то есть это же соревнования.
-
Получить при этом приз?
-
Нет, нет, нет, не могли. Ну то есть тут баланс был. Вот, и собственно, например, мне удалось вот за весь конкурс, я не ушел с пустыми руками, я вот выиграл там 5000 баксов, как раз потому что я понимал, что я уже типа не вывожу до конца и решил просто поделиться тем, что
-
у меня было для того, чтобы... заплатили.
-
Да, да.
-
А ты участвовал один или с кем-то?
-
Это тоже большая проблема, потому что таких больных людей в моем окружении, как я, больше не было. И мне приходилось большую часть времени участвовать одному. Потом я объединился с ребятами из Франции и Ирландии, с двумя которыми размечать данные. Ну, то есть, буквально они уже предсказанные буковки обводили, типа, именно в контуры буквы, для того, чтобы было дальше легче, проще обучать модель. Вот. И я поделился там с ними часть призок, которые вот мы получили за то, что вот пошарили свои результаты.
-
Какой был результат?
-
Чего именно?
-
Ну, за который ты получил призны.
-
А, да, мы просто вот пошарили все маски вот эти вот. Ну, то есть, как вот этот итеративный процесс был, да, что ты там типа видишь первые буквы, потом ты идешь, смотришь вручную на папирус, пытаешься провести там дальше контуры, снова обучаешь модель и так далее. И вот мы изначально вот поделились вот этими масками, которые мы сами разметили для буквок и так далее, чтобы было проще обучать модель. Ну, то есть, пропустить какой-то там вот этот этап.
-
А расскажи про, вообще, тусовку. Кто там был?
-
Кого там только не было. Ну, то есть, это буквально... Это студенты, это какие-нибудь там FAANG-инженеры, это какие-нибудь биофизики, инженеры НАСА, безработные искатели приключений. Ну, это буквально... Ну, то есть, кого там только не было. Были, собственно, историки, были папирологи, палеографы, были вот люди, которые по-древнегречески могли что-то разобрать и прочитать.
-
Это мужчина или женщина? Есть подозрение, что там все мужики?
-
Нет, нет, нет, даже не близко. Ну, то есть, типа, там девушки и вообще... То есть, ну, тусовка вообще максимально не маскулинная, я бы так сказал.
-
Это может как бы звучать тупо, но ты топовый ML-специалист. Работаешь в главном месте, где работают ML-специалисты, зарабатываешь... Ты как раз чувак из мема, который зарабатывает 100к в секунду. Ты при этом работал над этим проектом условно полгода, практически второй фулл-тайм, а на самом деле скорее как первый фулл-тайм постоянно об этом думал.
-
Да, все так и было.
-
Если просто помножить твою зарплату за это время, я думаю, можно квартиру купить как бы, не в самом плохом городе.
-
Возможно.
-
А выиграл типа 5 тысяч, и то поделил с чуваками, с которыми вместе сделал. Расскажи про мотивацию.
-
Ну, смотри, это вот, мне кажется, на самом деле мотивация именно, зачем люди идут делать open-source, да? Потому что, ну вот, хочется. Не знаю, не получается по-другому. И мне кажется, основная мотивация была как раз... Ну, очевидно, что она была там выиграть, и я, например, хотел себе купить домик в Италии. Вот у меня есть вот мечта. Я не знаю, если ты вот есть в Инстаграме аккаунт Cheap Italian Properties, там они постят за 20-30 тысяч баксов маленькие домики в Ебенях, вот в горах, где ты там выходишь, никого нет. И, конечно, это была... Денежная мотивация, безусловно, присутствовала. С другой стороны, не всё же JSON'ы перекладывать, в конце концов, правильно? То есть есть что-то интереснее вот в этом мире. Вообще, на самом деле, я долгое время как бы немножко тихлидел один из ОВД-Инфо. И вообще ВВД-Инфо-разработка и вообще НКО-разработка вот всего-то что-то такого, legal tech'a, она бесплатная. То есть у тебя там никто не получает деньги. При этом сама идея драйвит настолько, вот вообще желание именно помочь, что ты даже бесплатно готов там что-то делать. Ну то есть у тебя, очевидно, есть какой-то лимит, у тебя там в какой-то момент ты уходишь оттуда, потому что, ну, пропадает мотивация. Устал. Да, в том числе. Но при этом ты все равно можешь что-то делать. И мне кажется, что тут мотивация примерно такая же. У тебя есть какая-то идея, которая тебя драйвит, но ты никому ничего не должен. Ты можешь просто в любой момент уйти. При этом ты будешь понимать, что ты сделал там какой-то свой вклад. Сейчас, например, стать активным участником вот после главного приза. Ну, вообще, если что, вот на главном призе, что ты там прочитал вот эти... Сколько там? Две тысячи символов, да? Вот это какой-то там текст про удовольствие.
-
Какую-то фразу, короче.
-
От еды, да. И на самом деле там очень мудрые мысли.
-
А что там написано?
-
Вот если ты, например, получаешь удовольствие от еды, а суть жизни в получении удовольствия, должен ли ты голодать неделю, чтобы еда потом была вкуснее, чтобы ты получил больше удовольствия от еды? И ответ нет, потому что типа нужно все равно каждый день наслаждаться жизнью. Ты не можешь как бы себя лишать этого. Вольная трактовка, но принцип примерно посыл такой.
-
Всего 2000 символов, а впереди еще сколько.
-
Да, именно так. Вот, и да, это очень важно отметить, что вот эти вот 2000 символов— это только 5% текста одного свитка, а сейчас их уже отсканировано 4. То есть это буквально там вообще малюсенький кусочек от вот того текста, который там есть.
-
То есть то, что в конкурсе разыграли и типа выдали главный приз, не означает, что он закончился?
-
Нет, он до сих пор идет. То есть это вот буквально долгосрочный проект, и основная задача на вот этот год, вот что сейчас вообще происходит, это попытка отмасштабировать это, чтобы ты мог посчитать... Ну то есть вот следующий приз, прям изученная цель, да, за которую там вот дают сейчас там 100 тысяч призовых, это прочитать 95% текстов из всех свитков и найти первые буквы в других свитках. Потому что сейчас это все тексты с одного, который было типа легче всего расшифровать. Ну то есть там работы еще бесконечное количество. И вот ты спрашивал про активных участников. Вот сейчас активных участников именно в Дискорде, которые вот сейчас решают это, так сказать, в регулярной основе, ну, может быть, наверное, человек там 100-150, вот так. Ты знаком с победителями? Да-да-да, конечно. Со многими мы типа прям обсуждали вот результаты именно в процессе.
-
Насколько они, кстати, отличаются? То есть они победители, потому что они супер реально на порядок лучше что-то знают? Или им повезло? Или они как-то правильно подошли к этому? Можешь немножко рассказать?
-
Они правильно подошли, плюс, мне кажется, что порог входа из-за того, что они уже, то есть, отгадали первые, так сказать, буквы, у них уже было лучше понимание задач, потому что месяца полтора-два потратил просто на то, чтобы понять, ну, именно глубину, что там нужно делать, как это технически решать и так далее. И они работали над TeamFullTime, то есть, двое ребят, насколько я знаю.
-
А, в смысле, они перестали работать и... Они студенты. А, они не работали, господи, ну это нечестное соревнование.
-
Да, ну вот. Но, смотри, я, честно, брал отпуск на, по-моему, три недели в прошлый восемь для того, чтобы вот фулл-тайм сидеть и работать.
-
Это, кстати, был мой следующий вопрос. Как тебя босс заметил, что ты как бы увлекся?
-
Нет, ну то есть, не знаю, мне кажется, что... Наверное, важно уточнить, да, что в FAANG, то к тебе вообще нет вопросов. Ну то есть, скажем так, типа глобально. Ну и вообще во всех приличных местах, скажем так. И в целом, да, я просто упоминал, что я вот решаю соревнования, что вот я там выиграл какую-то там призовую денежку. Ну три команды рассказал, ну да, ну вопросов не было.
-
У девушки?
-
Были, были, были вот типа разговоры, да. Ну то есть это на самом деле странно, потому что мы не живем вместе, она вот учится сейчас в другой стране. Ну то есть когда мы созванивались, спрашивали, как дела, я говорил, я решаю свитки. Вчера решал свитки, а сейчас мы закончим разговоры, сейчас я тоже буду решать свитки. Ну то есть это был такой, да, сложный период, но она очень поддерживала. Спасибо ей.
-
gambling addiction / «это аддикция». Я представляю, у вас есть какие-то типа свитки анонимус, где вы собираетесь.
-
Да-да-да.
-
Ты собираешься продолжать заниматься вообще дальше?
-
Ну вот сейчас типа был период где-то вот с февраля, когда там вот феврале начался второй этап и так далее. Я вообще пытался попасть в команду фуллтайм. Я готов этим фуллтайм заниматься.
-
А, там они берут, типа, каких-то чуваков на работу?
-
Ну вот они сейчас наняли победителей, вот ребят, которые там закончили только магистратуру и PHD, дальше продолжать это развивать. При этом я не уверен, почему они не нанимают, типа, прям инженерных инженеров, чтобы это, типа, скеррить, считать и так далее.
-
Может, еще не подошли к этому этапу просто?
-
Мне кажется, на самом деле. Потому что вообще в планах у них было на этот год расширить команду до 5-7 человек фулл-тайм для того, чтобы вот это прям типа фулл-тайм довести до вот
-
продакшна, скажем так. Я так понимаю, ты как раз мечтаешь, что ты будешь тем самым инженером, который будет в этой команде?
-
Ну в идеале, да. То есть я как бы писал, конечно, и спрашивал, а что там как, а что когда. Но пока что они решили вот не нанимать, и мне кажется, это как раз из-за того, что не очень понятно, как скейлиться. И это вот на самом деле сейчас мы вот подошли к вот этому типа закону Парето, когда вот там типа получили 80% результатов, а вот все, что дальше, это супер больно и требует еще там типа какого-то качественного вот еще нового подхода.
-
Прорывы еще одного?
-
Ну типа да, да, мне на самом деле кажется, что да.
-
Но инвестиций для этой прорыва уже нужно типа сильно больше.
-
Но денежных нет. Мне кажется, что просто нужно такие же просто интеллектуальные какие-то инвестиции, вот и ресурсные в плане времени.
-
Да-да-да, я про это. Ну, они уже делали самое сложное. Команда у них есть. Если люди не выиграют, вопрос типа хватит.
-
Не-не-не, там на самом деле прогресс идёт. Ну, то есть там типа вот прогресс идёт, и типа всё хорошо. И кажется, что какие-то промежуточные призы, там типа а-ля там новые буквы в других свитках и так далее, они подогревают всё равно интерес. Но да, сейчас, к сожалению, меньше, чем хотелось бы этим заниматься, но вот есть надежда, что вернусь.
-
В этом плане это вряд ли кто-то с зависимостями говорит, типа, мало, конечно, курю, надо надеяться, что вернусь. Вы, вот эта команда, все вместе, и организаторы, мне кажется, в том числе, знатно, мне кажется, угорели и сделали классное научное открытие, уже сейчас даже. Понятно, что еще хочется больше, но скажи, как ты считаешь, это поменяет что-то в том, как ведутся другие научные исследования? Это такая модель или это одноразовая история?
-
Мне кажется, что такие модели были и до этого. Ну то есть если ты, например, подумаешь, что DeepMind занимался примерно тем же самым. Вот если когда DeepMind основался... Модель вообще работы DeepMind, она абсолютно такая, что ты берешь инженеров, даешь им какую-то сложную непонятную задачу, они разбираются и решают это.
-
Погоди, DeepMind – это отдел внутри Google?
-
Это была, точнее, изначально отдельная компания ресерчерская. Есть такой спектр стартапов, который называется DeepTech Startup. Это стартапы, которые пилят только глубокие технологии. Они занимаются ресерчем, делают там что-то непонятное. Изначально занимался именно этим. Потом их просто купил Google, и теперь внутри Google занимаются этим.
-
Да, и они занимаются, насколько я помню, это чуваки, которые в шахматы играли, потом в ГО играли.
-
Играли в шахматы, играли в ГО, сворачивали белки, управляли плазмой в фьюжн-реакторах. Чем они только не занимались. Это вот да, это опять же, это про то, что у тебя спектр задач очень огромный, и у тебя есть просто люди, которые разбираются в них и решают. Проблема? Ну, мне кажется, даже это не проблема, что такая модель как бы существовала и до этого. Другое дело, мне кажется, что да, эта модель вполне жизнеспособная. Ну то есть ты действительно можешь там нанять людей, которые там на каком-то интересе и там как-то не... Ну смотри, очевидно, что если ты тратишь на такое какое-нибудь там соревнование, условно, ну там миллион долларов, например, да, там типа эффект вообще, типа вот влияние, оно сильно больше. Ну потому что хоть ты не можешь померить, но вот как ты сказал, да,
-
что все мы... Просто зарплаты стоили бы не миллион, а мне кажется, типа на порядок больше десятки сотни миллионов долларов.
-
Да, да, абсолютно так, да. При этом они бы не дали результат.
-
Такого.
-
Ну, мне кажется, что да, что это типа довольно вообще здоровая история делать что-то такое. Другое дело, что есть вот это... Опять же, здесь очень легко, потому что у тебя нет коммерческого интереса, ты не можешь это коммерциализировать. Ты не можешь, например, тем же самым заниматься в медтехе, потому что, ну типа, если, например, будешь чем-то этим заниматься, то это сразу типа деньги, патенты, продажи и вот это все.
-
Ты думаешь, что это более безопасная среда?
-
Да-да-да, безусловно.
-
Как тебе кажется, это можно делать только в ML или это можно использовать в других областях человеческой деятельности тоже?
-
Не, в других областях тоже. Ну, то есть у Дурова во всех его конкурсах, если... Ну, я просто не знаю, насколько глубоко доследил там за его конкурсами.
-
Я знаю, что есть дизайн, есть про разработку.
-
Да, про разработку есть и ML-конкурсы, да, например, про понимание топиков, тематики или языка канала.
-
То, через что нам рекламу пихают теперь в Телеграме?
-
Например, в том числе. И ты можешь решать это иметь задачи, а можешь всем решать алгоритмически. Вот ребята, которые там занимали первые места, они решали это просто алгоритмически. То есть буквально у тебя там есть типа какие-то кей-ворды, которые ты там считаешь, смотришь и все.
-
То, что называется набор эвристик.
-
Ну, типа да.
-
Да, именно так. Кайф. Кто-то это послушал и такой, блин, я тоже хочу в этом всем участвовать. С чего стоит начать?
-
Стоит пойти на сайт scrollprize.org, или как-то так он называется, Vesuvius Challenge, прочитать всё, что было, найти ссылку на Discord, нажать галочку, что ты принимаешь там, типа, условия работы с данными, и всё. И присоединиться к Дискорду и начать читать.
-
Каеф. Спасибо тебе огромное, что пришёл. Прям очень душевный разговор и очень интересная тема. Я многое... Типа, я про это написал пост, который суперхорошо зашёл, но я понимаю, что я, оказывается, даже вот типа 10% этой истории не знал.
-
Да-да-да, это буквально вот эта мем про айсберг.
-
Спасибо тебе большое.
-
Тебе спасибо, что позвал.
-
Дорогие друзья, спасибо вам, что вы с нами. Это подкаст Студии Либо-Либо. И сделали мы его совместно с сервисом онлайн-образования Яндекс Практикум. Над подкастом работали редакторки Маша Агличева и Рита Берденникова, продюсер Данил Остапов, звукорежиссер Юрий Шустицкий. За джингл спасибо Алексею Зеленскому (?). Редактор субтитров А.Синецкая Корректор А.Егорова