1 сезон · выпуск 3 · 12 декабря 2019 · 34 мин

Турникет в метро тоже искусственный интеллект? Как устроено машинное обучение

ИИ и нейросети

Слушать · 33:33

Есть три хайповых термина: искусственный интеллект, машинное обучение и data science. Все их хотят, все их путают и все ими пользуются. Самат Галимов поговорил с Самером Фатайри и Петром Ромовым о том, как наука о данных применяется на практике. Самер руководил отделом аналитики Bookmate и разработал рекомендательную систему, которая помогает пользователям подбирать нужные книги. Петр занимается внедрением искусственного интеллекта в киберспорт.

Этот подкаст мы делаем совместно сервисом онлайн-образования Яндекс.Практикум

Таймкоды

Что такое машинное обучение и с чего можно начать им заниматься?

Чем отличается искусственный интеллект от машинного обучения?

Как работает компьютерное зрение

Какой объем данных используют при машинном обучении?

Технология у тебя в штанах. Где применяют машинное обучение?

Как рекомендательные системы подсказывают, что нужно пользователю

Как алгоритмы превращают текст в речь и обратно

Соревнования от Netflix с призовыми фондом в миллион долларов

Dota, токсичные комментарии и киты

Где и как работают специалисты data science?

Транскрипт

Самат Галимов, Петр Ромов, Самер Фатайри, Заставка, Гость · расшифровано автоматически, ошибки возможны

  1. Самат Галимов

    Привет, меня зовут Самат Галимов. Это подкаст «Запуск завтра». Обычно мы говорим о технологиях примерно вот так.

  2. Петр Ромов

    Вот есть такая операция свёртки. Оно описывается матрицей. Алгоритм машинного обучения, который он использовал, градиентный бустинг.

  3. Самер Фатайри

    Существует облачный алгоритм машинного обучения.

  4. Петр Ромов

    Он просто написал плюсовый код, то есть что там современных техник аугментации, типа логарифмической шкале. То есть датасет ImageNet.

  5. Самат Галимов

    Окей.

  6. Самат Галимов

    Я работаю техническим директором, и я нахожу специалистов мирового уровня. А дальше мы обсуждаем их работу простым человеческим языком. У меня в гостях два человека, которые занимаются Data Science. Это такое очень модное направление. Никто толком не понимает, чем отличаются Data Science, машинное обучение, искусственный интеллект и наука о данных. Сегодня мы будем разбираться в этом вместе с двумя специалистами экстра-класса, Самером Фатайри и Петей Ромовым. Это подкаст «Студии либо-либо», и у нас есть партнер— сервис онлайн-образования «Яндекс Практикум». Если вы хотите стать программистом, дизайнером или дата-сайентистом, идите на сайт «Яндекс Практикума» и учитесь.

  7. Самат Галимов

    Самер сейчас на юге Португалии, но вообще он обычно живет в Берлине, зарабатывает, мне кажется, кучу денег и делает какие-то очень крутые проекты в области идентификации установок мобильных приложений. Это связано с рекламой мобильных приложений, это гигантская индустрия, и Summer там довольно крутой чел. Всем привет.

  8. Самер Фатайри

    Это называется мобильная атрибуция на самом деле. Главная задача состоит в том, что нужно понимать, какой человек, откуда, в какое приложение пришел.

  9. Петр Ромов

    Всем привет. Я Петя. Я делаю искусственный интеллект, который помогает людям лучше играть в игры в компьютерные. Но вообще в целом у меня большой бэкграунд в машинном обучении. Я был в команде, которая делала Яндекс.Музыка, Яндекс.Радио.

  10. Самат Галимов

    Я, честно говоря, вообще не разбираюсь в машинном обучении. Это какая-то магия, даже для меня, человека технического, у которого довольно широкий кругозор технический, я хотел бы понять, как эта магия устроена, как этому можно учиться, как на этом можно зарабатывать деньги. Давайте начнем с того, это science или не science, это как бы вот говорят data science, вообще машинное обучение, data science, эти три там термины, искусственный интеллект их смешивают, что есть что.

  11. Петр Ромов

    Я бы сказал так, что изначально был сайенс, а по факту машинное обучение— это моделирование математическое. Раньше моделировали различные законы физики при помощи дифференциальных уравнений, а с появлением мощных компьютеров появилась возможность моделировать очень сложные вещи, такие как содержание изображения и то, как оно выглядит. То есть, моделировать зависимость между тем, как выглядит фотография и что на ней изображено. Изначально это был science. Ученые исследовали, как можно эти зависимости восстанавливать, моделировать. А сейчас это становится все более доступным для бизнеса, для практических применений и активно внедряется уже непосредственно в жизнь людей.

  12. Самат Галимов

    Я помню, что ты, Петя, учился на ВМК. Мы учились вместе?

  13. Самат Галимов

    ВМК— это факультет вычислительной математики и кибернетики Московского университета. Это то, где учат программирование. Якобы.

  14. Самат Галимов

    Ты пошел на кафедру, которая занималась чем-то похожим, да?

  15. Петр Ромов

    Я поступил на факультет вычислительной математики и кибернетики, где тоже учился.

  16. Самер Фатайри

    Смешно, я тоже учился на ВМК.

  17. Петр Ромов

    О, мы все с ВМК. Я перейдем на первый курс. Довольно быстро понял, что на лекциях самое полезное, что я могу делать, это спать. Получать знания лучше всего после 12 вечера в ботулке.

  18. Самат Галимов

    Это комната, где все делали домашку в общаге.

  19. Петр Ромов

    Да. и довольно быстро понял, что нужно искать людей на факультете, которые действительно применяют в реальной жизни то, чем занимаются и что преподают. И я нашел довольно быстро Антона Конушина, у него была лаборатория графики мультимедиа, в ней группа компьютерного зрения, и он делал спецкурс по компьютерному зрению. Это было 10 лекций, и две из этих лекций были про машинное обучение. И так я узнал про то, что вообще машинное обучение существует. И было задание распознавать номер машин автоматически. И сначала мы должны были сделать это руками, Если левая часть картинки белая, а правая чёрная, значит, это, скорее всего, единичка. Ну вот что-то в этом роде. Это работало плохо. А потом вторая часть задания, собственно, сделать это при помощи машинного обучения. И когда ты это руками проделаешь сначала первую часть, а потом вторую, понимаешь, что, блин, машинное обучение— это что-то, в принципе, не такое уж магическое, но, с другой стороны, очень мощное.

  20. Самат Галимов

    Оно проще, типа?

  21. Петр Ромов

    Оно не проще, оно просто позволяет делать вещи, которые ты сам руками делаешь, долго и муторно, сделать быстро.

  22. Самат Галимов

    А как ты? Ты просто прямо пришел и сказал, я хочу вот этим заниматься?

  23. Петр Ромов

    Нет, просто я узнал, что есть машинное обучение, и дальше все пошло уже исходя из этого предположения, что я хочу заниматься машинным обучением. Я считаю, что университет мне дал две самые важные вещи— это отсрочку от армии и возможность общаться с теми людьми, с которыми я там учился.

  24. Самер Фатайри

    У меня вообще всё по-другому было. Я тоже учился на ВМК, и чем ближе я был к моменту выпуска, тем больше я был уверен, что ничем связанным с математикой я никогда в жизни не буду заниматься, и ничем связанным с программированием тем более. Пока я не начал заниматься какими-то аналитическими вещами, довольно простыми, через какое-то время, через года 2 или 3 после выпуска. В какой-то момент мои аналитические задачи, которые, кстати, сейчас тоже называются термином Data Science, становились чуть сложнее, и стало понятно, что руками мне эти зависимости все искать довольно сложно. И тогда уже начало хайпить слово Data Science, это взлетело. Потом это все было на самообучение. Все, что я делал, это было самообучение. Спасибо куче разных вещей. Спасибо Slack Open Data Science в том числе. Большое спасибо, на самом деле, ВМК за то, что я знаю хорошо программу первых полутора курсов. Она очень полезна для машинного обучения. Всё остальное уже спорно.

  25. Самат Галимов

    Я хотел бы понять, в чём отличается искусственный интеллект от машинного обучения.

  26. Петр Ромов

    Я попробую объяснить. Искусственный интеллект— это некий базворд, под которым могут понимать всё что угодно люди. Как правило, это что-то про автоматизацию и замену человека в разных сферах деятельности. Например, есть автомобиль, сидит в нём водитель и управляет автомобилем. А тут мы возьмём и сделаем некое технологическое решение, которое позволит убрать водителя, убрать человека из этой системы. Это может касаться всего, что угодно. Система автоматического определения неполадок на производстве. Там может не быть машинного обучения, это просто какая-то автоматика, которая заменяет человека, которая контролирует процесс.

  27. Самат Галимов

    То есть ты называешь это тоже искусственным интеллектом?

  28. Петр Ромов

    Я бы называл это искусственным интеллектом, потому что он делает какую-то интеллектуальную вполне деятельность.

  29. Самат Галимов

    То есть, погоди, турникет метро тоже искусственный интеллект?

  30. Петр Ромов

    Я думаю, в каком-то приближении да. Про интеллектуальность турникетов можно рассуждать.

  31. Самат Галимов

    Положил карточку, он тебя пропускает или не пропускает.

  32. Петр Ромов

    Да, да, вполне. Ну а так бы стояла вахтерша, которая тебя пропускала бы и не пропускала. И вполне можно было бы назвать это интеллектуальной деятельностью. А машинное обучение— это математический аппарат, который позволяет строить алгоритмы на основе примеров. То есть мы показываем машине примеры, как мы хотели бы, чтобы наша программа работала. И машинное обучение строит нам этот алгоритм автоматически. То есть оно делает такую черную коробочку, которая работает, и она работает так, как мы показали на примерах.

  33. Самат Галимов

    Правильно ли я понимаю, что это значит, что если этому алгоритму, который построил метод машинного обучения, дать данные, которые сильно отличаются от тех, которые были для обучения, то он себя поведет непредсказуемым образом?

  34. Петр Ромов

    Да, и, собственно, специалисты по машинному обучению для того и нужны, чтобы различные такие ситуации разруливать.

  35. Самат Галимов

    Как они их разруливают? Они говорят тебе, что, знаете, нужно еще больше данных?

  36. Петр Ромов

    Вот, например, задача компьютерного зрения – распознавание изображений. Есть такой способ. У нас есть, допустим, тысяча изображений, примеров. Из них можно сделать миллион. Мы просто вырезаем кусочки изображений, имеющихся у нас, как-то искажаем, поворачиваем на рандомный угол.

  37. Самат Галимов

    Чтобы ему стало сложнее, чтобы он обучился.

  38. Петр Ромов

    С одной стороны, стало сложнее, с другой стороны, чтобы у нас были примеры не такие, как наша выборка изначальная.

  39. Самат Галимов

    Чтобы было меньше вероятности, что в дикой среде он встретится с хренью, на которую он не рассчитывал.

  40. Петр Ромов

    Да, то есть мы эту дикую хрень пытаемся каким-то искусственным образом придумать и смотрим, что получается.

  41. Самер Фатайри

    Да-да-да, я всегда любил приводить пример, который, мне кажется, довольно понятный, что если мы рассмотрим задачу компьютерного зрения, будем показывать машине фотографии красных яблок и говорить, что яблоко – это вот это много раз. то в тот момент, когда мы покажем зелёное, она не поймёт, что это яблоко, потому что она этого никогда раньше не видела.

  42. Самат Галимов

    И поэтому можно руками раскрасить яблоки?

  43. Самер Фатайри

    Можно либо руками красить яблоки, либо попросить человека принести зелёных яблок и пофотографировать. Это зависит от масштаба задач.

  44. Петр Ромов

    Еще всегда есть вариант не использовать машинное обучение, про него многие забывают.

  45. Самат Галимов

    Давай какую-нибудь реальную задачу. Я хочу, чтобы камера стояла у двери моего дома, их пускала членов моей семьи, а других людей не пускала. Сколько фотографий людей мне для этого нужно?

  46. Петр Ромов

    Поскольку у нас уже есть набор данных для задачи распознавания человека, с большим количеством других людей есть модели, которые могут делать сравнение двух лиц. Это один и тот же человек или не один и тот же. То мы можем просто взять их в готовом виде и по одной фотографии сопоставлять фото твоего родственника, А если бы не

  47. Самат Галимов

    было всех этих миллионов долларов, вложенных крупными компаниями в эту модель, то пришлось бы

  48. Петр Ромов

    вложить эти миллионы долларов.

  49. Самат Галимов

    О каком объёме идёт речь? Вот для распознавания лица, например.

  50. Петр Ромов

    Если не ошибаюсь, это сотни, тысяч, миллионы изображений разных людей.

  51. Самер Фатайри

    по-моему, датасет с фотографиями— это что-то вроде ста миллионов.—

  52. Петр Ромов

    А, может быть.—

  53. Самат Галимов

    Из детства.— Ну а сто миллионов человек.—

  54. Петр Ромов

    С лицами я вот не уверен.—

  55. Самер Фатайри

    Просто, смотри, задача распознавания лиц немножко отличается от распознавания красных яблок, потому что найти тысячу фотографий красных яблок— довольно тривиальная задача. То есть можно попарсить выдачу Google. Задача найти тысячу фотографий меня уже намного сложнее, потому что, скорее всего, их просто не существует даже в таком количестве.—

  56. Самат Галимов

    Да ладно, у тебя в Google Photos, скорее всего, есть миллион фотографий тебя.—

  57. Самер Фатайри

    Нет.—

  58. Самат Галимов

    Твоих личных.

  59. Самат Галимов

    Нет?

  60. Самер Фатайри

    Намного меньше, да.

  61. Самат Галимов

    Я просто пытаюсь какую-то интуицию выработать в этом вопросе. Она у вас наверняка есть. Если, например, научиться отличать макбуки от других ноутбуков, например, я не знаю, ну это слишком безумная задача, яблоки от бананов.

  62. Петр Ромов

    Я думаю, что сотни изображений будет достаточно. То есть, с учетом современных техник аугментации, вот добавления каких-то искаженных версий твоих исходных изображений, в принципе, можно.

  63. Самат Галимов

    И это без существующих нейросетей.

  64. Петр Ромов

    Естественно, работать с какой-то определенной ошибкой, и чем больше ты будешь добавлять в эту выборку, тем меньше будет эта ошибка, но нужно понимать, что все будет идти по логарифмической шкале. То есть первые 100 изображений дадут тебе некий большой скачок в качестве, и последующее небольшое улучшение ты будешь получать за каждую тысячу новых изображений.

  65. Самер Фатайри

    Да, но в этом случае, на самом деле, если помыслить немножко практически, я думаю, что если перед тобой станет задача отличать яблоки от бананов, то ты, скорее всего, это будешь делать с помощью какой-то существующей нейросети, которая уже обучена, например, на тысячи разных вещей. Она обучалась неделю в огромном дата-центре. То есть ты, на самом деле, скорее всего, будешь настраивать над тем, что большие корпорации уже сделали.

  66. Самат Галимов

    Скажи, пожалуйста, эти решения больших корпораций бесплатные или нет? Они вкладывали кучу денег в то, чтобы построить эту модель.

  67. Петр Ромов

    Почему она бесплатная?

  68. Самат Галимов

    Почему она доступна всем?

  69. Петр Ромов

    Вот есть датасет ImageNet. Если не ошибаюсь, это вообще академическая инициатива. Она была сделана университетами. может быть, одним, может быть, коллаборацией университетов. Возможно, там имели место какие-то гранты от компаний. Но совершенно точно это паблик-домен, и всем доступны как датасеты, так и некоторые обученные модели от непосредственно ученых, которые первыми этот датасет стали использовать.

  70. Самат Галимов

    Когда вы начинали этим заниматься, область была новой. Насколько сильно она изменилась, в смысле, насколько сильно ожидания, которые были, когда вы этим начинали заниматься, совпадают с тем, что в реальности сейчас. И где это реально применяется? Буквально, типа, у меня в штанах есть телефон. В каких приложениях это есть?

  71. Самер Фатайри

    Используется это везде. То есть, когда ты заходишь на YouTube, вот эти 20 видео, которые рекомендованы тебе, рекомендованы тебе огромные нейросети. Когда ты в гугле ищешь какие-то вещи, это тоже делается с помощью машинного обучения. Когда Gmail тебе подсказывает, какое слово ты хочешь вставить в следующем, твое письмо, это тоже делается с помощью машинного обучения. То есть сейчас это буквально везде.

  72. Петр Ромов

    Ну, если говорить про машинное обучение в штанах, то можно iPhone не доставать из штанов, можно сказать Siri, приготовь мне яичницу, и текст будет распознан. Это делается машинным обучением, никак иначе. Ты подносишь свое лицо к FaceID, телефон тебе разблокируется, это тоже делается машинным обучением.

  73. Самер Фатайри

    Я довольно долго работал в BookMate. Там была задача, тоже рекомендательная система для книг. Если человек прочитал вот эти 20 книг, какую 21 книгу он прочитает?

  74. Петр Ромов

    При этом надо сказать, что задача рекомендательной системы, построение рекомендательной системы – это не задача, непосредственно решаемая машинным обучением. Машинное обучение – это такой инструмент, который позволяет, например, предсказать вероятность того, что человек кликнет по книге и прочитает ее до того момента, как мы еще эту книгу показали ему. Таким образом, мы можем показать ему только те книги, которые, вероятно, он прочитает, чтобы он не тратил время на изучение всего ассортимента книг. И там, кроме предсказания, какая книга, вероятно, будет прочитана, есть еще много других вещей, как, в принципе, там извлечь максимальное количество денег из этого Ну, например, да. Кстати, в рекомендовательных системах, это очень известный такой прикол, что запустили рекомендовательную систему, которая была сделана для фильмов.

  75. Самат Галимов

    Это Netflix?

  76. Петр Ромов

    Ну да, запустили ее на интернет-магазине, клики увеличились в несколько раз, люди стали покупать товары, выручка просела.

  77. Самат Галимов

    Потому что они стали покупать более дешевые.

  78. Петр Ромов

    Ну да, потому что модель машинного обучения посчитала, что покупать люди будут вероятнее товара, которые дешевле.

  79. Самат Галимов

    И это была правда.

  80. Петр Ромов

    И это была правда. Задача специалиста по анализу данных по машинному обучению, в частности, правильным образом сформулировать задачу. Сделать такую метрику качества, которую машинное обучение должно будет оптимизировать.

  81. Самат Галимов

    Слушай, Самер, вы сделали алгоритм, который подсказывает следующую книжку, которая предлагается прочитать людям в букмейте. До этого там была какая-то рекомендация? Если была, то насколько лучше рекомендация с помощью машинного обучения, чем другая, редакционная?

  82. Самер Фатайри

    Когда мы начинали это делать, никакой рекомендательной системы не было. Сейчас в BookMate больше половины книг люди добавляют из рекомендательных слайдеров.

  83. Самат Галимов

    Насколько важен контент книг в этих рекомендациях? В смысле, насколько важно содержание этих книг? Например, человек прочитал книги А, Б, Ц, Д. Мы на основе этой информации можем им проникнуть книгу Ф? Или речь идет не о сути книг, а о том, как другие пользователи ведут себя с этими книгами?

  84. Самер Фатайри

    существует два разных вида того, как делаются рекомендательные системы. Собственно, у нас в какой-то момент были оба. Есть один, который работает так, что ты наиболее вероятно прочитаешь книги, которые читали люди, которые читают такие же книги, как и ты. То есть, если два человека читают очень похожие книги, это значит, что... Второму человеку

  85. Самат Галимов

    можно порекомендовать книгу первую, и, скорее всего, всё получится.

  86. Самер Фатайри

    Да, да. Или, например, если одну и ту же книгу читают два очень похожих набора людей, то эти книги похожи между собой. А другой – это контентная вещь. То есть, это когда мы лезем непосредственно в текст книги, чтобы понять, какие книги друг на друга похожи тематически. Это довольно решаемая задача для нон-фикшн книг, например. То есть мы можем понять, какие книги скорее про историю Советского Союза, а какие про фантастику про космос, например. Просто потому что набор слов там будет довольно разный. Какие книги как бы в фикшн – это уже довольно сложная задача.

  87. Петр Ромов

    Ну вот я работал над Яндекс.Музыкой, там 15 миллионов треков было в тот момент, когда я работал. И в отличие от книг, довольно проблематично взять и обработать все треки, извлечь из них какую-то осмысленную информацию. Поэтому там упор был именно на поведение пользователя, как он взаимодействует с треками, как большое количество пользователей взаимодействует с разными треками.

  88. Самат Галимов

    Это работало через какое-то время после запуска, да? Потому что тебе нужны данные о том, как себя люди ведут.

  89. Петр Ромов

    Да, это было уже на запущенном сервисе, который существовал какое-то количество лет. У него были активные пользователи. Там была функция лайкнуть трек, дизлайкнуть трек. Кстати, удивительная вещь была для меня то, что люди либо лайкают трек, либо дизлайкают. Там было 90% лайков, 10% дизлайков, и это были не пересекающиеся практически люди.

  90. Самат Галимов

    А, то есть есть люди, которым нравится лайкать, а есть люди, которым нравится дизлайкать.

  91. Петр Ромов

    Да. Это вот одна из проблем не машинного обучения в рекомендательных системах.

  92. Самат Галимов

    Ну, рекомендательная система— это понятная штука. Что еще есть? Какие еще есть области, в которых машинное обучение прямо рулит, и без которых его бы не было в том виде, в

  93. Самер Фатайри

    котором мы видим изображение?

  94. Петр Ромов

    Ну, анализ сигнала всяческого вида. Например, это может быть звук speech-to-text, text-to-speech, например. То есть есть модели машинного обучения, которые синтезируют речь. Получается более плавная речь. Можно зайти на Google Cloud и попробовать прям вот text-to-speech послушать. Это очень круто.

  95. Самат Галимов

    Я видел не совсем недавно статью на эту тему, буквально несколько лет назад, я уже был взрослый, когда это писали, что это был переход, когда перестали склеивать кусочки голоса и начали делать музыку.

  96. Самат Галимов

    Давайте проведем эксперимент. Заставим компьютер прочитать этот текст двумя разными алгоритмами. Старым, со склейкой звуков, и новым, на методах машинного обучения. У нас есть вот такой записанный голос.

  97. Заставка

    At first I was afraid, I was petrified Kept thinking I could never live without you by my side But then I spent so many nights thinking how you did me wrong And I grew

  98. Самат Галимов

    strong Мы хотим из него сделать текст. Для этого используем алгоритм speech-to-text. Теперь из получившегося текста мы хотим сделать голос. Это алгоритм text-to-speech. Обратная операция. Есть старый алгоритм, в котором нарезаются кусочки голоса и склеиваются вместе.

  99. Гость

    Звучит это примерно вот так. А есть

  100. Самат Галимов

    новый алгоритм, который не склеивает кусочки текста, а имитирует их из ранее услышанного?

  101. Гость

    Вначале я боялась, я была разочарована. Я думала, что я никогда не смогу жить без тебя с моей стороны, но потом я провела так много ночей думая о том, как ты меня ошиблась, и я выросла сильной, и я узнала, как добраться к тебе.

  102. Самат Галимов

    Ручной склейки никакой не происходит, алгоритм просто научился подражать дикторам.

  103. Петр Ромов

    Есть обработка текстов, как вот последовательность слов, такого вида сигналов. Машинный перевод делается тоже машинным обучением. На эту тему была история, когда известная компания делала переводчик лингво, если я не ошибаюсь.

  104. Самат Галимов

    ABBYY, ты имеешь в виду?

  105. Петр Ромов

    Да.

  106. Самат Галимов

    Русская компания очень крутая, которая делает также FineReader.

  107. Петр Ромов

    Много лет, больше 10 лет, на основе правил лингвистических. Был задействован большой штат лингвистов, но потом пришло машинное обучение и сделало это на параллельных корпусах. Просто вот были там книжки, переведенные варианты, скормили и получилось примерно такого же качества, но только за полгода.

  108. Самат Галимов

    О, больно как. Можем поговорить про соревнования? Потому что машинное обучение мне ещё интересно тем, что мне кажется, что у вас там очень часто, ну, самый известный это Netflix, когда Netflix сказал, вот, информация о том, что люди смотрят, сделать алгоритм, который будет предсказывать, что люди будут дальше смотреть, а тот, кто выиграет, получит миллион долларов, мне кажется, это было, да, Витя?

  109. Петр Ромов

    Да, это очень интересная история. Интересна еще тем, что они сделали задачу Netflix Prize такую, которая вообще не имеет практически никакой ценности для продакшна, для практики. Неправильно поставили задачу. Но когда люди стали решать эту задачу, они нашли все эти проблемы, возникло целое направление. Возникла конкуренция.

  110. Самат Галимов

    То есть, алгоритм, который выиграл, был не полезен для Netflix?

  111. Петр Ромов

    Он был настолько сложный, бессмысленный и беспощадный, что его просто вынесли на архив, на помойку научных статей.

  112. Самат Галимов

    Но формально он выиграл.

  113. Петр Ромов

    Благополучно забыли. Да, формально выиграл, конечно, приз получил. Но в процессе конкурса было исследовано настолько много проблем рекомендательных систем, было придумано столько много подходов вообще к решению этой задачи, что возникла целая конференция ACM RecSys, на которой вот уже там больше 10 лет собираются специалисты по рекомендательным системам и там обсуждают проблемы. Кроме того, после Netflix другие компании стали аналогичным образом поступать, выкладывать свои данные в публичный доступ для того, чтобы ученые, которые владеют этим математическим аппаратом, могли применить его на данных компании и попробовать принести пользу за счет своих исследований.

  114. Самат Галимов

    Расскажите, а в каких конкурсах вы участвовали? Самер, давай с тебя.

  115. Самер Фатайри

    Я вообще начал в них участвовать совсем недавно, буквально пару месяцев назад. До этого я просто обходил стороной, мне казалось, что это занятие для людей, у которых сильно больше свободного времени, чем у меня.

  116. Самат Галимов

    Давай-давай, не стесняйся, студенты, в котором делают нехрен.

  117. Самер Фатайри

    Не-не, там на самом деле люди, которые участвуют в конкурсах успешно, это обычно не студенты, а очень успешные data scientists. Я участвовал в конкурсе недавно, на самом деле просто он меня заинтересовал как конкурс. Это был конкурс от музея Метрополитен в Нью-Йорке. У них была куча фотографий разного вида искусства, и нужно было сделать алгоритм, который подписывал бы это искусство. Это китайское, это итальянское, это, скорее, 17 век. На этом есть мужчина, а на этом есть собака. В общем, я поучаствовал, мне понравилось. И теперь я участвую в конкурсе, где нужно комментарии на каком-то сайте определять, токсичные они или нет.—

  118. Самат Галимов

    О, это супермодная тема.—

  119. Самер Фатайри

    Это даже более модная тема, чем machine learning, да.—

  120. Петр Ромов

    Политически заряженная, я бы сказал.—

  121. Самер Фатайри

    Да-да-да.—

  122. Самат Галимов

    А есть слова точно токсичные? Можно ифы написать? Триггеры, типа, вот это слово есть?—

  123. Самер Фатайри

    Да, есть, но это будет довольно мало.— Слово, которое токсичное в одном контексте, может быть не токсичным в другом контексте. Например, слово «трамп».

  124. Петр Ромов

    Я участвовал и занял первое место в конкурсе. Задача, которая была организована интернет-магазином, там нужно было так сказать, что пользователь купит. И купит ли вообще, совершит ли покупку по его поведению на сайте.

  125. Самат Галимов

    Не только покупки, это просто типа как он ходит по сайте, что ли? Поведение на сайте?

  126. Петр Ромов

    Да, поведение на сайте. Зашел на страницу, посмотрел такой-то товар, посмотрел такую-то категорию. У тебя есть лог того, что он делал, и тебе нужно сказать, во-первых, совершит покупку или нет в итоге. И если он совершит покупку, то тебе нужно сказать, а что будет в корзине.

  127. Самат Галимов

    А зачем нужна эта информация?

  128. Петр Ромов

    Например, если пользователь дошел до покупки, но не совершил ее, а ты предсказываешь, что он очень хотел, вероятно, он бы ее совершил.

  129. Самат Галимов

    То ты ему звонишь прямо.

  130. Петр Ромов

    Ты можешь его догнать, да. Например, ресурсы отдела продаж пустить на вот таких вот людей. А если ты будешь на всю аудиторию

  131. Самат Галимов

    запускать... То это слишком дорого.

  132. Петр Ромов

    То это слишком дорого, да. Тут ты выбрал жирную категорию людей, которые способны на покупку. Мне очень нравилось, что в соревнованиях можно погрузиться в любую предметную область, какую ты хочешь.

  133. Самат Галимов

    Приведи примеры, какие предметные области бывают.

  134. Петр Ромов

    Например, бывают исследователи океана, которые исследуют миграцию животных, например, китов, и им нужно распознавать по плавнику, где какой кит, на каких фотографиях. вдоль береговых линий.

  135. Самат Галимов

    Классно.

  136. Петр Ромов

    Задача идентификации только не по лицу, а вот по плавнику кита. Есть задачи из банков. Вот, я никогда не работал в банке, а там есть задачи по оценке лояльности клиента, по кредитному скорингу.

  137. Самат Галимов

    Фрод.

  138. Петр Ромов

    По фроду, да. Если ты никогда не работал в банке, но хотел бы попробовать узнать вообще, что это такое и какие там есть особенности, то ты можешь поучаствовать в соревновании от банка.

  139. Самат Галимов

    А там все еще дают по миллион долларов?

  140. Петр Ромов

    На разных соревнованиях дают разные призы, от 5 тысяч до 100 тысяч долларов.

  141. Самер Фатайри

    На Миллионник денег дают, нет.

  142. Самат Галимов

    А почему у Нетфликса так? Это должен какой-то скачок, да? Ведь этого никто никогда не делал, они-то запустили.

  143. Петр Ромов

    Но они, видимо, очень хотели привлечь внимание, и надо сказать, что им это удалось.

  144. Самат Галимов

    До сих пор разговариваю.

  145. Петр Ромов

    На самом деле это породило, во-первых, соревновательное движение. Люди поняли, что можно не только в научных статьях сравнивать результаты друг с другом, что это можно сделать на вообще массовой аудитории, что это можно делать не только в рамках научной работы, что это можно делать просто как вот. Самат придумал какую-то идею, улучшил чей-то алгоритм и стал лучше, чем самый крутой ученый. И Самат не занимался исследованиями много лет, но при этом стал знаменитостью, потому что он придумал.

  146. Самат Галимов

    А есть такие люди?

  147. Петр Ромов

    Да, есть. Есть очень много таких людей.

  148. Самат Галимов

    Которые не из академической среды и не профессионалы. Как это работает? Что для этого нужно сделать?

  149. Петр Ромов

    Фишка как раз в том, что это непаханное поле, и от того, насколько ты будешь настойчивым, наверное, зависит, насколько интересную штуку ты найдешь.

  150. Самат Галимов

    Это новое поле, в котором ценится умение соображать.

  151. Петр Ромов

    Я думаю, скорее, знаешь, вот есть формат научного исследования строгого, где есть формат, рамки, и твою статью не опубликуют, даже если там будет крутой результат, но он будет такой мелкий, а тут эти рамки убрали. Любой, даже школьник, может принимать участие в соревнованиях, неважно, в каком он университете, неважно, на какой кафедре, неважно, какие у него статьи, и неважно, какое решение он сделал. Важно, что результат он получил. Это породило, на самом деле, очень много инструментов, библиотек, программных, с методами машинного обучения, которые используются в разных компаниях. Например, с такой библиотекой XGBoost.

  152. Самат Галимов

    Как еще раз?

  153. Петр Ромов

    XGBoost. Был китайский студент, он был недоволен тем, что алгоритм машинного обучения, который он использовал, градиентный бустинг, сложное слово. Есть такой модный алгоритм, градиентный бустинг.

  154. Самат Галимов

    Слышал даже, не знаю, что это такое.

  155. Петр Ромов

    И китаец был недоволен, что на его слабеньком ноутбуке можно было сделать 100 итераций, хотя другие ученые с большими серверами делали тысячу. Он просто написал плюсовый код эффективный.

  156. Самат Галимов

    Код на языке C++.

  157. Петр Ромов

    Ну да, стал делать тысячу итераций, как все.

  158. Самат Галимов

    А потом Google начал использовать, сэкономил миллиард.

  159. Петр Ромов

    Нет, потом просто все сообщество, которое осталось соревноваться, и пошло-поехало. Сейчас это одна из наиболее известных библиотек.

  160. Самат Галимов

    Что с этим студентом стало?

  161. Петр Ромов

    Честно говоря, не знаю. Я был на его стенде на конференции KDD. Knowledge Data Discovery. Там был этот китаец, и у него был самый популярный стенд. То есть все, кто рядом, нервно курили, потому что они были никому не интересны. Хотя он не делал никакого научного исследования, он просто эффективно запрыгивал то, что уже все и так знали. Круто. машинное обучение— это такая область, которая уже доступна школьникам. Мы проводили соревнования для школьников в Академии Искусственного интеллекта. Идея была в том, что учителя информатики показывают школьникам на уроках информатики, что, в принципе, есть такой вот Искусственный интеллект— машинное обучение. Идите на сайт, а на сайте их ждали материалы учебные в виде простых видеороликов, объясняющих, что к чему на пальцах. И соревновательная задача, в которой нужно было предсказать, кто победит в Доте. И школьник, получается, для него предметная область совершенно знакома, понятно. То есть это не какие-то скучные данные из банков. Его любопытство настолько завлекает, что он идет, разбирается в питоне, разбирается в библиотеках для машинообучения, ну и начинает участвовать. На финал было приглашено 100 школьников, которые какое-то разумное решение сделали. Был даже пример Саша Мамаев, он участвовал в подкастах «Медуза», рассказывал про то, как он работает. Тинькове работал во Вконтакте, будучи одиннадцатиклассником, и зарабатывает там больше 100 тысяч рублей в месяц.

  162. Самат Галимов

    Я хотел понять, нам есть чем гордиться? Просто вот Россия исторически это страна, которая там с космосом, например, хорошо что-то делает.

  163. Самер Фатайри

    Главная платформа для соревнований называется Kaggle. Если зайти в турнирную таблицу любого соревнования, там будет понятно, что есть чем гордиться. Отвечаю.

  164. Петр Ромов

    В России очень хорошая школа анализа данных, машинного обучения.

  165. Самат Галимов

    Это университетская, ты имеешь в виду?

  166. Петр Ромов

    Да. Во-первых, Яндекс сделал школу анализа данных. Это породило очень много специалистов действительно хорошего уровня. После этого университеты стали делать свои образовательные программы, посвященные машинному обучению. Ну и в целом у нас вот обучение машинному обучению в России очень хорошо выстроено. Вот тот Антон Канушин, который спецкурс по компьютерному зрению преподавал, он сейчас руководит образовательной программой на ФКН в Вышке, факультет компьютерных наук, заточенный под современные нужды компаний айтишных.

  167. Самат Галимов

    То есть, если хочешь этому научиться, необязательно ехать в MIT, можно вполне пойти в вышку и там этому научиться.

  168. Петр Ромов

    Тут есть такой момент, что ехать в MIT можно не только за знаниями, а за нетворкингом. В плане нетворкинга не могу сказать. Не был в MIT и не жил никогда в Америке и в Долине. Может быть, MIT того стоит, но совершенно точно в плане уровня знаний у нас все хорошо.

  169. Самат Галимов

    Окей, я выучился, я классно в этом разбираюсь, побеждаю на конкурсах. Кем мне можно работать в России, кем мне можно работать в мире?

  170. Самер Фатайри

    Я довольно долго работал в BookMate, потом в какой-то момент я захотел пожить где-нибудь не в России, и начал искать себе работу в Европе. В итоге я выбрал Берлин, не связанным вообще с машинным обучением, критерием. Работы очень много, работы реально очень-очень много.

  171. Самат Галимов

    Слушай, если сравнивать с программистами, мне кажется, ты же из программистов пришёл, да?

  172. Самер Фатайри

    Нет, я пришёл из аналитиков.

  173. Самат Галимов

    Я просто хочу понять, про программистов примерно понятно. Рынок, что тебе довольно легко найти работу, она бывает разная, здесь побольше, здесь меньше.

  174. Самер Фатайри

    Рынок программистов в пересчёте на количество людей намного больше, чем рынок data scientists. При этом, очевидно, ощущается нехватка data scientists. Постоянно меняется определение того, что должен уметь data scientists.

  175. Петр Ромов

    Я бы сказал так, что профессия эта появилась за счет того, что компании строили какие-то IT-решения, в принципе, они их построили, вот банк, у него есть уже IT-решение, его развивай-не развивай, оно принципиально не поменяется никак.

  176. Самат Галимов

    Ты имеешь в виду, что процент улучшений будет маленький?

  177. Петр Ромов

    Ну да, ты ничего не улучшишь от того, что в инфраструктуре что-то переделаешь. Но при этом компании с IT-инфраструктурой за все время их существования, развития, они накапливали очень много данных. И сейчас наступило такое время эволюционное, что все, что можно запрограммировать, запрограммировали. Профессия разработчика стала казуальной. Разработчик и разработчик. Не так, что ты разрабатываешь. Мы как раз тебя и искали. Рынок устоялся, и теперь есть потребность монетизировать данные, которые компании накапливали.

  178. Самат Галимов

    Я правильно тебя понял, что твоя идея в том, что компании столько накопили данных, что не хватает людей, которые бы помогли разобрать эти конюшни и понять, что из этого ценное, а что нет.

  179. Петр Ромов

    Ну, по крайней мере, есть спрос. Компании хотят разбирать эти данные и видят возможность роста в том, чтобы делать что-то новое на основе анализа данных, которые они уже имеют, уже накапливают. И в этом смысле появилась профессия data scientist. Это тот человек, который вроде как ставит задачи, которые могли бы быть полезны бизнесу, который делает прототип, показывает на эксперименте, что вот такой анализ данных действительно приносит пользу бизнесу. И потом еще каким-то образом с разработчиками это пытается интегрировать в процесс.

  180. Самат Галимов

    Я правильно понял, что Data Scientist говорит бизнесу, где бы бизнес мог сделать себя хорошо. То есть это не бизнесмен приходит и говорит, а сделать мне здесь анализ, а он как бы сам говорит. Я тут заметил, что вы могли бы...

  181. Петр Ромов

    Тут меня не расходится. Я вот, когда был Data Scientist, я считал, что вот именно эта роль Data Scientist в компании. Но вообще я считаю, что Data Scientist как профессия должна уйти. То есть это такая временная профессия. Вообще на самом деле будут просто разработчики инфраструктуры, разработчики фронтенда, аналитики, которые будут иметь в багаже своих знаний, машинное обучение.

  182. Самат Галимов

    А, пока этим просто мало кто умеет.

  183. Петр Ромов

    И они будут это применять в своих сферах. В принципе, ничего нового. В Яндексе так примерно всегда было устроено. Разработчики занимаются только лишь машинным обучением. Есть аналитики, которые могут взять данные, построить отчет.

  184. Самат Галимов

    А в компании не уровня Яндекса, а поменьше, там есть один человек, который умеет делать это все, но только в области машинного обучения.

  185. Самер Фатайри

    На самом деле это меняется довольно быстро. Я помню времена, когда можно было быть дата-сайентистом и уметь очень плохо программировать. Сейчас так уже делать нельзя.

  186. Самат Галимов

    Я слышу ностальгию такую.

  187. Самер Фатайри

    Это были хорошие времена, но потом пришлось научиться программировать. Алгоритмы машинного обучения на самом деле перестали быть. каким-то священным граалем, который 15 человек знает, как это работает. Существуют облачные алгоритмы машинного обучения, где ты подключаешься к гугловскому, амазоновскому, фейсбуковскому или кому-нибудь еще алгоритмам, и они предсказывают тебе, что на твоей картинке. Тебе не надо иметь человека в штате, тебе надо иметь человека, который может постучаться в какой-нибудь API, что намного дешевле сразу становится. Остается две вещи. Понять, когда надо применять машинное обучение и понять, как его встроить так, чтобы это работало на каких-то объемах трафика. Когда это уже как бы data scientist немножко скрещивается с product manager или с кем-нибудь еще. То есть ты должен понять, что в этом месте машинное обучение взлетит. Другое уже скрещивается с data engineer, разработчиками. В общем, это прямо техническая отрасль. Но вот человек, который умеет тренировать алгоритмы машинного обучения, он проваливается сейчас уже посередине. То есть надо либо понимать бизнес-ценность этого, либо уметь это очень хорошо интегрировать в работающий продукт.—

  188. Петр Ромов

    Ясно.

  189. Самат Галимов

    То есть дикие времена чуть-чуть проходят уже, времена становления индустрии проходят.—

  190. Петр Ромов

    Я думаю, что data science…—

  191. Самат Галимов

    Они

  192. Петр Ромов

    уже прошли. Science тут слово в принципе очень странное, потому что когда ты приходишь в какую-то компанию, компании не нужен science, им нужен решение конкретных проблем. Я думаю, что будут датсайентисты в исследовательских группах, например у Google, у Apple есть OpenAI и DeepMind, они будут заниматься развитием алгоритмов машинного обучения, которые инженеры, аналитики и прочие профессии, уже существующие давным-давно, будут использовать в своей практике. И вот исследовательские небольшой количество датсайентистов будет развивать эти методы, улучшать их и учить всех пользоваться, и делать их более казуальными, доступными для массовой

  193. Самат Галимов

    аудитории. Знаешь, это очень мне напоминает, когда я об этом думал, готовился к подкасту, у меня была в голове аналогия про то, что когда-то давно, в 60-е годы, каждый компьютер был уникальной штукой. Для каждого компьютера писали свою операционную систему, и были вообще люди, которые типа программисты, и они умели всё. А теперь мы просто берем, типа, макось и не думаем об этом. А есть типа там чуть хитрая система, но суть не меняется. Я не умею программировать операционную

  194. Петр Ромов

    систему, но пользуюсь ими. Да, совершенно точно такой же переход и в машинном обучении. Мне кажется, что я спросил вообще всё, что

  195. Самат Галимов

    хотел, мне было дико интересно. Спасибо большое, Самер. Спасибо большое, Петя. Это был подкаст «Запуск

  196. Самат Галимов

    завтра». Подписывайтесь там, где вы слушаете подкасты. Ставьте нам оценки и пишите комментарии. Мы все читаем, а на некоторые даже отвечаем. Этот подкаст сделали редактор Андрей Борзенко, звукорежиссёр Павел Цуриков, продюсер Павел Боровков. Благодарим за джингл Алексея Зеренского. Я Самат Галимов. Пока!

  197. Самер Фатайри

    Я выживу Я выживу Я выживу Я выживу

Слушайте где удобно

0:00