6 сезон · выпуск 21 · 7 апреля 2022 · 47 мин
Как визуализировать сложные данные
Слушать · 47:11
Представьте, что у вас есть таблица с тысячами разных параметров и значений. Как отобразить их на графике, чтобы не запутаться ещё больше? Татьяна Мисютина, гостья сегодняшнего эпизода и руководитель Лаборатории данных, разработала для этого целый алгоритм. Таня с Саматом обсудили, как сделать понятную визуализацию и получить с ее помощью интересные инсайты.
Этот подкаст мы делаем совместно с сервисом онлайн-образования Яндекс.Практикум
Подписывайтесь на подкаст «Рабочее название»: https://podcast.ru/1541357374
Землетрясения: https://www.flickr.com/photos/idvsolutions/7439877658/in/photostream/lightbox/
Марафон: https://moscowmarathon2017.datalaboratory.ru/results?runners=1,18
ПДД: https://pdd.datalaboratory.ru/
Сайт лаборатории со всеми нашими визуализациями: https://datalaboratory.ru/
Визуализация про ковид, совместная с Сергеем Кашиным: https://www.cashin.ru/virus/ranks/
Подборка «Визуализации года»: https://blog.infotanka.ru/tags/vizualizacii-goda/
Учебный курс: https://datalaboratory.ru/course/
Сайт и книги Эдварда Тафти: https://www.edwardtufte.com/tufte/
Reveal the data https://t.me/revealthedata
Послушать бонусные эпизоды «Запуск++»:
Патреон: https://www.patreon.com/zapooskzavtra
Boosty: https://boosty.to/zapuskzavtra
Над выпуском работали
- Редакторка
- Юля Яковлева
- Младшая редакторка
- Маша Агличева
- Продюсер
- Павел Боровков
- Младшая продюсерка
- Настя Медведева
- Звукорежиссерка
- Нина Мамотина
- Дизайнер обложки
- Петр Сутупов
Транскрипт
Самат Галимов, Таня Мясютина · расшифровано автоматически, ошибки возможны
-
Всем привет, меня зовут Самат Галимов и это подкаст Запуск Завтра. Как технический директор я пытаюсь разобраться, как устроены сложные и интересные штуки. Я зову профессионала, с которым можно поговорить простым человеческим языком. Наши редакторы и продюсеры очень просят напомнить о том, что для нас очень важны ваши оценки и комментарии. Оставляйте нам 5 звездочек, ну или ту оценку, которую вы считаете подходящей, в Apple подкастах. Пишите комментарии в кастбоксе. Для нас это очень важно. Вы могли заметить, что после начала все эпизоды были на тему повестки, то есть то, что происходит прямо сейчас, то, как происходящие действия влияют на нашу с вами жизнь. Мы поговорили о судьбе интернета, о судьбе лекарств, финансовой системы и так далее. Сегодня мы возвращаемся к технологической повестке. Сегодняшний эпизод об анализе данных, о том, как представить данные на картинке так, чтобы по ним было всё сразу понятно. Это подкаст студии Либо-Либо. И мы его сделали вместе с сервисом онлайн-образования Яндекс.Практикум. У Практикума есть курсы по разработке, по анализу данных и по английскому языку. Если вы хотите освоить цифровую профессию, переходите на сайт Яндекс.Практикум и учитесь.
-
Меня зовут Таня Мисютина. Я занимаюсь визуализацией данных. Я руковожу лабораторией данных, где мы создаем интерактивные визуализации и консультируем по визуализации, и ведем учебные курсы.
-
Давай начнем с каких-то очень простых вещей, чтобы вообще объяснить, о чем мы сегодня с тобой говорим. Где мы, как обычные люди, сталкиваемся с визуализацией данных как потребители?
-
Первое, что приходит в голову,— это погода. Gismeteo, любые сайты погодные, всё, что касается финансов, любые курсы доллара и евро, биржи, индексы— вот это всё. Пробки, маршруты, всё, что касается передвижения по городу— это тоже визуализация данных. Вот это то, с чем, мне кажется, сталкивается большинство людей в своей жизни.
-
А вот, например, карта метро московского и вот этой схемы транспортной— это тоже визуализация данных?
-
Нет, я бы не сказала. Ну, то есть здесь отсутствуют сложные данные, которые меняются постоянно. То есть сама по себе схема метро— это сложная структура, но ты ее, по сути, один раз визуализируешь. То есть это немножко другой класс задач.
-
Зачем вообще визуализировать данные?
-
потому что это безумно интересная точка приложения инженерного ума. У меня есть один из любимейших моих примеров— это карта, на которой показаны землетрясения, которые произошли за последние 200 лет на земном шаре. И это очень простая штука из таблички, где были просто записи координаты, время, силы землетрясения. Мы получаем вот эту карту, на которой у нас землетрясения разбросаны по земному шару. Они в зависимости от силы по-разному окрашены, и это тоже интересно, потому что землетрясения, которые 4-5 баллов, они такие просто точечки беленькие. А землетрясения сильные, 8-9 баллов, они показаны с такой светящейся обводкой, зелёной, жёлтой. И когда они накладываются друг на друга, например, в районе Тамбали, Таиланда, там, где сейчас самый активный какой-то сейсмоактивный пояс, на этой карте очень отчётливо проступают очертания тектонических плит. Очень круто, что мы не просто видим эти очертания, этих границ, мы ещё замечаем, что они разные. И даже ничего не зная о вот этих плитах, об их сдвигах, ничего не подозревая об этом, глядя на эту картину, ты задаёшься вопросом, почему? Что стоит за этой картиной? То есть вот в этом для меня магия, что проявилась какая-то штука, которую мы никогда бы не увидели в таблице, никогда.
-
То есть ты получаешь такую новую перспективу. Можешь привести какие-то примеры, когда визуализация помогла увидеть данные по-новому и вообще увидеть что-то, что в таблице не увидишь?
-
Ну, это определенно пример с нашей визуализацией московского марафона, которую мы делали в лаборатории данных. А сделали мы её, потому что в 2013 году я впервые пробежала московский марафон, готовилась, и на каком-то из промежуточных забегов в конце нам прислали таблицу с результатами. И это была такая плоская таблица, где была фамилия, может быть, город и время финиша. А когда ты бежишь, там же это же такой праздник, там столько людей, все такие разные, все такие классные, каждый со своей скоростью, каждый со своей историей тренировок. И что вот это всё, оно как бы схлопнулось вот в эту таблицу, как бы я в этом увидела такую несправедливость, и я подумала, что свой первый марафон я хочу сохранить в каком-то более информативном виде. И мы подготовили визуализацию, где можно было посмотреть, как бегут все бегуны от старта до финиша последнего бегуна, что это такая разноцветная толпа, такой у нас был удав разноцветный, который движется по этому маршруту марафона. Вначале он такой весь собранный, стартуют все вместе, потом как он распределяется вдоль трассы. И на нашей визуализации есть высотный график марафона, как высота меняется на протяжении вот этих 42 километров. У нас есть, как меняется погода, потому что это тоже важно. Ты бежишь при плюс 20 или ты бежишь при плюс 5 и под дождём. Каждый участник может найти себя в табличке, выделить себя и посмотреть, как он бежал и как бежал его друг рядом с ним.
-
А что, ты реально знаешь про каждого бегуна, с какой скоростью он бежал, каждый момент времени?
-
Конечно нет. Там просто стоят ворота. С какой-то частотой, там 5-10 километров, марафон фиксирует по твоему чипу, когда ты проходишь вот эти ворота.
-
Сколько человек там пробежало?
-
Там, по-моему, 6 тысяч было на какой-то из последних.
-
это звучит как довольно сложный интерактивный продукт, но при этом, судя по тому, что ты рассказываешь, как будто тут у нас задача стояла не в том, чтобы что-то новое показать, а скорее передать эмоцию. Я правильно тебя понял? Или там всё-таки можно что-то увидеть новое в этом удаве?
-
Да, там можно увидеть. Там, например, у нас помимо вот этой карты, которая такая большая визуализация, мы такую основную визуализацию снабжаем ещё дополнительными срезами. Например, у нас там есть вот эта полово-возрастная диаграмма, как бы мальчики, девочки в разные стороны, сколько в каких возрастных категориях. Но даже на этой штуке, которая довольно-таки стандартная, мы заметили одну очень важную, интересную историю. Дело в том, что там разный размер возрастных групп. То есть есть, например, возрастная группа 20-22— это пик спортивной формы. А есть 23-34, то есть предыдущая группа— это 2 года, а следующая группа— это 10 лет. И дальше они идут по 5 лет промежутками. И возрастные категории, они имеют смысл, потому что именно в них вручаются награды. То есть это штука, которая неотъемлема от марафона. И при этом, тут очень интересно, на нашей диаграмме мы сделали ширину столбца группы пропорционально количеству лет. То есть 20-22 у нас тоненький столбец, а 23-34 он такой очень жирненький, а следующий в два раза меньше, потому что там по 5 лет градации. А площадь столбца пропорциональна количеству людей в этой возрастной группе. И тогда высота столбца равна среднему количеству людей, приходящейся на один год возрастной группы. Вот это сложный момент.
-
Будто это уже непонятно, да. Потому что ты видишь как бы в этом.
-
Я вижу, что у мужчин переход из группы 23-34 в 35-39, у них вот это среднее значение меняется незначительно.
-
То есть те, кто бегут молодые, продолжают бежать взрослыми?
-
Да. Если бы у нас не было вот этой ширины, мы бы просто видели, что столбец 23-34, он огромный, а столбец 35-39, он меньше. Но мы не могли бы сказать, за счёт чего он меньше. За счёт того, что у нас количество возрастов в два раза меньше? Или из-за того, что у нас народу? Вот. А у женщин в два раза почти становится меньше вот в этой возрастной группе 35-39 по сравнению с 23-34.
-
То есть когда женщины взрослеют, они в два раза меньше начинают бегать, чем мужчины?
-
Переход между возрастными группами видно на нашей диаграмме. И это фантастический факт, при том, что я сама. Иллюстрация просто живая. Это и разница. Потому что я как там… Сколько мне было? 27, наверное, когда я пробежала марафон. 28. И с тех пор я не то что на марафоне, я вообще уже практически не бегаю.
-
Обалдеть! Слушай, это реально крутой инсайт, я не знаю, открытие, которое легко сделать на основе этой картинки, а без нее нужно прямо что-то отдельное садиться и считать.
-
Ну вот насчет легко, у меня даже на курсах аналитики данных приходят ко мне, и они со мной спорят, что ну как бы до этого же надо допереть, что это здесь есть информация, и до этого реально надо допереть. Вот понять, что значит ширина, что значит высота, и как это проинтерпретировать. Но если у тебя нет этой визуализации, у тебя вообще нет возможности сделать этот вывод. А визуализация тебе эту возможность даёт. Я хотела ещё про марафон маленький, очень простой инсайтик рассказать. У нас ещё есть диаграмма финишей, и на ней есть очень явные пики. Я тоже всегда на курсе спрашиваю, как вы думаете, что это за пики. Пики— это значит, что в какой-то момент времени количество людей очень резко возрастает. То есть идёт более-менее равномерное распределение, а потом в какой-то момент времени очень много людей финишируют.
-
Даже я могу предположить, что это такое. Это какие-то круглые числа, люди пытаются добежать в определённое время.
-
Вы бежите с четырёх, вы бежите с трёх сорока пяти, трёх тридцати и трёх часов. Вот эти четыре пика у нас очень хорошо видны на визуализации.
-
Очень крутой пример. Значит, землетрясение и марафон. Прям совсем, кажется, разные вещи, но при этом что-то общее в них есть.
-
Да.
-
А есть какие-то примеры, когда визуализация данных вредна? Ну или как минимум лишняя?
-
Ну очень много примеров, которые я просто в принципе не отношу к задачам визуализации данных. Это там, где нет сложных данных. Это там, где есть 5 каких-то чисел, там 10-20 чисел, ну даже 100, ну то есть 100— это как бы на границе. Небольшие наборы отлично воспринимаются в таблицах. Если нужен какой-то рейтинг стран по какому-то одному параметру, здесь не нужна визуализация данных. То есть это точно не помогает считыванию информации. Это помогает сделать какую-то эффектную штуку и там, может быть, её задорого продать.
-
А теперь рекламная пауза. Я хочу порекомендовать вам новый подкаст. Он называется «Рабочее название». Это подкаст с Яндекс.Практикума про работу в изменившемся мире, как найти работу и как вообще работать, когда сил вообще ни на что нет. Ведет его Ксюша Авдей. Ксюша была у нас в подкасте, она очень классный карьерный консультант и зажигательный рассказчик. Кстати, на следующей неделе будет эпизод со мной. Подписывайтесь, ссылка на этот подкаст есть в описании к этому эпизоду. В моей картине мира визуализация происходит так. Я сначала выбираю, какие именно данные я буду показывать, и дальше у меня есть какие-то способы, не знаю, графики, столбики, диаграммы, еще что-то, и я, значит, их применяю. Это так работает? Ну, расскажи, как это на самом деле устроено.
-
У меня немножко другой философский подход. Мне не очень нравится, когда мы пытаемся взять данные, которые у нас есть, и запихнуть их в какой-то формат, который из тех, что мы знаем. Вот у нас есть библиотека форматов. Так, вот это тут не подходит, тут не подходит. Ну, вот сюда попробуем их запихнуть. Вот как бы я так... не люблю, я люблю дать данным свободу. И для этого у меня как раз вот мой алгоритм со мной очень классно работает.
-
Так, алгоритм, расскажи про него.
-
Это очень хорошо в примере с марафоном получается объяснить. Вот на входе есть вот эта табличка с финишными результатами. Первое, что я делаю, я думаю, откуда эти данные взялись, что произошло в реальном мире, чтобы в таблице оказались вот эти данные. И это первый шаг моего алгоритма. То есть без этого я не начинаю визуализировать данные, без того, чтобы разобраться, что это за сущности, что это за свойства, как это всё выглядит в мире в реальном.
-
Что ты себе представляешь в случае марафона?
-
Я прям представляю вот эту толпу бегунов, как, значит, эти люди с разными флажками из разных стран, в какой они все разной форме, какого они разного возраста. И вот это вот всё мне хочется проявить. Начинает хотеться вот эту сложность перенести на экран. Вот эту штуку я называю реальность данных.
-
Так, вот, значит, ты провела этот обратный процесс и представила в голове, как происходил этот марафон, исходя из твоей таблицы. Что дальше?
-
А дальше подключается физика, моё основное образование. И мы начинаем вот в этой реальности данных искать элементарные частицы. Какая сущность, какое событие, какой объект реальности данных мы считаем вот этим неделимым кирпичиком, из которого всё остальное можно выстроить.
-
Прямо атом.
-
Да, вот мы прям ищем. То есть в примере с землетрясением это просто, это одно землетрясение со своими свойствами, со своей координатой, со своей силой, со своим временем. В примере с марафонцами это тоже просто, это бегун. У него есть координаты, которые меняются во времени, у него есть пол, у него есть возраст, страна. Но в некоторых задачах это очень сложно сделать. В некоторых задачах прям основная работа происходит вот на этом этапе. У нас был, например, такой запрос. Один раз прислали данные с сайта, где люди готовятся к сдаче экзаменов по правилам дорожного движения. И там, значит, в данных есть и конкретные пользователи, которые отвечают на вопросы разных билетов. Получаются у них разные результаты. Кто-то там угадывает, кто-то не угадывает, кто-то знает, кто-то не знает. Всё это происходит во времени. Один и тот же пользователь может на один и тот же вопрос ответить несколько раз. И получается, что сущностей много. И вот выбрать из этого всего, что здесь будет частицей данных, пользователя нет, пользователя много. Действия он совершает, он на много билетов, на много вопросов отвечает.
-
А почему нельзя? Это же вот человек, он проходит эти тесты.
-
Ну, потому что он это не раскладывает. А если тебе хочется по конкретному вопросу посмотреть статистику?
-
А, понятно. Если ты берёшь человека как частицу данных, то вопросы теряются в этом, ты уже не можешь по ним ничего разложить.
-
Да. Нам нужен какой-то вот этот общий знаменатель, как мы его иногда на курсах ещё называем, который бы все эти сущности объединил. И не буду интригу нагнетать, в общем, в случае этой задачи вот эта частица данных здесь будет попытка. То есть это попытка конкретного пользователя ответить на конкретный вопрос, конкретного билета. В этой попытке он выбирает конкретный вариант. И вот после того, как мы выбираем попытку, мы можем посмотреть статистику по одному вопросу, по одному билету всех попыток. Мы можем смотреть статистику пользователя. Например, мы можем посмотреть, как пользователи с первой попытки отвечают на вопросы всех билетов. И вот это то, что стало нашей визуализацией в конце, то есть такой центральной идеей, которую мы сделали.
-
То есть какие-то вопросы более сложные, какие-то более простые?
-
Да, мы это видим, какие вопросы более сложные, более простые. А потом мы начинаем двигать слайдер попыток, и мы видим, что какие-то вопросы зеленеют, и со второй попытки, с третьей попытки люди научаются на них отвечать. А какие-то вопросы есть, которые, я не буду врать, но до десятой попытки у нас там точно есть, 30% человек продолжает ошибаться в этом вопросе. Представляешь?
-
Господи, ужасные вопросы.
-
Но это явно проявляет суть наших данных. Это вопросы с подковыркой какие-то, на которые нужно обратить особое внимание при подготовке к экзаменам.
-
Вот это кайф.
-
В этой задаче это вот ровно то, что мы сформулировали, что у нас есть эта попытка, это как раз и дало возможность результат такой получить. То есть это центральная как бы получилась мысль в итоговой визуализации.
-
Хорошо, вот ты нашла неделимую частицу, этот атом. Что тебе дальше нужно с ним сделать?
-
А дальше следующий абсолютно магический этап. Вот у нас есть в базе данных вот это множество одинаковых объектов, и мы его переносим на экран просто. В самом простом случае мы просто можем сказать, что вот у нас чёрная точка— это один экземпляр частицы данных, например, бегун или, например, землетрясение. Удивительное в том, что на экране не самом большом ноутбука можно показать десятки тысяч таких точек. То есть вот они у тебя минуту назад лежали в базе данных, и ты никак ничего не мог с ними сделать. А потом ты перемещаешь их на экран, и вот эти там 20, 30, 40 тысяч точек, они у тебя материализуются. А потом, например, тебе нужно понять, вот среди вот этих всех попыток, которые были, у тебя больше было правильных ответов или неправильных?
-
И у тебя две горочки получаются такие, кучечки.
-
И ты говоришь, я вот одни покрашу красными, а другие зелёными. Или одни положу направо, а другие налево. И всё, и ты это уже видишь. А дальше ты можешь таким способом проявить достаточно много измерений. То есть ты можешь задействовать размер, ты можешь задействовать форму, ты можешь вместо точечки написать какой-то текст. Получается, что у тебя уже какая-то часть информации, которая была, опять же, скрыта в базе данных, которая была доступна при наведении на объект, она проявилась.
-
Мне очень понятна идея о том, что переводим нашу какую-то таблицу из одного вида в тот вид, в котором у нас есть много объектов с одинаковым набором свойств. И дальше столбцы в базе данных переводишь в визуальные свойства.
-
Качественные и количественные — любые свойства можно таким образом проявлять.
-
Концептуально на мета-уровне понятно. А как на практике конкретно, как это получается? Потому что в моей картине слово «визуализация данных»— это всё равно график, например. И вот мне непонятный переход— это момент магии.
-
Последний шаг— ты выбираешь, в каких осях ты хочешь смотреть вот на эти точки. За время работы с данными, за время попыток придумать какую-то методологию для этой работы, у меня получилось декомпозировать визуализацию и понять, что у нас есть два экранных измерения, я это называю каркасом, и любые параметры данных, абсолютно любые, мы можем привязать к горизонтали и к вертикали, Мы, например, называем каркасом карту, столбиковую диаграмму— это один из каркасов. На самом деле каркас— это просто связь горизонтали и вертикали, то есть двухэкранных измерений с параметрами данных. Например, если это карта, то у тебя привязка горизонталь и вертикаль— это долгота и широта. Или наоборот. Если у тебя каркас— это столбиковая диаграмма, то у тебя горизонталь— это какое-то свойство, по которому мы дробим, например, страны, например, время или возрасты, а высота— это количество объектов в этом промежутке. Либо, например, heat map—
-
тепловая карта.
-
Хитмап— это вот эти вот ячейки разноцветные. Это когда у тебя покрашены, например, это могут быть, я такой хитмап знаю, показаны, например, болезни по вертикали, а по горизонтали показаны года. И это болезни, которые заразные и от которых в какой-то момент стали делать прививку.
-
А в ячейках что?
-
В ячейках количество заболевших каким-то цветовым кодированием. И, соответственно, на таком хит-мапе там очень хорошо видна вот эта граница, когда там, в какой момент появилась вакцина и как болезнь себя ведёт до и как она себя ведёт после. То есть хит-мап— это такой каркас, в котором два качественных параметра, дискретных параметра привязаны к горизонтали и к вертикали.
-
Как понять, каким данным какой из этих способов стандартных лучше подходит? А в какой момент нужно вообще что-то новое придумать? Вот как этот выбор происходит.
-
Ну вот если следовать шагам алгоритма, если это не сложный график, если это какой-то понятный график, какая-то там динамика, например, с разделением внутри столбиков по каким-то типам, то, скорее всего, когда ты приходишь к вот этому шагу, где тебе нужно выбирать каркас, тебе понятно, на каком каркасе, ну то есть на какой вопрос мы отвечаем, как меняется количество чего-то во времени. Очевидно. Одна ось времени, другая ось количества. Ты привязываешь по горизонтали время, по вертикали количество, всё у тебя там выстроились твои посылки, заказы, оплаты, всё что угодно.
-
Хорошо. Можешь, пожалуйста, просуммировать свой алгоритм? Получается, ты выбрал частичку.
-
Сначала описали реальность данных, увидели общую картину целостную, в которой всё со всем связано, все параметры каким-то образом друг из друга выводятся. Потом выделили строительный кирпичик, из которого мы можем целиком вот эту реальность данных построить. частицу данных, перенесли ее на экран и выбрали, каким способом мы будем ее отображать. Это может быть точка, кружочек, линия, все что угодно, в зависимости от контекста. И дальше мы привязываем какие-то свойства вот этой частицы к горизонтали, к вертикали и смотрим, что у нас получается. И вот на этом этапе у нас может быть много-много итераций, много-много экспериментов. Ну вот здесь какой-то уже процесс изобретения, творения и, в общем... Понятное.
-
Подход, кажется, ясен. Вообще, хорошая визуализация— это когда? Это когда мы узнали новую перспективу. Судя по тому, что ты рассказывал, приводила примеры, каждый раз ты был такой «Вау, нифига себе, я бы этого так по-другому не узнал». Это является критерием визуализации.
-
Но вот у меня есть несколько принципов, по которым я оцениваю визуализацию. Визуализация должна свою ключевую задачу решать, то есть она должна проявить что-то, что иначе мы не видим. То есть это базовая история про то, что вот она лежит в таблице, и нам нужно проскролить множество строк и что-то пытаться из этого понять. Или у нас есть картинка, на которую мы смотрим, И наш мозг уже дальше с этой картинкой что-то начинает её обрабатывать вообще другими инструментами. Второй принцип— это информативность. Как я уже сказала, на экране очень много помещается информации. Есть визуализации, которые показывают 70 тысяч значений на площади, которая занимает меньше четверти экрана, но при этом эти значения доступны тебе для анализа, и ты можешь делать из них какие-то выводы. Есть ещё многомерность. Это то, что я приводила в пример на московском марафоне, когда ты много разных граней, много разных срезов, много разных свойств помещаешь в одну визуализацию. И тоже тут всё, что важно для бизнеса, всё, что важно— видеть все срезы, мы стараемся упаковать в какой-то один лаконичный формат, чтобы фильтры можно было комбинировать между собой, чтобы на всё можно было смотреть в разрезе чего-то другого, комбинировать эти разрезы. И вот это тоже даёт мощь визуализации как инструмента анализа. Наглядность очень важна. Очень важно использовать визуальные атрибуты, очень важно использовать такие средства графические для представления информации, чтобы не нужно было расшифровывать. То есть по максимуму, если у нас на марафоне есть девочки и мальчики, мы их красим в розовый и голубой цвет, и это нам даёт сразу возможность не писать нигде отдельно. Но марафоны давно проходили, ещё не было ни бинарных участников в те времена. Сейчас это такая тоже интересная задача, которую как-то будем решать.
-
У меня есть предложение. Когда мы с тобой сыграем в игру, я тебе поставлю задачу. Проведи меня как клиента, наверное. визуализировать данные по своему подкасту. У меня есть информация о числе прослушиваний каждого эпизода по дням, распределении по платформам и устройствам. То есть я знаю, сколько людей слушают на платформах, на разных устройствах. В некоторых платформах, в Apple подкастах, есть еще пол, возраст и глубина прослушивания. То есть тот, до какой минуты люди дослушивают. Еще есть информация по эпизоду. Это длительность эпизода, когда он вышел, тема эпизода. Как мне лучше визуализировать эти данные?
-
Хорошо. То есть понятно, что частица данных у нас здесь. Это одно прослушивание. То есть это конкретный слушатель со своими конкретными свойствами слушает конкретный эпизод. Всё сложилось. И ещё есть момент времени. То есть подкасты они же слушают как бы не в тот момент, когда они выходят. У него ещё может быть какой-то хвостик.
-
Ну да, обычно там много людей слушают вначале, а дальше длинный хвост они потихонечку дослушивают.
-
Значит, тогда у нас, скорее всего, по горизонтальной оси, которая большая, она больше на экране, по горизонтальной оси у нас тогда будут подкасты, выпуски, эпизоды в хронологическом порядке. По вертикальной оси самое банальное количество прослушиваний— это то, с чего можно начать. И просто ты уже увидишь, как у тебя количество прослушиваний меняется от эпизода к эпизоду, будут видны самые популярные и так далее. И дальше это очень удобный график для того, чтобы на нём смотреть любые соотношения по любым параметрам, которые тебе интересны. Например, ты рядом можешь вывести либо просто такие переключалочки по платформам, по устройствам, по полу. У тебя не так много параметров, и кажется, что их все можно вывести в один аналитический инструмент, выбрать несколько форматов представления классных и дальше уже с ними играть. В твоём случае я не думаю, что прям какие-то супер неожиданные инсайты будут, когда ты просто сделаешь какое-то одно представление. Я думаю, что всё самое интересное будет крыться на стыке, когда ты будешь переключать, например, смотреть на девочек, которые смотрят через Spotify. То есть на стыке этих параметров ты можешь увидеть что-то интересное, немножечко сделать шаг в глубину. Я придумала, кстати, знаешь что? Я придумала, как показать твой длинный хвост на графике по эпизодам. Тебе нужно просто вот эти прослушивания, которые не в первый день, красить разными цветами. То есть взять один цвет для первого дня, второй цвет для второго, третий для третьего. И ты увидишь, как в эпизодах отличаться будут картины именно, сколько пришло в первый день и сколько пришло в хвосте.
-
Можно будет увидеть, какие эпизоды долгоиграющие, а какие эпизоды просто повесточные, типа в первый день выстрелили и все. Интересно, я не думал о том, что вот так это можно показать. Есть еще несколько вопросов, которые вот по этим данным. Они немножко шуточные, но я хочу их немножко добить. Например, есть два вопроса. Первый. Продюсер хочет решить, можно ли поменять ведущего? Можно ли на этот вопрос ответить с помощью визуализации данных?
-
Сходу кажется, что нет, до тех пор, пока ты не пригласил другого ведущего, собрал какое-то количество эпизодов.
-
А у нас есть несколько эпизодов, в которых участвуют редакторы Юля.
-
Тогда, конечно, можно как минимум сравнить. То есть вот представь, у тебя есть вот эта твоя история, где у тебя по эпизодам есть вот эта разбивка, и ты просто сверху или там слева делаешь эпизоды только свои, а там справа показываешь... Ты это можешь прям разделить. Вот у тебя эпизоды такие, эпизоды такие. Вот так это выглядит. Тебе даже не надо их искать внутри списка эпизодов, ты их просто разложил в две кучки, разделил и смотришь на них.
-
Основной вопрос, который возникает, насколько это связано с тем, что этот эпизод вела Юлия Яковлева, а насколько с какими-то другими параметрами, которые, например, он, например, на такую тему, которая у всех хорошо заходит. То есть как вы члените эти факторы?
-
Всё, что у тебя есть на визуализации, это ты видишь подписанную тему эпизода, и дальше уже твой мозг может, например, понять, что если с редактором популярность очень высокая везде или популярность очень высокая в одном посте, то это же тоже разные картинки будут. Но если твои данные в принципе позволяют сделать такой вывод, то визуализация тебе поможет. Если у тебя там три эпизода всего, и они ни о чём не говорят, то визуализация тоже не поможет. Здесь достаточно просто всё.
-
Вопрос, который всех нас волнует, тех, кто занимается подкастом. Всё ли мы делаем правильно? Становимся ли мы популярнее?
-
Здесь важно определить критерий, то, что KPI называется. Что вам интересно? Вам интересно увеличивать прослушиваемость, глубину, вот эту, про которую ты сказал? Или вам интересно, чтобы длинный хвост, чтобы подкаст не терял, например, популярность? Или вам, в принципе, интересно, чтобы прослушивание становилось больше? И дальше уже отталкиваясь от ответа на этот вопрос, на что вы хотите сказать, а может, вы на все три параметра вместе хотите смотреть. И это можно сделать с помощью визуализации. Можно три параметра, можно шесть проявить. То есть три точно можно проявить на одной картинке, чтобы они все вместе как-то играли. И в зависимости от этого уже делать вывод, например, что что-то растёт, что-то не растёт, или вообще всё замечательно.
-
Таня, ты сейчас рассказываешь мне о том, что давай так покрутим, давай так покрутим. А насколько реально, вот между тем, что ты подумала и между тем, что получила, сколько труда твоего нужно для того, чтобы посмотреть разные разрезы, например? Сколько времени нужно?
-
Слушай, ну это сейчас прозвучит, наверное, просто как суперреклама, но есть такой инструмент — Tableau, и вот то, что мы с тобой обсуждаем, там можно типа так покрутим или так покрутим. Это делается прям одним движением мышки. Как раз вот эти эксперименты, что мы положим на одну ось, что мы положим на другую ось, и что мы получим в результате, они там очень просто делаются. И там очень, как бы, почему я его еще люблю и почему мы именно его сейчас на курсах используем, потому что методология, которая лежит под капотом табло, она очень близка к моему алгоритму, несмотря на то, что мы как бы параллельными путями в эту точку пришли.
-
Пользуешь ли ты какими-то другими инструментами? И вообще, насколько важен инструмент?
-
Я вообще пользуюсь программистами. То есть в лаборатории у меня был штат, даже уже сейчас не скажу, человек пять, наверное, программистов, которые делали все, что мы делали, и это делали с использованием библиотеки D3.
-
D3— это библиотека для JavaScript, в которую нужно прямо программировать, программировать. Это не то, что слайдеры подвигу. Честно говоря, я пытался разобраться в D3, и у меня не получилось, при том, что я немножко умею программировать на джаваскрипте.
-
Последний раз я воспользовалась программистом, когда мы с Сергеем Кашиным делали визуализацию по данным про ковид.
-
Это журналист Сергей Кашин? Кто это?
-
Это блогер, технический директор, видимо. Я вот боюсь сейчас соврать.
-
В общем, технарь. И что вы сделали? Можешь рассказать?
-
Когда вот эта вся закрутилась история с ковидом, мне пришла в голову идея одной визуализации. Это то просто, как я на эти данные смотрела. Я тогда заходила на «Медузу» и проверяла Россию, вот те страны, которые вокруг России сегодня. и завтра, по сравнению с теми странами, с которыми там, когда у нас было ещё 5 случаев, там 10 случаев. Вот эти страны, которые в списке, стоят вокруг. Как бы что в них происходит? Мы их обгоняем, тех, с которыми были рядом вчера? То есть я не цифрами оперировала, а я оперировала вот этим местом в этой табличке. И мы с Сергеем сделали визуализацию, которая показывает, как меняются места. В какой-то момент штаты вышли на первое место, и в какой-то момент их с этого места подвинули. Они обогнали Китай, потом кто-то обогнал их. То есть там видно вот это. Да-да-да, в плохом смысле. Никто не хочет быть на первом месте. И мы вместе сделали такую штуку. Там очень прикольно получилось сделать эффект, когда страна переходит в какой-то рубеж, там тысячу, пять тысяч, десять тысяч и так далее, там мы меняем цвет подложки. И вот эта подложка, она превратилась в такую разноцветную карту, градиентную, как бы путешествие стран по вот этим большим числам. И там очень все получилось математично, очень красиво, как я люблю.
-
Таня, а как тебе обычно ставят задачу? Или к тебе приходят вот с конкретными вопросами, и тебе говорят, вот, у нас куча данных, сделай красиво?
-
По-разному, и так, и так бывает. Конечно, если это какие-то бизнес-дашборды, я всегда общаюсь, созваниваюсь, задаю вопросы, потому что реальность данных, она не всегда очевидна, если это какой-то бизнес, там много всего, может быть, под капотом каких-то сущностей, непонятных связей. Это все очень нужно детально во всем разобраться, и как раз в процессе этого общения Когда ты узнаёшь всё о предметной области от человека, который непосредственно заинтересован в результате, обсуждаете реальность данных. Я задаю вопросы, что важно видеть, какую-то постановку задачи формулирую. Тоже достаточно одного абзаца текста для этого обычно бывает. И дальше мы уже движемся какими-то итерациями. Показываю, что получилось, нравится, не нравится. Это суперстандартный дизайнерский процесс. Я долго занималась дизайном интерфейсов, и вот эти штуки, они все мне очень легко даются, и мне тут чаще даже непонятно, что может быть непонятно, или что может не сработать, как можно не услышать, как можно не понять, на какой вопрос нужно
-
давать ответ. Насколько вообще нужно хорошо разбираться в предметной области, в теме, которую ты визуализируешь? Насколько тебе приходится глубоко погружаться?
-
Насколько возможно, насколько позволяют когнитивные способности. Мы делали для наших учёных биоинформатиков визуализацию. Они анализируют ДНК кишечного микробиома и разбираются какие-то свойства тебя как человека. Они выводят на основе свойств твоего ДНК бактерий, которые живут в твоём кишечнике.
-
Суперинтересная тема. Есть гипотеза, что мы во многом зависим от того, что у нас в желудке.
-
Да-да-да. И там ребята очень серьёзно, очень много лет уже этой темой занимаются. И как бы не всё, что они делают, но всё, что касается того исследования, для которого мы визуализируем данные, нужно понять максимально детально, что значат буковки, что значит какие-то эти там коды участков, генов, которые отвечают, за что они отвечают. То есть вот эти все связи нужно построить. Ну, это самое интересное, мне кажется. Ну, кроме конструирования потом формата, который это все представит, я стараюсь максимально глубоко погружаться.
-
А что, реально ученые заказали вам визуализацию?
-
Да, ее даже опубликовали в журнале Oxford Bioinformatics.
-
Вот это круто. Расскажи про профессию. Ты сказал, что начинала как дизайнер интерфейсов. А вообще есть такая отдельная профессия— визуализатор данных?
-
Сейчас, наверное, нескромно прозвучит, но мне кажется, в какой-то момент я её себе придумала. Да, я в какой-то момент поняла, что я не хочу... То есть я была дизайнером интерфейсов, который был ориентирован... Ну, я старалась делать проекты, которые связаны именно с информационно нагруженными интерфейсами, информативными интерфейсами. Я искала такие проекты, но я называла себя дизайнером интерфейсов. А потом я решила, что я как балерина, которая хочет зарабатывать только балетом, не буду больше делать никаких проектов, кроме визуализации данных. И это, собственно, был момент, когда я открыла лабораторию данных и сказала, что вот за визуализацией интерактивной приходите к нам.
-
В чем разница между дизайнером интерфейсов и человеком, который все время занимается только визуализацией данных? В чем разница?
-
Но всё-таки дизайнер интерфейсов— это очень широко. То есть, например, дизайнеру интерфейсов можно принести систему, с которой будет визуализация данных, но, например, вокруг неё будет сложный процесс, условно, какого-нибудь создания заказа с большим количеством полей, с несколькими этапами, например, этого создания. И это, как проповедует бюро Горбунова, это никогда не про формочки, не про иконки, не про кнопочки. Это всегда про то, что ты должен погрузиться опять же в предметную область, но погрузиться по-другому. Не как я, когда я работаю с данными, а погрузиться именно вот в этот процесс. В то, что можно улучшить в этом процессе, оптимизировать в этом процессе. Как можно эту формочку от трёх этапов сократить до одного. и как там всё написать человеческим языком. И если ты дизайнер интерфейса, и это будет высоконагруженный информационно-нагруженный интерфейс, но всё равно там будет большая часть работы, которая не про вот это жонглирование разными параметрами и разными визуальными атрибутами, а про работоспособные системы и бизнес, И, наверное, для меня вот в этом разница, что когда ты дизайнер интерфейсов, у тебя нет возможности… Ну, понятно, что у тебя всегда есть возможность отказаться от любого проекта, но вот с точки зрения того, как ты себя позиционируешь, то как будто это про тебя.
-
Ты сказала, я в какой-то момент себе придумала эту профессию. Это только ты её придумала или…
-
Мне кажется, что большая часть людей, которые сейчас занимаются визуализацией в России, это люди, пришедшие из мирных профессий. То есть кто-то больше с таким вот техническим бэкграундом, как я, который приходит из дизайна интерфейсов, может быть, даже из каких-то инженерных историй, из каких-то научных лабораторий. Медицинские визуализации очень классные ребята делают наши. Есть люди, которые больше приходят со стороны граф-дизайна и, может быть, даже такой более гуманитарной повестки. Это какие-то, могут быть, исторические истории, рассказанные задействованием визуализации. Но я не знаю, наверное, никого из своего окружения, кто бы в России отучился на дизайнера визуализации. Но есть наш учебный курс. Стараемся учить.
-
Теперь хочется баек твоих, war stories. Можно ли сделать хорошую визуализацию в PowerPoint?
-
Можно скриншот сделать и вставить в Пауэрпойнт.
-
А в Инстаграме?
-
Слушай, я тут недавно, не знаю, знаешь ли ты Олю Маркес, музыкант, вот, и она на День матери такую сделала у себя в блоге перекличку. Надо было написать, сколько тебе лет, сколько у тебя детей и, ну, просто ручкой помахать. И я в какой-то момент… Мне так понравилось, сколько там откликнулось мам активных читательниц. Я в какой-то момент спарсила эти данные и просто сделала очень примитивную… Реально два часа вечером потратила, сделала очень примитивную визуализацию. Даже в инсту Оле закинула, она там её пошарила. Ну и фишка была в том, что каждая мама могла себя найти. Там было… Чем больше твой столбик, тем больше у тебя детей. Соответственно, он розовый, если это девочки, какой-то серенький, если смешанные, и голубенький, если мальчики. И вот там, короче, можно было прям потыкаться и найти, и там какие-то даже незнакомые мне мамы находили себя, кликали и выкладывали скриншот с собой на этой визуализации всех мам, которые, значит, любят Олю и читают её.
-
Обалдеть!
-
Вот, это визуализация в Инстаграме.
-
Сейчас, погоди, это была интерактивная штука в интернете? В смысле, на веб-странице какую-то ты сделала интерактивную?
-
Но это в табло. Как раз это в табло очень просто делается. Это достаточно стандартный формат. И потом по ссылке можно зайти, сделать тоже скриншотик и в инсту выложить.
-
Ничего себе. Есть ли какая-то визуализация, которую ты часто видишь и каждый раз бесишься?
-
круговая диаграмма.
-
Круговая диаграмма? Почему?
-
В любом виде, особенно в каких-то серьезных источниках или с каким-то серьезным контекстом. Потому что, когда ты можешь показать 70 тысяч значений, почему ты показываешь 4 или 8? Это просто необъяснимо. Вообще необъяснимо никак. То есть табличку нарисуйте. Да, я из разряда тех людей, которые ненавидят круговые диаграммы.
-
Когда ты сказала «круговую диаграмму», я сразу вспомнил Тинькофф. У меня просто банк Тинькофф, и он показывает именно в формате круговой диаграммы расходы.
-
Причём у них есть там нормальный этот столбик длинный, на котором у тебя всё то же самое показано столбиком. Зачем как бы его закручивать в этот круг?
-
Красиво, чтобы было, наверное.
-
Ну да, эффектно.
-
Мы с тобой обсуждаем всё время визуализацию интерактивную. Визуализация в компьютере, ты говоришь, можно выбрать человечка, можно нажать, и вот это всё. А на бумаге можно делать хорошую визуализацию?
-
Можно. И те визуализации, которые меня вдохновили заняться визуализацией, это были именно бумажные примеры. Они до сих пор у меня вызывают просто невероятный восторг и очень тёплые чувства. Эти визуализации я нашла в книгах Эдварда Тафти. И это был тот момент, когда я поняла, что, кажется, это моё. Вот, кажется, я здесь для этого.
-
А кто такой Тафти?
-
Эдвард Тафти— это гуру визуализации данных, который, в принципе, миру открыл визуализацию как дисциплину. И это тот, с кого у меня начался мой путь. В какой-то момент, когда я заканчивала университет и искала, куда дальше податься, мне Артём Горбунов посоветовал прочитать книги Тафти. Я потратила на них всю свою тогдашнюю зарплату. Два месяца ждала, когда они приедут с Амазона. Но оно того стоило. Я открыла первую книгу, и читать её было непросто, потому что у Тафти такой язык. У меня реально был словарик, в который я выписывала новые слова, и отдельная тетрадочка, где я пыталась из этих новых слов составить какие-то фразы, чтобы мой мозг вообще понял, о чём речь идёт. Но так как я потратила всю свою зарплату и два месяца ждала, я была на это готова. Первое время после того, как мне приехали эти книжки Тафти, мне хотелось просто всем ходить и показывать эти графики. Посмотрите на это, как это круто, как это умно. И мне, конечно, очень захотелось разобраться, как это работает, захотелось научиться делать так же. Вот, ну и примеры— это карта нашествия Наполеона на Москву и его последующего отступления, где очень хорошо видно, как огромная армия, там десятков тысяч человек, там она показана толщиной, размер армии, видно, как она движется по маршруту, постепенно уменьшаясь, разворачивается под Москвой и возвращается на позиции, откуда она стартовала, там порядка, ну то есть там какой-то тысяча человек, что ли, вернулась, и ты видишь эти потери. своими глазами эту историю. На этой карте показана температура, то есть ты видишь, в какие моменты потери связаны с погодой. Ты видишь переправу через Березину, где просто вдвое уменьшается это войско, которое к тому моменту туда дошло. То есть это история, которая рассказана на плоской бумажной карте. Очень крутая штука.
-
Очень круто, и это чем-то напоминает мне вот твою змейку, про которую ты рассказывала в самом начале с марафоном.
-
Марафон определенно вдохновлён Тафти и этой конкретной картой Минара. Ну и много там было ещё других классных примеров, которые также меня заворожили. И после того, как я прочитала эту книжку, я нарисовала свою первую визуализацию. Это была визуализация пассажиропотоков в московском метро. Это было тестовое задание на вакансии информационного дизайнера в только что открывшемся дизайн-бюро Артёма Горбунова. И после этого задания, после, не знаю, нескольких месяцев переписки с Артёмом, я ему присылала до этого тоже тестовое задание, но именно после этой схемы пассажиропотоков он пригласил меня на работу, и я стала первым сотрудником дизайн-бюро Артёма Горбунова.
-
Ничего себе! Ты была первым сотрудником?
-
Да, очень этим горжусь.
-
Ничего себе, да. Есть чем гордиться. Бюро Артёма Грабунова— это одно из крутейших дизайн-студий России. Два блиц-вопроса. Первый. Назови, пожалуйста, топ-3 визуализации всех времён и народов.
-
Это, естественно, нашествие Наполеона, я вот про неё рассказала. Пожалуй, землетрясение. У меня есть в блоге несколько лет подряд собирала по итогам лучшей визуализации года именно там, где посмотреть на вот эту красоту, которую видишь умом. Вот там везде есть какая-то фишка, какое-то красивое решение очень. Но пусть еще будет визуализация Джона Сноу, которая помогла остановить холеру в Лондоне.
-
Что, Джон Сноу? Подожди, я про «Игру престолов» подумал. Расскажи.
-
Врач был в Лондоне, который на карте помечал случаи заболевания и видел, что случаи заболевания в кварталах увеличивается их плотность по мере приближения к городским колонкам. Предположил, что колонки являются источником заражения. Исследовал случаи, которые противоречили этой гипотезе. То есть все случаи, которые были вдалеке от колонок. Там прямо у него было какое-то целое расследование. Когда он ходил по этим семьям, он спрашивал, пили ли вы воду какую-то другую необычную. И выяснялось, что какой-то рабочий остановился возле колонки попить и после этого умер. Это как бы исключение, которое подтверждали правила. А потом он использовал эту свою визуализацию, чтобы эту идею донести до королевского двора. Закрыли колонку, холера остановилась. Вот такая еще история.
-
Охренеть! Какой век?
-
19-й, наверное.
-
Обалдеть. Мне кажется, что на этом можно как бы mic drop и заканчивать запись. Единственное, есть финальный вопрос, который я задаю всем гостям. Какую книжку купить? Мне кажется, я знаю ответ. Для того, чтобы разобраться в визуализации данных.
-
Эдвард Тафти. Все четыре, вернее, пять уже у него книг. Но будьте готовы, это не простой путь.
-
Хорошо. А есть ли что-нибудь попроще? Если я casual, как бы, не хардкор, на что стоит подписаться? Какой-то YouTube, может быть, или Telegram-канал, сайты, блоги?
-
Я слежу очень точечно. То есть я, понятно, «Нью-Йорк Таймс», слежу за интерактивными визуализациями, которые они выпускают. Я просматриваю. В конце года большинство изданий начали публиковать свои какие-то списки 10 наших лучших или все визуализации за этот год. Я просматриваю их. Есть канал моего коллеги, с которым мы ведём курс Ромы, который тоже собирает классные визуализации. Это канал в Телеграме у него.
-
Как он называется?
-
Он называется Reveal the Data, проявлять данные.
-
Ссылка на него будет в описании.
-
И вот он больше там пишет про табло, про бизнес-дашборды, тоже кому-то это может быть интересно. Вот, на Рому я советую подписаться, он очень всё по делу, классно рассказывает, у него есть на это ресурсы силы. Можно зайти у меня в блоге, полистать подборки классных визуализаций. Три-четыре года у меня, начиная с 2015-го, наверное, есть собраны там много хороших примеров. Ну, на мой взгляд, хороших примеров. И я старалась каждому писать, что именно в этом примере классного, на что обратить внимание.
-
Как называется сайт?
-
Infotanka.ru, блог.
-
Ссылка на него будет тоже в описании к этому эпизоду. Это момент, когда блоги еще были не в Телеграме, а в Интернете.
-
Да-да-да.
-
Класс. Спасибо тебе огромное, что пришла.
-
Очень рада была пообщаться сегодня.
-
Это подкаст «Студии Либо-Либо». И мы его сделали «Яндекс.Практикум». На подкаст мы работали. Редакторка – Юлия Яковлева. Младшая редакторка – Маша Агричева. Продюсер – Павел Боровков. Младшая продюсерка – Настя Медведева. Звукорежиссерка – Нина Мамытина. За джингл спасибо Алексею Зеленскому.