Skip to content

Повний Курс по Google Таблицям – Аналіз даних для всіх … — Transcript

Повний курс з аналізу даних у Google Таблицях для початківців та професіоналів українською мовою.

Key Takeaways

  • Google Таблиці є потужним і доступним інструментом для аналізу даних.
  • Курс охоплює весь цикл роботи з даними: імпорт, очищення, аналіз, візуалізація.
  • Практичні навички можна застосувати в різних сферах, включаючи бухгалтерію та інженерію.
  • Використання формул та зведених таблиць допомагає автоматизувати аналіз.
  • Інтерактивні дашборди дозволяють ефективно презентувати результати аналізу.

Summary

  • Вступ до курсу з аналізу даних у Google Sheets від Нікіти Тимошенка, досвідченого аналітика даних.
  • Переваги Google Таблиць: безкоштовність, актуальність версій, простота використання.
  • Імпорт даних із різних джерел: веб-ресурси, Вікіпедія, Excel, текстові файли.
  • Покращення якості даних, виправлення помилок та підготовка даних до аналізу.
  • Використання формул, фільтрів, зведених таблиць для трансформації даних.
  • Створення інтерактивного аналітичного дашборду з автоматичним оновленням.
  • Практичні рекомендації та посилання на додаткові ресурси для поглиблення знань.
  • Робота з реальними даними онлайн-магазину, аналіз транзакцій та клієнтів.
  • Оцінка якості даних через Data Quality Report та дета профайлінг.
  • Розробка власних проектів і портфоліо на основі відкритих безкоштовних даних.

Full Transcript — Download SRT & Markdown

00:01
Speaker A
Друзі, я радий вітати вас на цьому каналі і в цьому унікальному курсі з аналізу даних в Google Sheets. Мене звати Нікіта Тимошенко. Я працюю аналітиком даних в канадській консалтинговій компанії. Я також задіяний в проектах з інженерії даних, з візуалізації даних, з менеджменту даних.
00:14
Speaker A
даних я отримую такий досвід який корисний не тільки аналітикам даних він корисний взагалі усім Отже якщо ви думаєте про опанування професії аналітика даних або в вашій роботі Ви працюєте з даними і ви працюєте в таких сферах як інженерія Бухгалтерія
00:28
Speaker A
Я отримую такий досвід, який корисний не тільки аналітикам даних, він корисний взагалі усім. Отже, якщо ви думаєте про опанування професії аналітика даних або в вашій роботі ви працюєте з даними і ви працюєте в таких сферах, як інженерія, бухгалтерія,
00:44
Speaker A
актуальними інструментами я вирішив обрати Google sheets я бачу в цьому декілька переваг ну по-перше цей інструмент абсолютно безкоштовний по-друге у нас завжди актуальна версія Отже всі останні формули функції та інструменти нам доступні за замовчування Ну і по-третє це інструмент дуже легко
01:00
Speaker A
логістика, освіта, навчання, підприємницька діяльність, цей курс я розробив саме для вас. Адже врешті-решт нам усім потрібно знати і вміти отримати корисну інформацію з сирих даних. Для того щоб цей курс був інтерактивний, ви змогли впроваджувати актуальні практики аналітики даних, користуватися
01:15
Speaker A
імпортуємо дані із різних джерел це будуть веб-джерела Вікіпедія різні Google таблиці excel-таблиці текстові файли Отже ми зберемо все в одному місці далі після імпорту даних ми перейдемо до підвищення якості даних до виправлення помилок ми будемо готувати наші дані до
01:31
Speaker A
актуальними інструментами, я вирішив обрати Google Sheets. Я бачу в цьому декілька переваг. Ну, по-перше, цей інструмент абсолютно безкоштовний. По-друге, у нас завжди актуальна версія. Отже, всі останні формули, функції та інструменти нам доступні за замовчуванням. Ну і по-третє, це інструмент дуже легко
01:50
Speaker A
своїм колегам друзям однодумцям в цьому курсі я покажу мінімальний набор інструментів та можливостей які запропонує нам Google sheets але при цьому буду давати багато рекомендацій стосовно того як можна розширити аналіз я буду залишати корисні посилання в описі під цим відео і ті з вас хто
02:05
Speaker A
інтегрується в наше життя. Якщо у нас є хоч якийсь досвід з Excel, я думаю, саме мінімальний досвід роботи в Microsoft Excel є вимогою для проходження цього курсу. Структурно цей курс виглядає наступним чином: ми приєднаємо наш файл Google таблиць до різних джерел. Ми
02:22
Speaker A
навчальний контент українською а ми переходимо до самого курсу друзі радий всіх вітати у вступній частині до курсу аналітика даних в Google sheets в цьому відео ми подивимось на те де завантажити дані для подальшої роботи Я також покажу де
02:42
Speaker A
імпортуємо дані із різних джерел. Це будуть веб-джерела, Вікіпедія, різні Google таблиці, Excel-таблиці, текстові файли. Отже, ми зберемо все в одному місці. Далі, після імпорту даних, ми перейдемо до підвищення якості даних, до виправлення помилок. Ми будемо готувати наші дані до
02:59
Speaker A
отримуємобуємо зрозуміти проблему яку ставить перед нами наш уявний замовник Отже почнемо з даних Я зараз на сторінці свого github репозиторію тут я зберігаю код У мене є спеціальна папка посилання до якої у вас є під курсом під відео на
03:15
Speaker A
подальшого аналізу. Далі ми будемо трансформувати дані, змінювати наші таблиці, будемо впроваджувати формули, фільтри, зведені таблиці. Це все для того, щоб врешті-решт в кінці курсу розробити аналітичний інтерактивний дашборд. Він буде оновлюватися, ним буде зручно користуватися, його ви можете показувати
03:31
Speaker A
ці проблеми вирішувати також в кінці ви можете побачити перелік ресурсів які надають відкриті та безкоштовні дані для нашої роботи цей перелік Я впевнений буде в нагоді після проходження курсу коли ви захочете створювати власні проекти для власного портфоліо власної
03:47
Speaker A
своїм колегам, друзям, однодумцям. В цьому курсі я покажу мінімальний набір інструментів та можливостей, які запропонує нам Google Sheets, але при цьому буду давати багато рекомендацій стосовно того, як можна розширити аналіз. Я буду залишати корисні посилання в описі під цим відео, і ті з вас, хто
04:06
Speaker A
можу перейти до будь-якого файлу і завантажити натискаючи на кнопку завантажити і встановити всі ці файли на наш комп'ютер також їх можна завантажити за посиланням нижче це окреме сховище де я також завантажив всі ці файли переходимо назад і подивимось на ще одну
04:22
Speaker A
захочуть піти далі в аналізі цих даних з використанням Google Sheets, можуть розширити ваш аналіз використанням моїх рекомендацій. Отже, друзі, додавайте це відео в збереження, щоб проходити цей курс у власному темпі, рекомендуйте це відео друзям, ставте лайк, залишайте коментарі. Це дозволить мені і надалі розробляти
04:36
Speaker A
звіт Data Quality Report тобто оцінка якості даних ми будемо проговорювати це в межах нашого курсу але я хотів щоб у вас перед очима був приклад звіту який я розробляв для наших з вами даних Отже ви зможете зробити Щось на кшталт такого
04:51
Speaker A
навчальний контент українською. А ми переходимо до самого курсу. Друзі, радий всіх вітати у вступній частині до курсу аналітика даних в Google Sheets. В цьому відео ми подивимось на те, де завантажити дані для подальшої роботи. Я також покажу, де
05:07
Speaker A
специфічний вид аналізу Але для того щоб розширити ваш інструментарій для того щоб здобути більше практики ви можете подивитися на цей звіт і зробити таку ж саму візуалізацію провести такий самий аналіз використання Google sheets Отже це все що я хотів сказати про
05:21
Speaker A
знайти корисні посилання для того, щоб розширювати свої знання і практикувати аналітику даних після проходження курсу. Також покажу, де можна знайти корисні звіти як приклади для вашої роботи під час курсу, і ми подивимось на дані, ми подивимось на те, які таблиці ми
05:36
Speaker A
файлі який Ми створимо Але для того щоб продемонструвати наші дані я покажу вам файл який ми з вами будемо розвивати протягом нашого курсу Отже Ми імпортуємо дані в один файл і Дані складаються з декількох таблиць це таблиця транзакцій
05:51
Speaker A
отримуємо, будемо зрозуміти проблему, яку ставить перед нами наш уявний замовник. Отже, почнемо з даних. Я зараз на сторінці свого GitHub репозиторію. Тут я зберігаю код. У мене є спеціальна папка, посилання до якої у вас є під курсом, під відео на
06:09
Speaker A
онлайн-магазині ми щось продаємо це товари так чи інакше пов'язані з велоспортом система фіксує нову транзакцію Отже кожна транзакція отримує свій унікальний ID і по кожній транзакції нам відома певна інформація наприклад який продукт придбали ну тобто ID продукту який замовник зробив це
06:29
Speaker A
YouTube. Ця папка присвячена нашому курсу. Отже, тут ви можете побачити вступну частину до курсу, що ми проходимо, в якій послідовності. Якщо у вас виникають будь-які питання щодо створення акаунту Google та створення першого файлу Google Sheets, тут є корисні посилання на те, як
06:45
Speaker A
собівартість або вартість з каталогу Отже ми можемо працювати з цими даними і досліджувати динаміку продажів нашого онлайн-магазину як відбувалися продажі в розрязі різних брендів різних класів наших продуктів можемо таж окремо дослідити наших замовників адже кожен замовник може мати певну історію
07:04
Speaker A
ці проблеми вирішувати. Також в кінці ви можете побачити перелік ресурсів, які надають відкриті та безкоштовні дані для нашої роботи. Цей перелік, я впевнений, буде в нагоді після проходження курсу, коли ви захочете створювати власні проекти для власного портфоліо, власної
07:22
Speaker A
багато чого зробити з такими даними давайте подивимось що в нас є ще таблиця замовників надає більше інформації про наших замовників адже в транзакціях ми бачимо ID замовника тобто певний код який може характеризувати цього замовника Я переходжу до таблиці
07:35
Speaker A
практики. Отже, за посиланнями ви зможете отримати багато цікавої інформації, яку дуже-дуже цікаво аналізувати. Також ви зможете побачити тут дві папки. Перша з яких — це дані для роботи. Тут декілька файлів, всі вони будуть використовуватися під час курсу. Можна завантажити їх тут. Я
07:51
Speaker A
будемо працювати в межах курсу будемо їх очищати підвищувати їх якість але знаючи певні характеристики наших замовників ми можемо провести певну сегмента розробити певний профайл нашого замовника подивитися хто найчастіше купує товари в нашому магазині і використовувати це для збільшення
08:08
Speaker A
можу перейти до будь-якого файлу і завантажити, натискаючи на кнопку завантажити, і встановити всі ці файли на наш комп'ютер. Також їх можна завантажити за посиланням нижче. Це окреме сховище, де я також завантажив всі ці файли. Переходимо назад і подивимось на ще одну
08:24
Speaker A
проаналізувати продажі в розрізі різних локацій географічних таблиця шта Австралії була імпортована нами з Вікіпедії ми це будемо робити в межах курсу підтягувати ці дані з Вікіпедії наступна таблиця є бонусною ми не будемо проходитись по неї детально в межах
08:40
Speaker A
папку, яка знаходиться в межах матеріалу цього курсу. Це приклади звітів. Ми про звіти будемо говорити під час курсу, ми будемо робити певні елементи таких звітів, але я хотів, щоб вони були у вас перед очима як приклади. Отже, відкриваю
08:57
Speaker A
тобто вони ще не стали нашими клієнтами Можливо вони ще не зробили жодної покупки а тільки зареєструвалися у нас на сайті І при цьому Ми вже знаючи цю інформацію можемо їх аналізувати а більше У нас є продажі У нас є
09:13
Speaker A
звіт Data Quality Report, тобто оцінка якості даних. Ми будемо проговорювати це в межах нашого курсу, але я хотів, щоб у вас перед очима був приклад звіту, який я розробляв для наших з вами даних. Отже, ви зможете зробити щось на кшталт такого
09:31
Speaker A
має найбільший пріоритет найбільший потенціал для нас як постачальника послуг або товарів Отже це коротко про те яка ідея подальшого аналізу ми будемо імпортувати ці дані ми будемо їх обробляти підвищувати їх якість будемо ще багато про них говорити і в кінці
09:47
Speaker A
звіту. Тепер у вас є приклад для виконання. Інші звіти надають інші рекомендації, наприклад ARFM звіт — це фрагмент ARFM аналізу, який можна застосувати до наших даних. І власне тут це і відбувається в межах курсу. Ми не будемо проводити цей
10:12
Speaker A
інших сервісів та додатків І знаходжу Google drri Саме тут в цьому середовищі ми будемо працювати з Google sheets тут я можу створити папку для подальшої роботи правою кнопкою миші переходжу до нової папки назвемо її аналіз даних і після створення папки
10:30
Speaker A
специфічний вид аналізу, але для того, щоб розширити ваш інструментарій, для того, щоб здобути більше практики, ви можете подивитися на цей звіт і зробити таку ж саму візуалізацію, провести такий самий аналіз використання Google Sheets. Отже, це все, що я хотів сказати про
10:49
Speaker A
різні задачі наприклад Ду листи місячні витрати якісь фінансові чеки календарі планувальники Навіть є аналітичний дашборд але ми плануємо створити свій власний аналітичний дашборд з нуля тому переходимо до чистого файлу і після відкриття нашого файлу Я вже бачу якісь
11:08
Speaker A
репозиторій. Посилання є в описі під курсом. Ви можете завантажувати матеріали і працювати зі мною одночасно. Також давайте подивимось на дані, з якими ми будемо працювати. Це наш з вами робочий файл. Ми з вами почнемо роботу з нуля, тобто в нас не буде нічого в нашому
11:26
Speaker A
будь-яку клітинку і побачу що всі зміни збережені нашому файлі більш того ми можемо перейти до хмаринки і налаштувати тут можливість працювати офлайн так само збережуючи всі зміни в нашому файлі Тепер я хочу повернутися до Google Drive тут потрібно оновити сторінку для того
11:44
Speaker A
файлі, який ми створимо. Але для того, щоб продемонструвати наші дані, я покажу вам файл, який ми з вами будемо розвивати протягом нашого курсу. Отже, ми імпортуємо дані в один файл, і дані складаються з декількох таблиць: це таблиця транзакцій,
12:02
Speaker A
до деталей і мені доступні метадані тобто дані про наші дані це тип файлу розмір де він розташований хто його власник які є права доступу коли він в останніо був модифікований можна додати сюди опис цього файлу це те що ми
12:18
Speaker A
наших замовників customers, адрес наших замовників, австралійських штатів та таблиця New Customer List — це перелік нових замовників. Давайте, давайте подивимось трошки ближче, щоб зрозуміти, що на нас очікує. Отже, таблиця транзакцій відображає безпосередньо транзакції. Кожна транзакція — це оплата в
12:39
Speaker A
будемо зберігати всю інформацію про Дані з якими працюємо це дуже корисно в реальних проектах тепер поговоримо про зміни які ми будемо впроваджувати це дуже важлива тема ну в першу чергу потрібно зазначити що у нас є на закладці файл можливість побачити
12:56
Speaker A
онлайн-магазині. Ми щось продаємо, це товари так чи інакше пов'язані з велоспортом. Система фіксує нову транзакцію. Отже, кожна транзакція отримує свій унікальний ID, і по кожній транзакції нам відома певна інформація, наприклад, який продукт придбали, ну тобто ID продукту, який замовник зробив це
13:14
Speaker A
також я можу працювати з поточною версією я бачу відформатовану клітинку метадані Таким чином я можу відстежувати версії я можу відтворювати їх тобто повертатися до попередніх версій якщо щось пішло не так Це дуже-дуже важливо але так само як у випадку з метаданими
13:32
Speaker A
замовлення, тобто ID нашого замовника, коли це відбулося, це було онлайн замовлення або офлайн замовлення, чи підтверджено статус, чи відмінено. В нас є декілька брендів, які продаються, яка категорія товарів, який розмір товару. Також у нас є фінансові показники — це
13:49
Speaker A
змінив це буде в нагоді мені це також дуже корисно якщо я працюю з командою і людина яка відкриє файл зможе швидко дізнатися що саме було змінено по відношенню до оригінально даних Отже це в нас такий буде журнал змін тепер ми можемо
14:05
Speaker A
собівартість або вартість з каталогу. Отже, ми можемо працювати з цими даними і досліджувати динаміку продажів нашого онлайн-магазину, як відбувалися продажі в розрізі різних брендів, різних класів наших продуктів. Можемо також окремо дослідити наших замовників, адже кожен замовник може мати певну історію
14:20
Speaker A
відійти від стандартних налаштувань тут можна створити свій власний стиль власну тему і в подальшому використовувати її по відношенню до всіх таблиць візуалізації але я пропоную залишатися в межах базової стандартної теми також зазначу що основні елементи які ми будемо використовувати знаходяться тут
14:37
Speaker A
купівель на нашому сайті наших товарів. Так само можемо аналізувати продукти, які було придбано в межах цього періоду часу, який ми зафіксували. Нам доступно зараз подивитись 20 000 транзакцій — це транзакції, що були зроблені в межах одного календарного року. Отже, ми можемо
14:53
Speaker A
секцію і побачите що до кожної функції є короткий опис якщо Ми обираємо цю функцію ми вже готові її розвивати тут в обраній клітинці Ми також можемо отримати додаткову інформацію з прикладами та нюансами пов'язаними з цією функцією можемо перейти до learn
15:11
Speaker A
багато чого зробити з такими даними. Давайте подивимось, що в нас є ще. Таблиця замовників надає більше інформації про наших замовників, адже в транзакціях ми бачимо ID замовника, тобто певний код, який може характеризувати цього замовника. Я переходжу до таблиці
15:29
Speaker A
опиняємося в Google Docs editors help help Center Тобто це ресурс який надає всю інформацію відносно цього інструменту це власне документація і я пропоную зберігати такі закладки особливо якщо ви ще не отримали досвід роботи з цим інструментом на перших
15:48
Speaker A
замовників і бачу, що у нас є дійсно різні ID наших замовників, по кожному з яких нам відома певна інформація, наприклад, де працює людина, якої статі, ім'я людини відомо і інша інформація. Деяка інформація приходить в дуже незадовільному варіанті. З цими даними
16:04
Speaker A
інструкції і підказки для більш ефективної роботи з інструментом також окрім тренінгів є перелік всіх оновлень оновлення бажано відстежувати і знати що змінилося які нові функції були додані в останню в останньому оновленні тому тут надається Ось така структурована вибірка
16:23
Speaker A
будемо працювати в межах курсу, будемо їх очищати, підвищувати їх якість, але знаючи певні характеристики наших замовників, ми можемо провести певну сегментацію, розробити певний профайл нашого замовника, подивитися, хто найчастіше купує товари в нашому магазині і використовув...
16:40
Speaker A
і підвищувати ефективність нашої роботи з інструментом І на останок зазначу що крім базової функції Ми можемо перейти до надбудов Ось тут в закладці extensions перейдемо і побачимо що нам доступно ми не будемо в межах цього курсу працювати з будь-якими додатками
16:57
Speaker A
та надбудовами але ми знаємо що є можливість інтегрувати інші додатки генеративний штучний інтелект календарі сховища різні таск-менеджери це все цікаво досліджувати експериментувати і знову ж таки покращувати досвід взаємодії з інструментом Тепер можемо переходити до безпосереднью роботи над нашими даними і почнемо з імпорту даних
17:18
Speaker A
в наш файл перед тим як імпортувати необхідні таблиці та дані в наш робочий файл я вирішив розпочати заповнення аркушу метадані Саме тут ми будемо зберігати дані про наші дані тобто що за дані Ми отримали про що вони які містяться
17:41
Speaker A
колонки які містяться типи даних які є сумніви або спостереження відносно якості даних всю цю інформацію можна буде отримати з цього аркушу і розпочав Я з секції джерела даних адже ми хочемо бачити звідки дані прийшли в якому вони форматі також додамо сюди доречні
17:59
Speaker A
коментарі відносно доступу до цих даних можливості їх оновлення в майбутньому Отже у нас є п'ять таблиць про кожну з яких ми будемо ще говорити окремо але на цьому етапі потрібно розуміти що ці таблиці приходять в різних форматах з
18:12
Speaker A
різних локацій перші дві таблиці це таблиця транзакцій тобто купівель і наших замовників customers вони приходять з папки Що зберігається у нас на комп'ютері Тобто це завантажені на комп'ютер файли один в форматі Excel інший в форматі csv ми зараз подивимось
18:30
Speaker A
на них трошки ближче наступні файли будуть приходити в інших форматах ми побачимо як імпортувати дані що знаходяться на веб-сторінці в Вікіпедії на github ми подивимось як можна імпортувати дані з іншого Google sheets Таким чином ми зберемо всі наші дані в
18:46
Speaker A
одному місці імпортувавши їх з різних локацій в різних форматах розпочнемо з наших перших двох таблиць вони зберігаються локально на комп'ютері Я для цього переходжу на закладку файл І знаходжу можливість імпортувати дані мені спершу пропонується імпортувати їх з Google Drive але вони збережені
19:04
Speaker A
локально на моєму комп'ютері Я переходжу до завантаження і шукаю файли на моєму комп'ютері і Почнемо ми з транзакцій я обираю таблицю транзакцій тут доступний перегляд цієї таблиці Отже ми відразу можемо оцінити як виглядають наші дані та їх масштаб Ну наприклад з
19:20
Speaker A
використанням комбінації клавіш Ctrl стрілочка вниз я можу перескочити на останній рядок і оцінити кількість записів це 20 000 транзакцій по кожній з яких вказується який продукт було придбано який замовник придбав продукт коли це відбулося та інші характеристики на які ми ще подивимось Отже саме в цих
19:38
Speaker A
даних Я зацікавлений Тому обираючи цей файл переходжу до імпорту даних після того як дані завантажені ми бачимо що нам пропонуються різні варіанти їх завантаження ми можемо завантажити їх в новий Google sheet новий файл але я хотів би продовжувати працювати в нашому
19:56
Speaker A
робочому файлі Отже я хочу вставити новий аркуш для цього я обираю відповідний пункт в меню Тут також є можливість імпортувати налаштування тем кольорові рішення це не те що мене цікавить Я хочу імпортувати дані в новий аркуш в моєму поточному файлі імпортуємо
20:14
Speaker A
дані ну в залежності від обсягів даних завантаження може тривати від декількох секунд до декількох хвилин наші дані мають завантажуватись досить швидко адже це тільки 20 000 рядків 20 000 записів ми вже впізнаємо нашу таблицю Я думаю що все імпортувалося коректно принаймні ми
20:31
Speaker A
бачимо відповідну кількість колонок і знову ж таки з використанням Ctrl та стрілочкою вниз я можу перескочити на останній рядок і побачити дійсно всі транзакції тут на місцях Ну в Google sheets також зручно Можна обрати одну колонку і тут в різних характеристиках
20:47
Speaker A
подивитися саме кількість записів ми бачимо 20 000 записів плюс заголовок Отже дані імпортовані коректно аркуш називається так само як він називається в оригінальних даних Я не планую ц цього змінювати давайте повернемося до наших метаданих і побачимо що у нас є Таблиця
21:04
Speaker A
це транзакції різні покупки наших клієнтів в різний період часу джерело - це посилання на файл що знаходиться на моєму комп'ютері Отже я можу знайти мій файл тут і скопіювати посилання щоб знати завжди де він зберігається так само вказано що оригінальний формат - це
21:21
Speaker A
формат Excel і можна додати коментар Наприклад Дані зберігаються локально оновлення Не передбачається добре переходимо до наступної таблиці це таблиця наших клієнтів і у нас є посилання на знову ж таки збережений на комп'ютері файл але на цей раз він в
21:37
Speaker A
форматі csv Тобто Це текстовий файл csv - це Coma separated values тобто значення що розділені комою і це не завжди так це можеть бути інші роздільники давайте подивимось що ми отримали Я переходжу до закладки файл імпортую дані на цей раз обираючи саме
21:56
Speaker A
File customers і я бачу що це тек текст вий файл і дійсно всі значення розділені саме комою Я бачу що у нас є колонки це ID кожного клієнта їх імена та інша доступна інформація все це розділено комою давайте перейдемо до імпорту
22:12
Speaker A
такого дуже популярного в аналітиці даних формату файлів тут ми бачимо знову ж таки нам пропонує створити новий файл новий Google sheet файл але я хочу все ж таки залишитися в межах нашого файлу і достатньо Буде лише імпортувати нові
22:27
Speaker A
аркуші і І роздільник це те про що ми сказали може бути кома Може бути табуляція Може бути кастомний роздільник в залежності від того в якому форматі ви отримали дані з вашого джерела Ну ми побачили що в нас є кома але можна
22:43
Speaker A
залишитися в автоматичному налаштуванні і подивитися наскільки якісно Google sheet розпізнає роздільник наших даних Також ми зацікавлені в тому що незважаючи на те що ми зберігаємо текстові значення в цьому файлі ми їх розпізнали як відповідно числові значення дати та формули імпортуємо
23:03
Speaker A
дані і бачимо таблицю у вигляді нового аркушу який називається так само як називається аркуш нашого джерела ми бачимо дійсно що у нас є різні замовники в кожного є свій ID номер по кожному замовнику надається ім'я дата народження я вже бачу що у нас є проблеми з певними
23:22
Speaker A
значеннями і форматом даних які ми отримали бачимо колонки які виглядають дивно тобто є системні по полки в даних є питання щодо якості даних про це ми будемо говорити в наступних секціях нашого проекту а Зараз ми можемо лише переконатися що дані імпортовані
23:38
Speaker A
коректно Ми отримали знову ж таки 4 000 клієнтів по кожному з яких надається інформація з цим і будемо працювати Я повертаюся до аркушу метаданих і вказуючи посилання на файл формат csv коментар в принципі можна залишити той самий ми зберігаємо дані локальне
23:56
Speaker A
оновлення Не передбачається і ще у нас зали лишається три таблиці дві з них ви можете так само імпортувати з папки збереженої на вашому комп'ютері тобто я можу перейти до файл імпор перейти до нашої папки з якої Ми тягнули перші два
24:11
Speaker A
файли і побачити що тут є чотири файли тобто забажанням ви так само можете імпортувати таблицю адрес як csp файл таблицю нових замовників як excelфайл в такому випадку ви можете заповнити їх шлях тут у відповідному полі додати формат і коментар але я хотів показати
24:31
Speaker A
як завантажити Такі дані якщо вони не збережні на нашому комп'ютері а знаходяться десь на сайтах на якихось ресурсах в Вікіпедії або в інших Google sheets Отже в наступному відео ми навчимося підтягувати інформацію з подібних джерел якщо ви вирішили продовжувати
24:54
Speaker A
імпортувати дані що вже зберігаються у вас локально на комп'ютері То ви могли імпортувати ще таблицю адрес наших клієнтів і таблицю перелік нових клієнтів вони так само знаходяться в папці яку ви завантажили з github Отже у вас тут я передбачаю є актуальне джерело
25:12
Speaker A
тобто посилання на файл актуальний формат даних що ви отримали та доречний коментар А я в цьому відео хочу показати що робити якщо ці файли завантажені десь на веб-сторінках десь в мережі давайте Подивимось як працювати з такими даними почнемо з в таблиці адрес це адреси
25:30
Speaker A
наших існуючих клієнтів і вони зберігаються так само як і інші файли на сторінці github до якої у вас був доступ Саме тут ви завантажили всі дані але зараз я кажу що я не хочу завантажувати дані Я хочу приєднатися напряму і
25:45
Speaker A
отримати доступ до файлу що опублікований тут на github я бачу в режимі перегляду що це знайомий для нас формат Отже всі значення розділені комою і ми хочемо отримати доступ до цих опублікованих даних для цього я буду використовувати актуальне посилання на
26:01
Speaker A
цей файл Отже я копіюю це посилання ctrl C переходжу до нашого файлу і тут в джерелі вставляю посилання формат цього файлу так само csv ми бачили що всі значення розділені комою і давайте Подивимось як його можна імпортувати для
26:18
Speaker A
цього я створюю новий аркуш перетягую його в кінець обираю першу клітинку і буду писати формулу адже саме формула дозволить мені імпортувати дані що зберігаються на веб-сторінках починаю формулу з дорівнює імпорт Саме так починаються всі формули що дозволяють імпортувати дані в різних
26:38
Speaker A
форматах опубліковані на веб-сторінках я бачу під кожною формулою короткий опис цієї формули і мене цікавить імпор Data адже саме така формула дозволить мені імпортувати дані з використанням посилання на ці дані в форматі csv або tsv ну мається на увазі Tab separated
26:56
Speaker A
values тобто значення розділені не комою а табуляцією таке теж зустрічається я обираю відповідну функцію тут бачу всі інструкції інформацію щодо використання цієї формули і також можемо перейти до документації щоб дізнатися більше але формула не складна в дужках вказується
27:16
Speaker A
посилання на цей файл також додатковими є вказання роздільника якщо Це доречно Отже посилання ми не будемо вказувати в формулі тому що в нас воно є безпосередньо в клітинці на заклад метаданих Отже я хочу посилатися саме на клітинку тут закриваю дужки формули
27:34
Speaker A
відпрацюємо її бачу що є завантаження даних і після декількох секунд спроб Я бачу що є помилка в посиланні на цей файл і ця помилка дуже легко виправляється для того щоб дані все ж таки були завантажені нам потрібно дещо
27:49
Speaker A
покращити посилання на ці дані я повертаюсь до аркушу метадані переходжу до нашого довгого посилання і в кінці хочу вставити декілька символів це знак оклику Row equals True Саме ці символи в кінці дозволять нам відпрацювати нашу формулу Отже я погоджуюся натискаючи
28:09
Speaker A
Enter і Я переходжу до нашого аркушу і бачу що дані було провантажено ми можемо подивитися як багато клієнтів Ми отримали в першу чергу давайте перейменуємо наш аркуш адже це тепер адреси і повертаючись назад бачу що в принципі всі дані було імпортовано
28:28
Speaker A
коректно ми ще попрацюємо з якістю даних але ми вже маємо дані для роботи ще хочеться зазначити що приєднуючись до зовнішніх ресурсів і забезпечуючи нас такою можливістю постійно отримувати актуальні дані постійно їх оновлювати дається з використанням функції яка все
28:44
Speaker A
ж таки тут зберігається Це вона і вона відпрацьовує кожного разу коли ми щось оновлюємо на нашому аркуші Отже я не можу працювати з цими даними напряму змінюючи їх якщо я видалю якесь значення з клітинки я побачу що після повтор
28:58
Speaker A
відпрацювання функції що зберігається тут в клітинці А1 дані знову були підтягнуті з джерела Отже перевагою є те що змінюючи дані на джерелі ми будемо бачити їх тут завжди актуальними недоліком є те що ми не можемо напряму змінювати ці дані тут для цього їх
29:14
Speaker A
потрібно скопіювати і вставити але це згодом зараз повертаюсь до нашого аркушу метаданих і можу вказати що дані зберігаються на github передбачається або можливе оновлення цих даних добре це те що стосується підтягування даних опублікованих на веб джерелах зараз я хотів би показати як
29:39
Speaker A
можна підтягнути дані що вже є в іншому Google sheets вони так само там можуть існувати змінюватися хтось з ними може працювати І ми так само можемо приєднати Такі дані з використанням подібних функцій імпорту даних і давайте спочатку створимо такий файл де будуть
29:55
Speaker A
зберігатися ці дані я можу власне імпортувати цю таблицю с першу до Google sheets як це ми вже робили з попередніми файлами Ось він зберігається тут в завантаженнях імпортувати його але на цей раз імпортувати як новий файл імпортуємо і побачимо як було створено
30:12
Speaker A
новий файл з даними переходимо за посиланням щоб відкрити файл Так це наші дані це перелік всіх нових клієнтів з якими будемо працювати І саме я власник цих даних мій акаунт використовується для того щоб ці дані зберігати тому я не
30:26
Speaker A
думаю що в мене можуть бути будь-які проблеми з доступом до цих даних але якщо ви хочете приєднатися до зовнішніх даних які не належать вашому акаунту потрібно Звичайно це відпрацювати тут в налаштуваннях доступу до цих даних щоб ви мали доступ я доступ маю оскільки я
30:43
Speaker A
власник цих даних Все що мені потрібно це посилання на цей файл скопіюю його тут переходячи до метаданих розташую посилання тут в якості джерела в якості формату зазначу Google sheets і спробуємо імпортувати знову ж таки створюю новий аркуш перетягую його в
31:03
Speaker A
кінець і ми будемо працювати з формулою Отже обираючи першу клітинку Я починаю писати імпор і шукаю необхідну функцію яка називається import Range саме ця функція відповідає за підтягування даних з інших Google sheets файлів обираю цю функцію дивлюсь на специфікацію бачу що
31:22
Speaker A
так само потрібно вказати посилання на файл Окрім цього потрібно вказати посилання на аркуш цього файлу і діапазон клітинок в яких зберігається потрібна інформація ну почнемо з посилання на файл ми знаємо що можемо посилатися на клітинку в якій зберігається власне посилання закриваємо
31:41
Speaker A
дужки відпрацьовуємо формулу бачимо що є помилка і в цьому випадку недостатньо аргументів нашій функції ми вказали посилання але не вказали де на якому аркуші і в якому діапазоні клітинок знаходяться наші дані ну аркуш наш називається customer list я його скопіюю
32:00
Speaker A
цю назву перейду до нашої функції і дещо її покращу після коми відкриваю лапки вставляю назву нашого файлу далі знак оклику що ідентифікує назву аркушу і тепер діапазон Ну тут можна бути не сильно точним а вказати діапазон від колонки a до колонки Z закриваємо лапки
32:20
Speaker A
відпрацюємо цю формулу знов падає помилка подивимось що на цей раз бачимо що нам потрібно приєднати ці файли тобто якщо ми вперше приєднуємося до них з використанням формули потрібно налаштувати цей Connect для цього достатньо дозволити доступ до цього файлу натискаю на кнопку і за декілька
32:39
Speaker A
секунд отримую дані з нашого файлу перейменую наш аркуш він буде називатися New customer list тобто перелік наших нових клієнтів по кожному клієнту є якась інформація будемо це досліджувати але зараз хочеться додати що знову ж таки ця таблиця - це результат роботи
32:57
Speaker A
функції яка тут тут в першій клітинці працює Отже змінити дані я не можу адже після того як функція відпрацює дані будуть знов таки додані Але я можу змінити їх тут в самому джерелі тобто якщо я видалю перший рядок тут я побачу
33:12
Speaker A
що після відпрацювання формули ще раз я отримую актуальні дані відповідно до джерела Отже ще раз оновимо дані і таблиця готова переходимо до метаданих і додаємо коментар що дані зберігаються в іншому Google sheets можливе оновлення Отже Ми отримали доступ до чотирьох
33:30
Speaker A
таблиць саме з цими таблицями будемо працювати в наступних секціях цього курсу ми познайомимося з ними почистимо їх і почнемо працювати з візуалізацією Та аналітикою зараз я хотів би ще показати як приєднатися до таблиці що розташована на Вікіпедії адже це досить популярний
33:51
Speaker A
ресурс для імпорту даних і В якості прикладу я вирішив що якщо ми працюємо з австралійськими даними і переходячи до адрес наших замовників Я бачу що вказана Австралія як країна і відповідно різні австралійські Штати Я хотів би трошки більше дізнатися про Штати Австралії як
34:07
Speaker A
вони правильно називаються які в них коди для цього ми можемо піти до Вікіпедії я напишу Австралія штати і перейду до першого посилання на Вікіпедію це веб-сторінка тут є інформація текстова є картинки є візуалізація є табличні дані і ми часто
34:25
Speaker A
зацікавлені в тому щоб імпортувати та табличні дані напряму в наш файл і так само завжди забезпечувати себе актуальну інформацію Отже якщо щось змінюється тут ми хочемо отримати актуальний результат в нашому файлі і для того щоб мати можливість забрати дані з цього сайту
34:42
Speaker A
нам потрібно дізнатися як вони тут зберігаються і це є елементи вебскрепінгу нам потрібно правою кнопкою миші перейти до режиму inspect подивитися на код на верстку якай забезпечує нас цією таблицею на вебсайті Я бачу що кожному рядку цього коду
34:59
Speaker A
відповідають різні елементи створені на цьому ресурсі але мене цікавить саме той код який охоплює всю таблицю тут правою кнопкою миші я можу скопіювати шлях до цієї таблиці я обираю наприклад Full xpass і переходжу до метаданих тут в коментарях я можу вказати Full xpass він
35:19
Speaker A
дозволить мені відстежувати мою таблицю Ось вона і вона має індекс 3 саме заради цього я і скопіював цю адресу чому це для мене важливо тому що коли я створюю новий аркуш і підтягую дані з Вікіпедії Я так само переходжу до клітинки шукаю
35:35
Speaker A
можливість імпорту даних але на цей раз Мене цікавить дані HTML тут є посилання але окрім посилання є інші додаткові аргументи я бачу в прикладі є посилання на Вікіпедію в дужках далі об'єкт таблиця індекс 4 ми знаємо що в нас
35:53
Speaker A
таблиця індекс 3 ми це побачили Отже все що мені залишається це закрити дужки зараз мені ця формула не потрібна адже я хочу скопіювати посилання на Вікіпедію переходжу до метаданих залишаю посилання в якості джерела тут переходжу до аркушу і
36:11
Speaker A
давайте завершувати нашу формулу посилання це є клітинка тут на закладці метаданих і після коми Я хочу вказати що в мене є в дужках таблиця table ще одна кома індекс 3 відпрацюємо цю формулу і ми побачимо саме ту таблицю
36:31
Speaker A
яку шукали Отже у нас є дані щодо різних штатів Австралії і наводиться додаткова інформація щодо кожного штату це може бути в нагоді для нашого аналізу Отже переходячи до метаданих формат отриманих даних - це HTML а коментарем буде дані
36:48
Speaker A
зберігаються на Вікіпедії також не забуваємо перейменувати аркуш для того щоб мати розуміння що тут зберігається напишу що це австралійські штати і ми з вами отримали робочу книгу для того щоб в подальшому працювати ми можемо бачити всі наші аркоші тут можемо піти сюди і побачити
37:08
Speaker A
їх у вертикальному виконанні це в принципі все що нам потрібно для початку роботи і перед тим як розпочати роботу над нашими даними Я хотів би побачити певну структуру такий умовний план пода дальших дій ми вже розуміємо більш-менш проблему з якою зіткнулися ми вже мали
37:32
Speaker A
можливість побачити наші дані в якому вони вигляді як вони приходять до нас але подальші кроки все ж таки ще невідомі Я хотів би якраз на цьому аркоші на аркоші метаданих зберегти таку діаграму яка б послідовно показувала наші подальші дії і для цього ми можемо
37:47
Speaker A
використати інструмент який можна знайти тут на закладці вставка малювання ось такий інтерфейс у цього інструменту нам доступні різні геометричні фігури стрілки текст картинки можемо тут розробити нашу просту послідовну діаграму етапів нашого аналізу даних і почнемо з першого блоку
38:06
Speaker A
я його створю з використанням прямокутника з заокругленими кутами Ось таким чином його тут розташую і перший етап роботи з даними - це є проблема Це надзвичайно важливий етап де ми визначаємося з проблемою яку вирішує наш аналіз маємо зрозуміти і відчути
38:22
Speaker A
контекст в якому ми знаходимося спланувати подальші дії сформувати можливо певні гіпотези припущення сформувати перелік запитань до наших даних я можу скопіювати цей блок і вставити поруч для вказання наступного етапу роботи це буде збір даних і тут ми визначаємося з тим які дані Нам потрібні
38:43
Speaker A
які дані нам взагалі доступні де вони знаходяться це бази даних окремі Excel файли можливо якісь веб-ресурси Отже звідки дані приходять в якому вигляді і як їх зібрати в одному місці продовжиуємо додавати блоки до нашої схеми і наступним етапом буде підготовка
39:02
Speaker A
наших даних цей етап передбачає дуже кропітку роботу над нашими даними адже тут ми будемо прибирати помилкові дані виправляти певні помилки це буде робота з якістю даних оцінку якості даних та підвищенням якості даних ми будемо шукати дублікати будемо думати що робити
39:20
Speaker A
з відсутніми даними з помилковими даними на виході з цього етапу у нас має бути дані найвищої можливої якості для подальшої роботи а подальша робота буде обробка або ж трансформування наших даних на цьому етапі ми вже впроваджуємо певні зміни до самих таблиць до структур
39:39
Speaker A
наших даних ми можемо додавати наприклад розрахункові колонки впроваджувати зведені таблиці тобто маючи дані найвищої можливої якості ми починаємо їх трансформувати для подальшого аналізу І власне наступним етапом і Останнім етапом нашого проекту буде аналіз даних цей етап передба використання
39:58
Speaker A
підготовлених оброблених даних для нашого аналізу для пошуку інсайтів ми можемо використовувати елементи візуалізації даних побудови аналітичних дашбордів і впроваджувати різні техніки та підходи до аналізу даних для того щоб отримати бажаний результат для того щоб поєднати ці блоки в одну і зробити таку
40:16
Speaker A
діаграму я можу використовувати стрілочки Ось таким чином їх досить легко впроваджувати на каv поєднаю всі блоки і у мене на виході є план наших дій або етапи реалізації нашого проекту я можу завантажити цей малюнок сюди в робочий файл ось в такому вигляді ми
40:35
Speaker A
отримуємо нашу діаграму Я хотів би його розмістити в самому початку нашого робочого аркушу і найбільш зручний варіант - це виділити певну кількість рядків наприклад 10 рядків приблизно ми можемо перетягувати ці рядки а можемо правою кнопкою миші вставити саме таку
40:51
Speaker A
кількість рядків зверху або знизу Я хотів би вставити зверху Отже якщо мені потрібен один рядок я виділяю один рядок і вставляю один рядок зверху тепер у мене є місце для того щоб розмістити нашу діаграму вона буде оформлена в
41:06
Speaker A
такий прямокутник тобто я можу виділити її Ось таким чином і ці етапи ця послідовність буде допомагати нам орієнтуватися в нашому проекті назвемо це план роботи і тепер так само виділяючи рядки можемо видалити не потрібні рядки тут в меню правою кнопкою миші отже як ми
41:26
Speaker A
можемо побачити у нас є Перший етап - це визначення проблеми і ми розуміємо контекст наших даних ми їх побачили далі ми перейшли до збору даних і в нас вже є місце де ми зберігаємо всі потрібні дані цей етап також відображається тут в
41:39
Speaker A
метаданих і ми з вами можемо переходити до етапу підготовки наших даних в попередніх відео ми вже поговорили про проблему яку вирішуємо для нашого умовного замовника і зібрали дані в одному місці ми маємо таблицію по кожній таблиці ми надали опис вказали
42:00
Speaker A
джерело яке використовувалося в якому форматі дані прийшли і залишили коментарі тепер ми можемо переходити до підготовки наших даних і почнемо з дета профайлінгу дета профайлінг - це процес дослідження наших даних з метою оцінки їхньої якості для того щоб комплексно
42:18
Speaker A
підійти до питання оцінки якості і підвищення якості наших даних ми маємо з чогось почати я створив таку таблицю яка дозволить нам охарактеризувати ті дані які ми вже отримали таблиця називається Data profайing до очищення даних Отже маємо таблиці по кожній з таблиць
42:34
Speaker A
надаємо базові характеристики це кількість рядків та кількість колонок це інакше називається форма нашої таблиці Також потрібно оцінити кількість унікальних рядків кількість та наявність відсутніх значень серед всіх значень нашої таблиці Тобто це перший крок оцінки наших даних потім ми оцінимо
42:52
Speaker A
якість підвищимо якість даних таблиці дещо зміняться ми втратимо певну кількість або змінимо певну кількість значень далі ми заповнимо ще раз таку таблицю вже за результатами очищення даних також в кінці напишемо невеличкий звіт про те як ми оцінили якість даних
43:07
Speaker A
як ми її підвищили Отже переходимо до дета профайлінгу і почнемо збирати інформацію про нашу таблицю транзакції Отже кількість рядків можна порахувати з використанням формули яка називається Rolls сюди ми передаємо діапазон значень і отримаємо кількість відповідно рядків переходимо до таблиці транзакцій я можу
43:26
Speaker A
обрати першу транзакцію і далі якщо я натискаю клавішу Shift я можу динамічно змінювати цей діапазон Отже Мені потрібно обрати першу клітинку натиснути Shift і обрати останню клітинку нашого діапазону ми передаємо актуальний діапазон в нашу формулу закриваємо дужки погоджуємося і бачимо 20 000 рядків в
43:44
Speaker A
нашій таблиці transactions Я думаю доречно вже поговорити про форматування числових значень якщо я обираю це значення 2000 цю клітинку я можу перейти до налаштувань форматування і обрати відображення числово значення Таким чином я отримую роздільник десятих сотих тисячних так само як роздільник між
44:03
Speaker A
тисячами мільйонами і так далі ну цей варіант більш розповсюджений в Америці в європейських звітах також можна бачити крапку як роздільник десятих сотих тисячних в Україні більш розповсюдженим є варіант використання коми на цьому місці це дуже легко змінюється Ми можемо
44:18
Speaker A
перейти до файл налаштувань і обираючи ту чи іншу локацію Ми отримаємо відповідне форматування числових значень Отже якщо ви обираєте Україну Ви отримаєте кому в якості роздільника я залишаюся в налаштуваннях United States і у мене крапка відповідає за роздільник
44:34
Speaker A
детих сотихтисячних ці значення Мені не потрібні я їх прибираю ось тут тепер перейдемо до кількості колонок так само є формула яка відповідає за це називається colums і ми так само передаємо діапазон значень переходжу до таблиці транзакцій і обираю першу колонку протягую до
44:55
Speaker A
останньої і саме для цього діапазону Я хотів би бачити кількість колонок це 13 і це вже наша форма форма нашої таблиці 20 000 на 13 тепер перейдемо до підрахунку кількості унікальних рядків ну для цього можна орієнтуватися по колонці transaction ID в нас кожна
45:14
Speaker A
транзакція має свій унікальний ID і ми будемо сподіватися що саме це є ідентифікатор унікальності самої транзакції це найбільш простий варіант оцінити унікальність всієї таблиці Отже Я переходжу до метаданих і прописую формулу яка дозволить мені порахувати кількість унікальних значень це count
45:33
Speaker A
тобто кількість чогось але ми маємо count unique як варіант цієї формули яка підраховує кількість унікальних значень в нашому діапазоні відкриваю дужки і переходячи до таблиці транзакцій обираю першу клітинку першої транзакції id1 далі з використанням Ctrl Shift і стрілочкою вниз я можу охопити весь
45:56
Speaker A
діапазон наших значень закриваємо дужки переходимо до оцінки 20 000 така сама як і загальна кількість рядків Отже у нас немає задубльованих ID транзакцій будемо вважати що це і є ознака відсутності дублікатів в наших даних хоча це не так
46:14
Speaker A
і ви можете продовжувати досліджувати інші колонки або комбінації колонк для того щоб побачити чи є дублікати з різними ID транзакції для того щоб підрахувати кількість відсутніх значень є декілька різних спо способів ну перший який приходить на думку - це підрахунок
46:30
Speaker A
кількості наявних значень за це відповідає функція count a Отже бачимо що ця функція повертає нам кількість значень в датасеті і якщо я перейду до транзакцій оберу першу транзакцію Ctrl Shift вправо охопили всі колонки Ctrl Shift вниз охопили всі
46:50
Speaker A
рядки Ми пропередаємо весь діапазон нашої таблиці закриваю дужки і отримую кількість наявних значень наші таблиці а для того щоб отримати кількість відсутніх даних потрібно мати загальну кількість даних нашої таблиці Отже я можу помножити 20 000 рядків на 13 колонок і відняти від результату
47:11
Speaker A
кількість заповнених значень моєї таблиці і отримати 1500 відсутніх значень це як варіант але інший варіант є формула яка відповідає за пусті значення це count Blank отже я бачимо додаємо сюди діапазон повертаємо кількість пустих значень незаповнених в нашій таблиці
47:34
Speaker A
переходжу до транзакцій обираємо першу клітинку але на цей раз ми відразу рахуємо кількість незаповнених клітинок як бачимо результат отримали такий самий 1500 відсутніх значень можемо застосувати наше форматування до цього значення і підрахувати відсоток відсутніх значень адже маємо кількість
47:53
Speaker A
відсутніх значень і загальну кількість значень Отже відсоток буде дорівнювати 1542 значення розділити на кількість рядків помножена на кількість колонок зараз це дробове число переходимо до форматування самого числа обираємо відсоток тепер ми бачимо що відсоток відсутніх значень нашої таблиці
48:16
Speaker A
transactions менше 1% це небагато інформації надає тому що ми не знаємо як розподілені ці пусті значення в межах нашої таблиці це одна колонка або декілька колонок або певні рядки це ми ще будемо досліджувати але З чогось потрібно починати і Ось таким чином ми
48:33
Speaker A
можемо оцінити кожну з нашої таблиці я вас закликаю попрацювати з кожною таблицею я передбачаю що будуть нюанси пов'язані з таблицею New customers і підрахунком її кількості унікальних рядків адже коли я обираю таблицю New customers Я бачу що ми вже маємо нових
48:49
Speaker A
клієнтів по них ми маємо якусь інформацію але клієнти не отримали свій ID свій унікальний номер Отже Ми не можемо по якійсь одній колонці отримати уявлення про унікальність нашої таблиці і про підхід який можна застосувати в такому випадку ми поговоримо в
49:04
Speaker A
наступному відео ми повертаємося до таблиці Data профайлінг де ми вже охарактеризували таблицю транзакцій і ми можемо застосовувати цей приклад по відношенню до всіх інших таблиць і в мене не було жодних проблем щоб охарактеризувати кількість рядків та колонок таблиць
49:25
Speaker A
порахувати кількість відсут х значень таблиць і ми можемо маючи формулу розрахунку відсутніх значень протягнути цю формулу і застосувати її до кожної таблиці окремо так ми бачимо що деякі таблиці мають високий відсоток відсутніх значень а деякі таблиці не мають
49:43
Speaker A
відсутніх значень взагалі Такі дані дуже легко аналізувати коли ми застосовуємо умовне форматування до клітинок можемо виділити діапазон перейти до форматування і знайти меню умовне форматування клітинок тут можемо застосувати якийсь колір щоб знайти необхідні значення в якомусь діапазоні або можемо навести шкалу кольорову я
50:04
Speaker A
обираю шкалу від зеленого до червоного Отже в мене мінімальне значення буде в клітинці зеленого кольору середні значення будуть білого кольору максимальні значення червоного кольору застосовуємо це правило і бачимо тепер які таблиці мають високу якість даних А які потребують додаткової уваги і перед
50:22
Speaker A
тим як завершувати етап деa профайлін потрібно порахувати кількість унікальних рядків для таблиці New customers нагадаю що в цій таблиці немає колонки яка відповідає за індикатор унікальності рядка тобто У нас вже є наші замовники ми знаємо їхню інформацію але вони ще не
50:39
Speaker A
отримали свій власний унікальний ID Отже спробуємо оцінити кількість унікальних замовників використовуючи їх імена і давайте поступово впроваджувати таку процедуру я буду працювати тут ми так само будемо використовувати формули але формул буде значно більше ніж просто count unique перше що я хочу зробити -
50:56
Speaker A
це отримати ти ім'я людини для цього я можу просто послатися на потрібну клітинку першого імені і в мене є перше ім'я Але я думаю що тільки ім'я не надає нам розуміння унікальності тому що імена можуть повторюватись Я хотів би мати і ім'я і прізвище для
51:16
Speaker A
цього я можу склеїти дві колонки два значення з використанням ось такого знаку амперсан і тепер обравши прізвище першого замовника я отримаю такий склеєний варіант ім'я і прізвища ми можемо додати пробіл між ними тобто склеїти не тільки значення але й склеїти
51:37
Speaker A
пробіл який я розташую в подвійних дужках так само оточений знаком амперсант Отже у нас є колонка амперсан пробіл амперсан наступна колонка і ось так можемо протягувати цю формулу змінюючи посилання і отримуючи наших замовників ну для того щоб переконатися
51:54
Speaker A
що це ім'я більше ніде не зустрічається і воно є унікальним маємо передбачити що імена можуть бути написані з великої літери з маленької літери або тільки великими літерами або тільки маленькими літерами Отже регістр має значення для того щоб оминути цю проблему я можу
52:09
Speaker A
застосувати іншу формулу яка називається Low і вона мені поверне все що буде в цій формулі але маленькими літерами Подивіться Отже Ми залишаємо нашу формулу ми склеїли наші колонки Але перед тим як повертати результат ми передаємо всі ці текстові значення
52:28
Speaker A
маленькими літерами і тепер я буду аналізувати всі унікальні імена наших замовників проблема в тому що зараз ця формула повертає лише одного замовника в одну клітинку де вона власне вбита і ми не можемо порахувати кількість унікальних замовників не маючи повністю
52:45
Speaker A
весь діапазон наших замовників Отже ми можемо повернути його сюди можемо створити тут перелік всіх замовників і далі порахувати кількість унікальних але ми можемо зменшити кількість процесів в цьому дослідженні і відразу повернути формулу масивом що я маю на увазі
53:02
Speaker A
давайте приберемо всі імена окрім першого і перед тим як прописати lower і склеїти наші рядки ми можемо прописати функцію яка називається array формула array формула ця формула повертає не значення в клітинці в якій вона вбита а масив даних Тобто це буде ці стовпчик в даному
53:28
Speaker A
випадку дивіться rреay формула Залишаємо все як було закриваємо дужки я можу створювати нову строку з використанням Ctrl Enter і так підвищувати скажімо читабельність мого коду і давайте подивимось що повертає така формула ну наразі Вона повертає одне значення тому
53:45
Speaker A
що в принципі ми посилаємося на конкретне значення тут і тут Але якщо ми збільшимо цей діапазон з використанням двокрапки починаючи з А2 закінчуючи а 1000 один наприклад і B2 закінчуючи b1001 тобто охопивши весь діапазон імен і призвіщ ми маємо отримати
54:07
Speaker A
безпосередньо діапазон як результат роботи цієї формули Отже формула вбита в одній клітинці Але на відміну від того що ми робили до цього Вона повертає нам заповненням цілий діапазон значень Отже ми його маємо і він зберігається тут і тепер ми можемо порахувати кількість
54:24
Speaker A
унікальних значень в цьому діапазоні тобто я можу знову ж таки застосувати Ctrl Enter і сказати порахуй мені будь ласка всі унікальні значення формула count unique який повертає формула яку ми Прописали до цього закриваємо дужки відпрацьовуємо цей результат і ми бачимо
54:43
Speaker A
значення 1000 Отже Ми рахуємо кількість унікальних значень що знаходяться в масиві даних склеєних імен і припрізвищ наших замовників і таким чином якщо поступово впроваджувати такі складні формули можна до ти бажаний результат без формування якихось проміжних таблиць проміжних масивів а відразу відтворюючи
55:03
Speaker A
результат В самій формулі Отже стосовно відсотка відсутніх значень ми вже поговорили стосовно унікальності наших таблиць бачимо що з 20 000 транзакцій кожна транзакція має свій власний унікальний ID так само і для наших замовників так само і для їх інформації
55:19
Speaker A
що стосується нових замовників ми бачимо що ми не повторюємо одне і те саме ім'я і прізвище замовника Отже передбачаємо що це і є індикатор унікальності так само відображаємо шість штатів Австралії без жодних дублікатів для початку цього достатньо далі переходимо до роботи з
55:35
Speaker A
якістю наших даних і спробуємо її підвищити і ми починаємо роботу з даними з таблиці транзакцій це напевно така Центральна таблиця нашого аналізу адже вона реєструє сам факт купівлі певного товару певної категорії певної вартості Але ми не будемо змінювати оригінальну
55:58
Speaker A
таблицю все ж таки рекомендується створювати дублікати тому ми правою кнопкою миші переходимо до дублікату аркушу транзакції і після створення копії адаптуємо назву нашого нового аркушу назвемо його transactions Clean тобто дані очищені і після зміни назви також можемо змінити колір нашого аркушу
56:17
Speaker A
це що спрощує саму навігацію між аркушами Ми також можемо перейти до переліку всіх аркушів і так само бачити колір нашого аркушу і залишаючись в межах аркошу transactions Clean починаємо впроваджувати перші кроки з оцінки якості даних і їх очищення Отже
56:33
Speaker A
маючи таку таблицю Я виділяю всі дані за допомогою кутової кнопки і подвійний клік на ширину стовпця дозволить мені адаптувати ширину таким чином щоб кожна назва кожної колонки була повністю відображена також перед початком роботи я дуже уважний щодо прихованих колонок
56:50
Speaker A
таке трапляється якщо я виділяю дві колонки і правою кнопкою миші приховую їх Ось тут в меню Я дуже легко можу забути про існування тих колонок і втратити з ними зв'язок вони показані Ось таким чином Отже перед початком роботи я б все ж таки хотів би бути
57:06
Speaker A
впевнений що працюю з усіма можливими колонками тому я їх відкриваю також з корисних функцій можна використовувати Ось такі лінії для маркування заморожених рядків тобто перший рядок тепер заморожений і він не змінюється при скролингу так само я можу змінювати
57:21
Speaker A
і заморожувати стовпчики Отже при горизонтальному скролингу Я також не змінюю першу колонку це думаю може бути зручно під час такого первинного аналізу нашої таблиці тому я прибираю заморозку і вже можемо безпосередньо переходити до самих даних якщо я обираю колонку Я вже
57:40
Speaker A
бачу якусь інформацію ось тут надаються статистик якщо це числова колонка Тобто ми зберігаємо числа ми можемо побачити сумарне значення середнє мінімальне максимальне кількість значень в нашій колонці та кількість числових значень нашої колонки Тому що одне значення в даному випадку це безпосередньо назва
57:57
Speaker A
нашої колонки Тобто я вже маю певне уявлення про значення Що місяться в нашій колонці але є більше можливостей можемо перейти до інструментів Data і знайти можливість відобразити статистики по наших колонках Отже Ось так виглядає статистика колонки транзакцій ми бачимо
58:14
Speaker A
що в нас є рівномірний розподіл всіх значень що містяться в цій колонці це не дивно тому що в нас є унікальні транзакції Тобто кожна категорія наприклад від ну0ля до 2 000 має таку саму кількість транзакцій як від 2 000
58:26
Speaker A
до 4 000 це не дуже корисне відображення статистики в нашому випадку але ми бачимо кількість по кожному значенню бачимо максимальне мінімальне значення бачимо кількість незаповнених клітинок кількість унікальних значень сумарне значення середнє медіана це все потрібно нам для первинного аналізу для скрінінгу
58:45
Speaker A
нашої таблиці Я так само можу піти до наступної колонки обрана колонка буде підсвічуватися Ось таким кольором але якщо я і тут буду обирати колонку я буду продовжувати відстежувати статистики відображення саме для цієї колонки переходимо до колонки transaction Date
59:00
Speaker A
тобто дати коли була здійснена транзакція бачимо що всі транзакції потрапили в якийсь один певний проміжок часу якщо подивитися на статистику бачимо що мінімальне значення - це 1 січня 17го року максимальне значення - це кінець 17-го року бачимо що в нас є
59:16
Speaker A
365 унікальних значень Тобто ми в принципі відображаємо значення для повного календарного року ми можемо змінювати формати даних що надаютьсями можемо обрати всю колонку дат перейти до формат знайти можливість змінити числове значення і використати в даному випадку значення саме дати ми можемо подвійним
59:34
Speaker A
кліком перейти до редагування даних і побачити календар таке можливо виключно для всіх значень тип яких дата а не числове значення і тепер можемо повернутися до саме кількісного відображення всіх транзакцій протягом нашого календарного року і ми бачимо історичні дані ми бачимо тренд продажів
59:51
Speaker A
тобто тренд кількості транзакцій протягом усього нашого року можна вже сказати про умовно наявність або відсутність певної сезонності можна бачити певні пікові продажі можна також бачити певні тенденції зниження продажів протягом певного проміжку часу Тобто можна вже зробити перші поверхневі
60:10
Speaker A
висновки щодо роботи онлайн-магазину і подумати про фактори які можуть впливати на тренд кількості транзакцій добре поки що закриваємо цю статистику переходимо до наступної колонки це онлай оorder відкриваємо фільтр і фільтри ми будемо використовувати багато протягом оцінки якості даних і ми бачимо що у нас є
60:29
Speaker A
значення True тобто ця транзакція - це онлайн замовлення та False ця транзакція була офлайн замовлення також в нас є незаповнені значення давайте очистимо фільтр оберемо тільки незаповнені значення і Подивимось як це виглядає ми бачимо що у нас є 360 незаповнених
60:46
Speaker A
клітинок в колонці онлайн оorder тобто ми не знаємо чи це було онлайн замовлення чи олайн замовлення проте ці дані нам цікаві тому що ми бачимо що по цих транзакціях ми маємо всю необхідну інформацію для аналізу ми знаємо який
60:58
Speaker A
бренд який клас який розмір яка була вартість придбаного товару Ми хочемо працювати з цими даними тому я хотів би залишати ці дані в жодному разі їх не видаляти потрібно це відобразити в нашому звіті про оцінку якості даним а
61:12
Speaker A
поки що пропоную додати третю категорію замість незаповнених значень вказати що статус невідомий Отже будемо використовувати це слово для відображення невідомого статусу онлайнзамовлення подвійний Клік дозволить автозаповнити всі всці клітинки тепер Можна повернутися до фільтру обрати всі значення і переходити
61:32
Speaker A
до наступної колонки це ордер статус бачимо що у нас є замовлення що були підтверджені та замовлення що були відмінені в принципі на перший погляд жодних питань до цієї колонки не виникає підемо далі у нас відображені бренди подивимось яка їх кількість ну бачимо
61:47
Speaker A
декілька декілька брендів серед них також є незаповнені значення давайте подивимось на них я очищую фільтр обираю незаповнені значення і у мене є зараз інша картина для незаповнених брендів Я бачу що у мене є багато відсутньої інформації в принципі тобто для певної
62:05
Speaker A
кількості транзакцій а саме 197 транзакцій нашої бази даних ми маємо справу з дуже обмеженою кількістю інформації а основні атрибути щодо товарів тобто бренд продукт клас розмір вони просто відсутні вони не фіксувалися тобто є певна помилка під час збору та
62:23
Speaker A
систематизації цих даних і ми маємо про це сказати з цими даними працювати буде дещо важче тому що багато інформації яка нам потрібна просто відсутня і якщо Такі дані можна використовувати для аналізу кількості транзакцій та розподілу транзакцій відповідно по різних
62:37
Speaker A
продуктах та різних замовників ми не зможемо використовувати ці дані для аналізу безпосередньо атрибутів які обиралися нашими замовниками Також ми бачимо що у нас відсутня колонка Standard Cost а саме ця колонка дозволить нам в майбутньому порахувати прибуток тому що в нас є каталог в нас є
62:56
Speaker A
варті тість яка зазначена на сайті наприклад і у нас має бути вказано собівартість цього товару для того щоб ми могли Розрахувати прибуток Отже у нас будуть проблеми з цими даними це також потрібно відобразити в нашому звіті і вам вирішувати як надалі працювати з
63:12
Speaker A
цими даними Я бачу що у нас є 197 незаповнених значень Тобто ми в межах 1% від загальної кількості транзакцій і це дозволяє мені в принципі видалити їх для цього аналізу потім я скомунікую з замовником надам йому рекомендації і
63:29
Speaker A
сподіваюсь що ми зможемо покращити якість даних знайти проблему і чому виникає така ситуація дані будуть покращені і ми зможемо їх додати потім до аналізу Отже я обираю всі рядки які приймають в цьому участь і правою кнопкою миші переходжу до видалення
63:44
Speaker A
наших рядків Отже ми втрачаємо 197 транзакцій переходимо до фільтру бренду обираємо всі наші бренди бачимо що пустих значень вже немає в нашій базі і так само бачимо що ми дійсно втратили певну кількість транзакцій адже в нас було 20 000 транзакцій спочатку Окрім
64:02
Speaker A
цього я б хотів би ще перевірити безпосередньо самі бренди тому що я бачу що перший бренд soulex виглядає наче тут є пробіл перед Першою літерою так дійсно таке трапляється і дуже часто і ми маємо оцінювати наявність пустих знаків або
64:18
Speaker A
пробілів в наших категорійних даних для того щоб потім уникнути проблем при їх інтерпретації і для цього нам може допомогти інструмент в Google sheets який власне надає рекомендації як покращити наші дані ми з ним ще не працювали я обираю колонку переходжу до
64:33
Speaker A
даних і шукаю можливість отримати рекомендації по очищенню наших даних і ми дійсно бачимо що інструмент нам підкреслює наявну помилку саме бренд sollex містить пробіл перед Першою літерою ми можемо побачити всі клітинки в яких це спостерігається їх не так
64:50
Speaker A
багато але така проблема є і це добре що ми її виявили Тому що я так розумію що ця ситуація не для всіх представників бренду sollex давайте побачимо тільки sollex і подивимось чи всі вони Ні тільки частина транзакції де зафіксовано
65:06
Speaker A
бренд sollex має проблему в назві бренду тому ми можна сказати з вами маємо два різних бренди тут Отже я виділяю цю клітинку бачу що в мене є проблеми переходжу до рекомендацій і я можу обрати функцію triam All тобто прибрати всі пусті
65:25
Speaker A
символи та пробі бачимо що відпрацьовано було для 19 клітинок і в принципі нашу проблему було вирішено цей інструмент не завжди працює так як ми хотіли би він не завжди надає доречні рекомендації або іноді не бачить якихось очевидних проблем які ми з вами люди можемо
65:41
Speaker A
побачити тому я не можу на 100% довіряти цьому інструменту але я часто перевіряю його рекомендації щоб перевірити власне мої спостереження та ідеї закриваємо цей інструмент і на цьому етапі можна завершити роботу з нашими брендами Я повернув відображення в фільтрах можемо
65:57
Speaker A
переходити до product Line відкриваю фільтр бачу що у нас є декілька продуктів ці пусті значення які були вони були видалені під час очищення стовпчика БН prodктк характеризується класом високий середній або низький також є prodct size Отже розміри вказуються у форматі великий середній та
66:18
Speaker A
маленький Я також не бачу на перший погляд знову ж таки проблем з цими даними list Price - це каталог Отже для кожного товару є вказана вартість це має бути значення числове нас цікавить точність до двох знаків після коми і
66:32
Speaker A
проблем з цими даними Я не бачу можемо відформатувати цей тип даних перевести його в валюту для цього я обрав всю колонку переходжу до формату числове значення валюта тепер у нас є більш наглядне відображення цієї колонки Standard Cost вже відформатовано
66:48
Speaker A
належним чином бачимо що у нас є значення від 7 до$ів до 100700 теж не виникають певні питання до цих даних На цьому етапі далі В нас є колонка product First Sold ну відповідно до назви Я думаю що це має бути Data але я не бачу
67:03
Speaker A
тут дати і розумію що це проблема знову ж таки форматування типів даних тому що так дійсно часто можна побачити відформатовану дату як число що я маю на увазі якщо я обираю цю клітинку і переходжу до форматування і відображення в форматі
67:18
Speaker A
дати Я дійсно побачу дату різниця лише у форматуванні Я не знаю що саме мається на увазі в цій колонці у нас не вистачає контексту певного для цієї колонки це може бути дійсно Перший день коли був проданий той чи інший продукт його
67:33
Speaker A
реалізація як версія але нам потрібно уточнити цей момент тому що не можна стовідсотково стверджувати що саме мається на увазі в цій колонці і я не знаю чи буду я її використовувати в подальшому аналізі одна з проблем на яку ми
67:52
Speaker A
витрачаємо багато часу в наших реальних проектах - це робота з дублікатами дуплікати трапляються часто ми хочемо їх відстежувати хочемо розуміти їх причину причину їх створення і хочемо правильно їх видаляти і Google sheets є для цього інструмент ми знаємо що в нашій таблиці
68:07
Speaker A
транзакцій немає дублікатів ми перевіряли нашу колонку transaction ID на унікальність але нічого не обмежує нас змітувати дублікати Я для цього скопіюю декілька рядків нашої таблиці комбінацію клавіш ctrl C і створю новий аркуш куди вставлю наші дані і ось тут
68:24
Speaker A
ми можемо попрацювати з дублікатами я для цьогоеру рядок три рядок пть рядок ві рядок 10 ctrl C дозволяє скопіювати ці дані і обираючи рядок 11 я вставлю ці значення вони будуть доповнювати нашу таблицю Отже ми знаємо що в нас є
68:38
Speaker A
створені дублікати адже транзакція під номером три вона повторюється і всі дані в межах цієї транзакції дублюються це дуже погано впливає на подальший аналіз Тому ми маємо пройти через етап дедуплікації нашої таблиці і в першу чергу я хотів би їх побачити Я хотів би
68:54
Speaker A
якось їх виділити для цього є інструмент умовного форматування ми вже працювали з цим інструментом я обираю всю колонку ID наших транзакцій переходжу до секції формат І знаходжу умовне форматування тут зараз виділено всі мої клітинки тому що є певний колір і правило яке
69:11
Speaker A
застосовує цей колір клітинка має бути не пустою у нас всі значення заповнені Отже ми застосували правило і виділили клітинки це не те правило яке я хочу використовувати є інші правила які стосуються текстових значень Тобто ми можемо шукати дані за тексто патернами з
69:26
Speaker A
чого починається текст на чому закінчується текст якісь окремі значення можемо шукати можемо шукати діапазони дат тобто можемо виділити всі рядки які відносяться до транзакції до або після певної дати так само можемо працювати числовими значеннями але ми будемо прописувати свою власну кастомну формулу
69:43
Speaker A
і саме вона буде визначати чи виділяти клітинку чи ні і вона буде перевіряти наші значення на дублікати формула досить проста це count if і в цій формулі буде декілька аргументів перший аргумент - це власне наш діапазон транзакції Отже знак долара для того щоб
69:58
Speaker A
зробити абсолютне посилання і не змінювати його клітинка А1 двокрап А так само з абсолютним посиланням тепер вказуємо першу клітинку цього діапазону А1 закриваємо дужки і прописуємо умову більше одного давайте подивимось на результат цієї формули Я бачу що у нас є
70:16
Speaker A
підкреслено ті клітинки які повторюються і ми знаємо що ця транзакція дійсно має дублікат в наших даних і тепер ми можемо подумати про них працювати з ними виявити причини для цього достатньо їх відфільтрувати так саме фільтр давайте застосуємо фільтрування нашої таблиці
70:31
Speaker A
фільтр дозволить нам їх побачити окремо Ми звикли працювати з фільтрами як числовими значеннями або текстовими значеннями що містяться в наших клітинках А я пропоную на цей раз відфільтрувати за кольором клітинки У нас є білий колір у нас є зелений колір
70:45
Speaker A
це дуже корисна функція тому що часто ми або наші замовники або наші колеги виділяють вручну якісь клітинки кольором можливо ті клітинки які потрібно уважно перевірити і ми можемо легко відфільтрувати клітинки маючи цей колір тут в переліку фільтрації отже дуже
71:01
Speaker A
зручно рекомендую звернути увагу на це тепер можна розширити дещо наше правило повернувшись до правил умовного форматування розширити наш діапазон нас цікавить всі дані Отже це діапазон з а до колонки M давайте подивимось на результат для коректності потрібно додати ще абсолютне посилання тут в
71:18
Speaker A
клітинку А1 і ми з вами бачимо виділення всього рядка Тобто всі значення цього рядка задубльовані отже не тільки номер транзакції а й власне всі атрибути цієї транзакції мають дублікат в наших даних і з цим можна далі працювати І навіть
71:34
Speaker A
Після цього я можу додавати якісь транзакції їх дублікати і бачити що правило буде миттєво застосоване до моєї таблиці тобто діапазон буде постійно враховувати нові рядки добре погоджуємося з цим правилом його можна видалити якщо ми не хочемо застосовувати можна залишити тепер стає питання як їх
71:51
Speaker A
Видалити Для цього є окремий Інструмент я можу перейти до закладки Data знайти секцію Data cleanup ми вже з нею працювали отримували рекомендації по очищенню Тепер давайте перейдемо до розділу remove duplicates прибрати дублікати в наших даних є заголовки і ми
72:08
Speaker A
бачимо всі наші колонки можемо працювати по всіх колонках і шукати повні дублікати можемо шукати по окремих колонках в будь-якому разі кнопка прибрати дублікати дозволить Швидко видалити всі задубльовані значення Отже ми не втрачаємо наші транзакції оригінальні ми видаляємо задубльовані
72:25
Speaker A
рядки Таким чином ми отримали по суті унікальні транзакції в цій таблиці інший спосіб отримати унікальні значення і таблицю унікальних транзакції це є використання формул і ми вже частково з цим працювали адже ми використовували функцію для підрахунку кількості унікальних значень Це була функція count
72:40
Speaker A
unique Зараз ми можемо використати просту функцію unique давайте подивимось що вона нам пропонує аргументами буде діапазон значень і саме унікальні значення цього діапазону будуть повернуті Отже я можу перейти до таблиці транзакцій знайти свою першу транзакцію це буде клітинка
72:58
Speaker A
А1 застосувати цю формулу і побачити унікальне значення мого діапазону це власне є клітинка А1 я можу розширити цей діапазон додати двокрапку а Таким чином обрати всі транзакції мого діапазону і отримати тільки унікальні транзакції Отже В мене вже є перелік
73:15
Speaker A
унікальних транзакцій що не містить дублікати Я також можу розширити діапазон горизонтально я можу сказати що з клітинки А1 по клітинку всі дані що містяться в моїй таблиці мають бути повернені без дублікатів застосуємо цю формулу і тепер побачимо вже таблицю унікальних значень ця
73:33
Speaker A
таблиця вже немає дублікатів Отже це один з варіантів того як можна позбутися дублікатів наших даних тепер переходимо до аналізу наступних таблиці переходимо до наступної таблиці яка відображає дані по наших замовників Але знову ж таки працювати ми будемо не тут
73:54
Speaker A
а на створеному дублі Каті цього аркушу змінюємо назву на customers Clean обираємо потрібний колір для того щоб бути послідовними і тепер можемо приступати до оцінки та підвищення якості даних і ми вже маємо декілька інструментів всі їх будемо знову
74:11
Speaker A
використовувати в першу чергу створюємо фільтри бачимо чи є у нас приховані колонки я їх не бачу на перший погляд можемо обрати першу колонку customer ID і перейти до нашого інструменту статистика по колонці бачимо що у нас є 4 000 різних замовників по кожному з них
74:30
Speaker A
є ім'я замовника ця інформація нам доступна А ось щодо прізвища я б не був такий впевнений тому що я бачив що є пробіли я не думаю що це є проблема для нашого аналізу не мати частину імені нашого замовника це не буде
74:43
Speaker A
відображатися в нашому аналізі та в результатах переходимо до колонки Де вказується стать і бачимо що у нас тут є проблеми з якістю даних тому що категорії непослідовні ми бачимо що є помилки нам потрібно це якимось чином привести до спільного знаменника якщо ми
75:02
Speaker A
можемо обрати якусь помилкову категорію то якщо небагато значень ми можемо власне вручну змінити це таким чином це миттєво відобразиться в нашому фільтрі Але звичайно досить Важко буде робити це для кожної категорії особливо коли якась категорія може бути представлена багатьма
75:23
Speaker A
значеннями Давайте спробуємо подивити спочатку як багато у нас помилок їх реально не дуже багато я я самостійно змінюю деяке значення і зараз я бачу в мене залишається female maale та U ну в даному випадку U можна сприймати як
75:40
Speaker A
unspefied тобто не вказаний генр і ми можемо замінити всі ці літери U на unspecified тобто не вказаний невідомий і для цього вже можна використати інший інструмент який називається знайти і замінити Ctrl F це гарячі клавіші які дозволяють нам перейти в таке вікно
75:59
Speaker A
знайти Я зацікавлений в тому щоб знайти літеру U і я бачу що Google sheets відпрацював це по всьому аркушу ну це не те що я хотів Я хотів працювати з конкретним діапазоном значень тому Я переходжу сюди до більше налаштувань я
76:13
Speaker A
хотів знайти U замінити Це на unspefied але при цьому шукати Я хочу в конкретному діапазоні переходжу сюди за посиланням обираю клітинку стовпчик gender і в принципі я бачу що ми шукаємо зараз тільки по стовпчику gender можемо натиснути кнопку replace All і бачимо що
76:35
Speaker A
ми 88 літер U замінили на потрібне нам слово перейдемо до фільтру так відпрацьовано бачимо що в нас є три категорії з цим працювати буде значно простіше переходимо далі колонка Past 3 years Bike related purchases тобто скільки за останні три роки цей замовник
76:56
Speaker A
придбав товарів в категорії велосипедів це має бути числове значення ми розуміємо що тут не має бути жодних літер або текстових значень значення від нуля до 100 в принципі має сенс переходимо далі doob Я думаю що це дата народження але бачимо знову ж таки
77:13
Speaker A
форматування не відповідає датам тому переходимо до формату і змінюємо числове значення на дату Це ми вже робили декілька разів і тепер відкриваючи фільтр Я бачу що у нас дійсно є різні дати народження 99-й рік 98-й рік може бути А ось я не впевнений що до 1843
77:32
Speaker A
року це я думаю очевидно якась аномалія Я можу прибрати все обрати тільки цю дату наступні не визивають так багато запитань і бачимо що в нас є один замовник стать якого невідома бачимо що в нього було 59 купівель за останні 3
77:49
Speaker A
роки ми можемо Видалити все значення тому що ми не довіряємо значенню конкретної колонки або можемо замінити Це значення наприклад на середній вік або можемо замінити Це значення на середній вік для цієї гендерної категорії для цієї професії тобто бути
78:05
Speaker A
максимально максимально близьким до того що показують інші дані в нас з вами є вся статистика ми бачимо що у нас медіана дата народження - це 77-й рік Тобто можна з цього зробити висновок і вручну замінити Це значення я вам
78:21
Speaker A
рекомендую попрацювати з цим подумати про найбільш Оптимальний варіант реалізації такого рішення я просто видалю цей рядок і вкажу про це у звіті про якість даних повертаємося до фільтрів відкриваємо всі наші значення і переходимо до наступних колонок У мене є колонка назва роботи та
78:42
Speaker A
сфера діяльності Я бачу що є два значення вказано перше - це назва роботи далі кома сфера діяльності і так для всіх Хто вказав хтось не вказав бачите Job Title назву роботи але сферу діяльності казав тому у нас є кома сфера
78:57
Speaker A
діяльності Отже це не дуже зручні дані для подальшої роботи Хоча вони надзвичайно важливі Ми не хочемо їх втрачати ми хочемо з ними працювати Ми хочемо бачити профілі наших користувачів залежно від того в якій сфері діяльності Вони працюють тому я хотів би зробити з
79:11
Speaker A
цієї колонки дві одна з яких відповідає за роботу за назву посади інша за сферу діяльності є такий інструмент обираючи весь всю колонку Я переходжу до Data І знаходжу можливість роз збити текстові значення на колонки Я просто натискаю на
79:28
Speaker A
цю функцію і бачу що вона миттєво відпрацьована так як мені було потрібно Отже кома була визначена як роздільник і ми отримали дві колонки кожна з яких представляє категорію перше - це Job Title залишається а для наступної обираю назву
79:47
Speaker A
industry бачимо по фільтрах що ми дійсно отримали різні сфери діяльності наших замовників кожна з яких може бути представлена різними на назвами професії з цим буде дуже цікаво попрацювати наступною колонкою у нас йде індикатор смертності тобто можемо враховувати або
80:02
Speaker A
не враховувати сам факт смертності замовників я в свою чергу залишаю всі дані для подальшого аналізу далі я бачу колонка яка називається default і вона відображає досить дивні дані якщо подивитися фільтри ми бачимо що дані дійсно виглядають некоректно це биті
80:21
Speaker A
дані ми не зможемо з ними нічого зробити Я думаю тобто це проблема попередніх етапів отримання кодування інформації та надання інформації нам для аналізу Отже ця колонка не буде використовуватися для аналізу Я її можу видалити правою кнопкою миші переходжу до видалення
80:38
Speaker A
всієї колонки з нашої таблиці в нас також є флаг відповідно до наявності у володінні автомобіля Я бачу що не всі вказали але це може бути Залишаємо це так також є колонка яка відповідає за тривалість напевно роботи людини на
80:55
Speaker A
своїй вказаній посаді Або можливо тривалість володіння автомобілем Ну тут потрібно запитати я залишаю цю цю колонку Хоча до кінця не розумію що значить ця колонка і ми з вами переходимо до наступних таблиць рухаючись далі ми переходимо до наступної таблиці тут відображені адреси
81:20
Speaker A
тобто по кожному нашому замовнику надаються дані щодо адреси і ми так також маємо оцінити і підвищити якість цих даних спершу робимо дублікат цього аркушу змінюємо назву та колір і маючи дублікат можна працювати але ця таблиця відрізняється від попередніх таблиць я
81:38
Speaker A
можу змінити значення певної клітинки на будь-яке значення і побачити що у нас буде помилка дані зникають Це через те що ця таблиця є результатом відпрацювання формули це динамічна формула що посилається на джерело інформації і у нас будуть значні труд в
81:55
Speaker A
спробах відредагувати дані що приєднані до джерела адже вони постійно мають бути синхронізовані Я повертаю таблицю до оригінального вигляду і стратегію тут може бути наприклад зробити копію всіх значень і вже працювати з таблицею що не з'єднана з джерелом але повністю його
82:14
Speaker A
відображає на момент проведення аналізу Отже я можу просто виділити всі значення з використанням комбінації клавіш Ctrl Shift вниз і маючи обраний діапазон скопіювати його комбінацію клавіш ctrl C після того як ми скопіювали дані я можу перейти кудись і вставити поруч з
82:31
Speaker A
оригінальною таблицею скопійовану таблицю отже комбінація клавіш ctrl V надає мені інформацію Але знову ж таки ми руйнуємо посилання Що формує першу таблицю і так само не можемо відпрацювати другу таблицю адже ми знову ж таки намагаємося вставити наше посилання але є можливість контролювати
82:49
Speaker A
що саме ми вставляємо і ось тут в меню я можу обрати що я хочу вставити Тільки значення я не цікавлений в формулах і це дозволить мені вставити копію таблиці і ці значення Я вже зможу редагувати без прив'язки до джерела інформації Я
83:03
Speaker A
видаляю непотрібні мені вже колонки і з цією таблицею ми можемо працювати як ми звикли ми додаємо фільтри Ми дивимось на значення в фільтрах на розподіли значень ми знаємо що у нас є унікальні ID по кожному нашому замовнику є текстові
83:18
Speaker A
адреси даних в нас є коди поштові у нас також є вказівка представником якого штату є замовники ми бачимо що тут дані відрізняються адже частина замовників представлена абревіатурами частина повними назвами штатів у нас до речі є таблиця яку можна використовувати як
83:35
Speaker A
референс це Штати Австралії Ми її імпортували з Вікіпедії можемо на неї посилатися ми бачимо що для кожного штату є код Я пропоную перевести всі наші штати в осі офіціальні коди переходжу до наших адрес і давайте впровадимо один з методів який ми вже
83:52
Speaker A
впроваджували наприклад пошук заміна значень отже комбінацію клавіш Ctrl F Я переходжу до пошуку далі відкриваю меню Я зацікавлений в тому щоб знайти Всі штати New South Wales і замінити Це на абревіатуру nsw але хочу шукати саме в діапазоні наших штатів Отже обираю
84:11
Speaker A
колонку D погоджуюсь і замінюю всі значення на абревіатуру тут зробили бачимо що наші зміни було впроваджено У нас ще є проблема зі штатом Вікторія і так само ми можемо з легкістю замінити Це значення на код Отже Мене цікавить
84:31
Speaker A
Вікторія замінюю на vic шукаю в діапазоні наших штатів і замінюю всі значення на вказані тепер якість даних підвищена ми бачимо що всі замовники розподілені між трьома штатами і тут помилок не має бути далі наступна колонка країна ми бачимо що всі наші
84:53
Speaker A
замовники - це представники однієї країни Австралії і в нас є ще одна колонка property evuation яка відображає значення від одного до 12 мені теж невідомо що саме відображається в цій колонці але відносно якості даних зауважень немає єдине що я хотів би
85:09
Speaker A
уточнити що саме мається на увазі і як я можу використовувати це значення в нашому подальшому аналізі Отже ми підвищили якість ще однієї таблиці в нас залишається остання таблиця яка називається New customer list ця таблиця відображає тільки нових замовників і ми
85:26
Speaker A
можемо використовувати ці дані для того щоб знайти серед них потенційно золотих клієнтів тих хто будуть приносити більше прибутку адже по них нам відома інформація де вони працюють Їх вік їх стать наявність або відсутність автомобілю і інші дані Тобто ми
85:42
Speaker A
потенційно можемо проаналізувавши існуючих замовників перенести результат на нових замовників ця таблиця також потребує очищення вона містить майже всі вже знайомі нам колонки атрибути отже не має бути проблем з підвищенням їх якості Спершу ми маємо скопіювати цю таблицю для того щоб не використовувати
86:01
Speaker A
динамічне посилання використовувати тільки значення цієї таблиці і далі колонка за колонкою маємо привести цю таблицю до вже встановленого нами стандарту Я пропоную вам зробити це самостійно дослідити кожну колонку зробити висновок про доцільність використання якогось певного методу підвищеня якості даних Я вже бачу що є
86:20
Speaker A
скриті колонки Я вже бачу що є колонки контекст яких нам невідомий це це має бути відображене в нашому звіті Отже Я запрошую вас до підвищення якості цієї таблиці а в наступному відео я покажу приклад звіту з аналізу та оцінки якості
86:34
Speaker A
наших даних New customer list - Це була остання таблиця цього етапу підготовки даних ми мали впровадити звичні нам процедури та дії для підвищення якості цих даних Отже Ми скопіювали цю таблицю Вона в нас на окремому аркуші Ми попрацювали з декількома колонками Я
86:57
Speaker A
думаю що всі оцінили колонку нer і привели її в порядок також можна було змінити тип даних дат народження і в принципі переконатися в тому що всі колонки відображають релевантну актуальну якісну Та взагалі адекватну інформацію На цьому етапі цього
87:15
Speaker A
достатньо ми можемо переходити до наступних етапів нашого аналізу даних Я переходжу на сторінку метаданих і бачу що ми завершуємо етап підготовки і вже переходимо до трансформування наших даних Але перед цим потрібно зробити висновки можливо написати звіт або зробити презентацію відкомунікувати все
87:33
Speaker A
що ми зробили та всі наші застереження і рекомендації на цьому етапі будуть дуже-дуже релевантні і ми зробимо Це відразу декількома способами Перший спосіб - це відобразити таблицю деa профайлін після очищення даних тобто порахувати все що ми рахували до цього
87:50
Speaker A
але по відношенню до очищених таблиць можна бачити що в формулах використову посилання на чисті таблиці по кожній таблиці та по кожному індикатору можна надати певні коментарі і потрібно це зробити тому що в деяких випадках наприклад ми погіршили якість даних можна побачити що таблиця
88:08
Speaker A
customers мала певну кількість відсутніх значень ця кількість збільшилася після нашої роботи але ми знаємо що ми там розбили колонку на дві колонки і зробили декілька інших впровадження які могли вплинути на цей показник про це потрібно сказати зробивши невеличку презентацію
88:24
Speaker A
або звіт говорячи про звіт можу навести приклад свого звіту він також доступний за посиланням під відео під цим курсом це є приклад того як можна оформити результати оцінки якості даних Отже ми описуємо наші дані які ми отримали таблиці ми надаємо їм таку саму
88:41
Speaker A
характеристику як надали з вами в файлі потім по кожній таблиці надається базовий опис того що вона відображає які до неї є питання які є сумніви які є відкриті питання так само тут можна зазначити ті колонки або значення які Ми
88:56
Speaker A
не розуміємо Це все можна відобразити в такому звіті далі наприкінці етапу оцінки даних ми надаємо тату таку матрицю оцінки якості даних де по кожному датасету по кожній таблиці відображаємо у загальне значення характеристику або оцінку певним параметрам якості даних Тобто ми не
89:17
Speaker A
просто в цілому оцінюємо якість даних а розбиваємо якість даних на деякі параметри наприклад точність повність послідовність актуальність релевантність даних валідність даних або унікальність даних і така таблиця відображає результат оцінки кожної таблиці по кожному з таких параметрів якості даних
89:35
Speaker A
це можна брати як приклад можна зменшити або збільшити кількість таких параметрів або навести більш деталізовану оцінку для кожного з таких параметрів надаються висновки і в кінці надаються рекомендації по покращенню якості даних тому що ми бачили що деякі колонки не
89:51
Speaker A
заповнюються Можливо ці поля можна зробити обов'язковими для заповнення для майбутніх клієнтів інші рекомендації це все має бути оформлене в такому звіті або в презентації Це виведе ваш проект на новий рівень Отже закликаю вас попрацювати над таким документом або
90:07
Speaker A
зробити презентацію і узагальнити всі дії які ми зробили протягом підготовки наших даних А ми далі рухаємося до трансформування наших даних отже як і очікувалося ми переходимо з етапу підготовки та очищення наших даних до етапу трансформування наших даних і ми почнемо
90:28
Speaker A
з формул адже жоден аналітичний звіт або дешборд не обходиться без розрахунків без впровадження агрегацій розрахунку різних метрик тощо і в формулах ми використовуємо функції я нагадаю що на закладці вставлення є перелік всіх функцій з детальним описом рекомендаціями до впровадження це дуже
90:45
Speaker A
зручно але нам В нашій роботі в аналітиці даних саме в цьому проекті не потрібно багато функцій ми будемо використовувати тільки найбільше актуальні вживані та розповсюджені формули Зараз подивимось переходимо на таблицю transactions Clean і знаємо що по кожній транзакції надається вартість
91:03
Speaker A
каталогу і стандартна вартість Отже ми можемо Розрахувати прибуток для цього я обираю колонку стандартна вартість вставляє одну колонку нову справа назвемо її профіit і розрахунок дуже простий це різниця між каталог вартість та стандартною вартістю бачимо інструмент який називається
91:22
Speaker A
автозаповнення погоджуємося і і отримаємо розраховану прибутковість по кожній транзакції подивимось фільтри чи виглядають дані адекватно наче так питань немає Отже перед тим як почати далі аналізувати цю таблицю хотілося б мати більше даних адже ми знаємо що по кожній транзакції У нас є наприклад ID
91:40
Speaker A
продукту якщо б у нас була б таблиця з продуктами ми б знали би характеристики цього продукту що це за продукт що це за товар але в нас таку інформації немає Натомість ми маємо ID нашого замовника і ми знаємо що по замовниках У нас є
91:52
Speaker A
інформація про х стать про Їх вік про їх роботу і так далі ми могли б підтягнути ці дані сюди для того щоб потім розробляти візуалізацію і шукати цікавій інсайт давайте перейдемо до таблиці customers отже по кожному замовнику ми
92:07
Speaker A
маємо дані щодо статі кількості покупок дати народження індустрії це все нам цікаво Ми хочемо це перевести в таблицю транзакцій давайте спочатку розрахуємо вік наших замовників це буде Набагато зручніше для об'єднання їх для сегментації їх в подальшому і в нас для
92:21
Speaker A
цього є певні формули і функції назвемо колонку Age і застосуємо функцію яка називається Date divf Ось вона це різниця дат тобто яка різниця між стартовою датою кінцевою датою і яких одиницях вимірювання тобто різниця в днях або в тижнях або в місяцях або в
92:38
Speaker A
роках виглядає досить просто Ми обираємо стартову дату Це дата народження нашого замовника кома далі кінцева дата Ну давайте зробимо сьогоднішню і кожного дня ця формула буде повертати оновлений результат Отже різниця між датою народження та дато Яка є сьогодні за це
92:55
Speaker A
відповідає функція Today кома і Unit Ми хочемо отримати різницю в роках тому відкриваю лапки і велика y літера дозволяє мені вказати що різниця має бути в роках погоджуємося бачимо автозаповнення знову таки погоджуємося і ми отримали вік наших замовників давайте
93:14
Speaker A
додамо цей вік до фільтрів і побачимо що наймолодшим замовником 22 роки в той час коли найстаршим 124 роки ну це виглядає як викид давайте подивимось на ці дані трошки ближче обираю тільки 124 і бачу що таким чином було розраховано вік для
93:31
Speaker A
замовників які не вказали свою дату народження Отже в нас є проблема з якістю даних яку ми не вирішили на попередньому етапі і зараз від цього Трошки страждаємо так само я бачу що ці замовники не надали інформацію щодо статі отже є частина замовників які не
93:45
Speaker A
надали всю інформацію але ми все ж таки знаємо в якій сфері наприклад Вони працюють чи володіють вони автомобілем Тобто я не хотів би їх втрачати зі свого аналізу просто видаливши цю вибірку натомість пропоную замінити їх дату народження на середню дату народження
94:01
Speaker A
нашої категорії тобто Їх вік на середній вік наших замовників це буде принаймні справедливо давайте приберемо фільтри і подумаємо Як це зробити Ну в першу чергу давайте подивимось який у нас середній вік Отже я обираю колонку вік розраховану і ми знаємо
94:18
Speaker A
інструмент який називається статистика по колонці ми вже з цим працювали Отже бачимо розподіл 20 2 роки наймолодшим далі бачимо найбільш часто зустрічаються люди віком 40 тире 50 років і бачимо викид 124 роки дійсно виглядає неадекватно ми знаємо чому Це
94:38
Speaker A
помилка в якості даних давайте подивимось на статистику бачимо що у нас є середній вік 48 років і медіанний вік 47 років і ось тут питання Який з цих показників доречно використовувати в нашому власне випадку в чому В чому власне різниця
94:54
Speaker A
якщо я візьму трьох замовників одному 20 років другому 30 років третьому 40 років і оберу цих трьох замовників я побачув що у них є середній вік 30 років як і очікується і медіанний Вік так само 30 років тому що немає різниці якщо ми
95:11
Speaker A
просумуємо 20 30 і 40 поділимо на 3ри середнє арифметичне буде 30 так само якщо ми просто упорядочимо цей перелік відсортуємо його 20 30 40 і візьмемо середній 30 як значення перетягнемо його сюди це і буде наше медіанне середнє
95:29
Speaker A
Отже різниці немає в цьому випадку але якщо я зроблю третій вік 80 подивіться що відбувається у нас середнє значення 43 роки і це дивно виглядає тому що у нас з трьох замовників два замовники мають вік 30 включно а середній вік 43 Отже ми бачимо
95:48
Speaker A
як 80 перетягує на себе середнє арифметичне натомість медіани залишається 30 то тому що в цьому відсортованому переліку 20 3080 все ще 30 виглядає як середній вік Тобто це значення не чутливе до змін до таких outliers це викиди значень і ми знаємо
96:06
Speaker A
що наша колонка вік має викиди 124 і ми розуміємо що середнє арифметичне значення буде дещо вище за медіанне значення якщо ми просто поставимо поруч всі дані щодо віку наших замовників і візьмемо середній вік з цього переліку в описі під відео будуть посилання на
96:23
Speaker A
описовій статистики на теорію і як їх використовувати я не хотів на цьому багато зупинятися в цьому курсі але Сподіваюся ідея зрозуміла ми візьмемо 47 років як середній вік наших замовників і тепер я можу додати колонку Age Clean наприклад яка буде розраховуватися за
96:41
Speaker A
умови чи є у нас дата народження чи її немає Якщо у нас немає дати народження тобто функція if дата народження дорівнює лапки відкрили лапки закрили тобто якщо немає інформації по даті народження то ми беремо 47 років якщо у
96:59
Speaker A
нас дані все ж таки є тобто інший випадок Ми беремо розрахований вік відповідно до нашої формули додаємо автозаповнюємо і отримуємо вже нову вибірку я можу побачити тут що у нас немає більше викидів 124 роки ми цими замовниками дещо поповнили наш середній
97:17
Speaker A
вік який виглядає Ось таким чином і тепер коли я маю всі дані щодо наших замовників можна підтягнутиці дані до кожної транзакції що мене цікавить Мене цікавить стать людини Мене цікавить кількість замовлень за останні три роки Мене цікавить назва роботи індустрія
97:35
Speaker A
наявність чи відсутність автомобілю Та Вік який ми з вами розрахували Отже ctrl C для того щоб скопіювати заголовки переходжу до таблиці транзакцій і ось тут в кінці вставляю ці заголовки для того щоб їх заповнити і підтягувати Дані дуже просто з використанням надзвичайно
97:52
Speaker A
популярної формули та функції яка називається vlup тобто вертикальний пошук значень Ми шукаємо якісь значення в інших таблицях і підтягуємо їх в нашу таблицю як працює ця формула ми вказуємо що ми шукаємо Ми шукаємо customer ID кома далі ми вказуємо Де ми це
98:13
Speaker A
шукаємо Я переходжу до нашої таблиці customers Clean і обираю всіє ї колонки і можемо вказати від A1 до M Тобто всі дані які знаходяться в цьому діапазоні Ми так само можемо виділити цей діапазон і клавішою F4 або fn F4 в залежності від
98:33
Speaker A
ваших налаштувань надати цьому абсолютне посилання тобто знак долара перед кожною колонкою та рядком Отже що шукаємо де шукаємо кома як знайти який індекс у колонці яка нас цікавить нас цікавить Ender колонка Custom Реді Це перша колонка далі йде друга третя четверта
98:51
Speaker A
отже нас цікавить четверта колонка нашої таблиці тобто знаходимо тут ID нашого кастомера шукаємо четверту колонку підтягуємо це значення Єдине що потрібно додати це False після коми яке вказує що ми шукаємо повне співпадіння нас не цікавить орієнтовне співпадіння і наші переліки Не
99:12
Speaker A
відсортовані ну це є базова рекомендація до використання цієї формули Enter і бачимо що ми підтягнули ID нашого кастомера тепер якщо ми застосуємо цю формулу подвійним кліком до всі наших замовників ми побачимо з вами як дані заповнилися для кожного замовника де ці
99:29
Speaker A
дані взагалі існують Таким чином ми можемо з легкістю підтягнути наступні дані я можу скопіювати цю формулу але тепер посилатися не на четверту колонку а на п'яту колонку щоб знати наступне значення для цього замовника кількість придбаних товарів за останні Т роки Давайте перевіримо нашого
99:49
Speaker A
першого замовника наш перший кастомер 29 переходимо до нашої таблиці customer шукаємо 29 прибираю всі фільтри 29 застосуємо це і бачимо що Ender mail кількість покупок 19 це саме те що нам повертає наш наша формула Отже Таким чином можемо заповнити дані з однієї
100:15
Speaker A
таблиці в іншу таблицю маючи спільний ключ в даному випадку це customer ID Я запрошу вас самостійно застосувати цю формулу для кожного іншого атрибуту який ми хочемо мати і переходимо до наступного відео і зараз я хотів би дещо зупинитися
100:36
Speaker A
на тому що таке таблиця тому що те що виглядає для нас як таблиця У нас є рядки у нас є колонки для Google sheets ще не є таблицею і одна з найголовніших характеристик таблиць це те що кожна колонка має відповідати тільки за один
100:51
Speaker A
тип даних і ми не можемо це порушити це дуже важливе обмеження Тому що якщо я захочу щось змінити наприклад в даті транзакції я можу змінити це значення на чотири п'ятірки Я навіть не побачу зараз помилку тому що я просто змінив значення
101:05
Speaker A
в певній клітинці Хоча я суттєво змінив логіку цієї колонки і таке значення якщо воно з'явиться в моїх даних які автоматично оновлюються буде мати наслідки в подальші візуалізації цих даних тобто мої звіти впадуть я не зможу оновити звіт не побачивши низку проблем
101:21
Speaker A
пов'язаних саме з тим що у нас з'явився ось такий жук в наших даних і давайте подивимось на те як Google sheets пропонує нам переходити від сирих даних до таблиць перейдемо до нашої таблиці New customer list Отже сюди падають всі
101:36
Speaker A
наші нові замовники які відповідають напевно якісь опитування в нас з'являється по них дата Я думаю що згодом ми будемо накопичувати нових замовників тобто в кінці переліку будуть з'являтися нові замовники і зараз ніщо не обмежує мене в тому щоб вводити дані
101:50
Speaker A
з порушенням цієї вимоги одного типу даних для моєї колонки і для того щоб перетворити це в таблицю і правильно накопичувати інформацію і обмежувати користувачів в тому щоб не допустити потрапляння помилкових даних в наших таблицях є інструмент який називається
102:06
Speaker A
форматування таблиці для цього я обираю будь-яку клітинку нашого діапазону переходжу до форматування і обираю конвертування таблицю ми миттєво бачимо що було застосовано цілу низку різних заходів по відношенню до наших даних ну по-перше бачимо що наші заголовки відформатовано вони за морожені І власне
102:24
Speaker A
сама таблиця відформатована і можна точно сказати що її читабельність підвищена в нас є фільтри за замовчуванням в принципі ми можемо працювати з цим так само як працювало до цього але тепер ми можемо починати закладати ці обмеження ось наприклад
102:39
Speaker A
дата народження має бути датою тому Я переходжу до меню колонки і обираю тип даних дата тепер я бачу значок що символізує дату Я також можу обрати тут в меню функцію показати плейсхолдери для чого це для того щоб коли я буду вводити
102:56
Speaker A
нового замовника переходячи в кінець переліку Я вже бачив формат даних який має бути якщо я порушу Цей формат буде помилка яка буде вказувати на невідповідність типів даних Тобто це власне те обмеження про яке ми вже говорили і так само я можу накладати
103:14
Speaker A
обмеження на будь-яку колонку наприклад колонка Ender - це текст колонка кількість купівель за останні три роки - це числові значення мають тут бути і Ось таким чином ми налаштовуємо нашу таблицю з врахуванням таких важливих обмежень Ми також можемо накладати обмеження
103:30
Speaker A
безпосередньо самих значень Ну ми знаємо що колонка gender представлена трьома значеннями це чоловіки жінки та невказане значення і ми можемо в налаштуваннях типів даних вказати випадаючий список Таким чином ми обмежимо користувача в наданні інформації це може бути тільки три
103:48
Speaker A
варіанти які нам підходять можемо створити якісь кольорові рішення для наших категорій застосувати і побачити що тепер у нас можливість вводити для нового замовника будь-які дані обмежена випадаючим списком і ми не допустимо щоб невідповідні дані потрапили до нашого датасету Ми так само можемо впровадити
104:07
Speaker A
це для всіх інших категорійних колонок тобто колонок де є повторювані значення Ну наприклад WS segment так само може бути представлений випадаючим списком Отже переходимо до меню колонки і обираємо випадаючий список налаштовуємо кольорові рішення які Нам подобаються і застосовуємо наше
104:27
Speaker A
правило наше обмеження І взагалі іноді в аналітиці даних навіть не потрібно розробляти візуалізацію іноді достатньо таблиці але таблиці яка легко читається з нею комфортно працювати налаштовані фільтри є можливість групувати елементи впроваджувати випадаючі списки і так далі тому частину роботи ми вже зробили
104:45
Speaker A
У нас є накопичення інформації по нових клієнтах у вигляді ось такої смарт таблиці скажімо і можемо додавати сюди функціонал Зараз ми бачимо всі наші значення а ми можемо згрупувати цю таблицю по різних значеннях Ну ось наприклад У нас є Job Title тобто
105:01
Speaker A
замовники вказували назву своєї посади Ми можемо перейти до меню нашої колонки і обрати варіант згрупувати за цією колонкою Подивіться як виглядає таблиця тепер у нас є по кожному окремому Job Title інформація я яка міститься в нашій таблиці це дуже зручно для звітності для
105:21
Speaker A
відстеження певних категорій ми групували дані ми можемо зберегти це як групування по посаді Я зберігаю це тут і тепер Ось тут в меню нашої таблиці яку так само можна перейменувати тут можна обрати це групування для подальшого аналізу Тобто ми можемо перейти до всієї
105:39
Speaker A
таблиці а або ми можемо обрати згрупований варіант який самостійно створюємо для нас або для наших замовників це теж дуже важлива характеристика якщо ми хочемо закінчити працювати в форматі цієї таблиці нам не подоба Ми хочемо повернутися в наш варіант ми переходимо ось сюди в меню і
105:57
Speaker A
обираємо варіант повернутися до не відформатованих даних Таким чином ми повернемося до нашої таблиці але я пропоную залишити цей варіант для того щоб зручно накопичувати в подальшому інформацію і це жодним чином не впливало негативно на нашу подальшу візуалізацію і ми переходимо
106:20
Speaker A
далі перед тим як переходити до теми зведених таблиць яка є ключовою в темі трансформації даних я хотів би поговорити ще про закладку дати яку ми вже частково використовували Але не всі можливості якої вже для себе відкрили починається ця закладка з сортування
106:37
Speaker A
нашого аркушу далі ми можемо перейти до керування фільтрами і можемо створювати згруповані перегляди наших таблиць це власне те що ми до цього робили коли працювали з форматованими таблицями впізнаємо мені це не потрібно наразі тому я просто перехо жу до повернення до
106:54
Speaker A
неформатованих даних але це досить швидкий спосіб перейти до такої таблиці так само можемо створювати фільтрvw що теж дуже корисно Отже якщо я хочу побачити тільки sollex брен в моїй таблиці даних я створюю відповідний фільterр viw я можу його зберегти
107:11
Speaker A
назвати його sollex БН І тепер у мене в Data є можливість працюючи з цією таблицею переходити до різних вже створених переглядів цієї таблиці рухаємося далі наступним цікавим елементом закладки Data є слайсеer слайсеer - Це фільтр який може приєднатися до будь-якої колонки моєї
107:30
Speaker A
таблиці Ось тут в налаштуваннях слайсера я можу обрати колонку наприклад той самий бренд і тепер слайсер відображає всі бренди моєї таблиці і обравши будь-який з них я отримую інформацію по цьому бренду Тобто це фільтрування моєї таблиці але з використанням такого
107:46
Speaker A
зовнішнього об'єкту який буде впливати на дані нашої таблиці і ще один цікавий елемент закладки Data це функції яки ми надаємо імена ми можемо створити власну функцію Ось тут в меню надати її ім'я Я пропоную порахвати кількість днів що
108:01
Speaker A
минули з моменту цієї транзакції ми назвемо цю функцію number of Days додамо стислий опис того що ця функція буде виконувати в нашому випадку вона буде розраховувати кількість днів з моменту транзакції І у цієї функції має бути аргумент як вона буде рахувати потрібно
108:20
Speaker A
передати безпосередньо день транзакції створюємо наш аргумент і наша функція буде виглядати таким чином це Date divf функція з якою ми вже знайомі і передати потрібно transaction Date Кома Ми знаємо що ми використовуємо функцію Today для того щоб функція завжди відображала
108:45
Speaker A
актуальний результат на сьогоднішній день і на цей раз в одиницях вимірювання вкажемо кількість днів Тобто D закриваємо дужки створюємо нашу функцію Давайте спробуємо її застосувати Отже Я переходжу до моєї таблиці тут в мене буде кількість днів і я готовий
109:03
Speaker A
впровадити свою функцію Отже дорівнює наша функція називається number of Days і ось вона запропонована нам як наша кастомна функція обираю її бачу що потрібно передати лише один аргумент це буде день транзакції знаходимо день нашої транзакції закриваємо дужки все
109:19
Speaker A
інше функція відпрацює відповідно до створеного нами шаблону і бачимо що ця функція повертає кількість днів починаючи з дня транзакції і завершуючи сьогоднішнім днем це теж може бути в нагоді і тепер коли ми попрацювали з формулами з фільтрами з таблицями ми
109:36
Speaker A
можемо переходити до надважливої теми зведених таблиць тема зведених таблиць є надзвичайно важливою На цьому етапі і ми побачимо як з використанням декількох кліків можна повністю транс вати наші таблиці але зараз давайте подивимось Навіщо нам це адже у нас є таблиця з
109:57
Speaker A
якою ми працюємо Справа в тому що ця таблиця добре працює лише для накопичення інформації ми можемо з легкістю додавати нові транзакції з характеристиками з атрибутами накопичувати аж допоки вистачає ресурсу нашого інструменту Ми також можемо фільтрувати ці таблиці і бачити якусь
110:14
Speaker A
обмежену інформацію по цій таблиці шукаючи якісь певні інсайти Але у аналітиків зазвичай виникає дуже багато запитань на які не може відповісти ця таблиця Ну ось я бачу що у нас є різні бренди Я запитую За який відсоток продажі відповідає бренд sollex або мене
110:29
Speaker A
цікавить які були середні продажі в січні у бренду Track bicycles в розрізі кожного з різних класів продуктів окремо по medium окремо по Low окремо по High тобто я починаю аналізувати дані у мене виникають запитання і ця таблиця не може
110:43
Speaker A
на них відповісти тому що для того щоб порахувати щось потрібно це десь порахувати провести певні агрегації по відношенню до різних категорій і ми зараз без цієї теорії побачимо як це працює з інструментом pivot tables зведені таблиці я обираю будь-яку
110:59
Speaker A
клітинку нашого діапазону переходжу до вставлення І знаходжу інструмент pivot table перевіряю чи актуальний діапазон нашої оригінальної таблиці так і на новому аркоші ми будемо створювати таку зведену таблицю зараз тут нічого немає таблиця очікує на наші дії тут є меню
111:16
Speaker A
якщо воно буде закрите ми все одно можемо перейти до меню навести мишкою на зведену таблицю і йти до меню налаштувань ось тут у нас тут вже є певні рекомендації Але ми не будемо на цьому зупинятися ми будемо повністю з
111:29
Speaker A
нуля створювати нашу зведену таблицю що означає створювати Подивіться тут є рядки колонки значення і фільтри якщо придивитися це те що характеризує будь-яку таблицю вона складається з рядків колонок на перетині яких є певні значення і все це можна змінювати з
111:47
Speaker A
використанням фільтрів і ось я бачу всі наші колонки нашої оригінальної таблиці якщо я захочу додати щось я можу натиснути кнопку Add або я можу перетягнути те що мене цікавить Ну наприклад я можу перетягнути всі мої транзакції в блок рядків я побачу кожен
112:06
Speaker A
день окремо це унікальні дні ми знаємо що в наша таблиця зберігає транзакції по кожному дню Але кожного дня можуть бути декілька транзакцій або багато транзакцій тут ми вже готові відносити їх до кожного дня окремо і що я хочу
112:19
Speaker A
порахувати для кожного дня Ну наприклад прибуток тобто Я переходжу до моїх колонок шукаю профіт перетягую до значень Я хочу щось розрахувати якщо я хочу розрахувати це блок значень і в мене є функція сум сума тобто Я рахую сумарний прибуток по відношенню до
112:39
Speaker A
кожного дня я можу відмовитися від тренду по часу Да я можу прибрати день транзакції і сказати добре що у мене є сумарний прибуток але я хочу відносити його до різних брендів тому я беру бренди і перетягую до рядків і тепер моя
112:54
Speaker A
таблиця виглядає зовсім інакше це бренди унікальні по кожному з яких є сумарний прибуток за весь час за всі дані які у мене є в оригінальній таблиці я можу показувати сумарні значення ось тут можу відмовлятися від цього але ця таблиця
113:10
Speaker A
вже відповідає на запитання я можу відсортувати все це по прибутку починаючи з найбільшого прибутку Я бачу що у нас є декілька лідерів і є один аутсайдер ми вже можемо говорити про про динаміку продажі в розрізі різних брендів це Ми тільки побудували таблицю
113:27
Speaker A
з використанням рядків та значень ми можемо додавати і колонки тобто не просто порахувати кількість значень для кожного бренду а порахувати їх в розрізі наприклад класів продуктів у нас є різні класи продуктів якщо я перетягну клас продуктів до колонок або іншим способом
113:44
Speaker A
я додам з використанням кнопки клас продуктів сюди в колонки я побачу клас продуктів там де очікується в колонках і тепер по кож кожній колонці це різні класи продуктів Я бачу як продавалися різні бренди Отже я відразу бачу що один
113:59
Speaker A
з брендів не продається в сегменті High а тільки в Low і medіum наш інший Фаворит бренд sollex бачимо що його продажі в сегменті теж не дуже великі тому що є інші бренди які продаються більше в цьому сегменті але ми бачимо що
114:14
Speaker A
ці бренди явно лідери в сегменті medідiumм Ну ми можемо робити певні висновки змінюючи цю таблицю знову ж таки можемо додавати або прибирати підсумкові значення окремо для колонок окремо для рядків і можемо продовжувати змінювати цю таблицю змінювати запитання до даних бачити різні інсайти можемо
114:34
Speaker A
можемо відмовитись від колонок які відображають продукт клас А перетягнути продукт клас до рядків подивіться що буде тепер у нас рядки представлені не тільки брендами але й по кожному бренду ієрархічно представлені різні продуктові класи наша таблиця змінилася Ми можемо з легкістю
114:51
Speaker A
приперебрати це і поба бачити нашу первинну таблицю брендів і сумарного профіту Ми також можемо додавати значення і в розрахункові значення я можу додати окрім прибутку наприклад вартість з каталогу так само сумарна вартість буде показана тут можна змінювати місцями для змінення
115:10
Speaker A
відображення цих метрик можемо додати ще наприклад кількість транзакцій тобто не тільки прибуток оцінювати але й кількість закупівель кількість транзакцій Отже Я додаю кількість транзакцій їй потрібно рахувати так само як і прибуток до кожного бренду ну використовуючи в даному випадку ID
115:27
Speaker A
транзакції Отже Я додаю ID транзакції і бачущо за замовченням у мене сума ID транзакцій ну ID транзакцій - це 1 2 3 4 5 рахувати суму немає жодного сенсу можемо обрати агрегацію яку будемо використовувати в даному випадку я хочу
115:42
Speaker A
кількість і ось кількість транзакцій прибуток та вартість сплачена по кожному бренду по даних які в нас містяться так само У нас є ще один елемент Керу зведеними таблицями це фільтри можемо додати якийсь якусь колонку Да в якості фільтру можемо спробувати додати колонку
116:00
Speaker A
дати в якості фільтру і побачити наші різні дати можна обирати ту чи іншу дату і бачити власне результат Таким чином ми використали всі елементи зведеної таблиці і побачили наскільки різноманітними можуть бути наші таблиці і мінус зведених таблиць в тому що є
116:17
Speaker A
дуже велика Спокуса їх ускладнювати Отже ми можемо додати prodдуct Line до наших рядків ми можемо створити колонки з використанням product size наприклад можемо створювати створювати і створювати і просто загубитися в цьому дуже важливо для зведених таблиць спочатку розробляти запитання до даних
116:36
Speaker A
на яке Ми хочемо знайти відповідь і потім відповідати на нього Отже я прибираю все що ми зробили і хочу повернутися до простого запитання як продавалися різні бренди в розрізі різних категорій наших товарів Отже бренди йдуть до рядків для кожного
116:52
Speaker A
бренду Я хочу побачити прибуток перетягую профіт до значень і в колонках Я хочу відобразити різні категорії товарів наприклад колонка product Line і таким чином я бачу бренди як вони продавалися в розрізі кожного з категорій я можу прибрати підсумкові
117:11
Speaker A
рядки та колонки і ця таблиця надає інсайти з цією таблицею легко працювати що ми ще можемо зробити зі зведеною таблицею Так це швидко побудувати візуалізацію тому що ми вже отримали ці дані вони виглядають так наче вони готові бути частиною графіку я можу
117:29
Speaker A
виділити ці дані закладка вставлення обираю візуалізацію і дивлюся на запропонований Google sheets варіант візуалізації наших даних отже по кожному бренду я бачу продаж причому легенда дозволяє мені побачити що саме відображено Отже для кожного бренду ми показуємо продаж по всіх наявних
117:49
Speaker A
категорій товарів в наступних відео Ми попрацюємо з різни зведеними таблицями і почнемо будувати інтерактивні візуалізації для того щоб розробити аналітичний дашборд Але кожного разу коли ми це будемо робити Спершу ми будемо задавати питання до даних потім розробляти просту компактну але дуже
118:07
Speaker A
зрозумілу зведену таблицю і потім будемо приєднувати до неї ось таку візуалізацію в чому перевага такого методу в тому що ця зведена таблиця як оця візуалізація пов'язані напряму з нашими даними якщо в наших даних з'являється новий бренд нова транзакція новий бренд назвемо цей бренд
118:26
Speaker A
New я можу перейти до нашої зведеної таблиці і побачити що вона вже бачить і відображає цей бренд адже по нашому бренду New є вже одна транзакція яку Ми щойно змінили на 17 долаів і кожного разу коли дані будуть оновлюватися на
118:41
Speaker A
джерелі вони будуть оновлюватися в нашій таблиці транзакцій і в свою чергу оновлюватися на нашій візуалізації Таким чином ми будемо мати постійно актуальні дані переходимо до роробки інших візуалізацій ми з вами побачили як з використанням фільтрів формул слайсерів введених таблиць ми можемо
119:06
Speaker A
трансформувати наші дані і це підводить нас до аналітики даних тому що у нас є запитання до даних ми трансформуємо їх отримаємо більш сприятливу для аналітики інформацію і починаємо з нею працювати і одним з етапів роботи з даними є їх
119:20
Speaker A
візуалізація вона допомагає нам побачити інсайти тренди зрозуміти дані краще Отже ми з вами в цьому відео будемо працювати над зведеними таблицями розробляти багато різних таблиць під кожну з яких будемо підлаштовувати відповідну візуалізацію подивимося Які в нас є можливості в цьому інструменті а в кінці
119:37
Speaker A
зведемо візуалізацію до одного аналітичного дашборду який буде інтерактивним динамічним будемо впроваджувати слайсери адже те що ми вже пройшли в межах цього курсу дозволяє нам розробляти такі інструментиже переходимо до нашої таблиці transactions Clean і ми знаємо що я можу впровадити нашу зведену
119:55
Speaker A
таблицю вставленням зведеної таблиці ось тут це буде новий аркуш я назву його dashбор Отже почнемо поступово розробляти зведені таблиці і візуалізацію потрошки більше знайомитися з нашими даними і Враховуючи те що це онлайн-магазин це продажі це статистика за певний час цікаво побачити динаміку
120:16
Speaker A
продажі в часі ми знаємо як це зробити Ми можемо обрати дати наших транзакцій розмістити їх в рядках прибрати підсумкові рядки і розрахувати наприклад прибуток як значення для відображення для кожного дня Ми так само можемо правою кнопкою миші обрати будь-яку дату
120:34
Speaker A
і перейти до групування наших об'єктів і згрупованою датою може бути місяць квартал рік Я наприклад хочу бачити дані згруповані по місяцях Я знаю що в мене повний календарний 2017 рік відображених даних Отже якщо я згрупую по місяцях Я
120:50
Speaker A
побачу як загальний прибуток тепер відноситься до кожного місяця наших даних це дуже зручно для подальшої візуалізації як Такі дані можна візуалізувати Ми обираємо весь діапазон переходимо до вставлення графіку і давайте подивимось графік який за замовчуванням рекомендується для впровадження це лінійча та діаграма і це
121:09
Speaker A
дуже зручний спосіб показувати тренди Коли у нас на горизонтальній осі на осі є певний проміжок часу і ми відстежуємо змінення якогось індикатору в даному випадку прибутку Ми можемо перейти до налаштування візуалізації і побачити різні інші варіанти демонстрації трендів
121:26
Speaker A
тобто окрім лінічних діаграм можна показати тренди стовчастими діаграмами є також Area Chart яка так само буде виконувати функцію трендів і в принципі враховуючи наші дані нічого не буде змінюватися Це просто різні способи відображення одного і того самого явища
121:42
Speaker A
динаміки змінення продажів в часі але ми можемо трошки розвивати цю візуалізацію Наприклад якщо ми хочемо додати ще одну метрику для відстеження тобто для кожного місяця окрім прибутку давайте подивимось ще й на кількість транзакцій кількість продажів я переношу в розділ
121:59
Speaker A
значень нову колонку транзакцій тут потрібно бути уважним адже потрібно агрегувати кількісно транзакції сума транзакцій нас не цікавить Отже тепер у нас є дві колонки дві метрики наша візуалізація не оновлена тому що вона все що працює з попереднім діапазоном я
122:16
Speaker A
ходжу в налаштування і ось тут можу з легкістю адаптувати візуалізацію до нашого нового діапазону обираю всі значення не бачу жодних змін але в налаштуваннях ще потрібно попрацювати ми бачимо що в нас є дати але демонструємо ми лише прибуток ми можемо додати те що
122:33
Speaker A
ми додали в нашу таблицю це кількість транзакцій і побачити що дійсно тепер у нас з'явилася кількість транзакцій ми її демонструємо але побачити її важко тому що в нас є колонка яка показує прибуток це сотні мільйонв доларів є ще одна
122:48
Speaker A
колонка яка показує одну або 2 000 транзакцій В той самий період часу дуже важко це співпідставити та проаналізувати тому є можливість комбінувати це подивіться у нас є комбінована візуалізація Отже стовпчаста діаграма буде візуалізувати тренд продажів а лінійчна діаграма Може на той
123:05
Speaker A
час показувати тренд кількості продажів Як це зробити потрібно перейти в налаштування цієї візуалізації знайти можливість адаптувати наші категорії обрати категорію для якої ми хочемо впровадити зміни в нашому випадку це кількість транзакцій і розмістити кількість транзакцій справа тобто Ми
123:23
Speaker A
створюємо другу вертикальну вісь і у нас є можливість співпідставити тепер ці значення ми бачимо тренд продажів у часі і ми можемо узагальнити що зменшення продажів як правило супроводжується падінням кількості транзакцій і ось така динаміка таке співпідставлення може надати дуже цікаві інсайти і корисні
123:43
Speaker A
Висновки до нашого аналізу давайте подивимось на інший варіант відображення трендів на цей раз я не хочу показувати транзакції Я хочу показати порівняння За продажів і прибутку Отже транзакції мені більше не потрібні я обираю в значення додати ще загальний продаж або наприклад
124:02
Speaker A
собівартість навіть краще буде показати собівартість я перенесу її трошки вище У нас є собівартість У нас є прибуток і тепер я хочу змінити тип діаграмиже переходжу до коригування діаграми і обираю замість комбінованої діаграми ось таку стовпчасту діаграму Я так само буду
124:19
Speaker A
показувати тренд на цей раз Мені не потрібно мати дві осі y достатньо однієї тому ми повертаємося до наших категорій обираємо те що ми змінювали категорію якого відображення було справа і повертаємо зліва це відображення Ми також можемо змінити Адже у нас є
124:35
Speaker A
можливість замість такої простої стовпчастої діаграми отримати накопичення значень Тобто ми бачимо що у нас є частина собівартості і частина прибутку і Досить дивно як для динаміки продажів виглядає ситуація коли у нас собівартість приблизно дорівнює прибутку але я бачу що дані відображають саме
124:52
Speaker A
таку тенденцію можливо додатковий аналіз потрібен давайте перейдемо до наших транзакцій подивимось на значення Я бачу що маючи 71 $ вартість в каталозі можемо перебрати 53 $ як собівартість і отримати 17 $в прибутку але для 1700 $ вартості певного товару собівартість
125:14
Speaker A
лише 248 $ Отже 100 $ прибутковість такої транзакції звичайно для того щоб зробити повноцінні висновки Нам потрібно більше контексту Чи правильно ми розуміємо дані наскільки це реалістично про це потрібно поговорити з замовником або з представниками або з колегами таку
125:31
Speaker A
ситуацію бажано уточнити але принаймні ми можемо казати що наша візуалізація повністю відповідає даним і вдображає їх актуальними Отже пропоную поки що залишити цей графік і перейти до інших типів діаграм і поговорити про те як ще можна показати наші дані у вигляді
125:48
Speaker A
візуалізації ми бачимо що наступною категорією є стовчасть діаграми причому є горизонтальні є вертикальні Давайте поговоримо про них вони зазвичай використовуються для того щоб показувати категорії Ну що я маю на увазі ми переходимо до нашої таблиці транзакцій і знаємо що ми продаємо товари різних
126:05
Speaker A
брендів У нас є декілька брендів у кожному з яких так само можна спостерігати загальний продаж загальну кількість транзакцій або загальну кількість замовників Це все можна віднести до кожної категорії кожного бренду тому я впроваджую нову зведену таблицю але на цей раз я хочу розмістити
126:21
Speaker A
її на аркуші де ми вже працюємо це аркуш dashборд Отже я оберу будь-яку клітинку тут знизу і вставлю сюди нову зведену діаграму тут ми хочемо відобразити наші бренди Отже я в рядках показую бренди і для кожного бренду Давайте так само
126:36
Speaker A
покажемо загальний прибуток тобто в розділі значень обираємо профіт колонку прибираємо підсумкові значення обираємо діапазон знову ж таки і вставляємо нову візуалізацію на цей раз з використанням стовпчастої діаграми саме вона за замовчуванням і пропонується нам тобто У нас є по кожній категорії загальний
126:56
Speaker A
продаж і це надзвичайно ефективний спосіб порівняти вже агреговані дані Ми можемо відсортувати цей перелік ось тут використовуючи сумарний продаж за зростанням або збільшого продажу до меншого і побачити наших лідерів наших аутсайдерів окрім такого відображення ми можемо також обрати варіант вертикальної
127:15
Speaker A
стовпчастої діаграми Отже тут замість горизонтального відображення обираємо вертикальну і так набагато краще можна ба бачити назви категорій особливо коли в нас великі назви категорій їх важко розмістити Ось тут в горизонтальному виконанні і Ми обираємо саме таку візуалізацію вона дуже ефективно агрегує
127:32
Speaker A
дані по різних категоріях До речі якщо ми побачимо інші типи діаграм окрім топчастих діаграм в горизонтальному та вертикальному виконанні ми можемо знайти ще одну дуже схожу на них діаграму яка називається гістограма і це трошки різні види візуалізації і вони
127:48
Speaker A
використовуються з різною метою Отже гістограму ми використовуємо для того щоб побачити розподілення що я маю на увазі ну переходимо до нашої таблиці транзакцій ми знаємо що у нас є люди різної вікової категорії ми порахували їх вік я обираю цю колонку я можу
128:03
Speaker A
побудувати гістограму побачити розподіл людей різного категорії різного віку за кількістю транзакцій як це буде виглядати ми вставляємо візуалізацію прямо тут нам пропонується стовпчиста діаграма яка намагається показати нам цей розподіл Але якщо ми перейдемо до гістограми ми побачимо дещо інший
128:22
Speaker A
варіант ми побачимо що всі наші люди ось тут Їх вік ось тут і кількісно ми можемо бачити яка категорія вікова зустрічається частіше за інших і ми можемо керувати категоріями можемо сформувати з них певні діапазони Як це зробити я обираю всі наші вікові
128:39
Speaker A
категорії переходжу до налаштування самої гістограми в розділі налаштувань і ось тут я можу обрати розмір категорії тобто наприклад 10 років тепер я бачу скількилю людей з 20 до 30 років Скільки з 30 до 40 років скільки людей є
128:56
Speaker A
представниками вікової категорії з 40 до 50 і так далі ми можемо керувати ось такими категоріями групувати їх і бачити розподіл людей за віком тобто Таким чином розуміти Хто наші замовники яка вікова категорія зустрічається найчастіше серед замовників нашого онлайн-магазину за це відповідає
129:13
Speaker A
гістограма тут я її приберу вона нам не потрібна переходимо далі до розробки наступних візуалізацій Якщо я перейду до іх графіків які на пропонується наступним є piechart він нам знайомий дуже давно ми його часто використовували раніше сьогодні він не так часто
129:28
Speaker A
використовується тому що він не дуже зручний коли мова йде про кількість категорій чотирип'ять або більше ось наприклад наша візуалізація яка зараз дуже точно показує дані по кожній категорії я можу додати сюди підписи даних Можу показати який це відсоток яке
129:43
Speaker A
значення відповідає цьому бренду і я зможу потім порівняти ці дані для цього року і наступного року наприклад коли я перейду до візуалізації в piechart я побачу діаграму яку дуже важко аналізувати потрібно читати кожний підпис тому що на око не завжди зручно
129:59
Speaker A
сказати де більше де менше а ОЖ Тим паче Якщо ми будемо порівнювати таку візуалізацію з подібною візуалізацією але для наступного року і намагатися зрозуміти як змінилася ситуація це дуже важко натомість Коли у нас буде дві візуалізації у виконанні стовпчастої
130:14
Speaker A
діаграми поруч для різних років ми побачимо з вами різницю тому що вона буде підписана буде відноситися до до кожного рядка цієї візуалізації це дуже легко в роботі Отже ми не дуже часто використовуємо piechart для таких візуалізації але у нас є невелика
130:31
Speaker A
кількість категорій Ну ось наприклад переходячи до транзакцій Я знаю що у нас всі транзакції можна умовно розділити на транзакції онлайн та транзакції олайн або транзакції approved Та транзакції canceled ось давайте візьмемо одну категорію наприклад онлайн та олайн і
130:48
Speaker A
покажемо цей розподіл тобто частку кожної категорії загальній кількості транзакцій знову формуємо нову зведену таблицю перенесемо її на наш аркуш dashборд трошки нижче і нас цікавить кількість транзакцій онлайн та кількість транзакцій олай Отже у нас є онлайн ордер в рядках невідомий True або False
131:14
Speaker A
В нас так само є кількість транзакції яку можемо розрахувати тут у значеннях підрахувавши кількість ID наших транзакцій ми бачимо цей розподіл і тепер я можу виділити цей діапазон і вставити нашу візуалізацію у вигляді pйchart причому за замовчуванням на цей
131:30
Speaker A
раз мені надається знову ж таки стовпчаста діаграма Давайте спробуємо побачити це на pйchр трошки простіше буде порівняти трошки простіше буде орієнтуватися в цих значеннях також можемо прибрати невідому секцію невідому категорію тому що вона досить мала у порівнянні з іншими
131:47
Speaker A
транзакціями У нас є тут розділ фільтрів тому я можу додати саме онлай orderрфільтр але прибрати цю невизначеність з нашої візуалізації цей фільтр застосовано до моєї таблиці і до моєї візуалізації окрім Pie Chart Ми також можемо використовувати donat Chart
132:04
Speaker A
Ось тут в налаштуваннях можемо знайти таку можливість і такий пончик так само можна побачити у використанні і часто тут розміщується певна іконка тобто можемо розмістити щось що підказує нам додає контексту до цієї візуалізації ми можемо вставити картинку ось ось тут
132:23
Speaker A
знайти картинку яка нам потрібна Ну я введу наприклад шопінг знайти якусь рандомну картинку і вставити її точніше інтегрувати її в нашу візуалізацію і таке часто можна побачити в аналітичних ітах та дашбордах Отже Таким чином ми можемо розвивати оформлення наших
132:40
Speaker A
візуалізацій перейдемо далі до наступних типів діаграм які пропонуються інструментом і бачимо що після pchart можна використовувати точкову діаграму це дуже зручний спосіб показувати чи змінення однієї метрики супроводжується зміненням іншої метрики Тобто це порівняння зміни двох числових значень буде простіше подивитися на прикладі що
133:02
Speaker A
у нас є в даних ну ми знаємо наприклад що кожна транзакція кожен замовник який до цієї транзакції відноситься може бути охарактеризований з використанням ось такого показника кількість покупок за останні три роки Отже ми маємо динаміку продажів протягом одного року але за три
133:18
Speaker A
роки до цього у кожного замовника були якісь прид придбання пов'язані з нашим онлайн-магазином з нашими товарами і ось цікаво чи люди які мали більший досвід придбання товарів в цьому році купляли більше в нашому онлайнмагазині чи це взагалі якось пов'язано давайте
133:33
Speaker A
подивимось Я можу вставити нову зведену таблицю У нас є для цього місце на нашому аркуші dasшборд десь тут і що ми маємо У нас є кількість покупок за останні три роки які я можу відобразити у вигляді рядків всіх наших замовників
133:49
Speaker A
можна умовно розділити на тих хто жодного разу нічого не придбав за останні три роки перед нашою статистикою перед 17-м роком А є ті замовники які мають велику історію купівель товарів нашої категорії Отже Ми хочемо співпідставити яка кількість покупок
134:05
Speaker A
була у замовника з тим скільки грошей Він приніс в нашу компанію В наш онлайнмагазин Отже я можу співпідставити це з вартістю транзакцій яка була які були здійснені кожним з цих замовників Отже моє питання чи збільшення історії покупок замовника показ зазвичай
134:22
Speaker A
збільшення загального чеку не знаємо давайте оберемо всі наші дані і як завжди вставимо візуалізацію нам пропонується Ось така стовпчаста діаграма але ми хочемо спробувати тип який називається точкова діаграма ось тут давайте подивимось що ми бачимо Отже у нас горизонтальна вісь показує
134:41
Speaker A
змінення кількості покупок за останні три роки на той час коли вертикаль показує змінення чеку тобто змінення вартості транзакцій які спостерігалися для цієї категорії людей і ми бачимо що в принципі кожна категорія людей майже незалежно від того яка кількість покупок
134:57
Speaker A
Була здійснена Протягом останніх трьох років представлена абсолютно різними чеками Тобто ми маємо серед покупців тих у кого кількість покупок вісім і сумарний чек за цей час за останній рік 124 000 Ми так само маємо тих у кого кількість покупок 86 і при цьому
135:15
Speaker A
загальний чек 108 000 до$ Отже я не можу сказати що змінення одного показника пов'язане зі і зміненням іншого показника для того щоб встановити певну кореляцію потрібно більше часу більше роботи з нашими даними для того щоб знайти певні зв'язки і сформувати більш
135:30
Speaker A
надійні гіпотези А я пропоную рухатися далі подивитися на інші типи візуалізацій вже переходимо до переліку і бачимо що після точкової діаграми є визначення геолокації ми можемо дивитися дані на картах показувати країни які приймають участь в наших даних або
135:45
Speaker A
показувати частку чогось наприклад продажів по відношенню до різних країн Ну ми знаємо що всі наші дані по з однією країною хоча у нас є дані щодо географії наших замовників давайте подивимося як це виглядає в нас є таблиця адрес ми бачимо що дійсно у нас
136:00
Speaker A
всі замовники з Австралії але ці замовники є представниками трьох різних штатів і ми можемо показати ці дані на карті Давайте спробуємо що для цього потрібно зробити в першу чергу для кожної транзакції потрібно підтягнути регіон нашого замовника там де він
136:16
Speaker A
відомий Отже знову ж таки маємо замовника хочемо отримати його регіон для цього ми будемо використовувати функцію vlup я впроваджую нову колонку яка називається region і формула нам дуже знайома vlup Що ми шукаємо Ми шукаємо замовника де ми шукаємо таблиці адрес обираємо всю
136:37
Speaker A
таблицю адрес не забуваємо зробити посилання абсолютними значок долару має бути під кожною колонкою та рядком в якій колонці Ми шукаємо це колонка під номером 1 2 3 4 поверніть нам четверту колонку і аргумент False для того щоб повертати тільки повне співпадіння
136:57
Speaker A
подивимось на результат бачимо що в нас є повернення регіону для нашого замовника запроваджую цю формулу для всіх наших замовників бачимо що не всюди є інформація тому що в нашій таблиці напевно немає замовника з id22 давайте подивимось чи це дійсно так
137:14
Speaker A
переходжу до наших замовників і бачу що у нас є ID 20 21 24 тобто замовник під id22 не вказав свої дані або чомусь ми його втратили оце Також потрібно буде вказати в результатах нашого аналізу і в відкритих запитання але ми можемо
137:30
Speaker A
працювати з тими замовниками де визначено регіон Отже тепер ми впроваджуємо нову зведену таблицю переконаємося що вона враховує нашу нову колонку вона враховує знайдемо її місце на нашому дашборді ось тут і давайте порахуємо для кожного регіону сумарний продаж Отже колонка регіон іде в рядки в нас є
137:56
Speaker A
три регіони і один невизначений і сумарний прибуток наприклад в якості розрахункового значення прибираємо те що нам не потрібно обираємо потрібні дані для візуалізації переходимо в вибір типу візуалізації бачимо що за замовчуванням в нас пачаart в даному випадку можна
138:15
Speaker A
досить швидко сказати що у нас є лідер серед регіонів але Подивимось як буде виглядати географіч на відображення цих даних тобто маючи виключно Ось такі коди Google sheats розуміє що ми відносимо всі наші продажі до регіонів Австралії до Штатів Австралії я можу трошки
138:33
Speaker A
налаштувати цю таблицю Ось тут я хочу бачити не світову карту тому що у нас дуже локалізовані продажі А наприклад регіон який нас цікавить і коли в нас більше даних більше регіонів більше країн залучено такі візуалізації будуть Дуже корисними і дуже цікавими для
138:49
Speaker A
досліджен давайте подивимось що в нас є що в нас залишилось з того що ми ще не розібрали є інші варіанти візуалізації ми не будемо довго тут працювати Тому що вони досить специфічні і не будуть входити в межі цього курсу Але можемо
139:03
Speaker A
подивитися на декілька з них ну надзвичайно корисною буде візуалізація ось таких карток також можна побачити як можна візуалізувати таблицю у вигляді таблиці як це буде виглядати Ну я обираю дані які ми вже використовуємо і вставляю нову візуалізацію для цих даних
139:19
Speaker A
але на цей раз можемо обрати варіант відображення у вигляді таблиці ми з вами бачимо У нас є таблиця яку можна рухати розміщувати десь тут не можна змінювати значення це є візуалізація у вигляді таблиці як і обіцяли іноді досить
139:34
Speaker A
корисний інструмент на наших дашбордах також Давайте поговоримо про картки для цього мені потрібно буде вставити нову зведену таблицю джерело не змінюється розміщення таблиці не змінюється ось тут і давайте порахуємо загальний продаж нашого онлайнмагазину для цього я обираю колонку list Price і переношу її до
140:01
Speaker A
значень вказавши саме суму цих значень Отже у нас є метрика ми порахували загальну кількість продажів і цю метрику можна візуалізувати з використанням карток Отже обираючи цей діапазон переходжу до ставлення візуалізації бачу загальний продаж тут але мене цікавить картка яка компактно лаконі
140:21
Speaker A
буде мені надавати цю інформацію і цю метрику так само можемо розміщувати на наших дашбордах Зараз ми побачимо як це зробити в першу чергу давайте налаштуємо безпосередньо значення наше значення - це валюта значення має бути заокруглене і окрім самого значення можна додати і заголовок
140:41
Speaker A
що буде в нагоді в даному випадку ми переходимо до налаштувань нашої картки бачимо що всі налаштування відповідно до нашого значення ось тут ми можемо налаштувати шрифт ми так також можемо налаштувати заголовок нашої візуалізації в даному випадку це буде Total sales і
140:57
Speaker A
ми можемо створювати декілька таких карток для того щоб показувати різні метрики різні агрегації давайте подивимося як це зробити я можу перейти до налаштувань моєї зведеної таблиці додати інші метрики Я хочу які я хочу розрахувати наприклад прибуток було б
141:11
Speaker A
цікаво побачити поруч так само заокруглимо значення і скопіюючи нашу візуалізацію яку ми вже створили з цим з цим форматуванням яке ми вже створили мо може просто змінити діапазон на який посилається ця візуалізація цей раз я хочу показати сумарний прибуток так
141:28
Speaker A
потрібно буде змінити назву це можна зробити і подвійним кліком можемо піти далі додати кількість транзакцій яку ми також розраховуємо з вами з використанням кількості ID наших транзакцій і тепер зробити ще одну копію нашої картки розмістити поруч але надати
141:46
Speaker A
можливість бачити загальну кількість транзакцій Мене цікавить саме цей діапазон відформатуємо значення як числове значення без знаків після коми і назва буде transactions тепер коли ми попрацювали з різними типами візуалізацій побачили як різні графіки Працюють як вони допомагають нам шукати
142:06
Speaker A
інсайти наших даних Я хотів би показати чому ми впровадили це на одній сторінці яку ми назвали dashборд по-перше вони всі існують тут і вони всі можуть керуватися слайсерами Тобто ми можемо динамічно впливати на кожен з нихбирає чи певну категорію Я переходжу до моєї
142:23
Speaker A
зведеної таблиці першої шукаю в закладці даa можливість ставити слайсер для слайсеру потрібно обрати будь-яку колонку яка має відношення до нашої оригінальної таблиці Ну наприклад обираємо клас наших продуктів ми знаємо що в нас є декілька різних класів продуктів і тепер якщо я оберу mediумкс
142:43
Speaker A
Я побачу як всі мої візуалізації будуть адаптуватися до цього ми бачимо різні прибутки різні продажі різну кількість транзакці тому що ми обрали на слайсері цю категорію А всі наші візуалізації пов'язані з однією оригінальною таблицею ба більше у нас всі наші зведені таблиці
143:00
Speaker A
знаходяться на одному аркуші саме це дозволяє використовувати такі слайсери і змінювати всі візуалізації одночасно Отже Починаємо ми там де ми і завершили роботу у нас є низка графіків які ми використовували для тренувань для того щоб зрозуміти зв'язок таблиць
143:20
Speaker A
графіків і як працюють власне різні типи графіків з нашими даними А тепер ми хочемо розробити інтерактивний дашборд Ми хочемо бачити декілька графіків які будуть розповідати нам одну якусь історію якщо ми подивимось на нашу таблицю ми побачимо потенціал для різних
143:35
Speaker A
історій У нас є статистика продажів ми можемо сказати яка була динаміка продажів в розрізі різних товарів різних брендів різних продуктів різними замовниками Ми також можемо сказати хто такі наші замовники У нас є низка інформації про те як Як їх можна
143:51
Speaker A
охарактеризувати і все що про них ми знаємо можемо зібрати в одному місці і розповісти історію про те які замовники найчастіше трапляються І як це можна зв'язати з продажами нашого онлайн-магазину можемо провести окремий аналіз того наскільки успішно є онлайн
144:07
Speaker A
платформа нашого магазину як продажі можна співпідставити онлайн Та олайн тут є багато різних варіантів того як можна візуалізувати наші дані на дашбордах і Ми обираємо простий варіант показати динаміку продажів різних товарів різних брендів різних та змінення кількості клієнтів у часі це буде такий початковий
144:29
Speaker A
дашборд для подальших дій Я переходжу на нашу закладку dasшборд зміню колір на якийсь яскравий і Давайте подумаємо як ми організуємо всю цю роботу я хочу по-перше вставити Місце для того щоб розробити цей дашборд правою кнопкою миші Я вставляю рядки зверху мені
144:46
Speaker A
потрібні всі ці таблиці Вони забезпечують роботу слайсерів як пам'ятаємо але для борду я таблиці показувати Не хочу я хочу показати тільки візуалізацію ми можемо виділити певну частину зони зверху надати їй якийсь колір наприклад такий тут буде відображено назву дашборду та певні
145:04
Speaker A
метрики які ми використовуємо для цього ми можемо перейти в інструмент який ми використовували вже і вставити текст назвою нашого дашборду це буде sales dashборд давайте оберемо шрифт будемо використовувати шрифт то трошки попрацюємо з форматуванням цього шрифту і зробимо його білим кольором щоб Він
145:24
Speaker A
відрізнявся на фоні нашої зони для заголовку Отже перетягую його сюди і у нас є назва нашого дашборду Ми так само можемо вставити якусь картинку сюди Ми вже знаємо що можна підтягувати різні картинки шукаючи їх безпосередньо в Google і можна взяти ось такий
145:41
Speaker A
мінімалістичний варіант іконки для того щоб більш яскраво презентувати саме назву нашого дашборду Тепер я хочу зробити іншим кольором робочу зону нашого дашбор борду трошки змінити його з білого на ось такий сірий колір це буде фон мого дашборду тут я можу додати
145:57
Speaker A
нижнє підкреслення для того щоб трошки виділити заголовок Отже обираю білий колір додаю трошки товщини нашій прямій і вставляю межу для того щоб виділити цю назву тепер подумаємо як це буде виглядати десь тут ми з вами додамо слайсери ми знаємо що ми зможемо обирати
146:14
Speaker A
різні слайсери і впроваджувати їх для візуалізації ось тут буде візуалізація яка буде показувати динаміку продажів у часі і ось тут Ми додамо ще декілька візуалізацій які так само будуть демонструвати динаміку наприклад кількості наших замовників або динаміку продажі в розрізі різних товарів зараз
146:31
Speaker A
подумаємо Давайте почнемо з найголовнішого графіка - це динаміка продажів у часі Ми вже в принципі його розробили я можу скопіювати його і вставити сюди в робочу зону нашого дашборду трошки адаптуємо його розмір і давайте попрацюємо над оформленням Отже
146:47
Speaker A
переходжу до налаштування нашої візуалізації і ось тут ми будемо змінювати те як він виглядає ну в першу чергу зробимо йому білий колір фону і приберемо границю Так виглядає краще Давайте змінимо назву ми показуємо тут sales trend цей шрифт так само потрібно
147:05
Speaker A
адаптувати буде будемо використовувати 16-й розмір сам шрифт буде робото колір Давайте зробимо наприклад можна дати жирний шрифт і так розмістити назву нашої візуалізації що робити з легендою ну поперше потрібно її перейменувати так воно не має бути ми показуємо проit ми
147:25
Speaker A
показуємо Total sales і давайте розмістимо десь легенду десь тут справа щоб не заважало далі ми прибираємо не потрібно нам підпис горизонтальної осі тому що ми так розуміємо що це час далі налаштуємо колір Ми можемо перейти до налаштування нашої візуалізації ось тут
147:45
Speaker A
обрати Total sales Якій зараз синім кольором і надати колір Ну наприклад ось такий будемо в той час коли для профіту теж можна обрати колір з скажімо таким відтінком тепер попрацюємо трошки з підписами тут ми можемо заокруглити це значення обравши тип даних валюта
148:05
Speaker A
заокруглена і звичайно Нам не потрібно такий великий шрифт Отже це буде 10й шрифт але все той самий робото якогось сірого Може трошки темніше сірого кольору прибираємо підпис тут так само можна змінити шрифт ризонтальної осібираємо ротобираємо 10 колір такий і у нас з
148:27
Speaker A
вами є перший графік який демонструє нам динаміку продажів причому ми можемо спостерігати зміну як і собівартості так і профіту тут потрібно виправитися це не Total sales виходячи з наших даних це Standard Cost тепер наш графік актуальний окрім візуалізації динаміки
148:44
Speaker A
тренду продажів Ми також можемо показати як змінюється кількість наших клієнтів за цей період часу ми я думаю не роби ще таку візуалізацію тому давайте її швидесенько впровадимо Отже переходжу до нашої таблиці вставляю введену таблицю Я думаю що після цих вправ ви будете це робити без
149:02
Speaker A
жодних проблем і в кінці вставимо нову візуалізацію яка буде присвячена нашим замовникам тобто я знову ж таки хочу працювати з датами як рядками я хочу відносити всі наші дані до місяців Отже я згрупую ці дані за місяцями не за руками а за місяцями
149:20
Speaker A
вевертаюся і перегрубую за місяцями і тепер я хочу віднести до кожного місяця кількість наших замовників У нас є id значенням буде кількість наших замовників Вона може бути унікальна вона може бути загальна кількість замовників оберемо те що ми хочемо я в даному
149:37
Speaker A
випадку обираю загальну кількість замовників і це вже можна візуалізувати у вигляді нового тренду Отже вставляю візуалізацію але змінюю топчасту діаграму на давайте використаємо лінійчату діаграму копіюю її тут і вставляю її в робочій зоні нашого дашборду ось тут давайте над нею
149:57
Speaker A
попрацюємо по-перше називатися вона буде customers trend Ми так само застосуємо до неї той самий шрифт можемо прибрати заголовки вони тут недоречні ми також можемо дещо змінити нашу лінійчну діаграму додавши її трошки заокруглень ось тут налаштуваннях стилю нашої візуалізації можна додати ці
150:16
Speaker A
заокруглення потрібно сказати що вони трошки спотворюють наші дані тут не за ди Зрозуміло Як саме поводиться наша крива в певній точці тобто візуально це може виглядати Більш естетично Але якщо нам потрібна точність краще не використовувати такий тип візуалізації
150:32
Speaker A
так само ми можемо показати її трошки змінивши діапазон значень нашої осі y От наприклад почавши з мінімальної 750 або 900 спробуємо ми бачимо що ми змінюючи тільки діапазон значень дуже сильно впливаємо на те як відчувається ця візуалізація Отже ми можемо побачити тут
150:52
Speaker A
дуже суттєвий зріст або дуже суттєве падіння причому якщо ми подивимось на цифри ми побачимо що це не є так категорично як виглядає тому син теж потрібно бути дуже-дуже обережними зменшимо розмір і залишимо розмір для ще однієї візуалізації наступною
151:08
Speaker A
візуалізацію може бути варіант коли ми показуємо вже агреговані дані За весь цей період для якоїсь категорії наприклад для продуктів ми знаємо що в нас є різні ID різних продуктів нам цікаво за цей час який були продажі по кожному ID продукту переходимо до
151:23
Speaker A
транзакції вставляємо нашу зведену таблицю ми знаємо де її розмістити і на цей раз покажемо різні наші продукти Отже я перетягую колонку prodк рядки і по кожному продукту можемо показати власне профіт порахуємо сумарний прибуток по відношенню до кожного ID
151:42
Speaker A
кожного продукту в нас є досить великий перелік Подивимось як це буде виглядати на нашій візуалізаціїже обираю всі дані вставляю візуалізацію бачу за замовчуванням лінійчну діаграму яка зручна для відображення тренду Але ми не показуємо тренд ця візуалізація дещо відрізняється від попередніх адже ми
151:58
Speaker A
показуємо вже агреговані дані по відношенню до кожного продукту це не змінення чогось в часі це сумарний прибуток у кожному ID продукту тому я хотів би обрати наприклад стовпчасту діаграму для відображення такого показника бачимо наші дані продукти розташовані за зростанням ID це зручно
152:17
Speaker A
якщо ми хочемо швидко знайти потрібний продукт тому можемо скопіювати цю візуалізацію і розмістити її на робочій зоні нашого дашборду тепер застосуємо всі такі самі вимоги до оформлення візуалізації як ми вже впроваджули до цього і отримуємо третю візуалізацію яка
152:34
Speaker A
доповнить наш дашборд ми можемо багато чого зробити додатково для того щоб ця візуалізація була більш цікавою з точки зору оформлення але цей курс не зовсім про оформлення дашбордів більше про те як їх налаштовувати як їх створювати які є можливості у Google sheets для того
152:50
Speaker A
щоб їх створювати і дуже важливою характеристикою Google shees є те що ми можемо їх всіх поєднати з використанням слайсерів Я переходжу до будь-якої зі зведених таблиць що відноситься до нашого джерела до таблиці transactions і ось тут на закладці Data вставляю
153:06
Speaker A
слайсер ми це вже робили в тестовому режимі і у нас слайсери будуть розміщені ось тут над нашими візуалізаціями і ми зможемо впливати динамічно на всі наші графіки Отже обираємо різні категорії які дозволять нам впливати можемо відстежувати дані по різних брендах
153:22
Speaker A
наприклад можна скопіювати і вставити поруч цей слайсер але на цей раз надати йому іншу колонку наприклад клас наших продуктів так само можна продовжувати і надавати різні інші категорії для наших слайсерів щоб впливати динамічно на нашу візуалізацію прок Line і ставимо ще один
153:42
Speaker A
слайсер який буде відповідати за регіон де власне відбулася транзакція Останнє що ми можемо зробити - це додати ті метрики які ми розраховували тобто фінальні агрегації по нашим даним щоб завжди бачити сумарний результат У нас є продаж профіт транзакції я скопіюю ці
153:59
Speaker A
три метрики І знайду їм місце на нашому дашборді вони можуть бути розміщені Наприклад тут тепер я хочу трош трошки їх адаптувати перебрати фон адаптувати шрифт і розмістити їх на білому фоні Ось таким чином будуть розміщуватися наші KPI картки тобто узагальнюючі індикатори
154:18
Speaker A
які дозволяють отримати уявлення про про агрегацію про взагалі що тут відбувається сумарно далі ми переходимо на відстеження помісячних трендів наших продажів можемо сказати Як змінюється продаж відносно часів розрізі наших собівартостей та прибутків далі можемо дивитися на те як змінюється кількість
154:37
Speaker A
клієнтів в часі Чи це якось може бути логічно пов'язано з тим що ми бачимо в продажах і в кінці ми можемо подивитися на певні продукти подивитися як продавалися за цей час певні продукти в аграгованому варіанті ми знаємо що ми
154:50
Speaker A
можемо використовувати різні слайсери і таким чином впливати на нашу візуалізацію друзі н дашбордом ми завершимо цей курс Я дуже дякую вам за ваш час за вашу активність за ваш інтерес до цієї теми Я сподіваюся ви отримали багато нових знань Які
155:06
Speaker A
дозволять вам покращити власний перформанс у вас на роботі в ваших поточних проектах або в навчанні Або можливо Цей курс стане початком входу в аналітику даних так само як це відбулося свого часу зі мною я буду дуже вдячний вам за коментарі та поширення цього
155:20
Speaker A
курсу поширення вашого досвіду проходження цього курсу переходьте за всіма ресурсами за посиланнями під відео Я вам вдячний і бажаю Удачі І наснаги в майбутніх проектах
Topics:Google Таблиціаналіз даниханалітика данихімпорт данихочищення данихдашбордзведені таблиціформули Google Sheetsвізуалізація данихкурс українською

Answers

Frequently Asked Questions

Для кого підходить цей курс з Google Таблиць?

Курс підходить для початківців та професіоналів, які працюють з даними в сферах аналітики, бухгалтерії, інженерії та інших. Вимагається мінімальний досвід роботи з Excel.

Які джерела даних використовуються у курсі?

У курсі розглядається імпорт даних із різних джерел, таких як веб-ресурси, Вікіпедія, Google Таблиці, Excel-файли та текстові документи.

Чи можна після курсу створювати власні аналітичні проекти?

Так, курс надає знання та ресурси для створення власних проектів, включно з розробкою інтерактивних дашбордів та використанням відкритих безкоштовних даних.

Get More with the Söz AI App

Transcribe recordings, audio files, and YouTube videos — with AI summaries, speaker detection, and unlimited transcriptions.

Or transcribe another YouTube video here →