Зарегистрированная негосударственная некоммерческая организация свидетельство № 1052p

Статьи

Дорожная карта в Data Science: план с нуля

12 мин чтения

Чем отличаются data analyst, data scientist и ML engineer, этапы изучения Excel, SQL, Python и машинного обучения, план по месяцам и советы по портфолио.

Когда речь заходит о Data Science, многим представляются сложные формулы, искусственный интеллект и что-то «только для математиков». На самом деле эта область осваивается поэтапно, и каждый этап сам по себе даёт полезный навык: кто умеет работать с таблицами, составляет отчёты; кто знает SQL, достаёт нужные данные из базы; кто владеет Python, автоматизирует рутинную работу. В этой статье разберём, чем отличаются профессии data analyst, data scientist и ML engineer, сколько математики нужно на самом деле, в каком порядке логично учиться — от Excel и статистики до машинного обучения, как пользоваться открытыми датасетами и какие проекты делать для портфолио. В конце — примерный план по месяцам, частые ошибки, практическое задание и чек-лист.

Data analyst, data scientist и ML engineer: в чём разница

Все три профессии работают с данными, но вопросы и результаты у них разные. В вакансиях эти названия иногда смешиваются, поэтому смотрите не на название, а на список обязанностей.

  • Data analyst (аналитик данных) отвечает на вопрос «что произошло и почему?». Он работает с таблицами, SQL и инструментами визуализации, готовит отчёты и дашборды, даёт руководству понятные выводы. Например, выясняет, в каком филиале торговой сети упали продажи и почему.
  • Data scientist (специалист по данным) занимается ещё и вопросом «что может произойти?». Он применяет статистические методы и модели машинного обучения: прогнозирует спрос, группирует клиентов, оценивает результаты экспериментов.
  • ML engineer (инженер машинного обучения) превращает готовую модель в работающую систему. Он ближе к программисту: отвечает за качество кода, серверы, скорость и стабильность модели.

Простое сравнение: Дильшод работает аналитиком в сети магазинов и каждую неделю готовит отчёт о продажах. Его коллега Зарина строит модель, которая прогнозирует, на какой товар в следующем месяце вырастет спрос. А третий коллега, Бекзод, подключает эту модель к складской программе, чтобы она каждый день работала сама.

Для новичков самая реалистичная точка входа — направление data analyst. Оно требует меньше математики, результат виден быстро, а в дальнейшем это прочный фундамент для перехода в data science. Если хотите на простых примерах понять, что такое анализ данных, сначала прочитайте статью об анализе данных.

Сколько нужно математики: реалистичная оценка

Многие боятся идти в эту сферу со словами «я плохо знаю математику». Реалистичный ответ: для старта достаточно школьной математики и основ статистики, а более глубокую математику изучают позже, по мере необходимости.

Для data analyst:

  • свободно работать с процентами, долями и средними значениями;
  • понимать разницу между средним, медианой, модой, минимумом и максимумом;
  • знать, что показывает разброс (стандартное отклонение);
  • понимать, что корреляция и причинно-следственная связь — не одно и то же.

Для data scientist дополнительно:

  • основы теории вероятностей;
  • элементы линейной алгебры: вектор, матрица, идея их умножения;
  • понятие производной и градиента — чтобы понимать, как модель «учится».

Важная мысль: вычисления выполняют библиотеки, и от вас требуется не решать формулы вручную, а правильно интерпретировать результат. Например, заметить, что высокая «точность» модели может оказаться обманчивой из-за дисбаланса в данных, — это и есть математическое мышление. Если хотите начать статистику с нуля, поможет статья об основах статистики.

Первый этап: Excel, статистика и SQL

Excel и электронные таблицы

Таблица — самая удобная «лаборатория» для работы с данными. В ней данные видны глазами, а ошибку замечаешь сразу. На этом этапе освойте следующее:

  1. Аккуратную структуру таблицы: одно значение в ячейке, один тип данных в столбце.
  2. Формулы: SUM, AVERAGE, COUNTIF, IF, XLOOKUP (или VLOOKUP).
  3. Сортировку и фильтрацию: Data → Sort, Data → Filter.
  4. Сводные таблицы: Insert → PivotTable — для группировки, подсчёта и суммирования.
  5. Диаграммы: Insert → Chart.

Эти навыки станут фундаментом для всех следующих этапов.

Основы статистики

Изучайте статистику вместе с таблицами. Например, внесите в таблицу месячное потребление электроэнергии семьями одной махалли в киловатт-часах (условные, придуманные числа) и сравните среднее значение с медианой. Вы увидите, как сильно одно очень большое значение «тянет» среднее за собой, — это один из важнейших уроков статистики.

SQL

В компаниях данные обычно хранятся не в таблицах Excel, а в базах данных, и достают их оттуда SQL-запросами. В большинстве вакансий аналитика данных требуется SQL. Порядок изучения:

  1. SELECT, FROM, WHERE — выбор нужных столбцов и строк.
  2. ORDER BY и LIMIT — сортировка и ограничение.
  3. GROUP BY и агрегатные функции (COUNT, SUM, AVG).
  4. JOIN — соединение нескольких таблиц.
  5. Подзапросы и оконные функции — следующий уровень.

Пример простого запроса:

SELECT region, COUNT(*) AS order_count
FROM orders
GROUP BY region
ORDER BY order_count DESC;

Этот запрос считает количество заказов по каждой области и выводит их, начиная с самой большой. Чтобы изучить SQL с нуля, загляните в статью об основах SQL.

Второй этап: Python, pandas и визуализация

Освоив таблицы и SQL, переходите к Python. Он автоматизирует рутинную работу, справляется с большими объёмами данных и открывает дорогу к машинному обучению. Если программирование для вас совсем в новинку, сначала освойте основы из статьи о первых шагах в Python: переменные, списки, условия, циклы и функции.

Удобная среда для обучения — Jupyter Notebook или Google Colab. Colab работает в браузере, и на компьютер ничего устанавливать не нужно: нажмите File → New notebook и начинайте писать код.

pandas

pandas — основная библиотека для работы с табличными данными. С её помощью многое из того, что в Excel делается вручную, выполняется несколькими строками кода:

import pandas as pd

df = pd.read_csv("savdo.csv")
print(df.head())
print(df.describe())
print(df.groupby("viloyat")["miqdor"].sum())

Здесь read_csv читает файл, head показывает первые строки, describe выводит основную статистику, а groupby группирует данные по областям и суммирует их. Основные операции, которые стоит освоить: выбор столбцов, фильтрация, поиск и заполнение пустых значений, изменение типа столбца, объединение таблиц.

Визуализация

Визуализация данных — это умение показать найденный вывод так, чтобы он был понятен другим. В Python базовая библиотека — matplotlib, а seaborn построена поверх неё и позволяет проще рисовать более аккуратные графики. Основные виды графиков: столбчатый (сравнение категорий), линейный (изменения во времени), гистограмма (распределение) и точечный (связь между двумя переменными).

Правила хорошего графика: понятный заголовок, подписанные оси, единицы измерения, никаких лишних цветов. Один график — одна мысль. Если по графику нельзя сформулировать вывод одним предложением, упростите его.

Третий этап: основы машинного обучения

Машинное обучение — это способ научить компьютер находить закономерности на примерах, не прописывая ему точных правил. Это самая прикладная часть области искусственного интеллекта. Новичку важно понять две основные идеи.

Обучение с учителем (supervised learning). Модели дают примеры с вопросом и правильным ответом. Например, данные учеников прошлых лет: посещаемость, часы, потраченные на домашние задания, и итоговые баллы за экзамен. Модель изучает связь между ними и предсказывает балл для нового ученика. Здесь есть два типа задач: регрессия (предсказание числа) и классификация (определение категории, например, спам письмо или нет).

Обучение без учителя (unsupervised learning). Правильных ответов нет, и модель сама находит естественные группы в данных. Например, делит покупателей интернет-магазина на несколько групп по их покупательским привычкам (кластеризация).

Основная библиотека для старта в Python — scikit-learn. В ней почти каждая модель используется по одной и той же схеме:

from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
model = LinearRegression()
model.fit(X_train, y_train)
print(model.score(X_test, y_test))

Ключевые понятия: разделение данных на обучающую и тестовую части (тестовую часть модель во время обучения видеть не должна), обучение модели (fit), предсказание (predict) и оценка качества. Самая опасная ошибка — когда модель «заучивает» обучающие данные и плохо работает на новых. Это называют переобучением (overfitting).

На этом этапе ограничьтесь простыми моделями: линейной регрессией, логистической регрессией, деревом решений и кластеризацией k-means. К нейронным сетям и глубокому обучению переходите, когда основы станут прочными.

Проекты, портфолио и открытые датасеты

Работодатель хочет увидеть не список сертификатов, а то, что вы реально умеете. Поэтому в конце каждого этапа делайте небольшой проект и собирайте их в портфолио.

Где взять датасет

Датасет — это набор данных, подготовленный для анализа. Для практики есть открытые источники:

  • Kaggle — тысячи датасетов, загруженных пользователями со всего мира, разборы к ним и учебные соревнования. Читать чужие работы — тоже хороший способ учиться.
  • data.gov.uz — портал открытых данных Узбекистана. На нём размещаются данные, опубликованные разными ведомствами. Проект на местных данных особенно интересно смотрится в портфолио.
  • Ваши собственные данные — семейные расходы, дневник чтения, результаты матчей футбольной команды вашей махалли. Прежде чем публиковать личные данные, удалите имена, телефоны и подобную информацию.

Каким должен быть хороший проект

  1. Чёткий вопрос. Не «проанализировал датасет», а «В какие месяцы падает посещаемость библиотеки и почему?».
  2. Очистка данных. Опишите, как вы работали с пустыми значениями, дубликатами и неверными форматами.
  3. Анализ и графики. Достаточно 3–5 содержательных графиков.
  4. Вывод. Простым языком: что обнаружено, какие есть ограничения, что можно сделать дальше.
  5. Публикация. Выложите код на GitHub и коротко опишите проект в файле README.

Подробнее о том, как собрать портфолио, мы писали в статье о создании портфолио.

Почему важен английский

Большая часть документации, руководств к библиотекам, форумов с вопросами и ответами и новых курсов в этой области — на английском. Даже чтобы найти решение по тексту ошибки, нужно уметь читать и писать по-английски. Свободно говорить не обязательно, но умение читать и понимать технический текст даёт огромное преимущество. Даже 15–20 минут чтения технических текстов в день заметно помогают.

Примерный план обучения по месяцам

Таблица ниже условная. Она рассчитана на человека, который начинает программировать с нуля и занимается примерно 8–10 часов в неделю. Кто уделяет больше времени, пройдёт быстрее, кто меньше — медленнее. Важна не скорость, а регулярность.

МесяцТемаРезультат этапа
1Excel, аккуратные таблицы, формулы, PivotTableТаблица анализа личных расходов
2Основы статистики, диаграммыНебольшой отчёт со сравнением среднего и медианы
3SQL: SELECT, GROUP BY, JOINНабор из 15–20 упражнений-запросов
4Основы PythonНебольшой скрипт для автоматизации
5pandas, очистка данныхОчистка и описание открытого датасета
6matplotlib, seaborn, визуализацияПолноценный аналитический проект (вопрос, графики, вывод)
7–8scikit-learn, обучение с учителем и безОдин проект с прогнозом и один с кластеризацией
9 и далееПортфолио, GitHub, резюме, повторение3–4 хорошо задокументированных проекта

В конце каждого месяца спрашивайте себя: «Смогу ли я объяснить то, что изучил, другому человеку и применить это в небольшой задаче?» Если ответ «нет», не спешите к следующей теме.

Частые ошибки

  • Только смотреть курсы. Видео создаёт ощущение понимания, но навык формируется, только когда вы пишете код сами. После каждого урока повторяйте изученное на своём примере.
  • Учёба без проектов. Закончить десять курсов и не сделать ни одного самостоятельного проекта. Работодатель смотрит не на сертификат, а на результат.
  • Пропуск основ. Начинать сразу с нейронных сетей. Без Excel, SQL и статистики трудно правильно оценить модель.
  • Всё одновременно. Параллельно браться за Python, R, пять библиотек и три курса. Выберите один путь и пройдите его до конца.
  • Непроверенные данные. Строить модель на неочищенных данных. Опытные специалисты тратят большую часть времени на то, чтобы понять и очистить данные.
  • Неумение объяснить результат. Сказать «у модели высокая точность» недостаточно. Нужно уметь простым языком объяснить, что этот результат значит для бизнеса или для людей.
  • Ожидание быстрого результата. Эта сфера требует нескольких месяцев регулярной работы, а то и больше. Ни один курс не гарантирует трудоустройство — результат зависит от вашей практической работы.

Практическое задание и чек-лист

Задание: анализ библиотеки махалли

Представьте, что Нилуфар работает в библиотеке махалли и хочет узнать, какие книги читают чаще. Данные условные, вы составите их сами.

  1. Создайте в таблице данные на 30–40 строк: дата, название книги, жанр, возрастная группа читателя, день возврата.
  2. С помощью PivotTable в Excel посчитайте, сколько книг взяли по каждому жанру.
  3. Для каждого жанра сравните среднее и медианное количество дней до возврата книги.
  4. Сохраните таблицу в формате CSV (File → Save As → CSV).
  5. В Google Colab прочитайте файл с помощью pandas и повторите шаги 2–3 кодом.
  6. Постройте в matplotlib столбчатый график по жанрам.
  7. Напишите вывод из трёх предложений: что обнаружено, какие есть ограничения, что вы порекомендуете библиотеке.
  8. Выложите всё на GitHub и напишите README.

Чек-лист

  • Могу своими словами объяснить разницу между data analyst, data scientist и ML engineer.
  • Умею считать и интерпретировать среднее, медиану и стандартное отклонение.
  • Умею строить в Excel сводную таблицу и диаграмму.
  • Умею писать SQL-запросы с GROUP BY и JOIN.
  • Умею с помощью pandas прочитать CSV-файл, очистить и сгруппировать данные.
  • Могу на примере объяснить разницу между обучением с учителем и без учителя.
  • Хотя бы один мой проект опубликован на GitHub с README.
  • Могу читать и понимать технический текст на английском.

Data Science — путь, который строится не за один день, а поэтапно. Каждый этап сам по себе даёт полезный навык, поэтому уже в первые месяцы вы начнёте применять изученное на работе или в повседневной жизни.

Если хотите пройти этот путь системно с преподавателем, познакомьтесь с бесплатными программами нашей ассоциации «Аналитика данных» и «Data Science», а также с другими учебными программами. Когда будете готовы, оставьте заявку — наши специалисты свяжутся с вами.

Вернуться к статьям

Другие статьи

13 мин чтения

Знакомство с 1С: основы учётной программы

Что такое 1С:Предприятие, разница платформы и конфигурации, справочники, проведение документов, отчёты, резервная копия и упражнение для новичков.

Начните обучение сегодня

Набор в группы открыт. Оставьте заявку — наши специалисты свяжутся с вами и помогут выбрать подходящее направление.

Написать в Telegram