Когда речь заходит о Data Science, многим представляются сложные формулы, искусственный интеллект и что-то «только для математиков». На самом деле эта область осваивается поэтапно, и каждый этап сам по себе даёт полезный навык: кто умеет работать с таблицами, составляет отчёты; кто знает SQL, достаёт нужные данные из базы; кто владеет Python, автоматизирует рутинную работу. В этой статье разберём, чем отличаются профессии data analyst, data scientist и ML engineer, сколько математики нужно на самом деле, в каком порядке логично учиться — от Excel и статистики до машинного обучения, как пользоваться открытыми датасетами и какие проекты делать для портфолио. В конце — примерный план по месяцам, частые ошибки, практическое задание и чек-лист.
Data analyst, data scientist и ML engineer: в чём разница
Все три профессии работают с данными, но вопросы и результаты у них разные. В вакансиях эти названия иногда смешиваются, поэтому смотрите не на название, а на список обязанностей.
- Data analyst (аналитик данных) отвечает на вопрос «что произошло и почему?». Он работает с таблицами, SQL и инструментами визуализации, готовит отчёты и дашборды, даёт руководству понятные выводы. Например, выясняет, в каком филиале торговой сети упали продажи и почему.
- Data scientist (специалист по данным) занимается ещё и вопросом «что может произойти?». Он применяет статистические методы и модели машинного обучения: прогнозирует спрос, группирует клиентов, оценивает результаты экспериментов.
- ML engineer (инженер машинного обучения) превращает готовую модель в работающую систему. Он ближе к программисту: отвечает за качество кода, серверы, скорость и стабильность модели.
Простое сравнение: Дильшод работает аналитиком в сети магазинов и каждую неделю готовит отчёт о продажах. Его коллега Зарина строит модель, которая прогнозирует, на какой товар в следующем месяце вырастет спрос. А третий коллега, Бекзод, подключает эту модель к складской программе, чтобы она каждый день работала сама.
Для новичков самая реалистичная точка входа — направление data analyst. Оно требует меньше математики, результат виден быстро, а в дальнейшем это прочный фундамент для перехода в data science. Если хотите на простых примерах понять, что такое анализ данных, сначала прочитайте статью об анализе данных.
Сколько нужно математики: реалистичная оценка
Многие боятся идти в эту сферу со словами «я плохо знаю математику». Реалистичный ответ: для старта достаточно школьной математики и основ статистики, а более глубокую математику изучают позже, по мере необходимости.
Для data analyst:
- свободно работать с процентами, долями и средними значениями;
- понимать разницу между средним, медианой, модой, минимумом и максимумом;
- знать, что показывает разброс (стандартное отклонение);
- понимать, что корреляция и причинно-следственная связь — не одно и то же.
Для data scientist дополнительно:
- основы теории вероятностей;
- элементы линейной алгебры: вектор, матрица, идея их умножения;
- понятие производной и градиента — чтобы понимать, как модель «учится».
Важная мысль: вычисления выполняют библиотеки, и от вас требуется не решать формулы вручную, а правильно интерпретировать результат. Например, заметить, что высокая «точность» модели может оказаться обманчивой из-за дисбаланса в данных, — это и есть математическое мышление. Если хотите начать статистику с нуля, поможет статья об основах статистики.
Первый этап: Excel, статистика и SQL
Excel и электронные таблицы
Таблица — самая удобная «лаборатория» для работы с данными. В ней данные видны глазами, а ошибку замечаешь сразу. На этом этапе освойте следующее:
- Аккуратную структуру таблицы: одно значение в ячейке, один тип данных в столбце.
- Формулы: SUM, AVERAGE, COUNTIF, IF, XLOOKUP (или VLOOKUP).
- Сортировку и фильтрацию: Data → Sort, Data → Filter.
- Сводные таблицы: Insert → PivotTable — для группировки, подсчёта и суммирования.
- Диаграммы: Insert → Chart.
Эти навыки станут фундаментом для всех следующих этапов.
Основы статистики
Изучайте статистику вместе с таблицами. Например, внесите в таблицу месячное потребление электроэнергии семьями одной махалли в киловатт-часах (условные, придуманные числа) и сравните среднее значение с медианой. Вы увидите, как сильно одно очень большое значение «тянет» среднее за собой, — это один из важнейших уроков статистики.
SQL
В компаниях данные обычно хранятся не в таблицах Excel, а в базах данных, и достают их оттуда SQL-запросами. В большинстве вакансий аналитика данных требуется SQL. Порядок изучения:
- SELECT, FROM, WHERE — выбор нужных столбцов и строк.
- ORDER BY и LIMIT — сортировка и ограничение.
- GROUP BY и агрегатные функции (COUNT, SUM, AVG).
- JOIN — соединение нескольких таблиц.
- Подзапросы и оконные функции — следующий уровень.
Пример простого запроса:
SELECT region, COUNT(*) AS order_count
FROM orders
GROUP BY region
ORDER BY order_count DESC;
Этот запрос считает количество заказов по каждой области и выводит их, начиная с самой большой. Чтобы изучить SQL с нуля, загляните в статью об основах SQL.
Второй этап: Python, pandas и визуализация
Освоив таблицы и SQL, переходите к Python. Он автоматизирует рутинную работу, справляется с большими объёмами данных и открывает дорогу к машинному обучению. Если программирование для вас совсем в новинку, сначала освойте основы из статьи о первых шагах в Python: переменные, списки, условия, циклы и функции.
Удобная среда для обучения — Jupyter Notebook или Google Colab. Colab работает в браузере, и на компьютер ничего устанавливать не нужно: нажмите File → New notebook и начинайте писать код.
pandas
pandas — основная библиотека для работы с табличными данными. С её помощью многое из того, что в Excel делается вручную, выполняется несколькими строками кода:
import pandas as pd
df = pd.read_csv("savdo.csv")
print(df.head())
print(df.describe())
print(df.groupby("viloyat")["miqdor"].sum())
Здесь read_csv читает файл, head показывает первые строки, describe выводит основную статистику, а groupby группирует данные по областям и суммирует их. Основные операции, которые стоит освоить: выбор столбцов, фильтрация, поиск и заполнение пустых значений, изменение типа столбца, объединение таблиц.
Визуализация
Визуализация данных — это умение показать найденный вывод так, чтобы он был понятен другим. В Python базовая библиотека — matplotlib, а seaborn построена поверх неё и позволяет проще рисовать более аккуратные графики. Основные виды графиков: столбчатый (сравнение категорий), линейный (изменения во времени), гистограмма (распределение) и точечный (связь между двумя переменными).
Правила хорошего графика: понятный заголовок, подписанные оси, единицы измерения, никаких лишних цветов. Один график — одна мысль. Если по графику нельзя сформулировать вывод одним предложением, упростите его.
Третий этап: основы машинного обучения
Машинное обучение — это способ научить компьютер находить закономерности на примерах, не прописывая ему точных правил. Это самая прикладная часть области искусственного интеллекта. Новичку важно понять две основные идеи.
Обучение с учителем (supervised learning). Модели дают примеры с вопросом и правильным ответом. Например, данные учеников прошлых лет: посещаемость, часы, потраченные на домашние задания, и итоговые баллы за экзамен. Модель изучает связь между ними и предсказывает балл для нового ученика. Здесь есть два типа задач: регрессия (предсказание числа) и классификация (определение категории, например, спам письмо или нет).
Обучение без учителя (unsupervised learning). Правильных ответов нет, и модель сама находит естественные группы в данных. Например, делит покупателей интернет-магазина на несколько групп по их покупательским привычкам (кластеризация).
Основная библиотека для старта в Python — scikit-learn. В ней почти каждая модель используется по одной и той же схеме:
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LinearRegression
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
model = LinearRegression()
model.fit(X_train, y_train)
print(model.score(X_test, y_test))
Ключевые понятия: разделение данных на обучающую и тестовую части (тестовую часть модель во время обучения видеть не должна), обучение модели (fit), предсказание (predict) и оценка качества. Самая опасная ошибка — когда модель «заучивает» обучающие данные и плохо работает на новых. Это называют переобучением (overfitting).
На этом этапе ограничьтесь простыми моделями: линейной регрессией, логистической регрессией, деревом решений и кластеризацией k-means. К нейронным сетям и глубокому обучению переходите, когда основы станут прочными.
Проекты, портфолио и открытые датасеты
Работодатель хочет увидеть не список сертификатов, а то, что вы реально умеете. Поэтому в конце каждого этапа делайте небольшой проект и собирайте их в портфолио.
Где взять датасет
Датасет — это набор данных, подготовленный для анализа. Для практики есть открытые источники:
- Kaggle — тысячи датасетов, загруженных пользователями со всего мира, разборы к ним и учебные соревнования. Читать чужие работы — тоже хороший способ учиться.
- data.gov.uz — портал открытых данных Узбекистана. На нём размещаются данные, опубликованные разными ведомствами. Проект на местных данных особенно интересно смотрится в портфолио.
- Ваши собственные данные — семейные расходы, дневник чтения, результаты матчей футбольной команды вашей махалли. Прежде чем публиковать личные данные, удалите имена, телефоны и подобную информацию.
Каким должен быть хороший проект
- Чёткий вопрос. Не «проанализировал датасет», а «В какие месяцы падает посещаемость библиотеки и почему?».
- Очистка данных. Опишите, как вы работали с пустыми значениями, дубликатами и неверными форматами.
- Анализ и графики. Достаточно 3–5 содержательных графиков.
- Вывод. Простым языком: что обнаружено, какие есть ограничения, что можно сделать дальше.
- Публикация. Выложите код на GitHub и коротко опишите проект в файле README.
Подробнее о том, как собрать портфолио, мы писали в статье о создании портфолио.
Почему важен английский
Большая часть документации, руководств к библиотекам, форумов с вопросами и ответами и новых курсов в этой области — на английском. Даже чтобы найти решение по тексту ошибки, нужно уметь читать и писать по-английски. Свободно говорить не обязательно, но умение читать и понимать технический текст даёт огромное преимущество. Даже 15–20 минут чтения технических текстов в день заметно помогают.
Примерный план обучения по месяцам
Таблица ниже условная. Она рассчитана на человека, который начинает программировать с нуля и занимается примерно 8–10 часов в неделю. Кто уделяет больше времени, пройдёт быстрее, кто меньше — медленнее. Важна не скорость, а регулярность.
| Месяц | Тема | Результат этапа |
|---|---|---|
| 1 | Excel, аккуратные таблицы, формулы, PivotTable | Таблица анализа личных расходов |
| 2 | Основы статистики, диаграммы | Небольшой отчёт со сравнением среднего и медианы |
| 3 | SQL: SELECT, GROUP BY, JOIN | Набор из 15–20 упражнений-запросов |
| 4 | Основы Python | Небольшой скрипт для автоматизации |
| 5 | pandas, очистка данных | Очистка и описание открытого датасета |
| 6 | matplotlib, seaborn, визуализация | Полноценный аналитический проект (вопрос, графики, вывод) |
| 7–8 | scikit-learn, обучение с учителем и без | Один проект с прогнозом и один с кластеризацией |
| 9 и далее | Портфолио, GitHub, резюме, повторение | 3–4 хорошо задокументированных проекта |
В конце каждого месяца спрашивайте себя: «Смогу ли я объяснить то, что изучил, другому человеку и применить это в небольшой задаче?» Если ответ «нет», не спешите к следующей теме.
Частые ошибки
- Только смотреть курсы. Видео создаёт ощущение понимания, но навык формируется, только когда вы пишете код сами. После каждого урока повторяйте изученное на своём примере.
- Учёба без проектов. Закончить десять курсов и не сделать ни одного самостоятельного проекта. Работодатель смотрит не на сертификат, а на результат.
- Пропуск основ. Начинать сразу с нейронных сетей. Без Excel, SQL и статистики трудно правильно оценить модель.
- Всё одновременно. Параллельно браться за Python, R, пять библиотек и три курса. Выберите один путь и пройдите его до конца.
- Непроверенные данные. Строить модель на неочищенных данных. Опытные специалисты тратят большую часть времени на то, чтобы понять и очистить данные.
- Неумение объяснить результат. Сказать «у модели высокая точность» недостаточно. Нужно уметь простым языком объяснить, что этот результат значит для бизнеса или для людей.
- Ожидание быстрого результата. Эта сфера требует нескольких месяцев регулярной работы, а то и больше. Ни один курс не гарантирует трудоустройство — результат зависит от вашей практической работы.
Практическое задание и чек-лист
Задание: анализ библиотеки махалли
Представьте, что Нилуфар работает в библиотеке махалли и хочет узнать, какие книги читают чаще. Данные условные, вы составите их сами.
- Создайте в таблице данные на 30–40 строк: дата, название книги, жанр, возрастная группа читателя, день возврата.
- С помощью PivotTable в Excel посчитайте, сколько книг взяли по каждому жанру.
- Для каждого жанра сравните среднее и медианное количество дней до возврата книги.
- Сохраните таблицу в формате CSV (File → Save As → CSV).
- В Google Colab прочитайте файл с помощью pandas и повторите шаги 2–3 кодом.
- Постройте в matplotlib столбчатый график по жанрам.
- Напишите вывод из трёх предложений: что обнаружено, какие есть ограничения, что вы порекомендуете библиотеке.
- Выложите всё на GitHub и напишите README.
Чек-лист
- Могу своими словами объяснить разницу между data analyst, data scientist и ML engineer.
- Умею считать и интерпретировать среднее, медиану и стандартное отклонение.
- Умею строить в Excel сводную таблицу и диаграмму.
- Умею писать SQL-запросы с GROUP BY и JOIN.
- Умею с помощью pandas прочитать CSV-файл, очистить и сгруппировать данные.
- Могу на примере объяснить разницу между обучением с учителем и без учителя.
- Хотя бы один мой проект опубликован на GitHub с README.
- Могу читать и понимать технический текст на английском.
Data Science — путь, который строится не за один день, а поэтапно. Каждый этап сам по себе даёт полезный навык, поэтому уже в первые месяцы вы начнёте применять изученное на работе или в повседневной жизни.
Если хотите пройти этот путь системно с преподавателем, познакомьтесь с бесплатными программами нашей ассоциации «Аналитика данных» и «Data Science», а также с другими учебными программами. Когда будете готовы, оставьте заявку — наши специалисты свяжутся с вами.