Python Pandas Data Cleaning Cheat Sheet for Data Analysts
Essential quick-reference syntax guide for data cleaning and transformation in Pandas: DataFrame filtering, missing value imputation, GroupBy aggregations, and string parsing.
Who This Guide Is For
Data analysts preparing datasets in Python, freshers learning Pandas, and analytics practitioners seeking fast syntax lookup.
Common Workplace Use Cases:
- Removing duplicate transactional records and normalizing currency strings.
- Imputing missing values with median values across skewed customer cohorts.
- Grouping multi-channel sales records with custom aggregation dictionaries.
- Merging disparate CSV exports using relational key joins.
Comprehensive Syntax & Formula Preview
Ungated Reference1. Ingestion & Rapid Data Inspection
How to load external datasets and immediately audit dimensions, null values, and column data types.
import pandas as pd
# Load CSV and inspect structure
df = pd.read_csv('ecommerce_orders.csv')
print(df.shape) # (rows, columns)
print(df.dtypes) # Column data types
print(df.isna().sum()) # Count of missing values per column
df.head(5) # Preview first 5 rows2. Conditional Filtering & Subsetting
Extracting specific business segments using multiple boolean conditions.
# Filter completed orders above 1,000 INR from North region
high_value_north = df[
(df['status'] == 'Completed') &
(df['amount'] >= 1000) &
(df['region'].isin(['North', 'NCR']))
]
# Alternative readable syntax using query()
high_value_north = df.query("status == 'Completed' and amount >= 1000")3. Data Cleaning & Handling Missing Values
Deduplicating rows and replacing NaN values without creating imputation bias.
# Deduplicate by transaction ID keeping the latest update
df = df.drop_duplicates(subset=['order_id'], keep='last')
# Impute missing numerical values with cohort median
df['discount'] = df['discount'].fillna(0)
df['delivery_days'] = df.groupby('region')['delivery_days'].transform(
lambda x: x.fillna(x.median())
)4. GroupBy & Multi-Metric Summary Aggregations
Calculating multiple distinct metrics on different columns in a single vectorized pass.
# Executive cohort performance summary
cohort_kpis = df.groupby('customer_segment').agg(
total_orders=('order_id', 'count'),
total_revenue=('amount', 'sum'),
avg_order_value=('amount', 'mean'),
median_discount=('discount', 'median')
).reset_index()
# Sort descending by total revenue
cohort_kpis = cohort_kpis.sort_values(by='total_revenue', ascending=False)Students, educators, bloggers, and tech writers may cite or reference this quick-reference guide in coursework, portfolio articles, or technical guides with proper attribution:
Key Topics Covered
- Data Ingestion & Inspection: read_csv(), info(), describe(), isna()
- Filtering & Conditional Selection: Boolean masking and query()
- Missing Data Handling: dropna(), fillna(), and forward-fill bfill()
- GroupBy & Multi-Metric Aggregation: groupby().agg() dictionaries
Apply These Formulas to Real Business Data
Master the full data analytics toolchain in our Live Online or Gurugram Classroom program with hands-on projects and interview preparation.