Dealing with Duplicates and Outliers
Course Content
0 / 31 completedCourse Overview
Refresher on Pandas Data Structures (Series, DataFrame)
Importing and Exporting Data (CSV, Excel, Databases)
High Performance Data Handling with Pandas
Working with String Data Types
Text Preprocessing Techniques
Regular Expressions for Advanced String Cleaning and Feature Engineering
Vectorized String Operations with apply() and lambda functions
Creating and Working with Date Time Objects
Datetime, Indexing and Selection
Datetime manipulation
Aggregating Time-series Data
Working with Levels in Multindex
Multi-level Indexing (Hierachial Indexing)
Stacking and Unstacking Data for Different Views
Fancy Indexing with boolean masks and conditions
Strategies for Handling Missing Values
Detecting Missing Values
Data Validation and Error Correction with Custom Functions
Dealing with Duplicates and Outliers
Creating New Features and Columns with Custom Logic
Vectorized Operations with apply(), map() and lambda functions
Merging & Joining DataFrames (inner, outer, left, right)
Concatenating DataFrames along rows & columns
Lambda Functions and Applying Custom Logic
User-Defined Functions (UDFs) for Data Transformations
Integrating Pandas with other Data Science Libraries (NumPy, Scikit-learn)
Profiling DataFrames to Identify Bottlenecks
Memory Optimization Techniques (dtypes, memory usage)
Best Practices for Efficient & Clean Pandas Code
Vectorized Operations vs. Loops for Efficiency