Data & Feature Engineeringbeginnermust-know4 min

Feature Engineering Fundamentals

Better data beats fancy algorithms. Where 80% of real-world model accuracy improvements actually come from.

Feature engineering extracts predictive signals from raw data. Techniques must match the target model family: tree-based models need minimal scaling but benefit from target stats and ratios; linear/neural models require strict feature scaling, one-hot encoding, and non-linear log or cyclical transforms (sin/cos). Key topics include handling missingness, high-cardinality encodings, interaction features, and preventing target leakage.

Data & Feature Engineeringintermediatemust-know5 min

SQL Questions in ML Interviews

Mastering the window functions, aggregation patterns, and point-in-time joins tested in ML engineering loops.

SQL is the universal data querying language for building training datasets and feature stores. ML interview SQL questions evaluate your ability to compute sliding window aggregates (Window Functions `OVER()`), avoid data leakage via point-in-time joins, calculate user engagement metrics (DAU/MAU ratios, retention cohorts), and handle missing values (`COALESCE`) or un-nesting arrays (`EXPLODE / UNNEST`).

Data & Feature Engineeringbeginner4 min

Encoding Categorical Variables

Converting non-numeric strings and categories into model-ready numerical matrices without introducing false ordinal rankings.

Categorical Encoding transforms string labels and discrete variables into numerical formats. Low-cardinality features use One-Hot Encoding (binary indicator columns) or Ordinal Encoding (integer mapping for ordered data). High-cardinality features use Target Encoding, Frequency Encoding, or Entity Embeddings. Selecting the wrong encoding introduces artificial distance assumptions or causes high-dimensional sparse matrix explosions.

Data & Feature Engineeringbeginner5 min

Scaling & Normalization

Standardizing numerical feature scales to prevent large magnitude variables from dominating model gradient optimization.

Feature Scaling and Normalization transform numerical features onto comparable numeric scales. Unscaled features cause gradient descent optimization to oscillate slowly and distance based algorithms to miscalculate sample similarities. Standardization (Z-Score) transforms features to zero mean and unit variance, while Min-Max Normalization rescales features into a fixed interval between 0 and 1.

Data & Feature Engineeringbeginner5 min

Datetime & Cyclical Features

Transforming raw timestamps into calendar features and continuous sine cosine cyclical signals for machine learning models.

Datetime and Cyclical Features transform raw timestamp values into informative signals for machine learning models. Raw timestamps (like Unix epoch seconds) are non stationary and difficult for neural networks to interpret. Feature engineering extracts calendar components (Hour of Day, Day of Week, Is Weekend) and uses Sine Cosine Trigonometric Transformations to capture smooth continuous cyclical time patterns.

Data & Feature Engineeringbeginner5 min

Turning Text into Features

Converting raw text strings into numeric vector representations using Bag of Words, TF-IDF, N-grams, and Dense Embeddings.

Turning Text into Features converts unstructured text strings into numerical representations for machine learning models. Traditional methods use sparse token counts like Bag of Words, N-grams, and Term Frequency Inverse Document Frequency (TF-IDF). Modern deep learning approaches extract dense continuous vector embeddings using pretrained Transformer models to capture semantic context.

Data & Feature Engineeringintermediate5 min

High-Cardinality Categoricals

Encoding categorical columns with thousands or millions of unique values without exploding memory or causing data leakage.

High-Cardinality Categorical Features (e.g. User ID, IP Address, Merchant ID, ZIP Code) contain thousands to millions of distinct categories. Naive One-Hot Encoding causes extreme sparse matrix memory explosion and weakens decision tree split power. Modern solutions include Out-of-Fold Target Encoding with Bayesian smoothing, Frequency Encoding, Hashing Trick (FeatureHasher), and Neural Entity Embeddings (Guo & Berkhahn, 2016).

Data & Feature Engineeringintermediate5 min

Feature Crosses & Interactions

Combining two or more categorical features to create non linear interaction signals for linear and deep models.

Feature Crosses create synthetic features by combining two or more categorical or discretized variables. Linear models cannot learn non-linear feature interactions natively without manual feature crosses. Combining features allows linear models and Deep and Cross Networks to memorize specific high value co-occurrences like User-Device or Location-Time combinations.

Data & Feature Engineeringintermediate5 min

Feature Selection Methods

Removing uninformative, redundant, and noisy features to improve model accuracy, reduce overfitting, and speed up training.

Feature Selection Methods select the most relevant subset of input features for model training. Including irrelevant or redundant features increases model variance, causes overfitting, slows down inference latency, and degrades model interpretability. Engineers select features using Filter Methods (statistical tests), Wrapper Methods (Recursive Feature Elimination), and Embedded Methods (L1 Lasso Regularization).

Data & Feature Engineeringintermediate5 min

Using Embeddings as Features

Extracting pre trained continuous dense vector representations to represent complex text, images, and graph entities in downstream models.

Using Embeddings as Features utilizes pre trained dense vector representations as inputs for downstream machine learning models. Instead of engineering manual features from complex data like text, images, or graph nodes, pre trained deep learning models compress complex entities into continuous dense vectors. These embedding features capture high level semantic relationships and transfer learning knowledge for tabular classifiers and ranking models.

Data & Feature Engineeringintermediate5 min

Data Quality & Validation

Automating data quality assertions and schema validation checks to catch corrupted features before they reach production models.

Data Quality and Validation enforces strict automated checks on incoming data pipelines. Garbage in results in garbage out. Validation frameworks test for missing values, unexpected null surges, out of range numerical values, schema type mismatches, and sudden distribution drift before data enters training or inference pipelines.

Data & Feature Engineeringintermediate5 min

Labelling: Weak Supervision & Annotation

Generating training labels at scale using human annotation crowdsourcing, weak supervision rules, and pseudo labeling.

Labeling Strategies generate ground truth training annotations for supervised machine learning models. Manual human data annotation is slow, expensive, and difficult to scale across millions of samples. Modern teams combine Manual Annotation (crowdsourcing), Weak Supervision (programmatic heuristic labeling rules via Snorkel), Pseudo Labeling, and Pre-Trained Foundation Models to generate training datasets rapidly.

Data & Feature Engineeringintermediate5 min

Inter-Annotator Agreement

Measuring consensus, consistency, and label quality among multiple human annotators using Fleiss Kappa and Cohen Kappa statistics.

Inter Annotator Agreement measures consistency and consensus among human data annotators. Unclear task guidelines, subjective definitions, or careless annotators result in noisy contradictory ground truth labels. Statistical metrics like Cohen Kappa, Fleiss Kappa, and Krippendorff Alpha quantify annotation agreement beyond random chance, ensuring high quality training datasets for machine learning models.

Data & Feature Engineeringintermediate5 min

Sampling from Huge Datasets

Extracting representative training samples from multi terabyte datasets using Reservoir, Stratified, and Importance Sampling.

Sampling from Huge Datasets enables training machine learning models on multi-terabyte data lakes. Loading massive raw datasets into memory is computationally impossible. Engineers use Stratified Sampling to preserve class balances, Reservoir Sampling to sample streaming data in a single pass, and Importance Sampling to focus compute on informative or rare samples.

Data & Feature Engineeringintermediate5 min

Deduplication & Near-Duplicate Detection

Identifying and removing exact and near duplicate documents, images, and web pages at scale using MinHash and LSH.

Deduplication and Near Duplicate Detection removes repetitive content from training sets and search catalogs. Duplicate data causes data leakage between train and test splits, wastes vector database storage, and degrades LLM pre-training efficiency. Engineers use Exact Hashing (MD5, SHA-256) for exact matches, MinHash with Locality Sensitive Hashing (LSH) for near-duplicate text, and Perceptual Hashing (pHash) for images.

Data & Feature Engineeringintermediate5 min

SQL Window Functions

Calculating rolling aggregations, lead lag temporal features, and ranked partitions using advanced SQL window functions.

SQL Window Functions perform calculations across sets of table rows related to the current row without collapsing rows into single summaries. Unlike standard GROUP BY queries, window functions maintain individual row identities while computing rolling averages, cumulative sums, lead and lag temporal features, and partition rankings. They form the backbone of offline feature engineering for machine learning pipelines.

Data & Feature Engineeringintermediate5 min

Streaming vs Batch Data

Comparing scheduled bulk dataset processing against real time sub second continuous event streams.

Streaming vs Batch Data processing represents the two core paradigms for ingestion and feature computation. Batch Data processing executes jobs on large historical datasets at scheduled intervals (nightly Spark jobs), offering high throughput and low cost at the expense of data freshness. Streaming Data processing ingests events continuously as they occur (Kafka and Flink), delivering sub second freshness for real time machine learning applications.

Data & Feature Engineeringintermediate5 min

Lake vs Warehouse vs Lakehouse

Comparing unstructured object storage data lakes against relational data warehouses and unified ACID data lakehouses.

Lake vs Warehouse vs Lakehouse compares the three major enterprise data storage paradigms. Data Lakes (AWS S3) store raw unstructured data at low cost but lack ACID transactions and query structure. Data Warehouses (Snowflake) offer fast structured SQL queries but are expensive for raw file storage. Data Lakehouses (Delta Lake) combine low cost object storage with ACID transactions, indexing, and direct machine learning engine integrations.

Data & Feature Engineeringintermediate5 min

Parquet & Columnar Storage

Understanding why columnar binary storage formats outperform row oriented CSV text files for feature engineering and analytical querying.

Parquet and Columnar Storage store tabular data organized by columns rather than by rows. Traditional CSV or database row formats scan entire rows sequentially, reading unnecessary columns during feature selection queries. Apache Parquet uses columnar organization, Snappy compression, dictionary encoding, and min max statistic skipping to achieve 10x faster query speeds and 75% smaller storage footprints.

Data & Feature Engineeringintermediate5 min

Handling PII in Training Data

Sanitizing, redacting, and anonymizing Personally Identifiable Information to protect user privacy and comply with GDPR regulations.

Handling PII in Training Data ensures sensitive user records are protected before training machine learning models. Personally Identifiable Information (PII) includes social security numbers, credit card details, real names, home addresses, and phone numbers. Leaking raw PII into training datasets creates privacy violations and legal liabilities under regulations like GDPR and CCPA. Sanitizing pipelines use regex redactors, Named Entity Recognition, hashing, and differential privacy to anonymize training data.

Data & Feature Engineeringadvanced5 min

Target Encoding Without Leakage

How naive target encoding accidentally feeds ground-truth labels to features, inflating cross-validation while destroying live test performance.

Target Encoding replaces categorical values with the mean target value of that category. If calculated naively across the entire dataset, Target Encoding introduces catastrophic Target Leakage: the model memorizes small-sample target means (especially for single-instance categories where target_mean = target_value), achieving 100% training accuracy but failing on unseen data. Mitigating target leakage requires Out-of-Fold (OOF) cross-validation calculation, Gaussian noise addition, and smoothing shrinkage.

Data & Feature Engineeringadvanced5 min

Schema Evolution & Contracts

Managing backward compatible database schema changes and enforcing API contracts across machine learning data pipelines.

Schema Evolution and Contracts manage structural database changes without breaking machine learning models. As upstream data sources evolve over time, adding, renaming, or deleting database columns can crash feature stores and inference endpoints. Data Contracts establish formal schema specifications between teams, while file formats like Apache Avro and Parquet support backward compatible schema evolution.

Data & Feature Engineeringadvanced5 min

Spark & Distributed Data Processing

Processing multi terabyte feature engineering datasets in parallel across distributed cluster worker nodes using Apache Spark.

Apache Spark provides in memory distributed data processing for large scale feature engineering. Single machine Pandas processing fails when datasets exceed local RAM memory limits. Spark partitions massive datasets across a cluster of worker nodes managed by a Driver node, performing parallel transformations, lazy evaluation, and distributed feature extraction across billions of rows.

Data & Feature Engineeringadvanced5 min

Data Skew & Shuffle Costs

Identifying and mitigating data partition imbalance and expensive network shuffle operations in distributed Spark jobs.

Data Skew and Shuffle Costs cause performance bottlenecks in distributed data processing. Data Skew occurs when a single partition receives far more data than others, stranding cluster workers. Data Shuffle moves data across cluster network nodes during joins or aggregations, causing heavy network I/O overhead. Engineers eliminate skew and shuffle costs using Salting, Broadcast Joins, and pre-partitioning strategies.

SCROLL · SAVE · TAP TO GO DEEPER