NotesRSS feed
Self-contained concept references I keep while studying machine learning, deep learning, and systems. Each note stands on its own.
PyTorch — Tensors & Mechanics
- PyTorch Basics — dtype conversion, `.item()`, clamp, round, NLL loss, sigmoid, sqrt, in-place updates & `no_grad`, `requires_grad`, `torch.autograd.grad`, one-hot, (n,)↔(n,1)
- PyTorch nn Modules — `nn.Linear`, `nn.Dropout`, custom `nn.Module`, manual weight init
- PyTorch Tensor Indexing: Slicing, Masking, Fancy Indexing — slicing (view) vs boolean masking (flattens) vs integer/fancy indexing; `gather`, `index_select`, `where`, `masked_fill`
- Tensor Memory Layout: Storage, Strides, Contiguity, view/reshape/permute — storage/strides/`data_ptr`, contiguity, `view` vs `reshape`, `permute`/`transpose`, `.contiguous()`
- Joining & Splitting Tensors: cat, stack, split, chunk — `cat` (existing dim) vs `stack` (new dim), `chunk` (count) vs `split` (size), `unbind`
- Broadcasting in PyTorch — right-to-left alignment rules, stride-0 mechanism, (n,) vs (n,1) silent bug, `expand` vs `repeat`
- Tensor Dtypes, Casting, and Type Promotion — dtype landscape, fp16 vs bf16, casting & truncation, type promotion, NumPy float64 trap
- Tensor Devices & Device Management (CPU / GPU) — CPU/GPU/MPS, create-on-device, `model.to` (in-place) vs `tensor.to` (copy), device consistency, transfer overhead, `pin_memory`/`non_blocking`
NumPy & Python
- NumPy Basics — one-hot, argmax, rounding, type conversion, random matrices, `default_rng`, transpose, broadcasting, reshape, reductions, norms, ReLU, stable sigmoid
- Python Basics — `match`, walrus, reshape/transpose tricks, string ops, dict max, char↔int, `assert` best practices
Training Dynamics & Optimization
- Optimization — Hessian eigenvalues, saddle points, condition number, adaptive optimizers, Newton's method, convergence, 2nd-order at LLM scale
- Learning Rate: Effect on Convergence & How to Tune It — LR effect on convergence/stability, tuning (log-scale, loss-curve, LR range test); SGD vs SGD+momentum vs Adam update rules + when-preferred; batch-size-1 SGD; warmup + decay schedules
Generalization & Model Fitting
- Diagnosing Overfitting vs Underfitting — diagnosing via train/val curves, bias-variance, fixes, val<train edge case, quick triage
- Regularization: L2 vs Dropout vs Early Stopping — L2 vs dropout vs early stopping mechanics, L1 vs L2, inverted dropout, early-stopping↔L2, other approaches, reg term & validation loss
- Regression: OLS and R² — OLS (normal equations), R² definition/interpretation, negative R², adjusted R², polynomial fitting (`np.polyfit` / `Polynomial.fit`)
- Feature Selection: Removing Low-Variance / Uncorrelated Features — low-variance / uncorrelated feature removal, interpreting `np.var`, univariate caveats, mutual info, model-based selection
- Preprocessing: Fit on Train, Apply Everywhere — fit on train / apply everywhere, fit vs transform, data leakage, pipelines, CV
Transformers & Sequence Models
- Self-Attention — scaled dot-product attention, QKV, softmax gotchas
- Attention-Free / Sub-Quadratic Architectures — sub-quadratic landscape (linear attention, SSM/Mamba, Hyena, AFT), train/infer duality; linear attention deep-dive (kernel factorization, `(QKᵀ)V→Q(KᵀV)`, `d×d` recurrent state, feature maps, decay→RetNet/RWKV)
- Positional Encoding — sinusoidal PE, even/odd indices, frequency intuition, RoPE vs learned vs sinusoidal
- Transformer Architecture — FFN role, attention vs FFN, memory view of FFN
- Normalization — LayerNorm formula, variance, LayerNorm vs BatchNorm
- Tokenization — how BPE/WordPiece handles rare words, numbers, code
- Perplexity — definition, stable log-prob implementation, why not to multiply probs
- Scaling Laws & Chinchilla — Chinchilla (C≈6ND, 20 tokens/param), Kaplan-era under-training, fitted loss model, inference-cost correction (overtraining), optimal-operating-point via local-quadratic fit
Math Foundations
- Linear Algebra Basics — singular matrices (equivalent characterizations, why they break OLS), near-singular / condition number, detecting rank-deficiency
- Taylor Series — definition, common expansions, computation, relevance to ML
Reinforcement Learning
- RLHF — Reinforcement Learning from Human Feedback — RLHF pipeline (pretraining → SFT → reward model + PPO), SFT model & its 3 roles, reward model from pairwise preferences (Bradley-Terry, architecture, margin, shift-invariance), PPO + KL penalty, reward hacking, DPO/RLAIF
- RL Fundamentals — on-policy vs off-policy (behavior/target policies, Q-learning vs SARSA, deadly triad, importance sampling, PPO clipped ratio, RLHF connection); GAE & the bias/variance tradeoff (advantage/baseline, TD residual, λ dial, γ vs λ)
Misc ML Concepts
- ML Concepts — Conv2d parameters, sigmoid, log
