skip to content
Victor Guerra

Notes / Math Foundations

Probability Distributions

Updated Sep 10, 20261 min read

A probability distribution describes the possible outcomes of a random variable and their probabilities. The ones that matter most in ML:

DistributionDescribesParametersML connection
Gaussian / Normalcontinuous real valuesmean μ, variance σ²MSE = Gaussian-noise MLE (loss-functions); weight init; noise models
Bernoullisingle binary trial (success/fail)pbinary classification, dropout mask
Categorical / Multinoullione outcome of K categoriesp₁…p_Ksoftmax output; multi-class classification
Binomial# successes in n independent Bernoulli trialsn, pcount of heads in n flips
Multinomialcounts across K categories over n trialsn, p₁…p_Kgeneralization of binomial; word counts

The generalization ladder:

  • Bernoulli → Categorical (2 outcomes → K outcomes, single trial).
  • Bernoulli → Binomial (single trial → n trials, still binary).
  • Binomial → Multinomial (binary → K outcomes, n trials).
  • Categorical → Multinomial (single trial → n trials, K outcomes).

So: single-trial vs n-trial on one axis, binary vs K-way on the other.

Cross-entropy is the categorical likelihood; BCE the Bernoulli likelihood — which is why they’re the natural classification losses (loss-functions). The softmax output layer parameterizes a categorical distribution over classes.


Related: loss-functions, perplexity, pca-svd, numpy-basics