Skip to content
Part IA Easter Term

Variance and Standard Deviation

Spread in Distributions

The expectation E[X]E[X] gives the centre of a distribution, but says nothing about spread. Two distributions can have the same mean but very different variability.

Example: All three distributions below have mean 3, but very different spread:

ValueDist ADist BDist C
101/30
2000
311/30
4000
501/31
  • A is concentrated at 3 (no spread)
  • B spreads evenly across 1, 3, 5 (medium spread)
  • C spreads to 3 and 5 (different spread)

We need a measure of spread.

Variance

Definition

The variance of XX is:

Var(X)=E[(Xμ)2]\text{Var}(X) = E[(X - \mu)^2]

where μ=E[X]\mu = E[X]. This is the expected squared deviation from the mean.

Properties:

  • Variance 0\geq 0
  • Variance =0= 0 iff XX is constant (almost surely)
  • Variance increases as values spread out from the mean

Computational Formula

Var(X)=E[X2]E[X]2\text{Var}(X) = E[X^2] - E[X]^2

Proof:

E[(Xμ)2]=E[X22μX+μ2]=E[X2]2μE[X]+μ2=E[X2]2μ2+μ2=E[X2]μ2E[(X - \mu)^2] = E[X^2 - 2\mu X + \mu^2] = E[X^2] - 2\mu E[X] + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2

This formula is often easier: compute E[X]E[X] and E[X2]E[X^2], then subtract.

Standard Deviation

The standard deviation is the square root of variance:

σX=Var(X)\sigma_X = \sqrt{\text{Var}(X)}

Why take the square root? Variance has units of X2X^2. Standard deviation returns to the original units.

If XX is in metres, Var(X)\text{Var}(X) is in square metres, but σX\sigma_X is in metres.

Example: Fair Die

E[X]=72,E[X2]=916E[X] = \frac{7}{2}, \quad E[X^2] = \frac{91}{6}

Var(X)=916494=18214712=35122.92\text{Var}(X) = \frac{91}{6} - \frac{49}{4} = \frac{182 - 147}{12} = \frac{35}{12} \approx 2.92

σX=35121.71\sigma_X = \sqrt{\frac{35}{12}} \approx 1.71

Properties of Variance

1. Constants

Var(c)=0\text{Var}(c) = 0

Var(X+c)=Var(X)\text{Var}(X + c) = \text{Var}(X)

Adding a constant shifts the distribution but doesn’t change spread.

2. Scaling

Var(aX)=a2Var(X)\text{Var}(aX) = a^2 \text{Var}(X)

Proof: Var(aX)=E[(aX)2]E[aX]2=a2E[X2]a2E[X]2=a2Var(X)\text{Var}(aX) = E[(aX)^2] - E[aX]^2 = a^2 E[X^2] - a^2 E[X]^2 = a^2 \text{Var}(X).

3. Sum of Independent Variables

If XX and YY are independent:

Var(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y)

Warning: This requires independence! Without it:

Var(X+Y)=Var(X)+Var(Y)+2Cov(X,Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) + 2\text{Cov}(X, Y)

4. General Sum Formula

Var(X+Y)=Var(X)+Var(Y)+2E[(XE[X])(YE[Y])]\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y) + 2 E[(X - E[X])(Y - E[Y])]

The last term is twice the covariance.

Example: Sums of I.I.D. Variables

Let X1,X2,,XnX_1, X_2, \ldots, X_n be i.i.d. with variance σ2\sigma^2. What is Var(Xi)\text{Var}(\sum X_i)?

By independence:

Var(X1++Xn)=nσ2\text{Var}(X_1 + \cdots + X_n) = n\sigma^2

For the average Xˉ=1nXi\bar{X} = \frac{1}{n}\sum X_i:

Var(Xˉ)=Var(1nXi)=1n2nσ2=σ2n\text{Var}(\bar{X}) = \text{Var}\left(\frac{1}{n}\sum X_i\right) = \frac{1}{n^2} \cdot n\sigma^2 = \frac{\sigma^2}{n}

Interpretation: Averaging reduces variance. More samples = more precise estimate.

Chebyshev’s Inequality Preview

Variance bounds how often XX deviates far from μ\mu. Chebyshev’s inequality:

P(Xμkσ)1k2P(|X - \mu| \geq k\sigma) \leq \frac{1}{k^2}

At most 1/91/9 of the distribution lies more than 3 standard deviations from the mean, for any distribution.

Summary

QuantityFormula
VarianceVar(X)=E[(Xμ)2]\text{Var}(X) = E[(X - \mu)^2]
ComputationalVar(X)=E[X2]E[X]2\text{Var}(X) = E[X^2] - E[X]^2
Standard deviationσX=Var(X)\sigma_X = \sqrt{\text{Var}(X)}
ScalingVar(aX)=a2Var(X)\text{Var}(aX) = a^2 \text{Var}(X)
Shift invariantVar(X+c)=Var(X)\text{Var}(X + c) = \text{Var}(X)
Independent sumVar(X+Y)=Var(X)+Var(Y)\text{Var}(X + Y) = \text{Var}(X) + \text{Var}(Y)