Zagadnienia

2. Metoda najmniejszych kwadratów (MNK)

Metoda najmniejszych kwadratów (MNK). Sformułowanie zadania. Wyznaczanie optymalnych wartości parametrów. Oszacowanie błędu przybliżenia. Algebraiczne własności MNK. (1 wykład)

2.1. Wprowadzenie

Zadanie.
Dane jest m+1 ciągów n-elementowych o wyrazach rzeczywistych:

Y=Ytt=1,…,n
X1=Xt,1t=1,…,n
X2=Xt,2t=1,…,n
…
Xm=Xt,mt=1,…,n.

Wyznaczyć współczynniki b1,…,bm∈R, które minimalizują błąd przybliżenia Y przez kombinację liniową Y^

Y^t=b1⁢Xt,1+…+bm⁢Xt,m.

Czyli mamy rozwiązać zadanie optymalizacyjne

∑t=1nξt2⟶m⁢i⁢n,⁢⁢⁢ gdzie ⁢⁢⁢⁢⁢⁢ξt=Yt-Y^t.

W zastosowaniach ekonometrycznych Y^ nazywa się zmienną modelową w odróżnieniu od zmiennej empirycznej Y.

W dalszym ciągu będziemy stosować zapis macierzowy:
Y będzie zapisywać jako wektor kolumnowy czyli macierz n×1

Y=Y1…Yn,

X jako macierz n×m, której kolumnami są Xi

X=X1,1X1,2…X1,mX2,1X2,2…X2,m…………Xn,1Xn,2…Xn,m,

szukane parametry bi jako wektor kolumnowy m×1

B=b1…bm,

podobnie składnik resztowy (residualny) ξ jako wektor kolumnowy n×1

ξ=ξ1…ξn.

Wówczas możemy zapisać

Y^=X⁢B,⁢⁢⁢ξ=Y-Y^=Y-X⁢B.

Suma kwadratów reszt (SKR) wynosi

∑t=1nξt2=ξ2=ξT⁢ξ=YT-BT⁢XT⁢Y-X⁢B=S⁢K⁢R⁢b1,…,bm.

Zauważmy, że funkcja

S⁢K⁢R:Rm⟶R

jest funkcją kwadratową o wartościach nieujemnych, a zatem osiąga swoje minimum.

Twierdzenie 2.1

Jeżeli ciągi X1, … , Xm są liniowo niezależne to S⁢K⁢R przyjmuje minimum dokładnie w jednym punkcie

Bm⁢i⁢n=XT⁢X-1⁢XT⁢Y. (2.1)

Minimum to wynosi

S⁢K⁢Rm⁢i⁢n=S⁢K⁢R⁢Bm⁢i⁢n=YT⁢Y-YT⁢X⁢XT⁢X-1⁢XT⁢Y.

Dowód.
Krok 1. Najpierw pokażemy, że macierz XT⁢X jest odwracalna a zatem wzór 2.1 jest poprawny.

XT⁢Xi,j=∑t=1nXt,i⁢Xt,j=XiT⁢Xj.

m×m macierz XT⁢X jest macierzą Grama wektorów Xi. Zatem jeżeli Xi są liniowo niezależne to macierz XT⁢X jest nieujemnie określona, a zatem odwracalna (por. [1] §VI.11 Wniosek 11.4).

Krok 2. Pokażemy, że Bm⁢i⁢n to punkt w którym przyjmowane jest minimum globalne.

B=Bm⁢i⁢n+b,⁢⁢⁢⁢⁢b≠0,
S⁢K⁢R⁢Bm⁢i⁢n+b=YT-Bm⁢i⁢nT⁢XT-bT⁢XT⁢Y-X⁢Bm⁢i⁢n-X⁢b=
=(YT-Bm⁢i⁢nTXT)(Y-XBm⁢i⁢n)-(YT-Bm⁢i⁢nTXT)Xb-bTXT(Y-XBm⁢i⁢n)+bTXTXb=
=S⁢K⁢R⁢Bm⁢i⁢n-2⁢bT⁢XT⁢Y-X⁢Bm⁢i⁢n+bT⁢XT⁢X⁢b.

Zauważmy, że drugi człon jest równy 0

XT⁢Y-X⁢Bm⁢i⁢n=XT⁢Y-X⁢XT⁢X-1⁢XT⁢Y=XT⁢Y-XT⁢X⁢XT⁢X-1⁢XT⁢Y=0,

a trzeci jest nieujemny dla niezerowych b ponieważ macierz XT⁢X jest nieujemnie określona. Zatem dla b≠0

S⁢K⁢R⁢Bm⁢i⁢n+b>S⁢K⁢R⁢Bm⁢i⁢n.

Krok 3. Wyznaczamy S⁢K⁢R⁢Bm⁢i⁢n.
Ponieważ jak pokazaliśmy powyżej XT⁢Y-X⁢Bm⁢i⁢n=0 to

S⁢K⁢R⁢Bm⁢i⁢n=YT-Bm⁢i⁢nT⁢XT⁢Y-X⁢Bm⁢i⁢n=YT⁢Y-X⁢Bm⁢i⁢n=
=YTY-YTXBm⁢i⁢n=YTY-YTX(XTX)-1XTY.
□
Wniosek 2.1

Dla B=Bm⁢i⁢n zachodzą następujące zależności:
1. Wektor składników resztowych ξ jest prostopadły do wszystkich kolumn Xi

XT⁢ξ=0.

2. Wektor składników resztowych ξ jest prostopadły do wektora Y^

Y^T⁢ξ=0.

3. Uogólnione twierdzenie Pitagorasa

YT⁢Y=Y^T⁢Y^+ξT⁢ξ⁢⁢⁢ czyli ⁢⁢⁢⁢Y2=Y^2+ξ2.

Dowód.
Ad 1. Z definicji ξ mamy

XT⁢ξ=XT⁢Y-X⁢B=XT⁢Y-X⁢XT⁢X-1⁢XT⁢Y=XT⁢Y-XT⁢X⁢XT⁢X-1⁢XT⁢Y=0.

Ad 2. Y^ jest kombinacją liniową Xi zatem

Y^T⁢ξ=BT⁢XT⁢ξ=0.

Ad 3. Ponieważ ξ i Y^ są prostopadłe to

YT⁢Y=Y^T+ξT⁢Y^+ξ=Y^T⁢Y^+ξT⁢ξ.
Uwaga 2.1

Gdy ciągi X1, … , Xm są liniowo zależne to wybieramy spośród nich maksymalny podzbiór liniowo niezależny Xj1, … , Xjk (k=r⁢a⁢n⁢k⁢⁢X<m). Niech X~ będzie n×k macierzą, której kolumnami są Xji.
Zmienna modelowa jest wyznaczona jednoznacznie (niezależnie od wyboru ciągów liniowo niezależnych)

Y^=X~⁢B~m⁢i⁢n,

gdzie

B~m⁢i⁢n=X~T⁢X~-1⁢X~T⁢Y.

Natomiast S⁢K⁢R przyjmuje minimum na podprzestrzeni afinicznej złożonej z punktów postaci

B=B∗+b,

gdzie

Bj∗=⁡B~m⁢i⁢n,igdyj=ji,0gdyj∉j1,…,jk,⁢

a wektory b opisują zależności między ciągami Xi

b∈k⁢e⁢r⁢X=v∈Rm:X⁢v=0.

Ponadto spełnione są punkty 1,2 i 3 z powyższego wniosku.

2.2. Odrobina algebry liniowej

Oznaczmy przez X podprzestrzeń liniową przestrzeni Rn rozpiętą przez kolumny macierzy X,

X=l⁢i⁢n⁢X1,…,Xm=X⁢V:V∈Rm.
Lemat 2.1

Macierz kwadratowa n×n

P=X⁢XT⁢X-1⁢XT

jest macierzą rzutu prostopadłego na podprzestrzeń X, a macierz

M=I⁢dn-P

macierzą rzutu prostokątnego na podprzestrzeń X⟂ (dopełnienie ortogonalne X).

Dowód.
Mnożenie przez macierz P zachowuje wektory z X

P⁢X⁢V=X⁢XT⁢X-1⁢XT⁢X⁢V=X⁢XT⁢X-1⁢XT⁢X⁢V=X⁢V

i anihiluje wektory prostopadłe do X

XT⁢W=0⇒P⁢W=X⁢XT⁢X-1⁢XT⁢W=X⁢XT⁢X-1⁢XT⁢W=0.

Natomiast mnożenie przez macierz M anihiluje wektory z X i zachowuje wektory prostopadłe do X

M⁢X⁢V=X⁢V-P⁢X⁢V=X⁢V-X⁢V=0,⁢⁢⁢M⁢W=W-P⁢W=W.
□
Lemat 2.2

1. Macierze P i M są symetryczne i idempotentne

PT=P,⁢⁢⁢MT=M,⁢⁢⁢P⁢P=P,⁢⁢⁢M⁢M=M.

2. Rząd macierzy P wynosi m, a M n-m.

r⁢k⁢⁢P=m,⁢⁢⁢r⁢k⁢⁢M=n-m.

3. Ślad macierzy P wynosi m, a M n-m.

t⁢r⁢⁢P=m,⁢⁢⁢t⁢r⁢⁢M=n-m.

4. Istnieje taka n×n macierz unitarna U (tzn. UT⁢U=I⁢d), że macierze UT⁢P⁢U i UT⁢M⁢U są diagonalne o wyrazach 0 lub 1. UT⁢P⁢U ma na przekątnej m jedynek, a UT⁢M⁢U n-m.

Dowód.
Ad.1. P i M są macierzami rzutów zatem P⁢P=P i M⁢M=M. Symetria wynika z faktu, że transpozycja jest przemienna z odwracaniem macierzy

PT=X⁢XT⁢X-1⁢XTT=X⁢XT⁢XT-1⁢XT=X⁢XT⁢X-1⁢XT=P,
MT=I⁢d-PT=I⁢dT-PT=I⁢d-P=M.

Ad.2. Rząd macierzy jest równy wymiarowi obrazu, zatem

r⁢k⁢⁢P=d⁢i⁢m⁢⁢X=r⁢k⁢⁢X=m,
r⁢k⁢⁢M=d⁢i⁢m⁢⁢X⟂=n-m.

Ad.3. P jest macierzą rzutu na podprzestrzeń m wymiarową, a zatem ma m wartości własnych równych 1 i n-m równych 0. Natomiast M jest macierzą rzutu na podprzestrzeń n-m wymiarową, a zatem ma n-m wartości własnych równych 1 i m równych 0. Ponieważ ślad jest to suma wartości własnych to wynosi on odpowiednio m i n-m.
Ad.4. Niech wektory U1,…,Um tworzą bazę ortonormalną podprzestrzeni X, a Um+1,…⁢Un bazę podprzestrzeni X⟂. Niech U będzie macierzą o kolumnach Ui. Wówczas

UiT⁢Uj=⁡1 gdy i=j,0 gdy i≠j,⁢
UiT⁢P⁢Uj=⁡1 gdy i=j≤m,0 gdy i≠j∨i>m,⁢
UiT⁢M⁢Uj=⁡1 gdy i=j>m,0 gdy i≠j∨i≤m.⁢

Zatem wszystkie trzy macierze są diagonalne i zero-jedynkowe.

□

Treść automatycznie generowana z plików źródłowych LaTeXa za pomocą oprogramowania wykorzystującego LaTeXML.

Projekt współfinansowany przez Unię Europejską w ramach Europejskiego Funduszu Społecznego.

Projekt współfinansowany przez Ministerstwo Nauki i Szkolnictwa Wyższego i przez Uniwersytet Warszawski.