Jak zrobić bayesowską sieć neuronową? Podobnie jak Bayesian linear regression - zakładamy, że wagi pochodzą z rozkładu normalnego, likelihood (wyjście) również.
Maximum a posteriori
Analogicznie jak w Maximum a posteriori dla modeli liniowych, jeśli będziemy celować w estymację MAP dla priora i likelihood Gaussowskich, to dostajemy funkcję straty w postaci Mean Squared Error + regularyzacja L2.
Jednak będzie to wciąż estymacja Maximum a Posteriori, tzn. szukamy takich wag, które zmaksymalizują (punktowo!) posterior. Nie dostajemy aktualizacji całych rozkładów wag, a jedynie ich średnie.
Możemy nawet zamodelować aleatoric uncertainty poprzez to, że sieć będzie miała dwa wyjścia - reprezentujące średnią i wariancję rozkładu. Ale to nie zmienia faktu, że w czasie trenowania będziemy estymować wziąć MAP, więc nie będziemy aktualizować pełnych rozkładów wag modelu.