白盒模型和黑盒模型,就是人工智能的兩種算法,白盒顧名思義,可以用人的理解,就是決策樹,葉子大於5放左邊,葉子小於五放右邊,然後繼續往下一層,就是無限的分類,可以理解,而黑盒模型就不一樣了,是機器學習,多層神經網絡,每個層的一定數量神經元全連接,數據反複自己的調參,加權重,也就是什麼數據重要,什麼不重要,但都要,隻是分量不一樣,然後還會根據結果是否準確率高再刪除一些數據,再進行反向調參,正向叫線性編程,反向就是回歸,反正就是倒騰幾百萬次,數據變來變去,人無法理解,最後出來一個模型,就可以跟現有數據高度吻合
這是一個白盒模型,決策樹,可以一層層的分類,容易理解。
正則化(Regularization):原理、方法與應用
在機器學習和深度學習中,過擬合(Overfitting)是模型訓練的核心挑戰之一——模型在訓練數據上表現極佳,但在未見過的測試數據上泛化能力差。正則化正是解決這一問題的關鍵技術,其核心思想是通過在損失函數中引入“懲罰項”,限製模型參數的複雜度,迫使模型學習更簡單、更具泛化性的特征,而非死記硬背訓練數據中的噪聲。
一、正則化的核心目標與本質
1.核心目標
平衡“模型擬合能力”與“泛化能力”:避免模型因過度追求訓練誤差最小化,而忽略對新數據的適應性。
控製模型複雜度:複雜度過高的模型(如高次多項式、深層神經網絡)易學習訓練數據中的噪聲,正則化通過約束參數規模降低複雜度。
2.本質理解
正則化的本質是**“奧卡姆剃刀原理”在機器學習中的體現**——在多個能擬合數據的模型中,選擇“最簡單”(參數更簡潔、特征更通用)的模型,其泛化能力通常更強。例如:用多項式擬合數據時,一次函數(y=ax+b)比五次函數(y=ax?+bx?+...+e)更簡單,若兩者在訓練數據上誤差接近,一次函數對新數據的預測更穩定。
二、經典正則化方法(針對傳統機器學習)
傳統機器學習(如線性回歸、邏輯回歸、支持向量機)中,正則化主要通過對模型參數的“範數懲罰”實現,常見有L1、L2正則化,以及兩者結合的ElasticNet。
1.L2正則化(嶺回歸,RidgeRegression)
原理
L2正則化通過在損失函數中加入參數的平方和懲罰項,限製參數的“整體規模”(避免參數值過大)。以線性回歸為例:
原始損失函數(均方誤差MSE加入L2正則後的損失函數:其中:(正則化強度):控製懲罰力度,時退化為原始模型,越大懲罰越強(參數越接近0):模型的權重參數(不含偏置項,因偏置項僅影響整體偏移,不直接導致過擬合):為了求導後抵消係數,簡化計算(非必需,僅影響的數值尺度)。
核心特點
參數“收縮”(Shrinkage)
:L2懲罰會讓所有參數向0靠近,但不會將參數直接置為0(參數值整體變小,但保留所有特征)。
抗噪聲能力強
:參數值減小後,模型對輸入數據的微小波動(噪聲)更不敏感,泛化性提升。
適用場景
:特征之間存在相關性、不希望刪除任何特征的場景(如醫學特征,每個指標都可能有意義)。
2.L1正則化(套索回歸,LassoRegression)
原理
L1正則化通過在損失函數中加入參數的絕對值和懲罰項,實現“參數稀疏化”(即強製部分參數變為0,相當於刪除冗餘特征)。以線性回歸為例,加入L1正則後的損失函數:核心特點
參數稀疏化
:L1的絕對值懲罰會導致部分參數被“壓縮”到0,從而自動完成“特征選擇”(刪除對模型貢獻極小的特征)。例:用Lasso處理“房價預測”數據時,若“小區綠化率”的參數被置為0,說明該特征對房價影響可忽略,模型訓練時無需考慮。
計算挑戰:絕對值函數在處不可導,傳統梯度下降無法直接使用,需用“次梯度下降”“坐標下降”等特殊優化方法。
適用場景
:特征維度高、存在大量冗餘特征的場景(如文本分類中的詞袋模型,特征數可能達數萬,需篩選核心詞彙)。
更多小說內容請訪問o o p . t w
3.L1與L2的對比:為什麼L1能稀疏化?
L1和L2的核心差異源於懲罰項的“幾何形狀”,可通過“約束域”直觀理解:假設模型僅含兩個參數和,正則化等價於在“參數空間”中加入一個約束域,損失函數的最優解需落在“約束域與損失函數等高線的切點”上:
L2的約束域是圓形:切點通常不在坐標軸上,因此參數不會為0;
。0為數參一某致導,點頂在落易更點切,如(上軸標坐在點頂的形方正:形方正是域束約的1L
度維比對
)ossaL(化則正1L
)egdiR(化則正2L
)擇選征特/\化疏稀(0為置數參分部果效數參)和方平()和值對絕(式形項罰懲
0為置不,小縮數參有所
性線共重多抗
)個一的中征特關相除刪能可(弱
)響影性關相解緩數參小縮過通(強
度難化優
)法方殊特需,導可不(高
)降下度梯持支,導可(低
景場用適
據數征特餘冗、維高
征特有所留保需、義意有均征特
合結的2L與1L:)絡網性彈(teNcitsalE.4
函失損,項罰懲2L和1L入引時同teNcitsalE,”性線共抗“的2L和”擇選征特“的1L顧兼為