AI到底聰明從手機人臉在哪起識別說
這就是脸识 AI 的"聰明" :不是真的理解,實際上在做這件事 :
- 右邊像素的别说亮度 × 正數(加分)
- 左邊像素的亮度 × 負數(減分)
- 中間像素 × 0(不影響結果)
所以最終的結果 ,什麽是到底鼻子。
那些檢測器裏的聪明从手數字,藍色的机人強度(也是 0 到 255)。我們先用一個更簡單的脸识任務來說明這個過程——區分貓和狗。它專門用來檢測垂直方向的别说邊緣。中間一列全是 0。反向傳播算法在 1986 年就發表了。訓練這樣一個模型 ,到達一個"很少出錯"的狀態。那就是像素。8 層網絡 ,至今已經用了半個多世紀 。算法改進——同時到位,層層加工"的計算結構。以及一種防止網絡"死記硬背"訓練數據的方法(叫 Dropout——隨機"關掉"一部分檢測器 ,
解決方法是:疊加很多層 。
2009 年 ,
為什麽 2012 年才成功?
你可能會好奇:如果"讓電腦自己學"這個想法這麽好 ,AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域 。不能告訴你"這是一隻眼睛" 。判斷"這是不是主人的臉" 。之所以叫這個名字,哪怕是一條 45° 的斜線 ,
彩色照片稍微複雜一點:每個像素需要三個數字,手機往往就不認識你了 。重複幾百萬次之後 ,
讓我用一個具體例子來演示。
Alex Krizhevsky 正是用兩塊遊戲顯卡(NVIDIA GTX 580,
一個現代的人臉識別模型可能有幾百萬到上億個參數。就能找到圖片裏顏色變化的地方。沒有邊緣。對應位置相乘再相加(這個操作的專業名稱叫"卷積" ,下麵有一條橫線,是因為裏麵的某個數字該大一點
電腦會計算:如果某個檢測器裏的某個數字稍微變大一點,49000 名標注工人來自 167 個國家
微信搜索"我沒有三顆心髒"或者掃描二維碼 ,鼻子(一個三角形輪廓) 、這樣就能得到一張新的"邊緣地圖"——原圖中每個位置的數字,它有 8 層。不過你不需要把這個類比想得太深——它隻是一種"層層傳遞 、他們第一次用數學來描述神經元的工作方式。叫"參數"。嘴巴(兩條曲線)
這是整個係統最精巧的部分 ,這些技術讓更深的網絡變得可訓練 。我們得先搞清楚一個更基本的問題 :手機到底是怎麽"人臉識別"的 ?
答案要從一個讓人意外的事實說起——
你的手機看到的不是一張臉 ,
這個困境持續了幾十年,其中前 5 層做的就是我們前麵演示的操作——用檢測器在圖片上滑動 、
就像考試之後對答案:
- 最終結果錯了
- 是因為最後一步的某個數字偏了
- 那個數字偏了,

