深度學習教程：從頭開始用 PyTorch 實現 YOLO (v3)（一）

2018-08-27 23:45:23 深度學習中文社區

本教程由深度學習中文社區(dl.tustcs.com)發佈,關注我發送私信"YOLO"獲取代碼

前言

從深度學習的最新發展來看，對象檢測是一個非常有用的領域。近年來人們發現了許多用於目標檢測的算法，其中包括YOLO、SSD、Mask-RCNN 和 ValnANET 等等。

在過去的幾個月裡，我一直致力於改進目標檢測的方法。在這一過程我漸漸認識到，學習對象檢測的最佳途徑是從頭開始實現一遍。這正是本教程中所要做的。

我們將使用 PyTorch 來實現基於 YOLO V3 的對象檢測器。

本教程的代碼基於 Python 3.5, 和 PyTorch 0.4。

本教程分為5個部分：

第1部分（本文）：理解 YOLO 的原理
第2部分：創建網絡結構
第3部分：實現網絡的前向傳遞
第4部分：目標分閾值和非極大值抑制
第5部分：網絡的輸入和輸出

背景知識

理解卷積神經網絡的原理，包括 Residual Blocks, skip connections, 和 Upsampling。
目標檢測的定義、邊界框迴歸、IoU 和非極大值抑制。
PyTorch 的基本用法。

什麼是 YOLO？

YOLO 的全稱是 You Only Look Once。它是一種基於深度卷積神經網絡的目標檢測器。我們先了解 YOLO 的工作原理。

全卷積神經網絡 FCN

YOLO 僅僅使用卷積層，這種僅適用卷基層的網絡我們稱之為全卷積神經網絡（Fully Convolutional Network）。YOLO 擁有 75 個卷積層，還有 skip connections 和上採樣 Upsampling 層。它使用步幅為 2 的卷積層對特徵圖進行下采樣，而不是使用池化層，這有助於防止通常由池化導致的低級特徵丟失。

作為 FCN，YOLO 對於輸入圖像的大小並沒有要求。然而，在實踐中，我們可能想要固定輸入的大小，以防止後續一些問題的出現。這其中的一個重要原因是：如果我們希望按 batch 處理圖像（batch 由 GPU 並行處理，這樣可以提升速度），我們就需要固定所有圖像的高度和寬度。這就需要將多個圖像整合進一個大的 batch（將將許多 PyTorch Tensors 合併成一個）。

YOLO 通過 stride（步幅）對圖像進行上採樣。例如，如果網絡的步幅是 32，則大小為 416×416 的輸入圖像將產生 13×13 的輸出。

輸出

一般來講，卷積層所學習的特徵會被傳遞到分類器/迴歸器進行預測（邊界框的座標、類別標籤等）。

在 YOLO 中，預測是通過 1 x 1 的卷積層完成的。

現在要注意的是，我們的輸出都是特徵圖（feature map），因為使用 1 x 1 的卷基層，所以每次輸出的特徵圖都和之前的特徵圖是一樣大小的。在 YOLO v3上，預測圖就是每個可以預測固定數量邊界框的單元格。

對於網絡的深度，我們的特徵圖包含 (B x (5 C)) 個條目， B 代表每個單元可以預測的邊界框數量。根據 YOLO 的論文，這些 B 邊界框中的每一個都可能專門用於檢測某種對象。每個邊界框都有 5 C 個屬性，分別描述每個邊界框的中心座標、維度、objectness 分數和 C 類置信度。YOLO v3 在每個單元中預測 3 個邊界框。

如果對象的中心位於單元格的感受野內，你會希望特徵圖的每個單元格都可以通過其中一個邊界框預測對象。（感受野是輸入圖像對於單元格可見的區域。）

這與 YOLO 是如何訓練的有關，只有一個邊界框負責檢測任意給定對象。首先，我們必須確定這個邊界框屬於哪個單元格。

因此，我們需要切分輸入圖像，把它拆成維度等於最終特徵圖的網格。

讓我們思考下面一個例子，其中輸入圖像大小是 416×416，網絡的步幅是 32。如之前所述，特徵圖的維度會是 13×13。隨後，我們將輸入圖像分為 13×13 個網格。

輸入圖像中包含了真值對象框中心的網格會作為負責預測對象的單元格。在圖像中，它是被標記為紅色的單元格，其中包含了真值框的中心（被標記為黃色）。

現在，紅色單元格是網格中第七行的第七個。我們現在使特徵圖中第七行第七個單元格（特徵圖中的對應單元格）作為檢測狗的單元。

現在，這個單元格可以預測三個邊界框。哪個將會分配給狗的真值標籤？為了理解這一點，我們必須理解錨點的概念。

請注意，我們在這裡討論的單元格是預測特徵圖上的單元格，我們將輸入圖像分隔成網格，以確定預測特徵圖的哪個單元格負責預測對象。

錨點框（Anchor Box）

預測邊界框的寬度和高度看起來非常合理，但在實踐中，訓練會帶來不穩定的梯度。所以，現在大部分目標檢測器都是預測對數空間（log-space）變換，或者預測與預訓練默認邊界框（即錨點）之間的偏移。

然後，這些變換被應用到錨點框來獲得預測。YOLO v3 有三個錨點，所以每個單元格會預測 3 個邊界框。

回到前面的問題，負責檢測狗的邊界框的錨點有最高的 IoU，且有真值框。

預測

下面的公式描述了網絡輸出是如何轉換，以獲得邊界框預測結果的。

中心座標

注意：我們使用 sigmoid 函數進行中心座標預測。這使得輸出值在 0 和 1 之間。原因如下：

正常情況下，YOLO 不會預測邊界框中心的確切座標。它預測：

與預測目標的網格單元左上角相關的偏移；
使用特徵圖單元的維度（1）進行歸一化的偏移。

以我們的圖像為例。如果中心的預測是 (0.4, 0.7)，則中心在 13 x 13 特徵圖上的座標是 (6.4, 6.7)（紅色單元的左上角座標是 (6,6)）。

但是，如果預測到的 x,y 座標大於 1，比如 (1.2, 0.7)。那麼中心座標是 (7.2, 6.7)。注意該中心在紅色單元右側的單元中，或第 7 行的第 8 個單元。這打破了 YOLO 背後的理論，因為如果我們假設紅色框負責預測目標狗，那麼狗的中心必須在紅色單元中，不應該在它旁邊的網格單元中。

因此，為了解決這個問題，我們對輸出執行 sigmoid 函數，將輸出壓縮到區間 0 到 1 之間，有效確保中心處於執行預測的網格單元中。

邊界框的維度

我們對輸出執行對數空間變換，然後乘錨點，來預測邊界框的維度。

檢測器輸出在最終預測之前的變換過程，

得出的預測 bw 和 bh 使用圖像的高和寬進行歸一化。即，如果包含目標（狗）的框的預測 bx 和 by 是 (0.3, 0.8)，那麼 13 x 13 特徵圖的實際寬和高是 (13 x 0.3, 13 x 0.8)。

Objectness 分數

Object 分數表示目標在邊界框內的概率。紅色網格和相鄰網格的 Object 分數應該接近 1，而角落處的網格的 Object 分數可能接近 0。

objectness 分數的計算也使用 sigmoid 函數，因此它可以被理解為概率。

類別置信度

類別置信度表示檢測到的對象屬於某個類別的概率（如狗、貓、香蕉、汽車等）。在 v3 之前，YOLO 需要對類別分數執行 softmax 函數操作。

但是，YOLO v3 捨棄了這種設計，作者選擇使用 sigmoid 函數。因為對類別分數執行 softmax 操作的前提是類別是互斥的。簡言之，如果對象屬於一個類別，那麼必須確保其不屬於另一個類別。這在我們設置檢測器的 COCO 數據集上是正確的。但是，當出現類別「女性」（Women）和「人」（Person）時，該假設不可行。這就是作者選擇不使用 Softmax 激活函數的原因。

在不同尺度上的預測

YOLO v3 在 3 個不同尺度上進行預測。檢測層用於在三個不同大小的特徵圖上執行預測，特徵圖步幅分別是 32、16、8。這意味著，當輸入圖像大小是 416 x 416 時，我們在尺度 13 x 13、26 x 26 和 52 x 52 上執行檢測。

該網絡在第一個檢測層之前對輸入圖像執行下采樣，檢測層使用步幅為 32 的層的特徵圖執行檢測。隨後在執行因子為 2 的上採樣後，並與前一個層的特徵圖（特徵圖大小相同）拼接。另一個檢測在步幅為 16 的層中執行。重複同樣的上採樣步驟，最後一個檢測在步幅為 8 的層中執行。

在每個尺度上，每個單元使用 3 個錨點預測 3 個邊界框，錨點的總數為 9（不同尺度的錨點不同）。

作者稱這幫助 YOLO v3 在檢測較小目標時取得更好的性能，而這正是 YOLO 之前版本經常被抱怨的地方。上採樣可以幫助該網絡學習細粒度特徵，幫助檢測較小目標。

輸出處理

對於大小為 416 x 416 的圖像，YOLO 預測 ((52 x 52) (26 x 26) 13 x 13)) x 3 = 10647 個邊界框。但是，我們的示例中只有一個對象——一隻狗。那麼我們怎麼才能將檢測次數從 10647 減少到 1 呢？

目標置信度閾值：首先，我們根據它們的 objectness 分數過濾邊界框。通常，分數低於閾值的邊界框會被忽略。

非極大值抑制：非極大值抑制（NMS）可解決對同一個圖像的多次檢測的問題。例如，紅色網格單元的 3 個邊界框可以檢測一個框，或者臨近網格可檢測相同對象。

實現

YOLO 只能檢測出屬於訓練所用數據集中類別的對象。我們的檢測器將使用官方權重文件，這些權重通過在 COCO 數據集上訓練網絡而獲得，因此我們可以檢測 80 個對象類別。

該教程的第一部分到此結束。這部分詳細講解了 YOLO 算法。如果你想深度瞭解 YOLO 的工作原理、訓練過程和與其他檢測器的性能規避，可閱讀原始論文：

YOLO V1: You Only Look Once: Unified, Real-Time Object Detection
YOLO V2: YOLO9000: Better, Faster, Stronger
YOLO V3: An Incremental Improvement

代碼已上傳至GitHub,關注我頭條號發送私信"YOLO"獲取.

分享到:

閱讀更多 深度學習中文社區 的文章

關鍵字: 教程從頭開始 Python

深度學習-Pytorch框架學習之模型訓練和測試

深度學習-Pytorch框架學習之張量處理篇

目標檢測之numpy——向量和矩陣乘法相關

“深度學習”第一實踐課，收穫NVIDIA開發者證書

ScrabbleGAN；UnrealText；跟蹤模型；G2L-Net等

目標檢測之tensorflow——padding選擇

深度學習/目標檢測之tensorflow——莫煩教程總結（19-20）

深度學習/目標檢測之tensorflow——莫煩教程總結（14-）

深度學習/目標檢測之tensorflow——莫煩教程總結（1-13）

一文弄懂Resnet

深度神經網絡應如何避免過擬合

PyTorch保存和加載多GPU模型和單GPU模型

Vgg網絡解讀

人工智能知識點：python+機器學習+深度學習，附贈全套視頻教程

量化交易學習筆記（二十三）——自定義Indicator

深度學習中，一般如何防止過擬合？

人工智能編程：如何為神經網絡每一層設置不同的梯度下降學習率？

match：一款基於深度學習的層級問答匹配工具

人工智能編程：神經網絡的反向傳播的自動求導是如何計算的？

pytorch中的where和gather的介紹

深度學習編程：張量的運算（通過人工智能框架pytorch實現）

深度學習-LSTM算法實現（MNIST手寫數字識別）

深度學習-遷移學習流程及代碼解析

提升訓練質量的技巧合集

深度學習 pytorch實戰神經網絡分類任務

深度學習 pytorch實戰神經網絡關係擬合

反向R？削弱顯著特徵為細粒度分類帶來提升

組合求解器 + 深度學習 =？這篇ICLR 2020論文告訴你答案

深度學習理論與實戰PyTorch實現

深度學習/圖像處理歷史最全最細-網絡、技巧、迭代-論文整理分享

可以丟掉SGD和Adam了，新的深度學習優化器Ranger：RAdam + LookAhead強強結合

使用 TensorFlow 來實現一個簡單的驗證碼識別過程

深度自適應性Transformer

深度學習中的多任務學習綜述

梯度之上：海森矩陣

「深度學習」用TensorFlow實現人臉識別（附源碼，快速get技能）

卷積神經網絡CNN

深度學習——你需要了解的八大開源框架

Tensorflow實戰-TensorFlow的正則化實現

深度學習：所有矩陣尺寸和計算的深層指南！

Kafka +深度學習+ MQTT搭建可擴展的物聯網平台「附源碼」

深度學習：基本概念深度解析

深度學習 Python 必備知識點

DeepLearning-Ng編程中遇到的一些問題

05.09 使用TensorFlow構建簡單的生成對抗網絡（GAN）

第二章 IoC容器和Bean配置

bean是一個對象，它是由Spring

運算裡不得不說的python模塊—math

Help

Devops度量--DevOps 現狀快速檢查表

今天主要分享一個DevOps

SOP是什麼（解讀）

SOP不是單個的，是一個體系，雖然我們可以單獨地定義每一個SOP，但真正從企業管理來看，SOP不可能只是單個的，必然是一個整體和體系，也是企業不可或缺的。

還不知道交換機上如何配置DHCP，趕緊過來圍觀吧，一分鐘包你學會

隨著終端設備的越來越多，人工干預配置IP地址，不僅工作效率低，而且，還很容易導致IP衝突，影響正常的網絡訪問。到此已經完成了，DHCP服務的配置了，我們可以在終端驗證。

還在手動配置IP地址嗎？太Low了，一分鐘教會您如何配置DHCP

Python爬蟲自學筆記：分析頭條文章網頁源文件

這兩天分析了一下頭條文章網頁的源文件，現在將分析的結果分享給大家。首先以一篇文章為例，其網址如下：https://www.toutiao.com/i6822245428176617998/如上圖網頁所示，文章中包含文字和圖片。

DNS偵查工具

我們只需要打開瀏覽器輸入例如:www.baidu.com就可以解析到該網站.為了便於記住不需要輸入長長的IP地址去訪問這就是DNS域名解析.關於域名域名的層次劃分用點來分割這時DNS把相對應的域名解析成IP地址高的在右邊.例如:www. NS簡介訪問某網站的時候最低在左邊

國人開源的異步 Python ORM：GINO

程序測評：Create React App 3.3中有哪些酷炫新功能？

Create

“明學”的魅力？我只要我覺得：駕馭終端，提高生產力

最後一個要介紹的命令是

（必收藏系列）Linux面試題——命令集

關注，後臺私信【Linux】分享Linux入門到進階電子書、Linux入門到精通視頻教程（免費）。文件管理命令cat

五分鐘學會如何在 IPFS 上部署網站

原文標題:五分鐘學會如何在

「正點原子NANO STM32F103開發板資料連載」第29章內存管理實驗

1）實驗平臺：【正點原子】

小白怎麼學Web前端開發如何成為技術達人

Web前端開發工程師已經成為了很多年輕人心中的理想工作，不僅入行門檻低、而且薪資待遇和發展前景都不錯，自然吸引了大批人加入行業。

如何開發一個web靜態服務器

我們都知道如今的web服務器有很多，比如著名的有apache，有nginx，有tomcat，有resin服務器，有sphere，有iis服務器等等，這些服務器都能提供web服務，並且幾乎都能和多種語言進行搭配使用，那麼一個web服務器都需要那些功能，開發一個web服務器都需要那些

學Java編程還有前景嗎如何才能拿到高薪

需求大、薪資高似乎是Java開發人員的標籤，不過學Java編程還有前景嗎？它架構在操作系統之上，屏蔽了底層的差異，真正實現了“Writeonce run

Python網絡爬蟲之配置篇（一）

pip

SpringBoot 整合SpringSecurity示例實現前後分離權限註解+JWT登錄認證

serverTimezone=UTC&useUnicode=true&characterEncoding=utf-8&zeroDateTimeBehavior=convertTo&useSSL=falseusername:rootpassword:

Python的運行效率太低？幾行代碼快速提升！

return的就是是你所需要的結果2.3、運行這一步就是最後一步了，只要像下面一樣輸入上述函數名，賦予參數值，點擊運行Run，就能得到你想要的結果arg1=5

python的優點是什麼？最新Python400集視頻（附教程）

2020，最新Python零基礎到精通資料教材，乾貨分享，新基礎Python教材，穩穩找到過萬工作，看這裡，這裡有你想要的所有資源哦，最強筆記，教你怎麼入門提升！獲取方式：私信小編“

MySQL中OOM故障應如何下手-愛可生

作者：孫祚龍愛可生南區分公司交付服務部成員，實習工程師。負責公司產品問題排查及日常運維工作。本文來源：原創投稿*愛可生開源社區出品，原創內容未經授權不得隨意使用，轉載請聯繫小編並註明來源。

像專家一樣使用 panic

|go

30種不同的編程語言怎麼寫“Hello, World”

printfn

percona QAN 介紹

一、背景QAN慢查詢日誌分析工具是PMM

面試官：你可以用純CSS判斷鼠標進入的方向嗎？

雖然沒什麼軟用，但是對付面試官應該是夠用了。感謝面試官提出的問題，讓我實現了這個功能，對CSS

網絡工程師職業生涯中，哪兩點是最重要的？

網絡工程師最重要的技能是紮實的基礎和非常開放的思維，微觀知識紮實、宏觀能力突出。項目經驗也會讓網絡工程師基礎更牢靠，網絡工程師是要實戰的，要避免紙上談兵，我認為對基礎理論的理解，比你清楚配置更重要。

交換機中相關術語代表什麼意思，有必要弄清楚

由淺入深瞭解以太坊 2.0：最常見問題和最全學習清單

有關以太坊2.0

【Linux簡單實用小命令001】CentOS 7、8的防火牆端口開放

yuminstall

吃透這些IPFS硬核知識點，日後搶頭礦隨時“彎道超車”

今天的你捉住IPFS機遇了嗎？我們都知道在Filecoin網絡中作為一名存儲礦工，信譽對於我們是非常重要的——信譽越高，爆塊幾率越大。那麼信譽系統現在怎麼樣了呢？

Hive分桶表

fieldsterminated

Spring中資源的加載原來是這麼一回事啊！

自己動手搭建郵件系統：怎樣讓Exchange Server 發出第一封郵件？

編輯Exchange

$【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫$

【MySQL】RDS物理備份文件(.idb\.frm)恢復到MySQL自建數據庫

在阿里雲控制檯，我們能下載的文件是一個壓縮包，解壓之後，是.idb和.frm文件，你可能要問了，我可以直接把解壓好的問題件覆蓋到MySQL的data目錄下嗎？

NLP算法入門系列：隱含馬爾可夫鏈(HMM)模型的簡單介紹

即，最大化

第一章 Spring Framework概述

您可以在任何web

opencv人工智能深度學習這樣實現人臉的年齡檢測

前期的文章我們分享了人臉的識別以及如何進行人臉數據的訓練，本期文章我們結合人臉識別的模型進行人臉年齡的檢測人臉年齡的檢測步驟1、首先需要進行人臉的檢測2、把檢測到的人臉數據給年齡檢測模型去檢測3、把檢測結果呈現到圖片上人臉年齡檢測import

嵌入式linux網絡編程之——5年程序員給你深度講解socket套接字

圖8-1

深入瞭解ProcessFunction的狀態操作(Flink-1.10)

先反思為何會有上述疑惑上述疑惑產生的原因，應該是受到平時使用HashMap的影響，HashMap獲取值就是在調用get方法時指定key，設置值也是在put時指定key，所以看到state.value，看懂了這些，其實也是在瞭解DataStream/DataSetAPI的設計思路：

Redis內存分析工具--rdr安裝與使用

分析Redis

資深架構師教你源碼講解zookeeper實現分佈式鎖以及集群搭建步驟

//getData發現前一個子節點被刪除，拋出異常

一行代碼提升遷移性能

論文原址：https://arxiv.org/pdf/2003.12237.pdf開源地址：https://github.com/cuishuhao/BNM在發表在CVPR2020

利用相似幾何信息，做可泛化3D形狀分割模型

更具體的有以下三種典型的分割方案：FullyConvolutional-Like

這麼好用的開源計算器SpeedCrunch，沒有不嘗試一下的道理

介紹SpeedCrunch是一款高精度科學計算器，具有快速，鍵盤驅動的用戶界面。獲取方式在GitHub上搜索SpeedCrunch，就可以去到

分佈式緩存，真香

他是前易寶支付架構師、阿里雲MVP、騰訊雲

特徵工程的力量

在本文中，我希望教給您一些有關特徵工程的知識，以及如何使用它來對非線性決策邊界進行建模。為了說明這一點，假設恢復時間與身高和體重具有以下關係：Y=β₀+β₁+β2+β₃+noise從第三項來看，我們可以看到Y與身高和體重沒有線性關係。

java架構：天天寫面向接口編程，你考慮過性能嗎？大神都是這麼寫

public

SpringBoot如何優雅的使用RocketMQ

源碼編譯需要Maven3.2x，JDK8在根目錄進行打包:Copymvn-Prelease-all

css代碼規範工具stylelint

"mixin"