Python
 Computer >> コンピューター >  >> プログラミング >> Python

PyTorchでCNNを実装してMNISTの手書き数字を認識する方法

この記事では、PyTorchを使ってCNN(畳み込みニューラルネットワーク)を訓練し、MNISTデータセットによる手書き数字の分類器を構築する方法を解説します。

MNISTは手書き文字認識タスクで広く利用されているデータセットで、ラベル付きの28×28ピクセル・グレースケール画像が7万枚以上収録されています。内訳は約6万枚の訓練画像と1万枚のテスト画像です。ここでは、6万枚の訓練画像でモデルを学習し、その後1万枚のテスト画像で分類精度を評価します。

環境準備

まず、最新版のPyTorchとtorchvisionが必要です。まだインストールしていない場合は、ターミナルで以下のコマンドを実行してください。

pip install torch torchvision

ライブラリのインポート

import torch
import torchvision

MNISTデータセットの読み込み

プログラムを始める前に、MNISTデータセットを用意します。画像とラベルをメモリに読み込み、今回の実験で使用するハイパーパラメータを定義しましょう。

# n_epochs は訓練データセット全体を繰り返し学習する回数
n_epochs = 3
batch_size_train = 64
batch_size_test = 1000

# learning_rate と momentum はオプティマイザ用のパラメータ
learning_rate = 0.01
momentum = 0.5
log_interval = 10

random_seed = 1
torch.backends.cudnn.enabled = False
torch.manual_seed(random_seed)

次に、TorchVisionを使ってMNISTデータセットを読み込みます。訓練時のバッチサイズは64、テスト時は1000とします。正規化には、MNISTデータセットの平均値0.1307と標準偏差0.3081を使用します。

train_loader = torch.utils.data.DataLoader(
    torchvision.datasets.MNIST('/files/', train=True, download=True,
        transform=torchvision.transforms.Compose([
            torchvision.transforms.ToTensor(),
            torchvision.transforms.Normalize(
                (0.1307,), (0.3081,))
        ])
    ),
    batch_size=batch_size_train, shuffle=True)

test_loader = torch.utils.data.DataLoader(
    torchvision.datasets.MNIST('/files/', train=False, download=True,
        transform=torchvision.transforms.Compose([
            torchvision.transforms.ToTensor(),
            torchvision.transforms.Normalize(
                (0.1307,), (0.3081,))
        ])
    ),
    batch_size=batch_size_test, shuffle=True)

出力結果

Downloading https://yann.lecun.com/exdb/mnist/train-images-idx3-ubyte.gz
Downloading https://yann.lecun.com/exdb/mnist/train-labels-idx1-ubyte.gz
Downloading https://yann.lecun.com/exdb/mnist/t10k-images-idx3-ubyte.gz
Downloading https://yann.lecun.com/exdb/mnist/t10k-labels-idx1-ubyte.gz
Processing...
Done!

test_loader を使ってテストデータを読み込んでみましょう。

examples = enumerate(test_loader)
batch_idx, (example_data, example_targets) = next(examples)
example_data.shape

出力結果

torch.Size([1000, 1, 28, 28])

出力から、テストデータの1バッチが [1000, 1, 28, 28] という形状のテンソルであることがわかります。つまり、28×28ピクセルのグレースケール画像が1000枚含まれているという意味です。

matplotlibを使って、データセットの一部を可視化してみます。

import matplotlib.pyplot as plt

fig = plt.figure()
for i in range(5):
    plt.subplot(2, 3, i + 1)
    plt.tight_layout()
    plt.imshow(example_data[i][0], cmap='gray', interpolation='none')
    plt.title("Ground Truth: {}".format(example_targets[i]))
    plt.xticks([])
    plt.yticks([])
print(fig)

ネットワークの構築

続いて、2次元畳み込み層2つと全結合層2つからなるネットワークを構築します。構築したいネットワーク用に新しいクラスを作成しますが、その前に必要なモジュールをインポートしておきましょう。

import torch.nn as nn
import torch.nn.functional as F
import torch.optim as optim

class Net(nn.Module):
    def __init__(self):
        super(Net, self).__init__()
        self.conv1 = nn.Conv2d(1, 10, kernel_size=5)
        self.conv2 = nn.Conv2d(10, 20, kernel_size=5)
        self.conv2_drop = nn.Dropout2d()
        self.fc1 = nn.Linear(320, 50)
        self.fc2 = nn.Linear(50, 10)

    def forward(self, x):
        x = F.relu(F.max_pool2d(self.conv1(x), 2))
        x = F.relu(F.max_pool2d(self.conv2_drop(self.conv2(x)), 2))
        x = x.view(-1, 320)
        x = F.relu(self.fc1(x))
        x = F.dropout(x, training=self.training)
        x = self.fc2(x)
        return F.log_softmax(x)

ネットワークとオプティマイザを初期化します。

network = Net()
optimizer = optim.SGD(network.parameters(), lr=learning_rate, momentum=momentum)

モデルの訓練

それでは訓練処理を組み立てていきます。まずネットワークを訓練モードに切り替え、各エポックごとに全訓練データを1周処理します。DataLoaderが個々のバッチを読み込み、optimizer.zero_grad() で勾配をゼロにリセットします。

きれいな学習曲線を描くために、訓練損失とテスト損失を保存するリストを2つ作成します。横軸には処理した訓練サンプル数を表示します。

train_losses = []
train_counter = []
test_losses = []
test_counter = [i * len(train_loader.dataset) for i in range(n_epochs + 1)]

backward() の呼び出しによって新しい勾配のセットが計算され、optimizer.step() を通じて各ネットワークパラメータへ逆伝播されます。

def train(epoch):
    network.train()
    for batch_idx, (data, target) in enumerate(train_loader):
        optimizer.zero_grad()
        output = network(data)
        loss = F.nll_loss(output, target)
        loss.backward()
        optimizer.step()
        if batch_idx % log_interval == 0:
            print('Train Epoch: {} [{}/{} ({:.0f}%)]\tLoss: {:.6f}'.format(
                epoch, batch_idx * len(data), len(train_loader.dataset),
                100. * batch_idx / len(train_loader), loss.item()))
            train_losses.append(loss.item())
            train_counter.append(
                (batch_idx * 64) + ((epoch - 1) * len(train_loader.dataset)))
            torch.save(network.state_dict(), '/results/model.pth')
            torch.save(optimizer.state_dict(), '/results/optimizer.pth')

ニューラルネットワークのモジュールやオプティマイザは、.state_dict() を使って内部状態を保存・読み込みできる点も覚えておきましょう。

次にテストループです。テスト損失を合計し、正しく分類できた数字の数を記録することで、ネットワークの精度を計算します。

def test():
    network.eval()
    test_loss = 0
    correct = 0
    with torch.no_grad():
        for data, target in test_loader:
            output = network(data)
            test_loss += F.nll_loss(output, target, size_average=False).item()
            pred = output.data.max(1, keepdim=True)[1]
            correct += pred.eq(target.data.view_as(pred)).sum()
    test_loss /= len(test_loader.dataset)
    test_losses.append(test_loss)
    print('\nTest set: Avg. loss: {:.4f}, Accuracy: {}/{} ({:.0f}%)\n'.format(
        test_loss, correct, len(test_loader.dataset),
        100. * correct / len(test_loader.dataset)))

訓練を実行する際は、n_epochs のループの前に test() を呼び出し、ランダムに初期化されたパラメータの状態でモデルを評価しておきます。

test()
for epoch in range(1, n_epochs + 1):
    train(epoch)
    test()

出力結果

Test set: Avg. loss: 2.3048, Accuracy: 1063/10000 (10%)

Train Epoch: 1 [0/60000 (0%)] Loss: 2.294911
Train Epoch: 1 [640/60000 (1%)] Loss: 2.314225
Train Epoch: 1 [1280/60000 (2%)] Loss: 2.290719
...
Train Epoch: 1 [36480/60000 (61%)] Loss: 0.496494
......
......
Train Epoch: 3 [49920/60000 (83%)] Loss: 0.253500
Train Epoch: 3 [50560/60000 (84%)] Loss: 0.364354
...
Train Epoch: 3 [59520/60000 (99%)] Loss: 0.318569

Test set: Avg. loss: 0.0912, Accuracy: 9716/10000 (97%)

モデル性能の評価

わずか3エポックの訓練だけで、テストセット上で97%の精度を達成できました。訓練開始前、ランダムに初期化されたパラメータの状態では精度はわずか10%でした。

学習曲線のプロット

fig = plt.figure()
plt.plot(train_counter, train_losses, color='blue')
plt.scatter(test_counter, test_losses, color='red')
plt.legend(['Train Loss', 'Test Loss'], loc='upper right')
plt.xlabel('number of training examples seen')
plt.ylabel('negative log likelihood loss')
fig

上記の出力を見ると、3エポック時点でも精度が伸び続けているため、エポック数を増やすことでさらなる精度向上が期待できます。

その前に、いくつか追加のサンプルでモデルの出力を比較してみましょう。

with torch.no_grad():
    output = network(example_data)

fig = plt.figure()
for i in range(6):
    plt.subplot(2, 3, i + 1)
    plt.tight_layout()
    plt.imshow(example_data[i][0], cmap='gray', interpolation='none')
    plt.title("Prediction: {}".format(
        output.data.max(1, keepdim=True)[1][i].item()))
    plt.xticks([])
    plt.yticks([])
fig

モデルの予測結果を見ると、これらのサンプルに対してほぼ正確に予測できていることがわかります。

  1. PyTorchを使った線形回帰の実装方法を徹底解説

    線形回帰とは 単純線形回帰の基礎 2つの連続変数の間にある関係性を把握するために用いられる手法です。 具体例: x = 独立変数(例:体重) y = 従属変数(例:身長) 関係式は y = αx + β という形式で表されます。 それでは、実際にプログラムを通して単純線形回帰の仕組みを見ていきましょう。 #単純線形回帰 import numpy as np import matplotlib.pyplot as plt np.random.seed(1) n = 70 x = np.random.randn(n) y = x * np.random.randn(n) colo

  2. PythonでのCX_Freezeの使い方:スクリプトを実行ファイル(EXE)に変換する方法

    はじめに 何か面白いものを作りたいという欲求は人間の本能であり、完成したものは誰かに共有したくなるものです。Pythonでもその願いを叶えられます。ただし、作成したPythonスクリプトをそのまま共有するには、相手のマシンにも同じバージョンのPythonと、プログラムで使用しているすべてのモジュールがインストールされている必要があります。 そこで役立つのがCX_Freezeです。このツールを使えば、Pythonがインストールされていない環境でも動作するスタンドアロンの実行ファイル(.exe)を作成できます。 CX_Freezeのインストール まず、コマンドプロンプトで以下のコマンドを実行し、c