ほうびとばつで教える
3.3 の終わりで言いましたね。ここまでAIを教えるやり方はひとつ、正解を付けて見せること だったと。
これは ねこの写真に「ねこ」と書いてあげられるからできることです。ところが自転車に乗ることはどうでしょう。「いま体を3.7度かたむけて」と書いてあげられますか。
できませんね。それでもわたしたちは自転車を覚えます。転びながら。1.2 で大人に聞いてみた あの自転車です。あのときも答えはだれも書いてくれませんでしたね。
はじめは本当にでたらめに置きます。ところが百局ほどすぎると 勝つのがむずかしくなります。
だれも規則を書いてあげていません。 「真ん中がよい」も、「二つならんだら止めろ」もです。機械が味わったのは 勝つことと負けることだけです。
ほうびとばつだけをあたえる
こうして教えるやり方を と呼びます。
正解を教えません。かわりに うまくいけばほうび、だめならばつ をあたえます。そしてほうびをたくさんもらえるほうへ 自分で変わっていくようにします。
マッチ箱の機械では ビーズがほうびとばつでした。勝ってふえたビーズがほうびで、負けてすてられたビーズがばつですね。
この「ほうび」を と呼びます。
1.2 のチェッカーとちがうところが ここです。チェッカーは どれくらいまちがえたか(誤差)を見て直しました。マッチ箱は 勝ったか負けたか(ほうびとばつ)を見て直します。
| いままでのやり方 | 強化学習 | |
|---|---|---|
| 人があたえるもの | 正解 | 報酬 |
| いつ使うか | 正解がわかること | 正解がわからないこと |
| 機械がすること | 正解に近づくこと | ほうびをたくさんもらうこと |
さいごの行をよく見ておいてください。このチャプターの話がそこから出てきます。
ビーズのかわりにニューラルネットを使うと
マッチ箱は盤が304種類しかないからできました。回したり裏返したりして同じ形になる盤を ひとつと数えた数です。画面の機械はそれをまとめないので 箱がもっと多いです。ところが車の運転は 場合の数が数えきれないほど多いですね。本物の道には ほかの車や人、天気まであります。
そういうときは ビーズのかわりに 3.2 で見たニューラルネット を使います。そしてうまくいったものだけをのこして 次の世代をつくります。
はじめは二十台ぜんぶが壁にぶつかります。ところが何世代かすぎると 長くもちこたえる車が出てきます。
車を一台おしてみましょう。この車が知っているのは 前の五つの向きまでのきょりだけです。 道がどんな形なのかも、自分がどこにいるのかも知りません。それだけで曲がり方を見つけ出しました。
ほうびをまちがえてあたえると
ここがこのチャプターの本当の話です。
右のつまみ三つが ほうびを何であたえるか を決めます。ひとつずつはしまでおしてみましょうか。
はやく行く だけを100に、のこりを0に。 そして はじめから学び直す を押してみましょう。
車がずっと早くぶつかります。長く生きることをはからないので ふみこんで走って壁にぶつかるほうが得 だからです。
こんどは ぶつからない だけを100に。
ほとんどが動きません。じっと立っているのが いちばんぶつからないやり方だからです。
言われたとおりにしただけです
機械は二回とも ほうびをいちばん多くもらうやり方 を正確に見つけ出しました。
わたしたちは「うまく走れ」と言ったつもりでしたが、じっさいにあたえたのは「はやく行けばほうび」でした。だからはやく行くことだけをしたのです。
AIはわたしたちがのぞんだことを学びません。わたしたちがあたえたほうびを たくさんもらうやり方を学びます。
3.3 で見たものと対になっています。あちらでは あたえた写真 が機械をおかしくし、ここでは あたえたほうび がそうします。どちらも機械ではなく 人があたえたものからはじまります。
3部で歩いてきた道です。箱ひとつがチャプターひとつです。
3部が終わりました
学ぶやり方を三つ見ました。正解を見せること、ほうびとばつをあたえること、そしてまちがって学ぶやり方までもです。
ところがいままであつかったのは ぜんぶ 見るAI でした。写真、点、道すじ。
4部では ことばをあつかうAI へ行きます。このごろいちばんよく出会うものたちです。
ところが ことばは写真とちがいます。写真は数でしたが、文はどうやって数にするのでしょう。
このチャプターのよりどころ
- 10 Michie, MENACE (1961) · "Experiments on the Mechanization of Game-Learning", The Computer Journal 6(3) (1963)