「インスタンスベース」学習と「モデルベース」学習
06/03/2024 2024-04-03 9:30「インスタンスベース」学習と「モデルベース」学習
ピエル・ジュゼッペ・ジリボーネ編集
学習システムを分類するもう一つの方法は、どれだけうまく一般化できるかに基づくものです。
機械学習アルゴリズムに期待される目標のほとんどは、予測能力に関するものです。つまり、学習用のデータサンプルが与えられた場合、システムは新しいデータ、つまりこれまで知られていなかったデータに対して、的確な予測を行うことができなければなりません。
訓練データ(「サンプル内」)において良好な性能指標を見つけることは確かに良いことですが、それだけでは十分ではありません。なぜなら、真の目標は新しいインスタンスに対して信頼できる結果を得ることだからです。
したがって、「サンプル外」の測定は、システムがトレーニング中に獲得した知識を正しく一般化できたかどうかを検証するための最良のツールとなる。
汎化には、インスタンスベース学習とモデルベース学習という2つの主要なアプローチがあります。
最も単純な学習形態は、最初のカテゴリーに分類される、単なる丸暗記による学習です。つまり、このヒューリスティックに従ってスパムフィルターを設計した場合、他のユーザーによって既にスパムと分類されているメールと全く同じメールはすべてスパムとしてマークされることになります。これはおそらく最悪の解決策ではないでしょうが、決して最良の解決策ではありません。
既にスパムとして認識されているメールと全く同じメールをフラグ付けする代わりに、既知のスパムと非常によく似たメールもフラグ付けするようにアルゴリズムをプログラムすることも可能です。この設計アプローチは明らかに合理的ですが、2つのメール間の類似度を測定する必要があります。
例えば、類似性を測る非常にシンプルな指標として、2つのメールに共通する単語の数を挙げることができます。新しいメールと既にスパムとして認識されているメールを比較した結果、共通する単語が多い場合、システムはそのメールをスパムとしてフラグ付けします。
この学習方法はインスタンスベース学習と呼ばれます。アルゴリズムは、トレーニング中に提供された例をできる限り忠実に学習し、その後、既知の要素(またはそのサブセット)との比較のための類似度尺度を使用して、この知識を新しいケースに一般化します。
一連の事例から一般化するもう一つの方法は、それらの事例間の潜在的な関係を数学モデルで構築し、それを用いて予測を行うことです。この種の一般化は、モデルベース学習と呼ばれます。
散布図、つまり直交座標平面上に点を配置して表現できるデータセットがあると仮定します。これは、例えば、OECD(経済協力開発機構)のより良い生活指数(https://www.oecdbetterlifeindex.org)と一人当たりGDP(国内総生産)の関係に当てはまります。
お金だけでは幸福は得られないことは周知の事実だが、統計によれば、倫理観や地球上の現在および未来の住人に対する相互尊重を当然考慮に入れつつ、お金は人々がこの崇高な目標を達成するための手段として活用できることが明確に示されている。
したがって、従属変数(指数スコア、グラフのy軸)と独立変数(一人当たりGDP、グラフのx軸)の間には正の傾向線が観察される。点は、この増加傾向線に沿って妥当な近似で配置される。したがって、この関係を適切に表すことができる数学モデルは線形である。これは、Score = theta0 + theta1*GDP の形式で表すことができる。
ここで説明する段階はモデル選択と呼ばれます。つまり、利用可能なデータ間の関係を表現できるすべての数学関数の中から、最も適切なものを選択するということです。この選択は、先ほど説明したケースのように直感に基づく場合もあれば、特定の仮定の下で検証された厳密な数学的証明に基づく場合もあります。
例えば、債券の利回りから価格を計算することを可能にする関係は、厳密でよく知られた金融数学の原理に基づいているため、それを経験的データから直接学習したり、それらから導き出された代表的なモデルを直感的に理解したりするアルゴリズムを構築することは意味がない。
スコアとGDPの関係が選択されたら、 θ0(線形モデルの定数)とθ1 (線形モデルの傾き)の最適な値、つまりデータに存在する傾向を最もよく表す値を決定する必要があります。
モデルパラメータの最適値を得るためには、性能指標を指定する必要があります。一般的には、モデルの適合度を測る効用関数(適合度関数とも呼ばれる)を定義するか、モデルの不適合度を測るコスト関数を定義するかのいずれかになります。
提示されたような線形回帰問題では、通常、コスト関数が使用されます。このコスト関数は、線形モデルによって提供される理論的な予測値と、モデルのトレーニングに使用されたデータで実際に発生した値との間の距離を測定します。目的は、この距離を最小化することです。
ここで学習プロセスが始まります。訓練データが渡され、最も代表的なパラメータの値、つまりデータ間に存在すると想定される関係を最もよく一般化する値が求められます。
線形回帰の場合、θの値を求めることができる解析式が存在することに留意すべきである。これは実際にはOLS(最小二乗法)である。
非線形モデルの場合、モデル学習問題を解決するために数値的手法が用いられる。
トレーニング段階が完了すると、較正済みのモデルを使用して予測を行うことができます。
例えば、GDPは分かっているものの、OECDによってスコアが算出されていない国があるとします。
線形関係Score = theta0 + theta1*GDP を使用し、独立変数 (国内総生産) の値を国の既知の値に置き換え、推定された theta を使用して、出力 (つまり予測) として従属変数の値、つまりモデルによって解釈されるスコアを取得できます。
結論として、従来の計量経済学で最も一般的なアプローチはモデルベースのアプローチであり、データ間の既存の関係が選択されると、そのモデルの係数を決定するために最良の推定が行われることがわかる。
データ間の関係が必然的に適応しなければならない関数形式について事前の仮定を置かないインスタンスベース学習は、新しい機械学習パラダイムの出現に伴い、特に重視されるようになった。
最後に、「タダ飯はない」ということを断言しておきます。インスタンスベース学習は、データ間の関係を事前に指定する必要がないため、より柔軟に定義できますが、このタイプの学習を用いたモデルは、データへの過学習を起こしやすく、 「ブラックボックス」になりがちで、結果として得られる予測の説明可能性が失われるという点を強調することが重要です。