AI(人工知能)・ML(機械学習)・DL(深層学習、ディープラーニング)は並列の3技術ではなく、AI ⊃ ML ⊃ DLという入れ子の関係にあります。AIは目指す目的(研究分野)の名前、MLはその目的をデータからの学習で実現する手法群、DLはMLのうち多層のニューラルネットワークを使う手法です。
本記事では、3語の定義をそれぞれの原典(1955年のダートマス会議提案書、1959年のSamuelの論文、2015年のNature誌の総説、2025年公布のAI法)で確かめ、MLとDLの違いを「特徴量を誰が作るか」「必要なデータ量と計算資源」で比較します。業務でどちらを選ぶかの判断材料として、表形式データでは深層学習が勝つとは限らないという研究結果も紹介します。
まとめ:AI・ML・DLの違いと選び分けの要点
- 包含関係:AIが最も広く、その中に機械学習、さらにその中に深層学習があります。深層学習はAIでもあり機械学習でもあります。
- AI:人の認知・推論・判断を機械で代替しようとする取り組み全体です。ルールを人が書き込むシステムもAIに含まれます。
- ML:規則を人が細かく書く代わりに、データ(経験)からコンピュータに規則を学ばせる手法群です。
- DL:多層のニューラルネットワークで、データの特徴(表現)まで自動で学ぶ機械学習です。
- MLとDLの最大の違いは、何に注目するか(特徴量)を人が設計するか、モデルが学ぶかです。画像・音声・文章ではDL、行と列の表形式データでは勾配ブースティングなど従来の機械学習が今も有力です。
- 生成AI・LLMは、深層学習の中のTransformerという構造を土台にしたモデル群です。
以下で、各用語の定義、MLとDLの比較、選び分けの判断基準の順に解説します。
AI・ML・DLの包含関係と3語それぞれの定義
3語は「目的」「手段」「手段の中の一手法」という階層で並びます。機械学習を使わないAI(人が書いたルールで動くエキスパートシステムなど)はありますが、AIに含まれない深層学習はありません。
| 用語 | 位置づけ | 代表例 |
|---|---|---|
| AI(人工知能) | 目的・分野の名前 | ルールベースの診断支援、カーナビの経路探索 |
| ML(機械学習) | AIを実現する手法群 | 迷惑メール判定、需要予測 |
| DL(深層学習) | MLのうち多層NNを使う手法 | 画像認識、音声認識、LLM |
AI(人工知能):1955年の研究提案と日本のAI法第2条の定義
「artificial intelligence」という語は、John McCarthy、Marvin Minsky、Nathaniel Rochester、Claude Shannonの4名が1955年8月付で出したダートマス夏季研究計画の提案書で使われました。McCarthy本人も、この提案書が自分の知る限りこの語の最初の使用だと書いています。提案書は研究の前提を「学習をはじめ知能のあらゆる側面は、原理的には機械で模倣できるほど正確に記述できる」という推測に置いており、学習(learning)は最初からAIの主題の一部でした。
日本の法令では、2025年6月4日公布の「人工知能関連技術の研究開発及び活用の推進に関する法律」(令和7年法律第53号、通称AI法)第2条が、人工知能関連技術を「人工的な方法により人間の認知、推論及び判断に係る知的な能力を代替する機能を実現するために必要な技術」などと定義しています。この定義は学習するかどうかを要件にしておらず、AIを機械学習より広い概念として扱う整理と一致します。なお、2016年12月14日公布の官民データ活用推進基本法(平成28年法律第103号)第2条第2項も「人工的な方法による学習、推論、判断等の知的な機能の実現」などと人工知能関連技術を定義しており、こちらは学習を例示の筆頭に置いていました。AIの種類や業務での用途はAIとは?人工知能の仕組み・種類と機械学習・生成AIの違いを解説で扱っています。
ML(機械学習):Samuelが1959年に示した「経験から学ぶ」プログラム
機械学習の初期の代表的な論文が、IBMのArthur Samuelが1959年7月にIBM Journal(Vol.3, No.3)へ発表した論文「Some Studies in Machine Learning Using the Game of Checkers」です。Samuelは、方法を細部まで指定するプログラミングは時間と費用がかかるとしたうえで、「経験から学ぶようにコンピュータをプログラムすれば、こうした細かなプログラミング作業の多くはいずれ不要になるはずだ」と述べています。論文の要旨では、ルールと手がかりの候補を与えただけのチェッカー(西洋碁)のプログラムが、8〜10時間の対局で作者より上手に指せるまで学習したと報告しています。
なお、機械学習の定義としてよく引かれる「明示的にプログラムしなくても学習する能力をコンピュータに与える研究分野」という一文は、この1959年論文の本文にはありません。Samuelの定義として引用する場合は、論文の原文と区別して扱う必要があります。教師あり学習・教師なし学習・強化学習といった種類は機械学習とは?初心者にもわかるよう仕組み・種類・活用例を簡単に解説で整理しています。
DL(深層学習):多層で表現を学ぶ手法とする2015年の総説
深層学習の定義として代表的に参照されるのが、Yann LeCun、Yoshua Bengio、Geoffrey Hintonの3名がNature誌(2015年、521巻436〜444ページ)に書いた総説「Deep learning」です。要旨の冒頭は「深層学習は、複数の処理層からなる計算モデルに、複数の抽象度をもつデータの表現を学習させる」という趣旨の一文です。ここでいう「深い」は層の数を指し、各層が前の層の出力を少しずつ抽象的な特徴に変えていきます。
層を構成するニューラルネットワークそのものの仕組み(重み・活性化関数・誤差逆伝播法)は、ニューラルネットワークとは?仕組み・種類・PyTorch実装まで実装目線で解説で実装例とあわせて解説しています。
MLとDLの違いを特徴量・データ量・計算資源で比較
MLとDLの違いは、次の表のように整理できます。深層学習も機械学習の一種なので、ここでの「ML」は深層学習以外の従来の機械学習(決定木、勾配ブースティング、ロジスティック回帰、SVMなど)を指します。
| 比較項目 | 従来の機械学習(ML) | 深層学習(DL) |
|---|---|---|
| 特徴量 | 人が設計して与える | モデルが層の中で学ぶ |
| 得意なデータ | 行と列の表形式データ | 画像・音声・文章 |
| 必要なデータ量 | 中規模の表でも高精度 | 多いほど伸びやすい |
| 計算資源 | CPUで学習できることが多い | GPUが前提になりやすい |
| 判断根拠の説明 | 重要度や係数で示しやすい | 別途の可視化手法が要る |
| 代表的な手法 | LightGBM、ランダムフォレスト | CNN、Transformer |
特徴量の作り手の違い:迷惑メール判定と画像判定の例
迷惑メールの判定を従来の機械学習で作る場合、「本文中のURLの数」「送信元ドメインが初見か」「特定の単語の出現回数」といった手がかり(特徴量)を人が決めて数値にし、モデルはその重みづけを学びます。精度は特徴量の出来に左右されます。
一方、写真に猫が写っているかを判定する場合、「耳の形」「毛の模様」を人が数値に落とすのは困難です。深層学習では画素の値をそのまま入力し、最初の層が輪郭、次の層が模様、さらに先の層が顔の部品といった具合に、判定に効く特徴をモデル自身が段階的に学びます。人手で特徴を決めにくいデータほど、深層学習の利点が大きくなります。
データ量と計算資源の差:AlexNetの学習規模
深層学習が画像認識の主流になった転機は、2012年の画像認識コンテストILSVRC-2012です。Hinton研究室のAlexNet(大会には7つのCNNの予測を平均した構成で出場)は、上位5候補に正解が入らない割合(top-5誤り率)で15.3%を記録し、2位の26.2%を大きく引き離しました。論文によると、単体のモデルは約6,000万個のパラメータと65万個のニューロンを持ち、約120万枚の画像で学習し、GTX 580(3GB)のGPU 2枚で5〜6日かかっています。
勾配ブースティングなどの従来の機械学習はCPUだけで学習できる場面が多いのに対し、深層学習は大量のデータとGPUを前提にしやすい手法です。自社で一から学習させる代わりに、公開済みの学習済みモデルを流用する転移学習を使えば、必要なデータ量と計算量を大きく減らせます。
表形式データで深層学習が勝つとは限らない理由と選び分けの基準
「深層学習のほうが新しく高性能」と考えがちですが、行と列からなる表形式データ、とくに1万件前後の中規模データでは当てはまらないことが多いと報告されています。Grinsztajn、Oyallon、Varoquauxの3名がNeurIPS 2022で発表した「Why do tree-based models still outperform deep learning on typical tabular data?」は、表形式の特徴を持つ45のデータセットで深層学習モデルと木系モデル(XGBoost、ランダムフォレストなど)を比較しました。結論は、約1万サンプル規模の中規模データでは、学習速度の差を考慮しなくても木系モデルが依然として最高性能というものです。
論文は差が生じる理由として、表形式データには予測に効かない列が混じりやすいこと、列ごとに意味が違うため回転させると情報が崩れること、目的変数が不規則に変化しやすいことを挙げています。いずれもニューラルネットワークが苦手とする性質です。
この結果を踏まえると、実務での選び分けは次の順で判断するのが妥当です。
- 売上・顧客・在庫など行と列の表データ:まずLightGBMなどの勾配ブースティングで基準となる精度を出します。深層学習はその基準を上回るかを比べる対象です。
- 画像・音声・自由記述の文章:深層学習を選びます。学習データが数千件に満たない場合は、学習済みモデルの転移学習や、生成AIのAPIを使う方法から検討します。
- 判断根拠の説明が必須の業務(与信審査、医療の一次判定など):係数や特徴量の重要度を示せる従来の機械学習が扱いやすく、深層学習を使うなら説明手法の追加費用を見込みます。
避けたいのは、数千行のExcelデータしかない段階で「AIを入れるならディープラーニング」とGPU環境から整える進め方です。学習にかかる費用と時間が増えるうえ、上の研究結果どおり精度でも勾配ブースティングに届かないことがあります。
AI・ML・DLの関係を変えた出来事の年表
3語の関係は最初から入れ子だったわけではなく、主役が入れ替わりながら現在の形になりました。
| 年 | 出来事 | 3語の関係への影響 |
|---|---|---|
| 1955年 | ダートマス夏季研究計画の提案書 | AIという語と研究分野が成立 |
| 1959年 | Samuelのチェッカー論文 | 論文題に「Machine Learning」を掲げた初期の研究 |
| 2012年 | AlexNetがILSVRC-2012で優勝 | 深層学習が画像認識の主流に |
| 2015年 | Nature誌の総説「Deep learning」 | 深層学習の定義が定着 |
| 2017年 | Transformerの論文公開 | LLMの土台となる構造が登場 |
| 2020年 | GPT-3の論文公開 | 1,750億パラメータのLLM |
| 2024年 | ノーベル物理学賞(Hopfield・Hinton) | ニューラルネットの基礎研究が受賞 |
| 2025年 | AI法の公布 | AI推進の基本法で「人工知能関連技術」を定義 |
見落とされがちなのは、Samuelが1959年の論文ですでに、機械学習の進め方を2つに分けていた点です。1つは「Neural-Net Approach」と呼ぶ、ランダムにつながった回路網に報酬と罰で学習させる方法で、汎用の学習機械につながるものの、当時作れる回路網は動物の神経網に比べて小さく実用には遠いと書いています。もう1つは特定のことだけを学ぶよう設計したネットワークで、用途ごとに作り直しが要る代わりにすぐ実現できるとして、Samuelはこちらを採用しました。Samuelが採用した方式は、人が列挙したパラメータ(特徴)の候補に対して、正しい符号と相対的な重みだけを学習させる線形多項式でした。特徴を人が用意し重みを機械が学ぶという点で、今日の従来型の機械学習とよく似ています。
2024年のノーベル物理学賞の授賞理由も「人工ニューラルネットワークによる機械学習を可能にした基礎的な発見と発明」で、ニューラルネットワークを機械学習を実現する手段として位置づけています。
生成AI・LLMの位置づけ:深層学習の内側にあるTransformer系モデル
ChatGPTなどの生成AIやLLM(大規模言語モデル)は、深層学習の内側に位置します。関係を4段で書くと「AI ⊃ 機械学習 ⊃ 深層学習 ⊃ LLM」です。
LLMの土台は、2017年6月に公開された論文「Attention Is All You Need」が提案したTransformerです。それまで文章処理の主流だった再帰型・畳み込み型のネットワークを使わず、注意機構(attention)だけで構成したニューラルネットワークで、構造の詳細はTransformerとは?自己注意の仕組みとBERT・GPTの違いを実装目線で解説で説明しています。2020年5月に公開されたGPT-3の論文では、このTransformerを1,750億パラメータまで大きくしたモデルが、数例を示すだけで新しい言語タスクをこなせることが示されました。
生成AIと識別・予測型のAIの違いや、企業で使うときの判断基準はLLMとは?大規模言語モデルの仕組み・生成AIとの違いと企業導入の判断基準を解説を参照してください。
よくある質問
MLとDLの違いを一言でいうと何ですか?
特徴量を誰が作るかです。従来の機械学習(ML)は判定の手がかりを人が設計して与え、深層学習(DL)は多層のニューラルネットワークがデータから手がかりそのものを学びます。DLはMLの一種なので、対立する技術ではありません。
ディープラーニングはAIに含まれますか?
含まれます。ディープラーニングは機械学習の一手法で、機械学習はAIを実現する手法の一つなので、ディープラーニングはAIの一部です。逆に、人が書いたルールだけで動くAIのように、ディープラーニングを使わないAIもあります。
LLMや生成AIはAI・ML・DLのどこに位置づきますか?
深層学習の内側です。LLMはTransformerという深層学習の構造を大規模にしたモデルなので、「AI ⊃ 機械学習 ⊃ 深層学習 ⊃ LLM」の順に含まれます。
「AI/ML」という表記は何を指しますか?
「AIと機械学習」をまとめて呼ぶ表記で、クラウドサービスの製品分類や求人の職種名でよく使われます。厳密な技術用語ではなく、機械学習を中心としたAI関連の技術全般を指すと考えて差し支えありません。
ml・dl(ミリリットル・デシリットル)の違いは何ですか?
計量単位のmL(ミリリットル)とdL(デシリットル)の違いであれば、1dL=100mLです。ミリは1,000分の1、デシは10分の1を表す接頭語なので、1L=10dL=1,000mLになります。本記事で扱っているのはIT用語のML(Machine Learning)とDL(Deep Learning)です。