生成AIはどう進化したのか|TransformerからAI Agentまでの技術史

「生成AIはどう進化したのか|TransformerからAI Agentまでの技術史」の内容を表す技術イラスト

生成AIの歴史を理解するとき、「GPT-3が登場した」「ChatGPTが流行した」「AI Agentが登場した」という製品年表だけを覚えても、技術の本質は見えてきません。

重要なのは、各段階で何ができるようになり、AIシステムの構造がどう変化したのかです。

2026年の生成AIは、単に質問を入力して文章を返すシステムではありません。

Prompt
↓
Model
↓
Text

という単純な構造から、

Goal
↓
Model / Reasoning
↓
Tool selection
↓
External system
↓
Result
↓
Verification
↓
Next action

という、複数ステップを実行するシステムへ発展しています。

この記事では、TransformerからFoundation Model、Instruction Tuning、RLHF、Chat型UI、Reasoning、Tool Use、AI Agentまでを、一つの技術史として整理します。

目次

今日の到達点

この記事を読み終えると、次のことを説明できる状態を目指します。

  • Transformerが生成AIの何を変えたのか
  • PretrainingとFoundation Modelの関係
  • Instruction TuningとRLHFが必要になった理由
  • ChatGPTが「新しいモデル」だけでは説明できない理由
  • 2026年のAIが単発チャットからagentic systemへ広がった理由

最終的には、生成AIの発展を「モデル性能の向上」ではなく、AIシステムの責務が拡張してきた歴史として捉えます。


Transformer以前の課題

自然言語処理では、文章を単なる単語の集合として扱うだけでは不十分です。

たとえば、

The engineer who designed the hydraulic unit arrived yesterday.

という文章では、離れた位置にある単語同士にも関係があります。

従来の系列モデルではRNNやLSTMなどが広く使われていました。これらは系列を順番に処理するため、長距離依存関係や並列計算の難しさが課題になります。

2017年に発表された論文「Attention Is All You Need」は、再帰構造や畳み込みを中心にせず、attention mechanismを中心としたTransformer architectureを提案しました。

Transformerの重要性は、単に「精度の高い翻訳モデルができた」ことではありません。

大規模データと大規模計算資源を使ってモデルをスケールさせやすい構造を提供したことが、その後の生成AIへ大きくつながりました。


Transformerが変えたもの

Transformerの中心にあるのがSelf-Attentionです。

簡略化すると、各tokenが他のtokenとの関係を評価します。

代表的なScaled Dot-Product Attentionは、

Attention(Q, K, V)
=
softmax(QK^T / sqrt(d_k)) V

で表されます。

ここで、

  • Q:Query
  • K:Key
  • V:Value
  • d_k:Keyの次元数

です。

重要なのは数式を暗記することではありません。

Transformerでは、系列の各位置が他の位置との関係をattentionとして計算できます。

これにより、

入力token列
↓
token間の関係を計算
↓
文脈を反映した内部表現

を構築できます。

Transformerはその後、BERT系、GPT系をはじめ、多くの大規模言語モデルの基盤となりました。

ただし、

Transformer = ChatGPT

ではありません。

Transformerはarchitectureです。

現在の生成AIシステムは、その上に大規模学習、alignment、tool use、retrieval、runtime orchestrationなど、多数の層を積み重ねています。


Pretrainingという転換

次の重要な変化が、大規模な**事前学習(pretraining)**です。

従来は、

翻訳用モデル
分類用モデル
質問応答用モデル

のように、タスクごとに専用モデルを作る発想が強くありました。

大規模言語モデルでは、大量のデータからまず汎用的なパターンを学習します。

概念的には、

大量データ
↓
Pretraining
↓
汎用的な基盤モデル
↓
さまざまなタスクへ適応

という構造です。

GPT系のautoregressive language modelなら、基本的な学習目標は次token予測として表せます。

文章を、

x1, x2, x3, ..., xn

とすると、

P(x_t | x_1, x_2, ..., x_{t-1})

を学習します。

一見すると「次の単語を当てているだけ」に見えます。

しかし大規模なデータとモデルを使うことで、モデル内部には言語、コード、概念、関係性などに関する広範な表現が形成されます。

ここから、個別タスク専用モデルとは異なる方向へAIが進み始めます。


Foundation Modelという考え方

2021年前後には、こうした大規模事前学習モデルをFoundation Modelとして捉える考え方が整理されました。

Foundation Modelとは、広範なデータで大規模に学習され、さまざまな下流タスクへ適応できる基盤モデルです。

重要なのは、

1 task
=
1 model

から、

1 foundation model
↓
many downstream tasks

へ設計思想が変わったことです。

これによってAI開発の中心は、

モデルを毎回ゼロから学習する

ことから、

既存の基盤モデルを
目的に合わせて適応・接続する

方向へ移ります。

2026年のAIシステム設計にも、この考え方は強く残っています。


Few-shotからInstruction Tuningへ

大規模事前学習モデルには、prompt内に少数の例を与えることで新しいタスクへ対応できる能力が見られるようになりました。

たとえば、

Input: 2 + 3
Output: 5

Input: 7 + 4
Output: 11

Input: 8 + 9
Output:

のように例を提示し、続きを生成させます。

これはFew-shot promptingの基本的な考え方です。

しかし、pretrained modelは本質的には、

人間の命令に従うAI

として学習されたわけではありません。

学習目標は主として、

もっともらしい続きを生成する

ことです。

そこで重要になったのがInstruction Tuningです。


Instruction Tuningが変えたもの

Instruction Tuningでは、多様な指示と応答の組を使ってモデルを追加学習します。

概念的には、

Pretrained Model
↓
Instruction + Response Dataset
↓
Instruction-tuned Model

です。

これによって、

次の文章を続ける

だけでなく、

要約して
分類して
コードを書いて
説明して
表にして

といった、人間の指示へ従う能力を強化できます。

これは非常に重要な転換です。

生成AIが、

Language Model

から、

General-purpose Assistant

へ近づき始めたからです。

ただし、Instruction Tuningだけで人間の意図を完全に表現できるわけではありません。


RLHFと「人間が望む回答」

次の重要な技術が**RLHF(Reinforcement Learning from Human Feedback)**です。

基本的な考え方は、

複数のモデル回答
↓
人間が比較・評価
↓
人間の選好を学習
↓
モデルの振る舞いを改善

です。

InstructGPTでは、人間のフィードバックを利用して、指示追従性などを改善する方法が示されました。

ここで重要なのは、

言語として自然

と、

人間が望む回答

は同じではないということです。

Pretrainingだけでは、

もっともらしい文章

を生成できても、

役に立つ
指示に従う
危険な要求を適切に扱う

といった性質が自動的に保証されるわけではありません。

RLHFは、このギャップを縮めるためのalignment手法の一つです。

なお、2026年のモデルすべてが同一のRLHF方式で学習されているわけではありません。

AIによるフィードバック、直接選好最適化、ルールベースの手法など、alignment手法は多様化しています。

したがって、

現代LLM = RLHF

と単純化するのは正確ではありません。


ChatGPTが変えたのはUIだけではない

2022年11月、ChatGPTが公開されました。

ChatGPTでは、

User
↓
Assistant
↓
User
↓
Assistant

という対話形式が前面に出ました。

これは単なるUI変更ではありません。

それ以前のlanguage model利用では、

Prompt
↓
Completion

という単発処理が中心でした。

Chat型では、

Conversation State
↓
次の入力
↓
Model
↓
応答
↓
さらに次の入力

という反復的なinteractionが自然になります。

ユーザーは、

もう少し短くして
この条件を追加して
さっきのコードを修正して
別案を出して

と続けられます。

AIが一回限りのgeneratorから、対話しながら問題を解くinterfaceへ変化したことが重要です。


Multimodal化

次の変化は入力と出力の種類です。

初期のLLM利用は主に、

Text → Text

でした。

現在では、

Text
Image
Audio
Video
Files
Structured Data

などを扱うmultimodal systemが一般化しています。

AIシステムの入力が、

文字列

から、

現実世界の情報

へ広がったと見ることもできます。

これは工学分野でも重要です。

たとえば、

図面
機械写真
計測データ
音
作業動画
技術文書

をAIシステムへの入力として扱える可能性が広がります。

Multimodal AIについてはDay 4で詳しく扱います。


Reasoningという新しい軸

モデル評価では長く、

どれだけ知識を持っているか
どれだけ自然な文章を書けるか

が目立つ評価軸でした。

その後、複雑な問題に対して推論処理へより多くの計算を割り当てるReasoning modelが重要になりました。

ここでは、

Input
↓
Inference / Reasoning
↓
Verification
↓
Answer

という構造を考えます。

重要なのは、モデルサイズや学習量だけでなく、

推論時にどれだけ計算するか

という軸が強くなったことです。

つまりAIの能力を、

training

だけでなく、

inference-time computation

から考える必要が出てきました。

このテーマはDay 3で詳しく扱います。


Tool Useという転換

LLMには根本的な制約があります。

モデル単体では、

最新情報を検索する
DBを読む
メールを送る
Calendarへ予定を登録する
プログラムを実行する
外部APIを操作する

といった処理を直接行えません。

そこで重要になるのがTool Useです。

構造は、

User Request
↓
Model
↓
Tool Selection
↓
Tool Call
↓
External System
↓
Result
↓
Model
↓
Response

となります。

ここでAIは文章generatorではなく、

どのtoolを
どの引数で
いつ呼び出すか

を判断する役割を持ち始めます。

2026年時点では、Web検索、ファイル検索、function calling、MCP接続、computer useなど、モデルを外部環境へ接続する仕組みが実用化されています。

この変化は極めて大きいものです。


ModelからSystemへ

ここまでの流れをまとめると、

Transformer
↓
Large-scale Pretraining
↓
Foundation Model
↓
Instruction Tuning
↓
Preference / Alignment
↓
Chat Interface
↓
Multimodal
↓
Reasoning
↓
Tool Use

と発展してきました。

しかし、2026年の重要な変化は、この先です。

中心が、

AI Model

から、

AI System

へ移りつつあります。

モデル単体ではなく、

Model
Tools
Memory
Retrieval
Data
Permissions
Execution Environment
Evaluation
Human Approval

を組み合わせて、一つのシステムを作ります。


Agentic Workflowとは何か

Agentic Workflowでは、モデルが一回だけ回答するとは限りません。

たとえば、

Goal
↓
必要な情報を判断
↓
Search
↓
結果を読む
↓
不足を判断
↓
別のToolを実行
↓
結果を検証
↓
成果物を生成

というloopを持ちます。

概念的には、

flowchart TD
    A[Goal] --> B[Model / Reasoning]
    B --> C{Action needed?}
    C -->|No| G[Final Output]
    C -->|Yes| D[Tool]
    D --> E[Environment]
    E --> F[Observation]
    F --> B

ここではモデルが、

文章を生成する部品

ではなく、

次のactionを決定する部品

として使われます。

これがagentic systemを理解する重要なポイントです。


WorkflowとAgentは同じではない

ここは混同しやすい部分です。

従来型Workflowは、

A
↓
B
↓
IF
├─ C
└─ D

のように、処理経路を人間が定義します。

一方Agentでは、

Goal
↓
Modelが状況を判断
↓
次のActionを選択

という部分が増えます。

したがって、

Agent = Workflowの上位互換

ではありません。

結果が決定論的である必要がある処理では、通常のWorkflowの方が適しています。

たとえば、

請求計算
安全インターロック
設計計算
DB整合性処理

などを、理由なくAgentへ置き換えるべきではありません。

2026年のAIシステム設計では、

曖昧な判断
→ AI

決定論的処理
→ Code / Workflow

と責務を分けることが重要です。


2026年の生成AIを技術スタックで見る

現在の生成AIを、一つのモデルだけで理解するのは難しくなっています。

概念的には次のstackで見ると整理しやすくなります。

Application
────────────────
Agent / Workflow
────────────────
Tools / APIs / MCP
────────────────
Memory / RAG / Context
────────────────
Reasoning / Planning
────────────────
Foundation Model
────────────────
Training / Data / Compute

ユーザーが触れているのは最上層のApplicationです。

しかし、その下では複数の技術が協調しています。

この構造を理解すると、

どのAIモデルが一番強いか

という問いだけでは、AIシステムを評価できないことが分かります。


生成AIの主要転換点を圧縮する

今回の歴史を10個以内へ圧縮すると、次のようになります。

転換点技術的に変わったこと
TransformerAttention中心のスケーラブルなarchitecture
Large-scale Pretraining大量データから汎用表現を獲得
Foundation Model1モデルを多数タスクへ適応
Few-shot / Prompting入力だけで新しいタスクへ対応
Instruction Tuning人間の命令へ従う能力を強化
Preference Alignment人間の選好をモデル挙動へ反映
Chat Interface単発生成から反復的interactionへ
MultimodalText以外の世界を入力・出力へ接続
Reasoning推論時計算という能力軸が拡大
Tool Use / Agentsモデルが外部世界へActionできるようになった

ここで最も重要なのは最後です。

AIの発展は、

より良い文章を書く

だけではなく、

より広い範囲の仕事を
システムとして実行する

方向へ進んでいます。


それでもLLMは「正解生成機」ではない

能力が拡大しても、重要な制約は残ります。

LLMは確率モデルです。

したがって、

自然な文章
=
正しい情報

ではありません。

また、

Reasoningを使った
=
論理的に正しい

でもありません。

Toolを利用しても、

検索結果を誤読する
間違ったtoolを選ぶ
不適切な引数を渡す
途中結果を誤って解釈する

可能性があります。

Agentではさらに、

誤判断
↓
Action
↓
外部システム変更

へつながります。

モデルが高性能になるほど、

Permission
Validation
Logging
Human Approval
Rollback
Evaluation

といったシステム設計が重要になります。


AIを評価するときはModelとSystemを分ける

2026年のAIを評価するとき、

Model能力

と、

System能力

を分けて考える必要があります。

モデルが高性能でも、

古い情報しか与えられない
Toolがない
Permission設計が悪い
検証処理がない
Context管理が悪い

なら、実務システムとしては弱くなります。

逆に、

Retrieval
Tools
Structured Data
Validation
Workflow
Human Review

を適切に組み合わせれば、モデル単体以上に信頼性の高いシステムを構築できます。

これが2026年の生成AIを理解する重要な視点です。


工学分野との接点

工学分野では、AIにすべてを任せる必要はありません。

むしろ、

AI
→ 曖昧情報の整理
→ 文献探索
→ 候補生成
→ 自然言語interface

Code
→ 数式
→ 単位変換
→ 設計計算
→ 制約判定

Database
→ 規格値
→ 部品情報
→ 過去データ

CAD
→ 幾何生成
→ 図面
→ モデル

Human
→ 設計責任
→ 妥当性判断
→ 最終承認

のように責務を分離できます。

これはagentic systemの考え方と非常に相性がよい構造です。

AIを「何でも答える頭脳」と考えるより、

工学システムを構成する一つの判断モジュール

として扱った方が設計しやすくなります。


まとめ

生成AIの歴史は、単純なモデルサイズ競争ではありません。

技術構造として見ると、

Transformer
↓
Pretraining
↓
Foundation Model
↓
Instruction Tuning
↓
Alignment
↓
Chat
↓
Multimodal
↓
Reasoning
↓
Tool Use
↓
Agentic System

という発展として整理できます。

Transformerによって大規模学習に適したarchitectureが成立し、Pretrainingによって汎用能力を持つFoundation Modelが発展しました。

Instruction TuningやRLHFなどによって、人間の指示や選好へ合わせる技術が進みました。

Chat InterfaceによってAIとのinteractionが変わり、Multimodalによって入力世界が拡張されました。

Reasoningによって推論時の計算が新しい能力軸となり、Tool UseによってAIは外部システムへ接続されました。

そして2026年には、

Model

だけを見る時代から、

Model
+
Context
+
Memory
+
Tools
+
Workflow
+
Permissions
+
Evaluation

を組み合わせたAI Systemを見る時代へ進んでいます。

この視点を持っておくと、これから登場する新しいモデルやAgent製品を、名前ではなく技術構造から理解できるようになります。

参考情報

  • Vaswani et al., Attention Is All You Need(2017)
  • Stanford Center for Research on Foundation Models, Foundation Models関連資料
  • OpenAI, Aligning Language Models to Follow Instructions(InstructGPT)
  • OpenAI, Introducing ChatGPT(2022)
  • OpenAI, Responses API / Tools / Agents関連公式資料
参考になったらシェアしてください
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

機械設計・油圧・CAD・Python・AIなど、ものづくりに関わる技術を扱っています。工学知識を整理・構造化し、設計や自動化に再利用できる形へ変えていくことを目指しています。

目次