生成AIの歴史を理解するとき、「GPT-3が登場した」「ChatGPTが流行した」「AI Agentが登場した」という製品年表だけを覚えても、技術の本質は見えてきません。
重要なのは、各段階で何ができるようになり、AIシステムの構造がどう変化したのかです。
2026年の生成AIは、単に質問を入力して文章を返すシステムではありません。
Prompt
↓
Model
↓
Text
という単純な構造から、
Goal
↓
Model / Reasoning
↓
Tool selection
↓
External system
↓
Result
↓
Verification
↓
Next action
という、複数ステップを実行するシステムへ発展しています。
この記事では、TransformerからFoundation Model、Instruction Tuning、RLHF、Chat型UI、Reasoning、Tool Use、AI Agentまでを、一つの技術史として整理します。
今日の到達点
この記事を読み終えると、次のことを説明できる状態を目指します。
- Transformerが生成AIの何を変えたのか
- PretrainingとFoundation Modelの関係
- Instruction TuningとRLHFが必要になった理由
- ChatGPTが「新しいモデル」だけでは説明できない理由
- 2026年のAIが単発チャットからagentic systemへ広がった理由
最終的には、生成AIの発展を「モデル性能の向上」ではなく、AIシステムの責務が拡張してきた歴史として捉えます。
Transformer以前の課題
自然言語処理では、文章を単なる単語の集合として扱うだけでは不十分です。
たとえば、
The engineer who designed the hydraulic unit arrived yesterday.
という文章では、離れた位置にある単語同士にも関係があります。
従来の系列モデルではRNNやLSTMなどが広く使われていました。これらは系列を順番に処理するため、長距離依存関係や並列計算の難しさが課題になります。
2017年に発表された論文「Attention Is All You Need」は、再帰構造や畳み込みを中心にせず、attention mechanismを中心としたTransformer architectureを提案しました。
Transformerの重要性は、単に「精度の高い翻訳モデルができた」ことではありません。
大規模データと大規模計算資源を使ってモデルをスケールさせやすい構造を提供したことが、その後の生成AIへ大きくつながりました。
Transformerが変えたもの
Transformerの中心にあるのがSelf-Attentionです。
簡略化すると、各tokenが他のtokenとの関係を評価します。
代表的なScaled Dot-Product Attentionは、
Attention(Q, K, V)
=
softmax(QK^T / sqrt(d_k)) V
で表されます。
ここで、
Q:QueryK:KeyV:Valued_k:Keyの次元数
です。
重要なのは数式を暗記することではありません。
Transformerでは、系列の各位置が他の位置との関係をattentionとして計算できます。
これにより、
入力token列
↓
token間の関係を計算
↓
文脈を反映した内部表現
を構築できます。
Transformerはその後、BERT系、GPT系をはじめ、多くの大規模言語モデルの基盤となりました。
ただし、
Transformer = ChatGPT
ではありません。
Transformerはarchitectureです。
現在の生成AIシステムは、その上に大規模学習、alignment、tool use、retrieval、runtime orchestrationなど、多数の層を積み重ねています。
Pretrainingという転換
次の重要な変化が、大規模な**事前学習(pretraining)**です。
従来は、
翻訳用モデル
分類用モデル
質問応答用モデル
のように、タスクごとに専用モデルを作る発想が強くありました。
大規模言語モデルでは、大量のデータからまず汎用的なパターンを学習します。
概念的には、
大量データ
↓
Pretraining
↓
汎用的な基盤モデル
↓
さまざまなタスクへ適応
という構造です。
GPT系のautoregressive language modelなら、基本的な学習目標は次token予測として表せます。
文章を、
x1, x2, x3, ..., xn
とすると、
P(x_t | x_1, x_2, ..., x_{t-1})
を学習します。
一見すると「次の単語を当てているだけ」に見えます。
しかし大規模なデータとモデルを使うことで、モデル内部には言語、コード、概念、関係性などに関する広範な表現が形成されます。
ここから、個別タスク専用モデルとは異なる方向へAIが進み始めます。
Foundation Modelという考え方
2021年前後には、こうした大規模事前学習モデルをFoundation Modelとして捉える考え方が整理されました。
Foundation Modelとは、広範なデータで大規模に学習され、さまざまな下流タスクへ適応できる基盤モデルです。
重要なのは、
1 task
=
1 model
から、
1 foundation model
↓
many downstream tasks
へ設計思想が変わったことです。
これによってAI開発の中心は、
モデルを毎回ゼロから学習する
ことから、
既存の基盤モデルを
目的に合わせて適応・接続する
方向へ移ります。
2026年のAIシステム設計にも、この考え方は強く残っています。
Few-shotからInstruction Tuningへ
大規模事前学習モデルには、prompt内に少数の例を与えることで新しいタスクへ対応できる能力が見られるようになりました。
たとえば、
Input: 2 + 3
Output: 5
Input: 7 + 4
Output: 11
Input: 8 + 9
Output:
のように例を提示し、続きを生成させます。
これはFew-shot promptingの基本的な考え方です。
しかし、pretrained modelは本質的には、
人間の命令に従うAI
として学習されたわけではありません。
学習目標は主として、
もっともらしい続きを生成する
ことです。
そこで重要になったのがInstruction Tuningです。
Instruction Tuningが変えたもの
Instruction Tuningでは、多様な指示と応答の組を使ってモデルを追加学習します。
概念的には、
Pretrained Model
↓
Instruction + Response Dataset
↓
Instruction-tuned Model
です。
これによって、
次の文章を続ける
だけでなく、
要約して
分類して
コードを書いて
説明して
表にして
といった、人間の指示へ従う能力を強化できます。
これは非常に重要な転換です。
生成AIが、
Language Model
から、
General-purpose Assistant
へ近づき始めたからです。
ただし、Instruction Tuningだけで人間の意図を完全に表現できるわけではありません。
RLHFと「人間が望む回答」
次の重要な技術が**RLHF(Reinforcement Learning from Human Feedback)**です。
基本的な考え方は、
複数のモデル回答
↓
人間が比較・評価
↓
人間の選好を学習
↓
モデルの振る舞いを改善
です。
InstructGPTでは、人間のフィードバックを利用して、指示追従性などを改善する方法が示されました。
ここで重要なのは、
言語として自然
と、
人間が望む回答
は同じではないということです。
Pretrainingだけでは、
もっともらしい文章
を生成できても、
役に立つ
指示に従う
危険な要求を適切に扱う
といった性質が自動的に保証されるわけではありません。
RLHFは、このギャップを縮めるためのalignment手法の一つです。
なお、2026年のモデルすべてが同一のRLHF方式で学習されているわけではありません。
AIによるフィードバック、直接選好最適化、ルールベースの手法など、alignment手法は多様化しています。
したがって、
現代LLM = RLHF
と単純化するのは正確ではありません。
ChatGPTが変えたのはUIだけではない
2022年11月、ChatGPTが公開されました。
ChatGPTでは、
User
↓
Assistant
↓
User
↓
Assistant
という対話形式が前面に出ました。
これは単なるUI変更ではありません。
それ以前のlanguage model利用では、
Prompt
↓
Completion
という単発処理が中心でした。
Chat型では、
Conversation State
↓
次の入力
↓
Model
↓
応答
↓
さらに次の入力
という反復的なinteractionが自然になります。
ユーザーは、
もう少し短くして
この条件を追加して
さっきのコードを修正して
別案を出して
と続けられます。
AIが一回限りのgeneratorから、対話しながら問題を解くinterfaceへ変化したことが重要です。
Multimodal化
次の変化は入力と出力の種類です。
初期のLLM利用は主に、
Text → Text
でした。
現在では、
Text
Image
Audio
Video
Files
Structured Data
などを扱うmultimodal systemが一般化しています。
AIシステムの入力が、
文字列
から、
現実世界の情報
へ広がったと見ることもできます。
これは工学分野でも重要です。
たとえば、
図面
機械写真
計測データ
音
作業動画
技術文書
をAIシステムへの入力として扱える可能性が広がります。
Multimodal AIについてはDay 4で詳しく扱います。
Reasoningという新しい軸
モデル評価では長く、
どれだけ知識を持っているか
どれだけ自然な文章を書けるか
が目立つ評価軸でした。
その後、複雑な問題に対して推論処理へより多くの計算を割り当てるReasoning modelが重要になりました。
ここでは、
Input
↓
Inference / Reasoning
↓
Verification
↓
Answer
という構造を考えます。
重要なのは、モデルサイズや学習量だけでなく、
推論時にどれだけ計算するか
という軸が強くなったことです。
つまりAIの能力を、
training
だけでなく、
inference-time computation
から考える必要が出てきました。
このテーマはDay 3で詳しく扱います。
Tool Useという転換
LLMには根本的な制約があります。
モデル単体では、
最新情報を検索する
DBを読む
メールを送る
Calendarへ予定を登録する
プログラムを実行する
外部APIを操作する
といった処理を直接行えません。
そこで重要になるのがTool Useです。
構造は、
User Request
↓
Model
↓
Tool Selection
↓
Tool Call
↓
External System
↓
Result
↓
Model
↓
Response
となります。
ここでAIは文章generatorではなく、
どのtoolを
どの引数で
いつ呼び出すか
を判断する役割を持ち始めます。
2026年時点では、Web検索、ファイル検索、function calling、MCP接続、computer useなど、モデルを外部環境へ接続する仕組みが実用化されています。
この変化は極めて大きいものです。
ModelからSystemへ
ここまでの流れをまとめると、
Transformer
↓
Large-scale Pretraining
↓
Foundation Model
↓
Instruction Tuning
↓
Preference / Alignment
↓
Chat Interface
↓
Multimodal
↓
Reasoning
↓
Tool Use
と発展してきました。
しかし、2026年の重要な変化は、この先です。
中心が、
AI Model
から、
AI System
へ移りつつあります。
モデル単体ではなく、
Model
Tools
Memory
Retrieval
Data
Permissions
Execution Environment
Evaluation
Human Approval
を組み合わせて、一つのシステムを作ります。
Agentic Workflowとは何か
Agentic Workflowでは、モデルが一回だけ回答するとは限りません。
たとえば、
Goal
↓
必要な情報を判断
↓
Search
↓
結果を読む
↓
不足を判断
↓
別のToolを実行
↓
結果を検証
↓
成果物を生成
というloopを持ちます。
概念的には、
flowchart TD
A[Goal] --> B[Model / Reasoning]
B --> C{Action needed?}
C -->|No| G[Final Output]
C -->|Yes| D[Tool]
D --> E[Environment]
E --> F[Observation]
F --> B
ここではモデルが、
文章を生成する部品
ではなく、
次のactionを決定する部品
として使われます。
これがagentic systemを理解する重要なポイントです。
WorkflowとAgentは同じではない
ここは混同しやすい部分です。
従来型Workflowは、
A
↓
B
↓
IF
├─ C
└─ D
のように、処理経路を人間が定義します。
一方Agentでは、
Goal
↓
Modelが状況を判断
↓
次のActionを選択
という部分が増えます。
したがって、
Agent = Workflowの上位互換
ではありません。
結果が決定論的である必要がある処理では、通常のWorkflowの方が適しています。
たとえば、
請求計算
安全インターロック
設計計算
DB整合性処理
などを、理由なくAgentへ置き換えるべきではありません。
2026年のAIシステム設計では、
曖昧な判断
→ AI
決定論的処理
→ Code / Workflow
と責務を分けることが重要です。
2026年の生成AIを技術スタックで見る
現在の生成AIを、一つのモデルだけで理解するのは難しくなっています。
概念的には次のstackで見ると整理しやすくなります。
Application
────────────────
Agent / Workflow
────────────────
Tools / APIs / MCP
────────────────
Memory / RAG / Context
────────────────
Reasoning / Planning
────────────────
Foundation Model
────────────────
Training / Data / Compute
ユーザーが触れているのは最上層のApplicationです。
しかし、その下では複数の技術が協調しています。
この構造を理解すると、
どのAIモデルが一番強いか
という問いだけでは、AIシステムを評価できないことが分かります。
生成AIの主要転換点を圧縮する
今回の歴史を10個以内へ圧縮すると、次のようになります。
| 転換点 | 技術的に変わったこと |
|---|---|
| Transformer | Attention中心のスケーラブルなarchitecture |
| Large-scale Pretraining | 大量データから汎用表現を獲得 |
| Foundation Model | 1モデルを多数タスクへ適応 |
| Few-shot / Prompting | 入力だけで新しいタスクへ対応 |
| Instruction Tuning | 人間の命令へ従う能力を強化 |
| Preference Alignment | 人間の選好をモデル挙動へ反映 |
| Chat Interface | 単発生成から反復的interactionへ |
| Multimodal | Text以外の世界を入力・出力へ接続 |
| Reasoning | 推論時計算という能力軸が拡大 |
| Tool Use / Agents | モデルが外部世界へActionできるようになった |
ここで最も重要なのは最後です。
AIの発展は、
より良い文章を書く
だけではなく、
より広い範囲の仕事を
システムとして実行する
方向へ進んでいます。
それでもLLMは「正解生成機」ではない
能力が拡大しても、重要な制約は残ります。
LLMは確率モデルです。
したがって、
自然な文章
=
正しい情報
ではありません。
また、
Reasoningを使った
=
論理的に正しい
でもありません。
Toolを利用しても、
検索結果を誤読する
間違ったtoolを選ぶ
不適切な引数を渡す
途中結果を誤って解釈する
可能性があります。
Agentではさらに、
誤判断
↓
Action
↓
外部システム変更
へつながります。
モデルが高性能になるほど、
Permission
Validation
Logging
Human Approval
Rollback
Evaluation
といったシステム設計が重要になります。
AIを評価するときはModelとSystemを分ける
2026年のAIを評価するとき、
Model能力
と、
System能力
を分けて考える必要があります。
モデルが高性能でも、
古い情報しか与えられない
Toolがない
Permission設計が悪い
検証処理がない
Context管理が悪い
なら、実務システムとしては弱くなります。
逆に、
Retrieval
Tools
Structured Data
Validation
Workflow
Human Review
を適切に組み合わせれば、モデル単体以上に信頼性の高いシステムを構築できます。
これが2026年の生成AIを理解する重要な視点です。
工学分野との接点
工学分野では、AIにすべてを任せる必要はありません。
むしろ、
AI
→ 曖昧情報の整理
→ 文献探索
→ 候補生成
→ 自然言語interface
Code
→ 数式
→ 単位変換
→ 設計計算
→ 制約判定
Database
→ 規格値
→ 部品情報
→ 過去データ
CAD
→ 幾何生成
→ 図面
→ モデル
Human
→ 設計責任
→ 妥当性判断
→ 最終承認
のように責務を分離できます。
これはagentic systemの考え方と非常に相性がよい構造です。
AIを「何でも答える頭脳」と考えるより、
工学システムを構成する一つの判断モジュール
として扱った方が設計しやすくなります。
まとめ
生成AIの歴史は、単純なモデルサイズ競争ではありません。
技術構造として見ると、
Transformer
↓
Pretraining
↓
Foundation Model
↓
Instruction Tuning
↓
Alignment
↓
Chat
↓
Multimodal
↓
Reasoning
↓
Tool Use
↓
Agentic System
という発展として整理できます。
Transformerによって大規模学習に適したarchitectureが成立し、Pretrainingによって汎用能力を持つFoundation Modelが発展しました。
Instruction TuningやRLHFなどによって、人間の指示や選好へ合わせる技術が進みました。
Chat InterfaceによってAIとのinteractionが変わり、Multimodalによって入力世界が拡張されました。
Reasoningによって推論時の計算が新しい能力軸となり、Tool UseによってAIは外部システムへ接続されました。
そして2026年には、
Model
だけを見る時代から、
Model
+
Context
+
Memory
+
Tools
+
Workflow
+
Permissions
+
Evaluation
を組み合わせたAI Systemを見る時代へ進んでいます。
この視点を持っておくと、これから登場する新しいモデルやAgent製品を、名前ではなく技術構造から理解できるようになります。
参考情報
- Vaswani et al., Attention Is All You Need(2017)
- Stanford Center for Research on Foundation Models, Foundation Models関連資料
- OpenAI, Aligning Language Models to Follow Instructions(InstructGPT)
- OpenAI, Introducing ChatGPT(2022)
- OpenAI, Responses API / Tools / Agents関連公式資料

