1. 定義と概要
エージェントとは、強化学習において環境(エージェントの行動を受け取り、次の状態と報酬を返す外部の仕組み)と相互作用しながら、試行錯誤によって行動を学習していく意思決定の主体です。その行動は、報酬(行動の良し悪しを数値で表したフィードバック)を最大化するように選ばれます。
具体例としては、ゲームをプレイするプログラム、ロボットアームの制御プログラム、自動運転車の運転制御プログラムなどが挙げられます。エージェントは、環境から観測した状態(エージェントが観測する、その時点での環境の状況)に基づいて行動(エージェントが状態に応じて選ぶ選択肢)を選び、その結果として環境から報酬と次の状態を受け取るという相互作用を繰り返します。
教師あり学習(正解のラベルが付いたデータをもとに学習する手法)が正解データとの誤差をもとに学習するのに対し、強化学習では正解データが与えられず、エージェントが自ら行動し報酬を手がかりに学習を進める点に特徴があります。
状態の観測、行動の選択、報酬と次の状態の受け取りという一連のやり取りは、マルコフ決定過程(MDP、現在の状態と行動だけで次の状態と報酬が決まるという、強化学習の数学的な枠組み)として定式化されます。エージェントという主体を中心に据えることで、環境がゲームであれロボットの作業空間であれ、共通の枠組みで行動学習を扱えます。
2. 試験対策ポイント
G検定でまず重要な論点になるのは、状態の観測、行動の選択、報酬と次の状態の受け取りという相互作用のループが、マルコフ決定過程として定式化される点です。この枠組みは強化学習全体を理解する土台になります。
もう一つの重要なテーマが、探索と活用のトレードオフです。活用(exploitation、これまでの経験から報酬が高いとわかっている行動を選ぶこと)だけに偏ると、より高い報酬を得られる未知の行動を見逃す可能性があります。そのため、まだ試していない行動を試して新しい情報を得る探索(exploration)とのバランスを取る必要があります。
エージェントが取り組む課題は、ゲームオーバーのような終端状態を持つエピソード的タスク(終わりのある課題)と、明確な終わりを持たない連続タスク(継続する課題)に分類されます。この区分も、課題の性質を整理するうえでの要点です。
学習を支える要素としては、行動選択の基準となる方策という用語、将来の報酬をどれだけ重視するかを表す割引率という用語、状態や行動の価値を見積もる価値関数という用語が登場します。それぞれの意味は次のとおりです。
| 用語 | 意味 |
|---|---|
| 方策 | ある状態でどの行動を選ぶかを決めるルール |
| 割引率 | 将来の報酬を今の価値としてどれだけ重視するかを表す数値 |
| 価値関数 | ある状態や行動を選んだときに将来得られる報酬の見込みを数値化したもの |
いずれもエージェントの学習を支える要素であり、これらの数式や具体的な計算方法は、別の記事で扱う内容です。
また、複数のエージェントが同一の環境で同時に学習・相互作用する設定はマルチエージェント強化学習(複数のエージェントが同時に学習し影響し合う設定の強化学習)と呼ばれます。他のエージェントも学習し続けることで生じる非定常性という、単一エージェントには無い課題があり、この詳細は別記事のテーマです。
3. 関連概念との比較・相違点
エージェントと対になる概念が環境です。エージェントが状態を観測して行動を選ぶ主体であるのに対し、環境はその行動を受け取り、次の状態と報酬を返す客体という関係にあります。両者は常にセットで機能し、一方だけでは強化学習の枠組みが成立しません。
一方、近年よく使われる「AIエージェント」(生成AIを使って自律的に目標達成のためのタスクをこなすプログラム)は、G検定で扱う強化学習のエージェントとは異なる概念です。ここでの生成AI(文章や画像などを新たに作り出すAI)は、大規模言語モデル(膨大な文章データで学習した言語処理AI)を使ってタスクを分解し、ツールを呼び出しながら自律的に処理を進めます。
これに対し、強化学習のエージェントは、報酬を手がかりに試行錯誤を繰り返しながら行動を学習していく点が特徴です。両者は自律的に動作する主体という点で似た言葉に見えますが、学習の仕組みそのものが異なる別の概念として区別されます。
呼び名の重なる2つのエージェントを、観点ごとに並べると次のように対応します。
| 観点 | 強化学習のエージェント | AIエージェント |
|---|---|---|
| 動作の土台 | 報酬を手がかりにした試行錯誤 | 生成AIと大規模言語モデル |
| 手がかりにするもの | 環境から返ってくる状態と報酬 | 与えられた目標と、分解したタスク |
| 進め方 | 行動を選び、その結果から学習を重ねる | ツールを呼び出しながら自律的に処理を進める |
自律的に動く主体という見え方は共通していても、何を手がかりに動くかが分かれていると捉えると、混同を避けやすくなります。
4. ビジネス・実務での活用シナリオ
ロボティクス・製造の現場では、ロボットアームの制御プログラムがエージェントとして関節の角度や力加減という行動を選び、対象物を落とさず掴めたかという結果を報酬として受け取りながら動作を洗練させていきます。試行錯誤を重ねるほど、成功率の高い動かし方が身についていく仕組みです。
広告・マーケティングの分野では、広告の表示内容を選ぶプログラムがエージェントとして機能し、クリックや購入という反応を報酬として受け取りながら配信方針を調整します。限られた試行の中で報酬を最大化する選択を学ぶバンディットアルゴリズム(限られた試行の中で報酬を最大化する選択を学ぶ手法)の考え方に通じる活用例です。
ゲームAIの領域でも、囲碁やビデオゲームをプレイするプログラムがエージェントとして盤面や画面という状態を観測し、勝敗という報酬を最大化する行動を学習します。複数のプログラムが同時に対戦しながら学習を進める個別の代表事例は、深層強化学習(深層学習を組み合わせた強化学習)やマルチエージェント強化学習の各記事で扱います。
5. 要点まとめ
- エージェントとは、強化学習において環境と相互作用しながら試行錯誤で行動を学習する主体で、状態の観測、行動の選択、報酬と次の状態の受け取りというループを繰り返します。
- このループはマルコフ決定過程として定式化され、既知の高報酬行動を選ぶ活用と未知の行動を試す探索のバランスが課題となります。
- 近年使われるAIエージェント(生成AIによる自律的なタスク遂行プログラム)とは学習の仕組みが異なり、複数のエージェントが同時に相互作用する設定はマルチエージェント強化学習という別の枠組みで扱われます。
6. 確認問題
問1エージェントは、環境から観測した状態に基づいて行動を選択し、その結果として環境から報酬と次の状態を受け取るという相互作用を繰り返す。
解答・解説をみる
○ 正しい
この状態、行動、報酬と次の状態というループが強化学習の基本構造で、マルコフ決定過程として定式化されます。
問2強化学習における探索と活用のトレードオフとは、既知の高報酬行動を選ぶ活用と、未知の行動を試す探索のバランスを取る必要があるという考え方である。
解答・解説をみる
○ 正しい
活用だけに偏ると、より高い報酬を得られる未知の行動を見逃す可能性があるため、両者のバランスが課題となります。
問3近年使われる「AIエージェント」という言葉は、G検定の強化学習における「エージェント」と全く同じ意味で使われ、報酬による試行錯誤のみで学習する主体だけを指す。
解答・解説をみる
× 誤り
近年の「AIエージェント」は生成AIを用いて自律的にタスクを遂行するプログラムを指すことが多く、報酬を手がかりに試行錯誤で行動を学習する強化学習のエージェントとは異なる概念として区別されます。

