1. 定義と概要
GPT-3とは、OpenAIが2020年に発表した大規模言語モデル(膨大な文章データを学習し、人間の文章に近い言葉を生成できるモデルの総称)です。Transformer(文章中の単語同士の関係を並列に処理できるニューラルネットワークの構造)のデコーダ(それまでの文脈をもとに次の単語を予測して生成する部分)を土台としています。
パラメータ(モデルが学習によって調整する内部の数値の集まり)の数は1750億にのぼり、前身のGPT-2はパラメータ数が15億だったため、約117倍という規模拡大になりました。発表論文のタイトルは「Language Models are Few-Shot Learners」です。
モデルの重みを更新するファインチューニング(事前学習済みのモデルを、特定のタスク用データで追加学習して重みを微調整すること)を行わない点が最大の特徴です。それでもプロンプト(AIに与える入力文)の中に少数の例を示すだけで、翻訳・要約・質問応答といった多様なタスクに対応できることを示しました。具体的には、数個の例文をプロンプトに含めるだけで、英語からフランス語への翻訳や文章の要約を行わせられます。
自然言語処理(人間の言葉をコンピュータで扱う技術分野)のモデルは従来、大規模なデータによる事前学習の後、個々のタスクに合わせた正解データで再学習するファインチューニングを行うのが前提でした。つまり、使いたいタスクの数だけ学習をやり直す組み立てだったわけです。
GPT-3はモデルの規模を極端に拡大することで、タスクごとの再学習をしなくてもプロンプト内の例示だけで対応できることを示し、モデルの規模と獲得できる能力の関係を示す事例として注目を集めました。この現象は、以降の大規模言語モデルの開発方針にも影響を与えています。
2. 試験対策ポイント
まず整理したいのは、GPT-3の開発元がOpenAIである点です。同じ大規模言語モデルでも、BERTや「T5」(あらゆる言語処理を「文章を入力して文章を出力する」形式に統一して扱うモデル)は「Google」が開発しており、開発元の取り違えに注意が必要です。GPT-3・BERT・「T5」はいずれも「Transformer」を土台とする点で共通しますが、開発した企業は異なります。
パラメータ数の規模も試験対策のポイントです。GPT-3のパラメータ数は1750億で、前身のGPT-2(15億)から約117倍に拡大しました。ここでの要点は数値そのものよりも、この規模拡大がfew-shot learning(少数の例示だけで多様なタスクに対応できる学習方法)という能力の質的な変化をもたらした点です。モデルを大きくするほど、追加の学習をしなくても新しいタスクに対応できる能力が現れることが示されました。
ファインチューニングなしで対応できる学習形態には3区分があります。例示をまったく示さないzero-shot learning(タスクの説明だけでモデルに実行させる方法)と、例示を1件だけ示すone-shot learning(見本をひとつだけ添える方法)があります。さらに、例示を数件示すfew-shot learning(複数の見本を添える方法)も含まれます。
いずれもモデルの重みを更新せず、プロンプト内に例を含めるだけという共通点があります。3つを分けているのは示す例の件数だけで、追加学習を行わない点は共通していると押さえておくと取り違えにくくなります。
3. 関連概念との比較・相違点
GPT-2との最大の違いは、パラメータの規模と、それによって生まれた能力の質的な変化です。GPT-2のパラメータ数は15億でしたが、GPT-3は1750億と、約117倍に拡大しました。
GPT-2は事前学習だけでも自然な文章を生成できる段階に達していましたが、GPT-3はファインチューニングなしで少数の例示だけを頼りに、翻訳・要約・質問応答といった多様なタスクに対応できることを示した点で一線を画しています。単なる性能向上ではなく、規模の拡大が新しい能力を生み出すという発見自体が、GPT-2とGPT-3を分ける分かれ目です。
BERTとの違いは、開発元とアーキテクチャの向きの両方に表れます。GPT-3はOpenAIが開発したのに対し、BERTは「Google」が開発したモデルです。構造の面でも、GPT-3は「Transformer」のデコーダ構造による自己回帰(直前までの単語列をもとに次の単語を順番に予測していく生成方式)で文章を生成するのに適しています。
一方でBERTは双方向のエンコーダ(文章全体の意味を双方向に読み込んで理解する部分)構造を採用し、穴埋めや分類といったテキストの意味理解に強みを持ちます。両者の違いを観点ごとに並べると次のようになります。
| 観点 | GPT-3 | BERT |
|---|---|---|
| 開発元 | OpenAI | 「Google」 |
| 土台となる構造 | 「Transformer」のデコーダ | 双方向のエンコーダ |
| 文章の扱い方 | 自己回帰で次の単語を順に予測 | 文章全体を双方向に読み込む |
| 得意な用途 | 文章の生成 | 穴埋めや分類などの意味理解 |
こうして並べると、生成に強いGPT系のモデルと、理解に強いBERT系のモデルという対比になります。
4. ビジネス・実務での活用シナリオ
カスタマーサポートの分野では、GPT-3のAPI(外部のプログラムから機能を呼び出す仕組み)を使い、問い合わせ内容に応じた回答文を自動生成するチャットボット(利用者からの問いかけに自動で応答するプログラム)に応用されています。個別のFAQ(よくある質問)データでファインチューニングしなくても、プロンプトに例を数件含めるだけで応答の形式を調整できます。
コンテンツ制作の分野では、ブログ記事の下書きや広告コピーの生成にGPT-3の文章生成能力が使われています。少数の見本文をプロンプトに与えるだけで、その文体を模した文章を出力できるため、ゼロから書き起こす手間を省けます。
ソフトウェア開発の分野では、GPT-3を応用したコード生成モデルが登場し、自然言語による指示からプログラムコードを生成する用途へと発展しました。プログラミングの専門知識が少ない担当者でも、要件を文章で伝えるだけでコードの雛形を得られるようになっています。
5. 要点まとめ
- GPT-3はOpenAIが2020年に発表した1750億パラメータの大規模言語モデルで、GPT-2(15億パラメータ)から約117倍の規模拡大を遂げました。
- ファインチューニングなしで、プロンプト内の少数の例示だけで多様なタスクに対応できるfew-shot learning(およびone-shot learning・zero-shot learning)を実証した点が特徴です。
- 開発元はOpenAIであり、「Google」が開発したBERT・「T5」とは開発元が異なります。BERTは文章の理解に向いた構成である点も、GPT-3との区別として取り違えやすい点です。
6. 確認問題
問1GPT-3はOpenAIが2020年に発表した大規模言語モデルで、パラメータ数は1750億に達する。
解答・解説をみる
○ 正しい
パラメータ数1750億は、前身のGPT-2(15億)から約117倍に拡大した数値で、規模の論点として扱われます。
問2GPT-3が多様なタスクに対応するには、タスクごとに大量の正解データを用いたファインチューニング(モデルの重みを再学習すること)が不可欠である。
解答・解説をみる
× 誤り
正しくは、GPT-3はファインチューニングを行わず、プロンプト内の少数の例示(few-shot learning)だけで多様なタスクに対応できることを示した点が特徴です。「大量データでの再学習が必須」という記述はGPT-3の特徴と逆向きになります。
問3GPT-3は「Transformer」のデコーダ構造をベースとする自己回帰的な文章生成モデルであり、「Google」が開発した双方向エンコーダ構造のBERTとは、開発元とアーキテクチャの向きの両方で異なる。
解答・解説をみる
○ 正しい
GPT-3はOpenAI開発でデコーダ構造による生成特化、BERTはGoogle開発でエンコーダ構造による理解特化という対比になります。

