1. 定義と概要
GPT-2とは、OpenAIが2019年2月に発表した言語モデルで、パラメータ数は約15億個です。この内部の数値をパラメータと呼び、その総数をパラメータ数といいます。前身のGPT(GPT-1、パラメータ数は約1.17億個)から、規模を約10倍に拡大したモデルにあたります。
学習には、WebText(Web上で評価の高かった記事を集めた、約800万ページ・約6.7億文からなるデータ集合)を用いて、事前学習(大量の文章データを使い、あらかじめ言語のパターンを学ばせておく工程)を行いました。つまり、特定の作業向けに仕込むのではなく、まず言葉づかいの全体像を大量の文章から覚えさせておくという組み立てです。
前身であるGPT(GPT-1)は、要約や翻訳といった個別のタスクごとに、ファインチューニング(事前学習を終えたモデルを、特定の作業向けに追加で学習させること)を行う前提のモデルでした。これに対しGPT-2は、モデルと学習データの規模を拡大しただけで、タスクごとの追加学習をしなくても複数の作業に一定の精度で対応できる性質を示しました。
この性質はzero-shot学習(追加の学習をしなくても、初めて扱うタスクにある程度対応できる性質)と呼ばれます。規模を拡大すること自体が性能を押し上げるというこの方向性は、後のGPT-3以降にも引き継がれていく流れとして位置づけられます。
2. 試験対策ポイント
G検定では、パラメータ数約15億・学習データ約800万ページというスケール(規模)の数値が、GPT-1との対比における重要な論点です。GPT-1のパラメータ数が約1.17億個だったのに対し、GPT-2は約10倍にあたる約15億個へと拡大されており、この規模の違いがGPT-1との比較を判断するうえでの材料になります。
OpenAIは2019年2月にGPT-2を発表した際、フェイクニュースの自動生成やなりすましなど、悪用への懸念を理由に最大規模のモデルをただちに一般公開しませんでした。公開はおよそ9か月かけて、次のように段階を踏んでいます。
| 時期 | 公開されたモデル |
|---|---|
| 2019年2月 | 約1.24億パラメータの小型版 |
| 2019年5月 | 約3.55億パラメータ版 |
| 2019年8月 | 約7.74億パラメータ版 |
| 2019年11月 | 約15億パラメータの全パラメータ版 |
悪用の兆候を観察しながら公開範囲を広げたこの経緯は、性能の高いAIモデルをどこまで公開するかという議論の初期の代表例です。発表の時期と、全パラメータ版が公開された時期がずれている点は、年号とあわせて押さえておきたいところです。
ファインチューニングなしで複数のタスクに一定の精度で対応するzero-shot学習の性質は、タスクごとの追加学習を前提としたGPT-1との違いにあたります。規模の数値だけでなく、この学習方式の違いも合わせて整理しておきたい点です。
3. 関連概念との比較・相違点
GPT(GPT-1)との最大の違いは、パラメータ規模と学習方式の両面にあります。GPT-1のパラメータ数が約1.17億個であるのに対し、GPT-2は約15億個と、約10倍の規模に達しています。
加えてGPT-1は、要約や翻訳といった個別のタスクごとにファインチューニングを行うことを前提としたモデルでした。一方GPT-2は、追加学習をしなくても複数のタスクに一定の精度で対応できるzero-shot学習の性質を示しており、モデルの使い方そのものが変わった点が両者を分けています。
GPT-3との最大の違いは、パラメータ規模の桁そのものにあります。GPT-2の約15億個に対し、GPT-3は約1,750億個に達しており、規模の差は二桁近くに広がっています。少数の例文を示すだけで新しいタスクに対応できるといった、GPT-3固有の詳しい仕組みは別の論点として扱われます。
三者の関係を、規模と学習方式という2つの軸で並べると次のようになります。
| モデル | パラメータ数 | 学習・利用の方式 |
|---|---|---|
| GPT(GPT-1) | 約1.17億個 | タスクごとにファインチューニングを行う前提 |
| GPT-2 | 約15億個 | 追加学習なしで複数のタスクに対応するzero-shot学習 |
| GPT-3 | 約1,750億個 | 少数の例文を示して新しいタスクに対応する方式 |
こうして並べると、GPT-2が規模と使い方の両面で中間に位置していることが見て取れます。GPT-2はGPT-3に先立ち、規模を拡大するほど性能が上がるという方向性と、性能の高いモデルをどこまで公開するかという方針の両方を示した点に位置づけられます。この2つの論点を通じて、GPT-2はGPTシリーズの転換点として扱われています。
4. ビジネス・実務での活用シナリオ
AI開発やリスク管理の分野では、GPT-2の段階的公開が、性能の高いAIモデルを一般公開する際にどこまで悪用のリスクを見極めるかという判断の初期事例となっています。フェイクニュースの自動生成やなりすましのような悪用を防ぐには、公開前に想定される被害の範囲を見極める必要があります。この経緯は、後年に登場した大規模言語モデル(膨大な文章データを学習した、パラメータ数の大きい言語モデル)の公開方針を検討するうえでの参考事例として扱われています。
コンテンツ生成や文章作成支援の分野では、追加学習なしで要約や文章生成に一定の精度で対応するzero-shot学習の性質が意味を持ちます。個別のタスクごとにモデルを作り直す手間がかからないからこそ、一つのモデルを幅広い用途に転用できるようになりました。この汎用性は、後発の文章生成サービスが備える、特定の作業に限定されず幅広い用途に使えるという特徴の原型になっています。
AI研究や大規模言語モデルの開発では、モデルと学習データの規模を拡大するほど性能が向上するという方向性が実証されたことが、大きな意味を持ちます。個々のタスクに合わせて設計を作り込まなくても、規模を広げるだけで性能を底上げできるという実証結果は、GPT-3以降のさらなる大規模化路線を後押しする材料になりました。
5. 要点まとめ
- GPT-2はOpenAIが2019年に発表した言語モデルで、パラメータ数は前身のGPT-1(約1.17億個)の約10倍にあたる約15億個です。
- フェイクニュース生成などへの悪用の懸念から、2019年2月の小型版公開に始まり、同年11月の全パラメータ版公開まで、約9か月かけて段階的な公開が行われました。
- GPT-3ではパラメータ規模がさらに桁違いに拡大しており(約1,750億個)、規模拡大の方向性はGPT-2から続く流れにあります。
6. 確認問題
問1GPT-2はOpenAIが2019年に発表した言語モデルで、パラメータ数は前身のGPT-1と比べて約10倍の規模である。
解答・解説をみる
○ 正しい
GPT-1のパラメータ数は約1.17億個であるのに対し、GPT-2は約15億個であり、規模は約10倍に拡大しています。この対比はGPT-1との違いを判断する手がかりになります。
問2OpenAIはGPT-2の発表時、悪用への懸念から最大規模のモデルをただちに公開せず、段階的に公開範囲を広げた。
解答・解説をみる
○ 正しい
2019年2月の小型版公開に始まり、5月・8月と段階的に規模を広げ、同年11月に全パラメータ版(約15億個)を公開するまで、約9か月を要しています。
問3GPT-2はGPT-3よりもパラメータ数が多く、より大規模なモデルである。
解答・解説をみる
× 誤り
正しくはGPT-3の方がはるかに大規模で、パラメータ数は約1,750億個に達します。GPT-2の約15億個の100倍以上の規模であり、大小関係を逆にした記述は誤りです。

