品詞タグ付け (G検定)

品詞タグ付け

1. 定義と概要

品詞タグ付け(POS tagging)とは、単語が並んだ列(系列)の各単語に対して、名詞・動詞・形容詞などの品詞(単語を働きによって分類した種類)を表すタグ(単語に付ける品詞などのラベルや目印のこと)を割り当てる処理です。自然言語処理(コンピュータに人間の言葉を処理させる技術分野)の基本タスクの一つに数えられます。単語の並びに1つずつ順番にラベルを付けていく処理という点では、系列ラベリング(並んだ単語の列に対して1つずつラベルを割り当てていく処理の総称)の一種に分類されます。

例えば英文「I like apples」では、「I」は代名詞、「like」は動詞、「apples」は名詞というように、各単語に品詞が付与されます。日本語の文であっても、単語1つひとつに品詞のラベルを対応づけるという考え方の骨格は変わりません。

従来のテキスト処理では、文を単語に区切ること自体が主な関心事でした。しかし、単語に区切るだけでは、より高度な自然言語処理には届きません。単語同士のつながりを明らかにする構文解析(単語同士のつながり方を明らかにする処理)や意味解析(語の意味を考慮して文全体の意味を解釈する処理)を行うには、各単語がどの品詞として使われているかという情報が土台として必要になります。

そこで、単語列に品詞のタグを付与する品詞タグ付けは、自然言語処理の一連の流れにおける基礎的な工程として位置づけられています。文を単語に分けるだけでなく、それぞれの働きまで判定しておくことで、後続の解析処理をより正確に進められるようになります。

2. 試験対策ポイント

まず押さえておきたいのが、品詞タグ付けと形態素解析(文を意味を持つ最小の単位である単語に区切り、それぞれの品詞などを判定する処理)との関係です。日本語は単語と単語の間に空白がなく、単語の境界そのものが自明ではないため、単語分割と品詞判別が同時に行われることが多く、品詞タグ付けは形態素解析に含まれる一部の工程として扱われる場合が多くなっています。

一方、英語は単語間に空白を入れて区切る分かち書き(単語と単語の間に空白を入れて区切ること)がすでにされているため単語分割は済んでおり、品詞タグ付けが独立した処理として扱われやすいという違いがあります。日英でのこの位置づけの違いは、取り違えやすい点です。言語ごとの事情と位置づけの対応を並べると、次のように整理できます。

言語 単語の区切り 品詞タグ付けの位置づけ
日本語 単語間に空白がなく、境界そのものが自明ではない 単語分割と品詞判別が同時に行われ、形態素解析の一部の工程として扱われることが多い
英語 分かち書きによって単語間に空白がある 単語分割が済んでいるため、独立した処理として扱われやすい

同じ「品詞タグ付け」という言葉であっても、どちらの言語を前提に話しているかで指し示す範囲が変わる、という点が要になります。

同じ単語であっても、前後の文脈によって割り当てるべき品詞が変わる場合があり、この曖昧性(同じ言葉が複数の意味や品詞の可能性を持ち、1つに決めにくい状態)の解消が課題となります。英文「Time flies like an arrow」では、「flies」が動詞(飛ぶ)にも名詞(ハエ)にも解釈できるように、機械的な品詞判定には文脈を踏まえた曖昧性の解消が求められます。文脈を無視して単語だけを見て品詞を決めると、誤ったラベルを付けてしまう恐れがあります。

品詞タグ付けの手法としては、統計的な手法や深層学習モデルなどが用いられます。隠れマルコフモデル(HMM)とは、品詞を「状態」、単語を「観測される出力記号」とみなして、実際に観測できるデータから推定する統計的な手法です。このほか、条件付き確率場(前後の単語との関係をまとめて考慮しながら、系列全体として最も適切なタグの並びを選ぶ統計的な手法)なども用いられます。これらの手法名は、系列ラベリングという分類と合わせて見ておきたいところです。

3. 関連概念との比較・相違点

形態素解析との最大の違いは、単語分割まで含む処理か、品詞の割り当てのみを指す処理か、という点にあります。日本語では単語分割と品詞判別が一体で行われるため、品詞タグ付けは形態素解析に含まれる一部の工程として扱われることが多くなっています。

これに対して英語では単語分割(分かち書き)がすでに済んでいるため、品詞タグ付けは形態素解析から独立した処理として扱われやすくなっています。同じ処理を指す言葉であっても、日英で範囲の捉え方が異なる点をおさえておく必要があります。

固有表現抽出(NER。文中から人名や地名、組織名などの固有名詞にあたる表現を見つけ出し、その種類を分類する処理)との違いは、文法上の種類を割り当てる処理か、固有名詞の種類を識別する処理か、という点にあります。品詞タグ付けはすべての単語に品詞を付与する網羅的な処理であるのに対して、固有表現抽出は人名や地名など特定の固有名詞的な表現のみを対象に、その種類と範囲を特定する処理です。

対象とする単語の範囲の広さが、両者を見分ける軸になります。三者を、何を割り当てる処理かと、どの単語を対象にするかという2つの軸で並べると、違いがはっきりします。

処理 割り当てるもの 対象となる単語
品詞タグ付け 名詞・動詞・形容詞などの品詞 文中のすべての単語
形態素解析 単語の区切りと、それぞれの品詞 文全体(区切りの判定から行う)
固有表現抽出 人名・地名・組織名などの種類 固有名詞にあたる表現のみ

品詞タグ付けの結果は、固有表現抽出をはじめとする後続の処理の手がかりとしても使われます。網羅的に品詞を振っておくことが、特定の表現だけを拾い出す処理の下支えになるという関係です。

4. ビジネス・実務での活用シナリオ

検索エンジンなどの情報検索の分野では、検索クエリ(検索窓に入力する語句)の各単語に品詞を付与し、名詞など検索意図を表しやすい語を重みづけして抽出することで、検索結果の関連性を高める処理の土台として利用されています。

チャットボット(文字などによる会話でユーザーに応答するプログラム)や音声アシスタントの分野では、ユーザーの発話を品詞タグ付けしたうえで構文解析や意味解析につなげます。動詞が表す要求内容と名詞が表す対象を切り分けることで、意図理解の精度を高める前処理として活用されています。

文章校正やライティング支援ツールの分野では、文中の品詞の並びから動詞が続く、主語となる名詞が欠落しているといった文法的に不自然な箇所を検出し、誤用の指摘や表現の改善提案に役立てられています。

5. 要点まとめ

  • 品詞タグ付けは、文中の各単語に名詞・動詞・形容詞などの品詞を割り当てる処理で、系列ラベリングの一種に分類されます。
  • 日本語では単語分割と品詞判別が同時に行われ品詞タグ付けは形態素解析の一部として扱われることが多いのに対し、英語では単語分割がすでに済んでいるため独立した処理として扱われやすくなっています。
  • 同じ単語でも文脈によって品詞が変わる曖昧性の解消が課題であり、隠れマルコフモデル(HMM)などの統計的手法が用いられます。

6. 確認問題

問1品詞タグ付けとは、分割された各単語に対して名詞・動詞・形容詞などの品詞を割り当てる処理である。

解答・解説をみる

○ 正しい

品詞タグ付け(POS tagging)の定義そのものであり、系列ラベリングの一種に分類されます。単語の並びに1つずつラベルを割り当てていく処理という点がポイントです。

問2日本語の形態素解析では単語分割と品詞判別が完全に別々の独立したステップとして分離されており、英語における品詞タグ付けとまったく同じ位置づけで扱われる。

解答・解説をみる

× 誤り

正しくは、日本語では単語間に空白がなく単語の境界が自明でないため、単語分割と品詞判別が同時に行われることが多く、品詞タグ付けは形態素解析に含まれる一部の工程として扱われることが多くなっています。英語は分かち書き済みのため品詞タグ付けが独立処理になりやすく、日英で位置づけが異なります。

問3品詞タグ付けでは、同じ単語であっても文脈によって割り当てるべき品詞が変わる場合があり、この曖昧性の解消が課題となる。

解答・解説をみる

○ 正しい

英文「Time flies like an arrow」の「flies」が動詞か名詞かで解釈が分かれるように、文脈に応じた曖昧性の解消が求められます。