LOD (G検定)

LOD

1. 定義と概要

LODとは、Linked Open Data(リンクト・オープン・データ)の略称です。誰でも自由に利用・複製・再配布できるデータ(オープンデータ)のうち、他のWeb上のデータとの「リンク」が付与され、コンピュータが処理しやすい形式で公開されているものを指します。

LODは「エルオーディー」とも読み、実務やニュース記事ではこの読み方で紹介されることもあります。代表例として、国立国会図書館が公開する書誌データ・典拠データが挙げられます。ほかにも、政府統計をRDF化した統計LOD、美術館・図書館・文書館・博物館のデジタルアーカイブメタデータ(本のタイトルや著者などデータを説明する情報)を統合公開するジャパンサーチなどがあります。

従来のWebは、HTML文書同士をハイパーリンクでつなぎ、人間が読んで理解する情報空間として発展してきました。各所でオープンデータの公開が進んだあとも、多くのデータはPDFや画像、独自形式のファイルなど人間向けの形にとどまり、コンピュータが自動でデータの意味を理解し組み合わせて活用することは難しい状態が続いていました。

ティム・バーナーズ=リーが提唱したセマンティック・ウェブ(Web上の情報に機械が読み取れる意味づけを加え、コンピュータが自動で情報を理解・活用できるようにする構想)を具体的なデータの形で実現する取り組みとして、LODは位置づけられます。

2. 試験対策ポイント

G検定では、LODという正式名称と読み方に加えて、データの公開レベルを星の数で示す5つ星オープンデータ(Five-star Open Data)という格付けの仕組みも、あわせて押さえておきたいポイントです。これはティム・バーナーズ=リーが提唱したもので、公開レベルは★1から★5までの5段階に分かれています。

各段階の条件は、次のように積み上がっていきます。

段階 公開の条件
★1 オープンライセンスでのWeb公開(形式は問わない)
★2 構造化データ形式での公開
★3 CSVなど非独占的なファイル形式での公開
★4 URI(Web上の情報や物事を一意に指し示す、住所のような識別子)を用いた公開
★5 他のデータソースへのリンクを含む公開

LODは実質的にこの★4・★5の要件、つまりURIによる識別と他データへのリンクを満たすデータとされています。星の数が上がるほど、人間が読むための公開から、コンピュータがデータ同士をたどれる公開へと近づいていきます。

LODを支える標準のデータモデルがRDF(Resource Description Framework)です。物事の関係を「主語-述語-目的語」という3つの要素の組み合わせ(トリプル)で表現し、コンピュータが機械的に処理できるようにします。たとえば「ある本の著者は誰である」といった事実を主語・述語・目的語の組み合わせとして記述することで、人間だけでなくプログラムが自動で読み取り、関係をたどれるようになります。

SPARQLとは、RDF形式のデータを検索・問い合わせるための専用の言語です。LODでは、事物やデータそのものにHTTP URIを付与し、Webページと同じようにアクセスしたり相互に参照したりできるようにします。国立国会図書館の典拠データなどは、SPARQLエンドポイント(SPARQLによる問い合わせを受け付ける窓口)として提供されています。

3. 関連概念との比較・相違点

通常のオープンデータとの最大の違いは、他データへのリンクの有無にあります。満たすべき要件と5つ星の水準で並べると、両者の位置関係がはっきりします。

観点 一般的なオープンデータ LOD
満たすべき要件 公開されて二次利用できること 加えて他のデータと機械可読な形でリンクされていること
5つ星の水準 ★1から★3 ★4・★5

単に自由に使えるデータを公開するだけでなく、他の情報源とつながることでコンピュータが自動的にデータを結びつけて活用できるようになって初めて、LODと呼べます。

LODは、セマンティック・ウェブという上位の構想を、具体的なデータの公開・連携という形で実現する取り組みです。セマンティック・ウェブ自体はWeb全体を対象とする構想であるのに対し、LODはその一部をURIやリンクを伴うデータとして具体化したものにあたります。構想と実装という関係でとらえると、両者の違いが整理できます。

4. ビジネス・実務での活用シナリオ

図書館・アーカイブの分野では、国立国会図書館がNDLサーチの書誌データや「Web NDL Authorities」の典拠データをLODとして公開しています。他の図書館システムがこれを参照することで、書誌情報を自動的に取り込んで自館のシステムに反映できるようになり、目録作成の手間を機関の枠を超えて省く効果を生んでいます。

官公庁・統計の分野では、政府統計をRDF化した統計LODがSPARQLエンドポイントで提供されています。異なる統計データや地理データを組み合わせた横断的な分析に活用でき、単独の統計表だけでは見えてこない関係性を浮かび上がらせる基盤となっています。

文化・GLAM分野(美術館・図書館・文書館・博物館)では、ジャパンサーチがこれらの機関のデジタルアーカイブメタデータをLODとして統合公開しています。機関ごとにばらばらだった情報を横断的に検索・二次利用できるようになり、一つの機関だけでは実現できない規模での文化資源の活用につながっています。

5. 要点まとめ

  • LOD(Linked Open Data/リンクト・オープン・データ)は、Web上で公開され他のデータとリンクされた機械可読なオープンデータで、セマンティック・ウェブの構想を具体化する取り組みの一つです。
  • ティム・バーナーズ=リーが提唱した5つ星オープンデータでは、URIによる識別(★4)と他データへのリンク(★5)がLODの要件に対応します。
  • RDFによる主語-述語-目的語のトリプル形式での記述と、SPARQLによる問い合わせが、LODを機械で処理可能にする技術基盤です。

6. 確認問題

問1LODとは、Web上で公開されたオープンデータのうち、他のデータとのリンクが付与され、コンピュータが処理しやすい形式で提供されているデータを指す。

解答・解説をみる

○ 正しい

LODの定義そのものです。単に公開されているだけでなく、他データとの機械可読なリンクを持つ点が要件になります。

問2ティム・バーナーズ=リーが提唱した5つ星オープンデータにおいて、最高評価の5つ星を得るには、データが構造化されているだけでなく、他のデータソースへのリンクを含む必要がある。

解答・解説をみる

○ 正しい

5つ星の最上位(★5)の条件は他データへのリンクの付与です。★4のURI識別とあわせて、LODの要件に対応します。

問3LODは通常のオープンデータと同じ概念であり、他のデータとのリンクの有無は評価上の違いにならない。

解答・解説をみる

× 誤り

正しくは、LODは他データとの機械可読なリンクを持つ点で通常のオープンデータと区別され、5つ星オープンデータの★4・★5の水準に相当します。リンクの有無が両者を分ける要件です。