【Python】Wikipedia のデータセットを取得し、文章を抽出する方法。

公開日: : 最終更新日:2018/12/16 Python , , ,

Wikipedia のデータセットを取得し、Python のライブラリを用いて文章を抽出する方法を紹介します。

OS 環境は Linux です。

Wikipedia のデータセットのダウンロード

Wikipedia にはデータセットが用意されているので、Wikipedia のデータを使いたいときは、できるだけクローリングせずにデータセットをダウンロードした方が良いみたいです。

Wikipedia の日本語データセットは以下のページに公開されています。

https://dumps.wikimedia.org/jawiki/

wget で記事ページをダウンロードします。

データは数GB あるので、ダウンロード完了まで数十分かかりました。

bzcat コマンドと less コマンドを使って、中身を確認できます。

Wikipedia のデータセットから文章を抽出

Python のライブラリ WikiExtractor を使って、先ほどダウンロードしたデータセットからタイトルと文章のみを抽出します。

WikiExtractor.py をダウンロード

スクリプトをダウンロードします。

WikiExtractor.pyを実行

以下のオプションを用いて、文章を抽出します。

–no-templates:ページの冒頭などに貼られるテンプレートを展開しない。

-o:出力先のディレクトリを指定する。

-b:分割するファイルサイズを指定する。

抽出が始まり、以下のように画面がスクロールします。

tree コマンドで確認すると以下のような構成になっていました。

ファイルの中身は、以下のように <doc> タグで囲まれて文章が抽出されていました。

<doc id=”10″ url=”https://ja.wikipedia.org/wiki?curid=10″ title=”言語”>
言語

この記事では言語(げんご)、特に自然言語について述べる。

広辞苑や大辞泉には次のようにある。

辞典等には以上のようにあるわけだが、これは大きく二分すると「自然言語」と「形式言語」とがあるうちの自然言語について述
べている。しかし、1950年代以降の言語学などでは、定義中にも「記号体系」といった表現もあるように形式的な面やその扱い、
言い換えると形式言語的な面も扱うようになっており、こんにちの言語学において形式体系と全く無関係な分野はそう多くはない
。形式的な議論では、「その言語における文字の、その言語の文法に従った並び」の集合が「言語」である、といったように定義
される。

言語は、人間が用いる意志伝達手段であり、社会集団内で形成習得され、意志を相互に伝達すること(コミュニケーション)や、
抽象的な思考を可能にし、結果として人間の社会的活動や文化的活動を支えている。言語(個別言語)には、文化の特徴が織り込
まれており、共同体のメンバーは、(その共同体で用いられている)言語の習得をすることによって、その共同体での社会的学習
、および(その共同体で望ましいとされる)人格を形成してゆくことになる。

表や箇条書きは取り除かれてしまうため、「–list」オプションで含めることができます。

中身を確認します。箇条書きが追記されていることがわかります。

<doc id=”10″ url=”https://ja.wikipedia.org/wiki?curid=10″ title=”言語”>
言語

この記事では言語(げんご)、特に自然言語について述べる。

広辞苑や大辞泉には次のようにある。
– 人間が音声や文字を用いて思想・感情・意志 等々を伝達するために用いる記号体系。およびそれを用いる行為(広辞苑)。音声
や文字によって、人の意志・思想・感情などの情報を表現したり伝達する、あるいは他者のそれを受け入れ、理解するための約束
・規則。および、そうした記号の体系(大辞泉)。
– ある特定の集団が用いる、音や文字による事態の伝達手段。(個別言語のことで、英語・フランス語・日本語などのこと)
– (言語学用語)ソシュールの用語「langue ラング」の日本語での訳語。

辞典等には以上のようにあるわけだが、これは大きく二分すると「自然言語」と「形式言語」とがあるうちの自然言語について述
べている。しかし、1950年代以降の言語学などでは、定義中にも「記号体系」といった表現もあるように形式的な面やその扱い、
言い換えると形式言語的な面も扱うようになっており、こんにちの言語学において形式体系と全く無関係な分野はそう多くはない
。形式的な議論では、「その言語における文字の、その言語の文法に従った並び」の集合が「言語」である、といったように定義
される。

言語は、人間が用いる意志伝達手段であり、社会集団内で形成習得され、意志を相互に伝達すること(コミュニケーション)や、
抽象的な思考を可能にし、結果として人間の社会的活動や文化的活動を支えている。言語(個別言語)には、文化の特徴が織り込
まれており、共同体のメンバーは、(その共同体で用いられている)言語の習得をすることによって、その共同体での社会的学習
、および(その共同体で望ましいとされる)人格を形成してゆくことになる。

参考書籍

これらの内容は、以下の書籍を参照しました。

関連記事

【Python】 Series 型を dict(辞書型)に変換する方法。

Python で Series 型を dict(辞書型)に簡単に変換する方法を紹介します。 「

記事を読む

【Python】Beautiful Soup を使ってスクレイピングする方法。

Beautiful Soup は、シンプルでわかりやすい API でデータを抜き出せる Python

記事を読む

【Google Colaboratory】クラウド上でPythonを使って機械学習を行う。

Python をブラウザ上で実行して、手軽に機械学習ができる環境「Google Colaborato

記事を読む

【Python】OpenCV を使って顔画像を検出してみた。

OpenCV のインストール Numpy のインストール [crayon-600e96b5c

記事を読む

【Pandas】 DataFrame のある列の最大値を含む行のインデックス値を取得する方法。

今回は、Pandas の DataFrame において、ある列で最大値を求めて、その最大値をもつ行に

記事を読む

【Python】API を使って YouTube から動画情報を収集する方法。

API を使って YouTube から動画情報を収集してみたときのメモです。 OS は Lin

記事を読む

python 2.7 を Windows 64bit OS にインストールした。

python 2.7 を Windows にインストールしたときのメモです。 Python に

記事を読む

【Python】Requests ライブラリを使って Web ページを取得してみた。

python の標準ライブラリ urllib を使っても Web ページの取得はできるのですが、Re

記事を読む

【Atomエディタ】Python 開発用にインストールしてみた。

Python でプログラミングするときの エディタ を探していたのですが、とりあえず Atom とい

記事を読む

【Python】時系列データ(為替データ)をグラフ表示してみた。

今回は、pandas・matplotlib ライブラリを使って、時系列データ(為替データ)をグラフ表

記事を読む

初心者でも分かるビットコインの仕組みについてまとめてみた。

ビットコインは,時価総額が1位で最も有名な仮想通貨です. 仮

【LaTeX】 見出し付き箇条書きを右にずらす方法【数式の変数説明】

今回は、LaTeX で見出し付き箇条書きの全体の位置を右にずらす方法に

【LaTeX】 余白部分を設定しレイアウトを確認する方法。

今回は、LaTeX の余白部分のレイアウトの変更方法とレイアウトの確認

【LaTeX】 レポートや論文の表紙のテンプレート。

LaTex を使ってレポートや論文を書くときに、表紙をつけると思います

【DTM】 Cubase AI でギターやベースを録音する方法。

今回は、DTM のための DAWソフト Cubase AI でギター(

→もっと見る

PAGE TOP ↑