上智2014

コーパスにもとづく日本語史研究

2014/11/07

「ひまわり」検索結果をExcelで扱う

Excelの基本操作

「ひまわり」データの追加

「太陽コーパス」

形態論情報付きの「ひまわり」データ

青空文庫の「ひまわり」データ

10/28みなし金曜日 の授業は休講です

2014/10/24

「ひまわり」の利用

正規表現を使ってみる

正規表現とは


ひまわりで利用可能なデータについて

◎を授業で取り上げます。

2014/10/17

近代雑誌コーパスと「ひまわり」

全文検索システム「ひまわり」について

himawari_aozora.png

「ひまわり」の導入

  1. 「ひまわり」のダウンロード
  2. 「近代女性雑誌コーパス」のダウンロード
  3. インストール
    • ダウンロードした二つのZIPファイルを右クリックして、[プロパティ] > [全般]でセキュリティのブロックが解除(必須)
    • Himawariフォルダ内のCorporaフォルダが重なる(上書きされる)形で、コーパスのフォルダをコピー
  4. 動作確認
    • Himawari.exeをダブルクリックして起動,configファイルを選択

Himawariの使い方

2014/10/10

日本語歴史コーパス(CHJ)の登録


「コーパス」について

狭義のコーパス
言語研究を目的として収集され、言語研究のための情報が付けられたコンピュータ上で利用可能な大規模な言語データ。
  • BCCWJ / 太陽コーパス / 明六雑誌コーパス / 日本語歴史コーパス
広義のコーパス
コンピュータ上で利用可能な大規模な言語データ。必ずしも言語研究向きではないが、言語研究に利用可能。
  • さまざまなテキストアーカイブ(新潮文庫の百冊 / 青空文庫 / 国会会議録)
  • Web上のデータ
    • 検索サイトの利用
    • WAC(Web as Corpus)

総索引から電子化テキストへ(国語史資料の電子化の歴史)

テキストファイル

プレーンテキストからタグ付きテキストへ

2014/10/03

イントロダクション


トップ   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS