上智2015

コーパスにもとづく日本語史研究

2015/10/30

「太陽コーパス」

「ひまわり」検索結果をExcelで扱う

Excelの基本操作

形態論情報付きの「ひまわり」データ

青空文庫

ひまわりで利用可能なデータについて

◎を授業で取り上げます。

2015/10/23

近代雑誌コーパスと「ひまわり」

全文検索システム「ひまわり」について

himawari_aozora.png

「ひまわり」の導入

2015/10/16

テキストエディタ

ショートカットキー

正規表現を使ってみる

正規表現とは

2015/10/9

日本語歴史コーパス(CHJ)の登録


「コーパス」について

狭義のコーパス
言語研究を目的として収集され、言語研究のための情報が付けられたコンピュータ上で利用可能な大規模な言語データ。
  • BCCWJ / 太陽コーパス / 明六雑誌コーパス / 日本語歴史コーパス
広義のコーパス
コンピュータ上で利用可能な大規模な言語データ。必ずしも言語研究向きではないが、言語研究に利用可能。
  • さまざまなテキストアーカイブ(新潮文庫の百冊 / 青空文庫 / 国会会議録)
  • Web上のデータ
    • 検索サイトの利用
    • WAC(Web as Corpus)

紙の資料からコーパスまで

  1. (紙の)本文テキスト
  2. (紙の)総索引
  3. 電子テキスト
  4. 構造化テキスト
  5. 形態論情報付きコーパス

総索引から電子化テキストへ(国語史資料の電子化の歴史)

テキストファイル

プレーンテキストからタグ付きテキストへ

2015/10/02

イントロダクション

デモ

授業で利用する主なソフトウェア

ソフトウェアの種類・名前利用目的
テキストエディタ サクラエディタ sakura2正規表現を使ったテキストの検索・整形
全文検索ソフトひまわりデータの検索
表計算ソフトExcelピボットテーブルによる分析・グラフ作成
ワープロWord「スタイル」を利用したレポート作成

シラバス確認


トップ   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS