上智2015

コーパスにもとづく日本語史研究

レポート提出について

2016/01/22

最終回:レポートの完成へ

発展

国語研のコーパス

2016/01/08

レポートテーマ調査報告 のこり

Wordを使ってレポートを書く

レポート作成のためのコーパス調査・質問(3)

2015/12/17

レポートテーマ調査報告(2)

レポート作成のためのコーパス調査・質問(2)

2015/12/11

レポートテーマ調査報告

レポート作成のためのコーパス調査・質問

2015/12/04

コロケーション強度の話

レポートテーマについて

2015/11/27

複数の検索結果をまとめる

分類用のフィールドを作って集計する

サンプリング調査

関数の利用

日本語歴史コーパス「中納言」補足

レポートテーマについて

2015/11/20

短単位について

品詞体系

中納言の使い方(続き)

2015/11/13

(補足)研究例

(補足)さまざまな「ひまわり」用データ

利用可能なデータについて


『日本語歴史コーパス』(CHJ)を使う

中納言の使い方

2015/11/06

青空文庫の「ひまわり」データ

ピボットテーブル(復習)

関数の利用

参考文献

中納言ログイン

2015/10/30

「太陽コーパス」

「ひまわり」検索結果をExcelで扱う

Excelの基本操作

2015/10/23

近代雑誌コーパスと「ひまわり」

全文検索システム「ひまわり」について

himawari_aozora.png

「ひまわり」の導入

2015/10/16

テキストエディタ

ショートカットキー

正規表現を使ってみる

正規表現とは

2015/10/9

日本語歴史コーパス(CHJ)の登録


「コーパス」について

狭義のコーパス
言語研究を目的として収集され、言語研究のための情報が付けられたコンピュータ上で利用可能な大規模な言語データ。
  • BCCWJ / 太陽コーパス / 明六雑誌コーパス / 日本語歴史コーパス
広義のコーパス
コンピュータ上で利用可能な大規模な言語データ。必ずしも言語研究向きではないが、言語研究に利用可能。
  • さまざまなテキストアーカイブ(新潮文庫の百冊 / 青空文庫 / 国会会議録)
  • Web上のデータ
    • 検索サイトの利用
    • WAC(Web as Corpus)

紙の資料からコーパスまで

  1. (紙の)本文テキスト
  2. (紙の)総索引
  3. 電子テキスト
  4. 構造化テキスト
  5. 形態論情報付きコーパス

総索引から電子化テキストへ(国語史資料の電子化の歴史)

テキストファイル

プレーンテキストからタグ付きテキストへ

2015/10/02

イントロダクション

デモ

授業で利用する主なソフトウェア

ソフトウェアの種類・名前利用目的
テキストエディタ サクラエディタ sakura2正規表現を使ったテキストの検索・整形
全文検索ソフトひまわりデータの検索
表計算ソフトExcelピボットテーブルによる分析・グラフ作成
ワープロWord「スタイル」を利用したレポート作成

シラバス確認


トップ   編集 差分 履歴 添付 複製 名前変更 リロード   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS
Last-modified: 2016-01-22 (金) 13:43:37