#author("2021-04-08T04:36:12+00:00","default:ogiwiki","ogiwiki") [[FrontPage]] *九州大学:国語学講義 III / 日本語学方法論特論 III [#td0ed75f] **コーパス日本語学 [#f20f4b84] 前期木曜2限:10:30-12:00 //-初回(2021年4月8日)の授業は下記のZoomミーティングで行います。(ミーティングID: 955 7075 9062) //--https://zoom.us/j/95570759062 //-パスコードは授業シラバスのページの特記事項の欄を見てください。 **4月15日(第2回) コーパスの設計 [#d3ad8ff2] ***コーパスとは [#t54768fa] :狭義のコーパス|言語研究を目的として収集され、言語研究のための情報が付けられたコンピュータ上で利用可能な大規模な言語データ。 --現代日本語書き言葉均衡コーパス(BCCWJ) / 日本語歴史コーパス(CHJ) :広義のコーパス|コンピュータ上で利用可能な大規模な言語データ。必ずしも言語研究向きではないが、言語研究に利用可能。 -さまざまなテキストアーカイブ(新潮文庫の百冊 / 青空文庫 / 国会会議録) --[[「ひまわり」パッケージ>https://www2.ninjal.ac.jp/lrc/index.php?%C1%B4%CA%B8%B8%A1%BA%F7%A5%B7%A5%B9%A5%C6%A5%E0%A1%D8%A4%D2%A4%DE%A4%EF%A4%EA%A1%D9]] -Web上のデータ --検索サイトの利用 --WAC(Web as Corpus) -この授業で主に扱うのは狭義のコーパス。中でも「現代日本語書き言葉均衡コーパス(BCCWJ)」と「日本語歴史コーパス(CHJ)」 ***紙の資料からコーパスまで (日本語研究資料の変遷) [#s7dfd61c] +(紙の)本文 +(紙の)総索引(コンコーダンス) +各種の電子テキスト --[[授業資料/テキストデータ紹介]] +構造化テキスト --[[太陽コーパス>https://ccd.ninjal.ac.jp/corpus_center/cmj/taiyou/]]など +形態論情報付きコーパス --[[現代日本語書き言葉均衡コーパス(BCCWJ)>https://ccd.ninjal.ac.jp/corpus_center/bccwj/]]など ***コーパスに求められるもの [#h042f3fe] -コーパス以前の電子化日本語資料(とその限界) --個人研究者による電子化テキスト ---cf. [[日本文学等テキストファイル(岡島昭浩)>http://www.ne.jp/asahi/nihongo/okajima/bungaku.htm]] --出版社による電子出版物(CD-ROM) ---新潮文庫の100冊 etc. --新聞のデータベース(CD-ROM) ---毎日新聞CD-ROM etc. --研究機関のデータベース ---国文学資料館 大系DB etc. --Web上のテキストアーカイブ ---青空文庫 etc. --Webそのもの ---Web as Corpus -(現代語)コーパスへの要請 --大規模であること --各種のテキストが含まれていて、ジャンルなどのバランスがとれていること --著作権の問題がないこと --言語研究に利用できる情報がついていること ***「現代日本語書き言葉均衡コーパス」(BCCWJ)の構成とサンプリング [#s89fe505] -https://ccd.ninjal.ac.jp/corpus_center/bccwj/ -均衡コーパス(Balanced corpus) --「バランスがとれている」「代表性」とは? --コーパスの母集団の設定とサンプリング --BCCWJのサブコーパス --可変長と固定長 -著作権をめぐる問題 ***「日本語歴史コーパス」(CHJ)の構成 [#x9f78d1c] -https://ccd.ninjal.ac.jp/corpus_center/chj/ ***参考リンク [#o1a9da5c] -英語のコーパス リファレンス --[[ブラウンコーパス マニュアル>http://khnt.aksis.uib.no/icame/manuals/brown/]] http://khnt.aksis.uib.no/icame/manuals/brown/ --[[BNCリファレンスガイド>http://www.natcorp.ox.ac.uk/docs/URG/]] http://www.natcorp.ox.ac.uk/docs/URG/ -現代日本語書き言葉均衡コーパス(BCCWJ) --[[現代日本語書き言葉均衡コーパス:概要>https://ccd.ninjal.ac.jp/corpus_center/bccwj/index.html]] --BCCWJの基本設計:https://ccd.ninjal.ac.jp/corpus_center/bccwj/basic-design.html --サンプリング:https://ccd.ninjal.ac.jp/corpus_center/bccwj/sampling.html --XMLによる電子化:https://ccd.ninjal.ac.jp/corpus_center/bccwj/XML.html **4月8日(第1回)イントロダクション/日本語コーパスの紹介 [#wdd4ab2f] ***イントロダクション [#z7ffa4ea] -[[自己紹介]] --大学共同利用機関法人人間文化研究機構 国立国語研究所 https://www.ninjal.ac.jp/ --[[国立国語研究所コーパス開発センター>https://ccd.ninjal.ac.jp/corpus_center/]] https://ccd.ninjal.ac.jp/corpus_center/ -(参考)国語研オープンハウス2020 https://www2.ninjal.ac.jp/openhouse2020/ --動画「日本語歴史コーパス」の紹介 https://youtu.be/tKvVR2K2h2E ***授業内容等の確認 [#e55ee18f] -[[シラバス>https://www2.lit.kyushu-u.ac.jp/~syllabus/cgi-bin/table-odd.cgi?thisyear=2021&num=1310103&show=S1110000&big=B00000&each=1]]の確認 --この授業の目的 --授業の進め方 --評価方法 -受講者アンケート --関心のある分野について --PC等のスキルについて ***「中納言」アカウントについて [#t6709ede] -「授業アカウント」について -「中納言」オンライン利用申込み --https://chunagon.ninjal.ac.jp/useraccount/register ***授業で利用する主なソフトウェア・Webアプリケーション(予定) [#i06478d2] |ソフトウェアの種類・名前|利用目的|h |[[コーパス検索アプリケーション''「中納言」''>https://chunagon.ninjal.ac.jp/]]|コーパスの検索| |表計算ソフト''Excel''|ピボットテーブルによる分析・グラフ作成| |[[Web茶まめ>https://chamame.ninjal.ac.jp/]]|形態素解析| |[[テキストエディタ ''サクラエディタ''>http://sourceforge.net/projects/sakura-editor/]]|正規表現を使ったテキストの検索・整形| |ワープロ''Word''|「スタイル」を利用したレポート作成| |[[全文検索ソフト''ひまわり''>https://www2.ninjal.ac.jp/lrc/index.php?%C1%B4%CA%B8%B8%A1%BA%F7%A5%B7%A5%B9%A5%C6%A5%E0%A1%D8%A4%D2%A4%DE%A4%EF%A4%EA%A1%D9]]|データの検索,ミニコーパスの作成| |[[R>https://www.r-project.org/]]|データの統計分析| ***授業内容デモ [#kc4ae1c5] -コーパスの利用 --[[「現代日本語書き言葉均衡コーパス(BCCWJ)」>https://ccd.ninjal.ac.jp/corpus_center/bccwj/]] ---[[梵天(BCCWJ文字列検索)>https://bonten.ninjal.ac.jp/bccwj/string_search]] ---[[中納言>https://chunagon.ninjal.ac.jp]] --[[「日本語歴史コーパス(CHJ)」>https://ccd.ninjal.ac.jp/corpus_center/chj/]] -Excelによる集計(ピボットテーブル) -形態素解析 --[[Web茶まめ>https://chamame.ninjal.ac.jp]] -テキストエディタとgrep -全文検索システム[[ひまわり>https://www2.ninjal.ac.jp/lrc/index.php?%C1%B4%CA%B8%B8%A1%BA%F7%A5%B7%A5%B9%A5%C6%A5%E0%A1%D8%A4%D2%A4%DE%A4%EF%A4%EA%A1%D9]] -[[R>https://www.r-project.org/]]