FrontPage

2023/04/18 国語研の書き言葉コーパス

国語研の書き言葉コーパスについて最新の研究を含めて概説する。

コーパスとは

狭義のコーパス
言語研究を目的として収集され、言語研究のための情報が付けられたコンピュータ上で利用可能な大規模な言語データ。
  • 現代日本語書き言葉均衡コーパス(BCCWJ) / 日本語歴史コーパス(CHJ)
広義のコーパス
コンピュータ上で利用可能な大規模な言語データ。必ずしも言語研究向きではないが、言語研究に利用可能。

コーパスへの要請

「現代日本語書き言葉均衡コーパス」(BCCWJ)の構成とサンプリング

参考リンク

「日本語歴史コーパス」(CHJ)の構成

近世以前
残されている資料が少なく、できるだけ(可能なら全部)コーパスに入れたい
近世(後期)以降
偏りはあるものの選べるだけの資料があるが、それでもなるべく全文でいれたい(作品など資料単位で調査したい)

近代語コーパスの場合

「昭和・平成書き言葉コーパス」(SHC)の構成

コーパスと著作権

2023/04/27 国語研の書き言葉コーパス

国語研コーパスへの形態論情報の付与について最新の研究を含めて概説する。


トップ   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS