総研大2024

2024/04/30 国語研の書き言葉コーパス

国語研の書き言葉コーパスについて最新の研究を含めて概説する。

「現代日本語書き言葉均衡コーパス」(BCCWJ)の構成とサンプリング

参考リンク

BCCWJ2

「日本語歴史コーパス」(CHJ)の構成

近世以前
残されている資料が少なく、できるだけ(可能なら全部)コーパスに入れたい
近世(後期)以降
偏りはあるものの選べるだけの資料があるが、それでもなるべく全文でいれたい(作品など資料単位で調査したい)

近代語コーパスの場合

「昭和・平成書き言葉コーパス」(SHC)の構成

雑誌
1933~1957 年刊の『中央公論』と1965~2013 年刊の『文芸春秋』(8年おき11か年分)
ベストセラー書籍
1933年以降、8年おき11か年のベストセラー書籍
新聞
1933年以降、8年おき11か年の『読売新聞』奇数月2日の朝刊1冊

※参考:配布資料(「『昭和・平成書き言葉コーパス』の構築と公開」)

コーパスと著作権

2024/05/07 国語研のコーパスの形態論情報

国語研コーパスへの形態論情報の付与について最新の研究を含めて概説する。

コーパスの形態論情報

品詞体系

コーパスへの形態論情報の付与

形態素解析を試してみる

形態素解析の仕組み

参考資料


トップ   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS