上智2016
コーパス日本語学入門(近現代語コーパス)
- 前期・金曜4限
- ogiso@ogiso.net ←@を@に直してください
2016/06/17
ランダムサンプリング調査
- 大量に用例があり、調査内容からすべて対象にできない場合
- ランダムに並べ替え→先頭n例を調査対象に
- ランダムな数字の列: =RAND()
- ランダムな数字の列をコピーして「値として貼り付ける」と数字が固定される
重複の削除
- 用例数ではなく、用例が一つでも出現したサンプルの数を調べたい場合
- 「データ」→「重複の削除」
関数の利用
- 集計用に用意した列で文字列処理関数を利用する
- LEFT,RIGHT,MID,LEN,SEARCH,SUBSTITUTE
- 応用例:品詞の大分類を使う
- =IFERROR(LEFT(<品詞>,SEARCH("-",<品詞>)-1),<品詞>)
コロケーション強度の話
【参考資料】助動詞と上接動詞のコロケーション
- 共起する語を評価するとき、単純な用例数では危険
- もともと頻度が高いもの同士のつながりは多くて当たり前
- ダイス係数=2×(ABの用例数/(Aの用例数+Bの用例数))
- 「つ」の前の動詞の場合
- AB= 「動詞+つ」の用例数
- A=当該動詞の用例数
- B=「つ」の用例数
- tスコア=(ABの用例数 - Aの用例数×Bの用例数/コーパスの総語数)/√ABの用例数
- MIスコア(相互情報量)=log[2]ABの用例数×コーパスの総語数/Aの用例数×Bの用例数
2016/06/10
近代雑誌コーパスについて
日本語歴史コーパス「中納言」補足
調整頻度の計算
- 粗頻度を総語数で割る
- レジスターごとの語数データ:中納言ページの「語数について」からExcelでダウンロードできる
- 調整頻度には100万語あたりの頻度が比較的よく使われる
- ※割合の違いを比較するだけなら調整頻度を出す必要はない。
レポートテーマについて
- レポートテーマについて全員に聞き、コメントします。テーマを考えておいてください。
2016/06/03
『日本語歴史コーパス』
- 平安時代編
- 鎌倉時代編Ⅰ説話・随筆
- 室町時代編Ⅰ狂言
- 明治・大正編Ⅰ雑誌
集計ためののテクニック
- 分類用の列を作って集計する
- 複数の検索結果をまとめる
- ショートカットキーを活用すると便利
- Ctrl+End ファイルの末尾/表のいちばん右下に移動
- Shift+Ctrl+End 〃範囲を選択
- 表をコピー
- Ctrl+Home, ↓(列名はコピーしないようにする),Shift+Ctrl+End, Ctrl+C
- コピーした表を既存の表の下に貼り付け
- Ctrl+End, Home, ↓, Ctrl+V, Ctrl+Home
2016/05/27
(復習)【重要】ピボットテーブルの使い方
テキストエディタとショートカットキー
- zipファイルの展開(解凍)について
- ダウンロードしたファイルのプロパティを見てセキュリティブロックを解除する
- 解凍しないままでも開けるが必ず解凍すること
2016/05/20
「中納言」の利用(つづき)
検索条件式の利用
キー: (品詞 LIKE "形容詞%" AND 活用形 LIKE "連体形%")
AND 後方共起: 語彙素="言葉" ON 1 WORDS FROM キー
WITH OPTIONS tglKugiri="|" AND tglBunKugiri="#" AND limitToSelfSentence="1"
AND tglFixVariable="2" AND tglWords="20" AND unit="1" AND encoding="UTF-16LE" AND endOfLine="CRLF"
「中納言」検索結果のダウンロードとExcelでの利用
- ダウンロード
- アーカイブの展開(解凍)
- Excelでインポート
Excelの基礎
【重要】ピボットテーブルの使い方
2016/05/13
形態論情報を利用した検索
UniDicによる形態素解析
2016/05/06
日本語コーパスの形態論情報
品詞体系と見出し語の階層
- BCCWJ,CHJはUniDicの品詞体系にもとづく
2016/04/29(祝日授業実施日)
日本語コーパスの紹介(2) コーパスの設計とサンプリング
- 均衡コーパス(Balanced corpus)
- 「バランスがとれている」とは?
- コーパスの母集団の設定とサンプリング
- BCCWJのサブコーパス
- 可変長と固定長
- 著作権をめぐる問題
参考リンク
- 英語のコーパス リファレンス
- 現代日本語書き言葉均衡コーパス(BCCWJ)
日本語コーパスの形態論情報
2016/04/22
コーパス検索アプリケーション「中納言」の申込みについて(来週以降)
現代日本語書き言葉均衡コーパス(BCCWJ)とは
- BCCWJについて、まず最小限のことを説明します。
日本語コーパスの紹介(1)コーパスとはどんなものか
- 狭義のコーパス
- 言語研究を目的として収集され、言語研究のための情報が付けられたコンピュータ上で利用可能な大規模な言語データ。
- 広義のコーパス
- コンピュータ上で利用可能な大規模な言語データ。必ずしも言語研究向きではないが、言語研究にも利用可能。
- この授業で扱うのは狭義のコーパス。中でも「現代日本語書き言葉均衡コーパス(BCCWJ)」と「日本語歴史コーパス(CHJ)」
- 「コーパス」以前の日本語研究用データとの違いは
2016/04/16
イントロダクション
- デモ
- 「現代日本語書き言葉均衡コーパス(BCCWJ)」
- 「日本語歴史コーパス(CHJ)」
- Excelによる集計(ピボットテーブル)
- 形態素解析