総研大2023

20230508

紙の資料からコーパスまで ~テキストの電子化とアノテーションの高度化

  1. (紙の)本文
  2. (紙の)総索引(コンコーダンス)
  3. 電子テキスト:テキスト (199x年代~)
  4. 構造化テキスト:テキスト+XMLによる構造化タグ (200x年代~)
  5. 単語情報付きのコーパス:テキスト+XMLによる構造化タグ+形態論情報 (201x年代~)

OCRによるテキスト化

電子化とアノテーション(明六雑誌コーパスを例に)

XMLの活用例

アノテーションの実際

20230501(オンデマンド) テキストデータ整備の準備


*1 かつては一般向けにたくさん発売されていたがかなり減ってしまった

トップ   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS