総研大2023

20230522

BCCWJのXMLタグセット

TEI (Text Encoding Initiative)

XMLアノテーションの実際

「太陽コーパス」でのXMLの活用例

Himawariでの利用

20230514

書き言葉コーパスの例(テキスト化+XMLアノテーション+形態論情報付与)

正規表現とは

正規表現のいろいろ

正規表現の応用

タグ付き正規表現

最長一致の原則(greedy matching)

検索文字列の中での後方参照

正規表現に関する参考資料

ゲームの紹介

XML入門

20230508

紙の資料からコーパスまで ~テキストの電子化とアノテーションの高度化

  1. (紙の)本文
  2. (紙の)総索引(コンコーダンス)
  3. 電子テキスト:テキスト (199x年代~)
  4. 構造化テキスト:テキスト+XMLによる構造化タグ (200x年代~)
  5. 単語情報付きのコーパス:テキスト+XMLによる構造化タグ+形態論情報 (201x年代~)

コーパスのファイル形式とアプリケーション

20230501(オンデマンド) テキストデータ整備の準備


*1 拡張正規表現では可能

トップ   新規 一覧 検索 最終更新   ヘルプ   最終更新のRSS