成蹊2023
応用日本語講座(日本語・日本文学のためのコンピュータ)†
05/12 正規表現†
正規表現を使ってみる†
- 文字クラス
- 例:読[まみむめもん]
- 半角ブラケットの中に文字を並べる→並べた文字いずれか1文字
正規表現とは†
- 正規表現 >用語
- 文字を表すための特殊な文字(メタ文字)を使って文字列のパターンを表現する
- テキストエディタでは置換・検索・grepで利用できる (エディタ以外にもさまざまなアプリケ-ションやコンピュータ言語で利用されている)
- 特殊な文字(メタ文字)はすべて半角
正規表現のいろいろ†
- 授業資料/正規表現
- 文字クラス [ ]
- 文字クラスの否定(補集合)[^ ]
- 繰り返し ? + *
- グループ化 ()
- or(論理和) |
- 文頭 ^、文末 $
正規表現の応用†
- カタカナ語
- 送りがなの揺れ(行う/行なう)
- 会話文中("「"で始まる文中)の用例を検索する
- 同一文中での共起
ゲームの紹介†
- 正規表現を学ぶ狩りに出ようRegex Hunting
「ひまわり」の準備†
04/28 テキストエディタの利用†
テキストデータ(青空文庫の夏目漱石作品)の配布†
- 検索・置換、grep
- 検索で初出行を調べる
- 置換で用例数を数える
- grepで用例リストを作る
- タグジャンプで文脈を確認する
ショートカットキー†
grepと置換でKWIC(CSVファイル)を作る(簡易版)†
- CSVファイルとは:テキストファイルで表を表現する
用語:CSVファイル
- KWIC:KeyWord In Context
正規表現を使ってみる†
- 文字クラス
- 例:読[まみむめもん]
- 半角ブラケットの中に文字を並べる→並べた文字いずれか1文字
USBメモリの準備について†
04/21 テキストデータと文字コード†
文字コード†
テキストデータ†
テキストエディタ†
テキストエディタのダウンロードとインストール†
フリーソフトウェア(無償)のサクラエディタを使います。(PC教室のパソコンにはインストール済み)
(以下は自分のPCで使う場合)
- ★サクラエディタのダウンロード
- インストールの手順
- ダウンロードしたzipファイルの中のsakura_install~.exeをダブルクリック
- 以下、画面の指示に従ってインストール
テキストエディタを使ってみる†
- テキストエディタの設定
- 行の折り返し
- 行番号表示
- スタイル行番号(ワープロ的行番号)と論理行番号(エディタ的行番号)
- 検索・置換、grep
- 検索で初出行を調べる
- 置換で用例数を数える
- grepで用例リストを作る
- タグジャンプで文脈を確認する
ショートカットキー†
04/14 イントロダクション†
- シラバス確認
- この授業のシラバス
- この授業の目的
- 授業の進め方
- 評価方法
授業で利用する主なソフトウェア†
授業で利用する主なデータ†
- テキストエディタとgrep
- 全文検索システムひまわり
- Excel(ピボットテーブル)
- 形態素解析:Web茶まめ