コーパス分析ツール(無料)KWIC・コロケーション・キーワード分析

学習者作文や教科書・論文のテキストを貼る/.txtを複数読み込むだけで、KWICコンコーダンス(分布プロット付き)、共起語(MI・t・LL・logDice)、語彙の束(n-gram)、単語リスト(DP)、参照コーパスとのキーワード分析(LL・Log Ratio・%DIFF)をブラウザ内で。

コーパス分析ツール(KWIC・コロケーション・キーワード)とは

学習者のエッセイや教科書本文、論文サンプルなど手元の英文を、その場でコーパスとして分析できる無料のブラウザツールです。インストール不要で、テキストは外部に送信されません。KWICと出現位置プロット、MI・t-score・対数尤度・logDiceによる共起語、語彙の束(n-gram)、DP付き単語リスト、対数尤度とLog Ratioによるキーワード分析を5つのタブで。計算式と文献を画面で確認でき、独立したPython実装と照合済みです。

主な機能

  • KWICコンコーダンス:語・フレーズ・ワイルドカード(* ?)・正規表現で検索し、1L〜3L/1R〜3Rで並べ替え。行をクリックすると元の文とファイル名を表示
  • 文書ごとの出現位置を示すコンコーダンス・プロット、TSV書き出し、ノード語を空欄にできるDDL(データ駆動型学習)ワークシートの印刷(解答ページ付き)
  • コロケーション:左右の窓幅・最小頻度を指定し、MI・MI3・t-score・対数尤度(G²)・logDice を算出。期待値の窓幅補正の有無を選べ、上位の共起語を一覧とワードクラウドで表示
  • N-gram・語彙の束:2〜6語の連鎖を頻度・100万語あたり頻度・レンジ(出現した文書数)で抽出。Biber, Conrad, & Cortes (2004) の基準をワンクリックで適用
  • 単語リスト:頻度、1万語/100万語あたり頻度、レンジ、散らばりの指標 DP と DPnorm(Gries, 2008; Lijffijt & Gries, 2012)。簡易レンマ化にも対応
  • キーワード分析:対象と参照コーパスを比較し、対数尤度(Rayson & Garside, 2000)、p値、%DIFF、Log Ratio を算出。使いすぎ(+)・使わなすぎ(−)の語を効果量のグラフで表示
  • 英文の報告文(手法の記述)のコピー、各表のCSV書き出し、計算式と文献つきの印刷

使い方(3ステップ)

  1. 左の「対象コーパス(A)」に英文を貼るか「📂 .txt を読み込む(複数可)」でファイルを追加(「📋 サンプル」で動作確認も可)
  2. 「KWIC」「コロケーション」「N-gram・語彙の束」「単語リスト」「キーワード」のタブを切り替えて分析する(キーワードは参照コーパス(B)も入力)
  3. 「📥 CSV」「🖨 印刷」「📋 報告文をコピー」で結果を書き出す。KWIC では「🖨 DDLワークシート」で教材プリントも作れます

授業での活用アイデア

学習者コーパス研究に学生のエッセイを対象コーパス、母語話者の模範エッセイを参照コーパスにしてキーワード分析を行うと、学習者が使いすぎている語(I think、very など)と、あまり使わない語(however、evidence など)が対数尤度と Log Ratio で一覧になります。レンジで何人の書き手が使ったかも確認できます。
アカデミック・ライティングの指導に論文サンプルから4語の語彙の束(on the other hand、it is often argued that など)を抽出し、KWIC で実際の文脈を確認。ライティング授業で「使える定型表現」の一覧として配布できます。
DDL(データ駆動型学習)の教材づくりに教科書本文や作文から重要語を検索し、「🖨 DDLワークシート」でノード語を空欄にしたコンコーダンス・プリントを作成。授業では「全部の空欄に入る1語は?」「前後にどんな語が来る?」と学生に規則性を発見させる活動に使えます。プロジェクターでは「ノードを隠す」で推測クイズにもなります。
教科書・試験問題の語彙分析に教科書の複数の課を .txt で読み込み、単語リストの頻度・レンジ・DP で「課をまたいで繰り返し出てくる語」と「特定の課に偏る語」を見分けられます。語彙リストや小テストづくりの根拠資料になります。

よくある質問

無料で使えますか?インストールや登録は必要ですか?

無料で、インストールも登録も不要です。ブラウザで開き、英文を貼り付けるか .txt ファイルを読み込むだけで使えます。

学生の作文などのデータは外部に送信されますか?

いいえ。解析はすべてお使いのブラウザ内で行われ、テキストが外部のサーバーに送信されることはありません。貼り付けた本文と設定はこのブラウザ(localStorage)にだけ保存されます(大きなテキストは保存されません)。

共起語の MI や t-score はどのように計算していますか?

MI = log₂(O/E)、t = (O − E)/√O、logDice = 14 + log₂(2O/(f(n)+f(c)))、対数尤度は 2×2 表の G² です。期待値 E は窓幅補正あり(f(n)·f(c)·窓幅/N、AntConc 4 や Brezina (2018) の補正式と同じ定義)と補正なしを選べます。ソフトによって期待値や窓の数え方が異なるため、論文では用いた設定を明記してください。計算式と文献は画面の「📚 計算式と文献」で確認できます。

どのくらいの量のテキストを分析できますか?

100万字程度(約17万語)のテキストでも、ブラウザ上で数秒以内に処理できるよう設計しています。複数の .txt をまとめて読み込むと、ファイルごとに文書として扱われ、レンジや DP(散らばり)の計算に使われます。

キーワード分析の対数尤度は他のツールと同じ値になりますか?

Lancaster 大学 UCREL の Paul Rayson による Log-likelihood and effect size calculator と同じ式(Rayson & Garside, 2000)で計算しており、同 calculator の計算シートの例題で対数尤度・%DIFF・Log Ratio が一致することを確認しています。ただし、語の区切り方(トークン化)の設定が異なると頻度そのものが変わるため、他のソフトとは結果が異なる場合があります。

大学・アカデミックのほかのツール

🎓 大学・アカデミックの一覧 ・ すべてのツール(407種) ・ 英語の先生のためのリンク集