語用論的判断の測定

「日本語はできる」のに詰まる能力を、数字にする

PRD / 2026-08-15 / 姉妹文書:遠回し表現トレーナー(練習ツール)

日本語|EN|한국어

誰の日本で働く外国人 230万人と、雇用する 34万事業所。そして訓練をつくる側。「なぜ辞めるのか」を誰も測っていない
どんな課題を語用論的能力は JLPT では測られない。測られないので、訓練しても効果を示せず、学習者も自分の位置を知れない
どう解決母語話者の回答分布を基準に、正答率と反応時間で測る。設問は慣習性の軸で組む

01Problem

日本で働く外国人は 230万2,587人、雇用する事業所は 34万2,087所 である(厚生労働省「外国人雇用状況の届出状況」2024年10月末)。ところが彼らがなぜ辞めるのかについての公的統計は存在しない。日本全体の離職理由は毎年『雇用動向調査』で調べられているのに、その調査には国籍の区分がない。

日本語能力試験は語彙・文法・読解・聴解を測る。「検討させていただきます」が断りだと分かるかは測らない。ところが職場で損をするのはこちらである。N1保持者が「前向きに考えます」を前進と受け取って一週間を失う、という事態が試験の外側で起きている。

この空白は二方向に効く。学ぶ側は自分がどれだけできないのかを知らないまま実戦に出る。つくる側は訓練ツールをつくっても効果を証明できない——「なんとなく分かるようになった」以上のことが言えず、対外的な説明が成立しない。

そして測定の方法はすでに学術的に確立している。語用論的な理解の測定では、会話を読む/聞いたうえで話し手の含意を多肢選択で答えさせ、正答率と反応時間を併せて見るのが標準である。さらに、慣習性の低い言い回しほど正答率が下がり理解に時間がかかることが繰り返し報告されている。方法はあるのに、学習者が使える形になっていない。

実際に試すと差は出る。関西在住10年以上・日本の大学院卒・日本企業3年目の当事者1名が10問を解いた結果は正答率50%、うち慣習性の低い設問は33%(平均10.5秒)、慣習的な設問は57%(平均6.2秒)だった。※ n=1 の試行であり、暫定解に対する値である。

02Goals / Non-Goals

  1. 学習者が自分の位置を数字で知る/指標:正答率と反応時間(慣習性の別に集計)
  2. 訓練の効果を第三者に示せる/指標:事前・事後の正答率と反応時間の差(同一被験者)
  3. どの類型が弱いかが分かる/指標:設問別の誤答率・所要時間
  4. 測定の手続きを公開し、追試できる/指標:設問・正解基準・手順の公開

Non-Goals

  1. 語彙・文法・聴解の測定 — JLPT等の領域。ここでは扱わない
  2. 資格試験化/採用・人事評価への利用 — 選抜に使われた瞬間、受験者は正直に答えなくなり測定が壊れる
  3. 唯一の正解の主張 — 母語話者の判断も割れる。割れ方そのものを情報として扱う

03User Stories

  1. 訓練ツールをつくる人が、その訓練に効果があったかを事前・事後の差で示せる。
    利点「効いた気がする」ではなく数字で説明できる/現在効果を示す手段がなく、対外的な説明が成立しない
  2. 日本で働く外国人材が、自分がどの場面類型で外すのかを知る。
    利点漠然とした不安が、対処できる弱点に変わる/現在できないことに気づく機会が実戦の失敗しかない

04Proposed Solution

場面と発言を提示し、その意味を選ばせる短いテストである。正答率と反応時間を記録し、学習の前後で比べる。設問は慣習性(慣習的な言い回しか、そうでないか)で分類する。母語話者にも同じ設問を解いてもらい、その回答分布を基準にする。

  1. 設問バンク — 発話行為と慣習性でタグ付けし、同型の別セットを事前用・事後用に用意する 〈US1・US2〉
  2. 母語話者の回答収集学習者と同じ画面で、正解を出さずに回答だけを集める。属性(年代・職場経験)も記録する 〈全体〉
  3. 受験と記録 — 選択式で短時間に終える。選択肢と反応時間を1件ずつ記録する 〈US2〉
  4. 集計 — 慣習性別の正答率・平均時間、設問別の誤答率を出し、練習側の重点に渡す 〈US1〉
  5. 手続きの公開 — 設問・分布・手順を公開し、第三者が追試できる状態にする 〈US1〉

※ 中核は2。母語話者の回答分布がなければこの測定は成立せず、この分布は集めた者しか持てない。収集は専用システムを作らず、学習者用の画面に「母語話者として答える」モードを置いて済ませる。

— 以下、別紙 —

05根拠・詳細

測定方法の学術的裏づけ — 語用論的「理解」の測定
DCT(談話完成テスト)との違い — なぜ多肢選択でよいのか

語用論の測定でよく参照される DCT は、場面を提示して「あなたなら何と言うか」を書かせる方法であり、測っているのは産出である。本書が測るのは理解であり、別の能力である。

この区別は実務上も重要である。Yamashita (1996) は6種の収集法を統計的に比較し、選択式 DCT だけは信頼性・妥当性が確認できなかったと報告している。Kawamura & Sato (1996) も「使うか分からない選択肢から選ばせるより、自分なら何と言うかを考えさせるほうが信頼できる」と述べる。

これらはいずれも「産出を選択式で問うこと」への批判であり、理解の測定には当たらない。作文力を選択式で測れば不自然だが、読解を選択式で測るのは通常である。本書は後者に位置する。

なお DCT には、回答欄の下に相手の次の台詞(リジョインダー)を置くと回答がそれに引きずられるという既知の問題がある。理解を問う本方式ではこの構造を持たない。

出典:名古屋大学(データ収集における方法論の検討)/Yamashita 1996/Kawamura & Sato 1996/Rose 1994

なぜ既存の試験では代替できないのか

JLPT は語彙・文法・読解・聴解を測る設計であり、発話行為の解釈は測定対象に含まれない。一方 BJT ビジネス日本語能力テストは「相手との関係性や状況に応じた適切な表現の使い分け」を明示的に掲げており、ここを「既存の試験は扱っていない」と書くのは誤りである。ただし公開サンプルで問われるのは「社長にどのようにあいさつしますか」といった産出の選択と、聞き取った事実の確認が中心で、含意そのものの解釈を問う設問は限定的である。JSST は会話力を、CQI は文化適応の適性を測る。

つまり既存の試験は産出・知識・適性を押さえており、空いているのは受け手側の含意理解である。本書が測るのはそこに限る。

経済産業省「高度外国人材研究会 報告書」(2024-07-26) は、外国人材の職場への不満として「暗黙の了解が理解できない」を 30項目中12位・15.8% に挙げ、対策として「コミュニケーションのローコンテキスト化」を掲げる。ただし同報告書の本文に測定・可視化・診断・KPI の語はなく、どの職場がどれだけ高コンテクストかを知る手段は示されていない。割れ方を出すことは、その手段の候補になる。

一方、語用論的能力の研究は蓄積があるが、研究のための測定であって、学習者が自分の位置を知るための道具にはなっていない。この間が空いている。

実装方針(High-Level Tech Consideration)

06Open Questions / Risks

Open Questions(5件)
Risks(6件・PMBOK形式/教材外の補強)
#リスク原因 → 事象 → 影響対応
R1標本不足母語話者・被験者が集まらない → 分布も差も出ない → 測定が成立しない軽減:最小構成(母語話者5〜10名・学習者10名)で先に一巡する
R2正解基準の偏り特定の年代・業種に偏る → 一部の常識を正解にする → 誤った基準を広める軽減:属性を記録し、偏りを明示したうえで公開する
R3設問の記憶事前・事後が同一設問 → 記憶で正答 → 上達に見える回避:同型の別セットを用意する
R4選抜への転用採用・人事に使われる → 受験者が正直に答えない → 測定が壊れる回避:Non-Goals に明記し、個人結果を第三者に渡さない設計にする
R5自作自演訓練と測定を同一人物が設計 → 訓練に有利な設問になる → 効果の主張が信用されない軽減:設問と正解基準を公開し、追試可能にする(G4)
R6方式への誤解「選択式は信頼性がない」と指摘される → 産出の批判が理解の測定に適用される → 方法ごと否定される回避産出(DCT)と理解は別であることを本書と画面の双方に明記する
この PRD の弱点

① 人を集める必要がある。本書の全体が母語話者と被験者の存在を前提にしており、そこだけは一人で完結しない。最小構成でも20名規模が要る。

② 「テストの点が上がる=実戦で困らなくなる」は証明されていない。測定できるのは語用論的理解であって、職場での結果ではない。両者の関係は本書の範囲外である。

③ 現在の「答え」は作成者の判断である。試行では、作成者が「そのままの意味」と置いた設問(取引先の「一度持ち帰らせてください」)で当事者と判断が割れた。作成者が誤っている可能性が実際にあるということであり、構成要素2(母語話者の回答収集)を先に済ませない限り、この測定は自分の思い込みを基準にしていることになる。