IN LEARNING & GROWTH · ISSUE 200
● 12 SEC研修のあとの紙には、たいてい満足度の欄があります。1997年のメタ分析〔複数の研究をまとめ直した研究〕は、34件の研究から111個の相関を集め、その欄とあとの段のあいだを測りました。
この論文は、いちばん下の段——反応——を二つに割ります。楽しかったかを聞く感情としての反応と、役に立つと思ったかを聞く有用性の判断。感情としての反応と直後の学習の相関は .02(11件の研究)、有用性の判断は .26(6件)。11件・6件は相関の個数ではなく研究の本数——脚注は "n is number of studies"(nは研究の本数)。
そして、いちばん上の「結果」の段。このメタ分析は、その段を集計から外しました。理由は "only three studies provided correlations that might be categorized as being based on Level 4 criteria, so we have not focused on this level"(第4段に分類できそうな相関を出した研究は3件だけなので、この段には焦点を当てていない)。内訳は学習と結果が2件(平均 .52)、行動と結果が1件(.48)。
学習効果の可視化(learning visibility)は、効果をあとから取り出せる形で残す話です。枠組みは四つの段——反応・学習・行動・結果。この4段を出した文章は1959年から1960年に発表され、6本すべてがそこを出発点です。
読み方には、査読誌に議論があります。1989年の著者抄録は、枠組みを "four ascending, causally related, and positively intercorrelated levels: reactions, learning, behavior, and results"(上昇し、因果的に関連し、正に相関しあう4つの段)と要約し、3つの問題含みの前提の妥当性を検討する、と続きます。本文に到達していないので、3つが何かは書きません。
「12件の研究と26個の相関」も1989年の本文からではなく、同じ第一著者が8年後に書いた1997年の本文が、1989年は12件・26個、今回は研究をほぼ3倍の計34件、相関を4倍以上の111個にした、と印字します。1989年の数字はすべて、この引用からです。

では、その段と段のあいだは、どこまで測られているのか。
011997年のメタ分析では、感情としての反応と直後の学習が .02、聞き方を変えると .26 だった。値は4つ。感情としての反応と直後の学習 .02(11件、95%信頼区間の下限 .01)、有用性と直後の学習 .26(6件、.20)、有用性と現場での行動 .18(3件、.12)、直後の学習と行動 .11(16件、.08)。標本の大きさで重みを付けた平均の相関〔参加人数の多い研究ほど強く効かせた平均〕で、効果量ではありません。原典は "behavioral learning predicts 'transfer' no better than utility or combined reactions"(行動として測られた学習は、有用性の反応より「転移」をよく予測しない)。3件・6件しかない値を含みます。
02397個の効果量を4つの段に分けた2003年のメタ分析では、段ごとの平均がほぼ同じだった。数の連鎖は初期1,152個・165出典→405個・164出典→外れ値8個を落とし397個・162出典(393+2+1+1=397)。単一群の前後比較は除外。反応15個・936人・d = 0.60(補正済み標準偏差〔値の散らばりの幅〕0.26、95%信頼区間 0.09〜1.11)、学習234個・15,014人・0.63(0.59、−0.53〜1.79)、行動122個・15,627人・0.62(0.29、0.05〜1.19)、結果26個・1,748人・0.62(0.46、−0.28〜1.52)。d は二つの群の差をばらつきで割った値。原典自身がコーエン(1992)を引き、0.20・0.50・0.80を小・中・大とします。学習と結果の区間は0をまたぎ、4つの平均に明確な差は言えません。5.8%(学習3.8%・行動2.0%)は0を下回ります。
032014年の調査は、上の2つの段の評価は組織では行われていない、というところから出発する。挙がった3つの要因は、時間や人員という資源、管理職の支持(組織の側)、評価の方法の専門性(個人の側)。到達は著者抄録まで。参加者の人数・職種・国は書きません。1996年の論文は、四段階の体系は評価モデルではなく結果の分類(taxonomy)だと主張(同じ号に提唱者の反論と再応答)、2004年の検討は「効果があったか」と「どう変えれば上がるか」の両方に答えられないとします。どちらも抄録まで、限界の内訳は書きません。

数字は動きません。動くのは、要約されていく途中のほうです。落ちやすいのは3か所。
01「下の段がよければ、上の段もよくなる」と読むと、その前提が検討された側が落ちる。1989年が検討するとした3つの前提の中身は、本文の側にあります。結び方だけは1997年の本文が引いています——枠組みは語彙と分類を与えるが、しばしば暗黙のまま置かれる前提を通じて、誤解と過度の一般化を招きかねない。1989年と1997年は同じ第一著者の連作で、独立した2本ではありません。
02「上の段ほど効果が小さいはずだ」と読むと、平均はほぼ同じで、同じ研究の中では下がっていたことが落ちる。平均は0.60・0.63・0.62・0.62。ただし逆の読み方だけを採るのも正確ではありません。同じ研究の中で複数の段を測ったものだけを取り出すと——反応と学習の12個(790人)が0.59と0.61、学習と行動の17個(839人)が0.66と0.44、行動と結果の10個(736人)が0.91と0.57、3つとも測った5個(258人)が2.20・0.63・0.82。逆向きは学習と結果の3個(187人)の0.73と1.42だけ。原典が例外として括弧に入れます。考察は "showed a substantial decrease in effect sizes from learning to these criteria"(学習からあとの段へ効果量がかなり下がることを示していた)、結果の節は平均的な低下を0.77とし、表の群平均との関係に説明はありません。著者たち自身、5個に満たない推定は慎重にと書きます。
03「満足度は意味がない」と読むと、聞き方の層と、著者たちの答えの両方が落ちる。.02 は「満足度」全体ではなく、感情を聞いた場合の値です。同じ表で、有用性の判断は学習と .26(6件)、行動と .18(3件)。学習と行動は .11 で、有用性より低い。答えは両側に振れます——"Utility reactions are thus not a substitute for learning and transfer measures, but they do provide a general sense of direction."(有用性の反応は学習や転移の測定の代わりにならないが、おおまかな方向の感触は与える)。意味が無いのではなく、聞き方で別の量になっている——この号の読み筋です。薄さの一部は、測る中身の違いでも説明できます——内容の近いものどうしは .16(45個の相関)、離れていると .04(42個)、差は有意(p < .001)。45・42だけ単位が相関の個数です。

測られたのは、組織が行った研修・講座の効果評価だけです。答えたのは111個の相関、397個の効果量(162出典・のべ33,325人)、専門職への調査。水準は訓練プログラムの単位で、一人ひとりの学びは追っていません。日常の読書や独学、職場の経験からの学習も、日本を対象にした研究も、この6本にありません。無作為な割り付けもどこにもないので、因果の言い方はしていません。回数も偏ります——反応15個・学習234個・行動122個・結果26個、割合は4%・59%・31%・7%(丸めで101%)。
時期も、反応は直後(平均0.00日)、学習26.34日後、行動133.59日後、結果158.88日後。段の種類との相関は .41 ですが、時期と効果量の相関は .03(p = .56)。全文まで読めたのは6点のうち2点。読めていないものについては書きません。1989年と1997年は同じ第一著者の連作、1997年と2003年は共著者が1名重なります。独立した6件ではありません。組織の評価を変える手順も書きません。どの研究も測っていないからです。
いちばん下の段が、二つに割れた。
いちばん上の段は、3件だった。
次の3手も、研究が命じた順番ではありません。1行を残したとき何が起きるかを測った研究はありません。判定しません。良し悪しも書きません。
TRY IT TODAY
- 01PICK
紙かメモアプリに、**最後に受けた研修・講座・オンライン講義を1つだけ**書く。良し悪しも講師の評価も書かず、名前だけ。
- 02CHECK
その下に、**そのとき測られたもの**を書く。満足したかか、覚えたかか、行動が変わったかか。無ければ「測られなかった」と。
- 03SORT
その1行を**「満足したか」「覚えたか」「行動が変わったか」「何も測られなかった」の4つのどれか**に分類し、右端に印。良し悪しの判定はしません。
四つの段には、静かな説得力があります。下から順に積み上がって見えるからです。確かめられたのは、その「積み上がっている」のほうでした。——いちばん下の段は、聞き方で二つに割れた。いちばん上の段は3件しかなく、集計から外された。段ごとの平均はほぼ同じでも、同じ研究の中では学習からあとの段へ下がっていた。積み上がっていることを示した数字は、この6本にありません。——今日残せるのは判定ではありません。機会がひとつ、測られたものがひとつ、印がひとつ。記録が1件、残るだけです。
SECOND LAYER · FULL SYLLABUS学習効果の可視化を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 効果量
- 差や関連の「大きさ」を、単位の違う研究どうしでも比べられるようにした共通の物差し。「効果があるか」ではなく「どれくらいか」を表します。
- 効果量 d・g
- 2つのグループの平均の差を、ばらつきの大きさで割った値。一般的な目安では 0.2=小、0.5=中、0.8=大。g は d を小規模研究向けに補正したものです。
- 95%信頼区間
- 推定値の「ばらつきを見込んだ幅」。同じ研究を何度もやり直したら、結果の多くがこの幅に収まると期待できます。幅が0(差なし)をまたぐときは、明確な差とは言い切れません。
- メタ分析
- 同じテーマの研究をたくさん集めて統合し、平均的な効き目を推定する方法。1本の研究より安定しますが、集めた研究の質と偏りに左右されます。
- 統計的に有意
- 「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
- p値
- 差がないと仮定したとき、偶然でこの結果以上が出る確率の目安。小さいほど偶然では説明しにくいことを表しますが、効果の大きさは表しません。
- 標準偏差
- ばらつきの大きさを表す値。大きいほど、人によって結果がばらばらだったことを意味します。
