IN LEARNING & GROWTH · ISSUE 198

(仮ビジュアル)夜の高層階の窓辺に立ち、暗いガラスに自分の姿を映しながら街の明かりのほうを見ている、黒いスーツの女性● 12 SEC
Visual: ALIFE Editorial

1996年に出た1本のメタ分析が、「フィードバックは効く」の根拠としていちばんよく引かれます。131本の論文から取り出した607個の効果量。標本サイズで重み付けした平均は d = 0.41——原典の言葉で、中程度の正の効果です。

引かれるのはここまで。ところが同じページに続きがあります——"However, over 38% of the effects were negative"(しかし、効果の38%超は負であった)。分布の重み付き分散〔散らばりの広さ〕は0.97、標本の揺らぎだけで生じるはずの分散は0.09。中心的な結論は、平均0.41ではなく、ばらつきが偶然では説明できないことのほうでした。

38%は、38%の人の成績が下がったという意味ではありません。607個の効果量のうち38%超が負の値だった、という意味です。要旨は「3分の1超」、結果の節は「38%超」、考察の節はまた「3分の1超」。丸まりやすいのは要旨の側です。

フィードバック密度(feedback density)は、少なくとも3つを指します。どれだけ頻繁か。どれだけ早いか。どれだけ細かいか。この号が扱うのは、効果の分布だけです。

d = 0.41 は607個を標本サイズで重み付けした平均で、研究ごとに真の値が違いうると見込むやり方(ランダム効果)ではありません。0.41 と 0.97 は同じ一つの分布の二つの言い方——平均は重心、分散は広がりの幅です。

原典は「見た論文のうち、条件を満たしたのは131本(5%)だけだった」と書きます。含まれた研究は実証的なフィードバック文献の10〜15%、検討した論文のおよそ37%は対照群なしで操作し、16%は他の処置と交ぜていたので、実証文献のおよそ3分の2はこの問いに光を当てられない、と。37%と16%を足しても3分の2にはなりませんが、原典はその計算を書いていません。

(仮ビジュアル)夜の高層階の窓辺に立ち、暗いガラスに自分の姿を映しながら街の明かりのほうを見ている、黒いスーツの女性
平均は重心の位置、分散は広がりの幅。同じ一つの分布の、二つの言い方。 Visual: ALIFE

返ってくるものの効果は、どこまで測られているのか。

01平均は0.41。同じ分布の38%超がマイナス側で、ばらつきは標本の揺らぎでは説明できなかった。1996年のメタ分析は、131本から取り出した607個の効果量、12,652人、23,663回の観測、1効果量あたり平均39人。効果量 d〔差をばらつきで割った量。0なら差なし〕の重み付き平均が0.41、うち38%超が負。91個は1人の研究者の実験室実験由来で、その平均−0.39、残り0.47。除いても分散0.92、残りの33%はなお負でした。

02多面評価のあとの補正後の効果量は0.15・0.15・0.05・−0.04。区間が0をまたがなかったのは上司評価だけ。2005年のレビューは、多面評価のあとの動きを24本の縦断研究で。内訳は単群前後17件・独立群事後4件・独立群前後3件。補正後〔測り方の粗さを差し引いた推定〕の効果量は直属の部下0.15・上司0.15・同僚0.05・自己評価−0.04、k〔効果量の個数=研究の本数〕は21・10・7・11。"For each rater source except supervisors, the 95% confidence interval included zero."(上司を除くすべての評価者で、95%信頼区間は0を含んでいた)——部下 −.14〜.44、同僚 −.24〜.34、自己 −.10〜.02、上司 .01〜.29。目安では小・中・大が.20・.50・.80(出所も同論文)。著者らの結論は、全面的な大きな改善を期待するのは現実的ではない。

03チームへのレビュー59本。要旨は「負の効果の報告は1本も無い」。本文は例外を1件名指ししている。2012年の、チームへのレビューは、高等教育または組織の現場の59本。成績についてのものは半分が一貫して正、残りは一部の指標だけ、やり方についてのものは全部が混在。要旨は"None of the studies reported any negative effects."(どの研究も負の効果を報告しなかった)。ただし本文は、1件を除いて負の効果は出なかったと書きます。その1件は、互いに不信のあるチームへ初期に負の指摘を与える危険を挙げた2003年の研究。要旨では0件、本文では1件。59は、585件から条件を満たした91件のうち本文が手に入った分で、残る32件は入手できず。

(仮ビジュアル)ベージュの空間で、黒い石の細長い天板を、灰青のガラス・銀の金属・赤い漆という3本の異なる脚がそれぞれ支えているコンソールテーブル
607個の分布・24本の縦断研究・チーム59本。まず測られたのは、この3本。 Visual: ALIFE

数字そのものは動きません。動くのは、要約されていく途中のほうです。

01「同じ内容の指摘なら、効き方も同じ」と読むと、著者らが立てた予測のほうが消える。同じ2人が、1998年に短い解説論文を書いています(1996年の理論を説いたもので、独立2件ではなく連作)。著者らは、この介入が注意を自分自身へ向けさせたとき成績を損なう危険が高まる、と予測した、と書きます。測定の結果ではありません。冒頭の歴史的な振り返りも、効果は一度として一貫していたことも単純だったこともない、という一文で締められます(刊行本文は未到達、引用集で確認)。

02「多いほどよい」と読むと、山なりの下り坂と、その説明が予想であることが消える。2011年の実験は、頻度を操作。題そのものが"Challenging the ‘more is better’ assumption"(「多いほどよい」という前提に挑む)。報告されたのは、頻度と成績の関係が逆U字〔上がってから下がる形〕になったこと、あいだに入ったのが課題への労力だったこと、曲線の形が前向きな感情の状態で変わったこと。「資源の容量を超えて労力が減る」ほうは、理論から立てた予想(原典の語は「提案する」)。抄録に無作為な割り付けの語はなく、参加者数も頻度の水準も抄録の外。ここから「減らせ」にもなりません。

03「現場のレビューに悪い結果が無い」と読むと、集める段階で落ちたぶんが消える。現場のレビューがもう1本。2001年に出た、1985年から1998年の43本の研究から68の適用例を分類した「客観的レビュー」(統合した効果量はなく、68は効果量ではなく場面の数)。報告は、一様には成績を上げないこと、他の手立てと組み合わせると一貫性が上がる傾向——新発見ではなく、1985年の先行レビューの再確認として。分布の左半分は、測られたか、報告されたか、集められたか——この3つのどこででも落ちます。負の例が無いことは、現場で起きていない証拠にはなりません。

(仮ビジュアル)3つの縦長の区画に分かれた写真。左は薄暗い寝室の乱れた寝具(壁に採光)、中央は窓の外を見ている女性の横顔、右は玄関の床に置かれた上着と鍵
同じ言葉なら同じ効果と読む・多いほどよいと読む・悪い報告が無いのを害が無いと読む。消えるのは、この三か所。 Visual: ALIFE

水準は、そろっていません。1996年・2005年・2011年は個人、2012年はチーム、2001年は適用例が単位で、混ぜて読める数字ではありません。多面評価の24本で評価を受けた本人は、部下からの評価で7,705人=7,355+192+158、上司5,358人、同僚5,331人、自己評価3,684人。

全文まで読めたのは6点のうち3点。読めていないものについては書きません。1996年は対照群のある研究だけを集め、無作為な割り付けの実験と準実験を区別して符号化——0.41・38%超・0.97は両方を混ぜた分布の値です。残る5本に、無作為な割り付けの記載はありません。だから「効いた」ではなく、上がっていた・散らばっていた・報告された、まで。日本で実施されたと原典にある研究も、求める人ほど得やすいという逆向きの筋道を排除した記述も、読めた範囲にはありません。6本のうち2本は同じ2人による連作で、独立6件ではなく5系統。

平均は、重心の位置にすぎない。
最後まで残るのは、向きだけ。

情報が減るとき、最初に落ちるのは散らばり、次に平均の値、最後まで残るのは向きだけ。というのが、この号の読み筋です。確かめられた事実ではありません。

TRY IT TODAY

  1. 01RECALL

    紙かメモアプリを開く。**直近1週間で受け取った指摘を、1件だけ**思い出す。中身も、相手が誰かも書きません。思い出せなければ「無かった」で完了。

  2. 02MARK

    その横に、そのとき注意が「作業」に向いていたか「自分の評価」に向いていたか、どちらかに印を付ける。**それだけです。**指摘の正しさは判定しません。

  3. 03STOP

    **印を付けたら、そこで終わりです。**返事も、見せる必要もありません。残るのは、指摘が1件あったかと、向き先の印の2つだけ。

2分。採点はありません。**これは、あなたの能力を測る課題ではありません。**誰かの指摘を採点しない。上司や同僚に評価を頼みに行かない。書いたものは誰にも見せず、提出もしません。思い返して気持ちが強く沈む場合は、この課題より先に、信頼できる相談先や医療・支援の専門家へ。

0.41 の弱点は、覚えやすすぎること。0.97 は覚えにくい。確かめられたのは4つ。——同じページに平均0.41と、607個の38%超が負、分散0.97に対し標本の揺らぎの分散0.09が並んでいたこと。要旨と結果の節で「3分の1超」「38%超」と書き分けられ、91個を除いても33%はなお負だったこと。2005年の4値で95%信頼区間が0をまたがなかったのは上司評価だけだったこと。2012年が要旨では0件、本文では1件の例外を名指ししていたこと。書かれているのは、効き方には幅がある、というところまで。記録が1件、残るだけです。

SECOND LAYER · FULL SYLLABUSフィードバック密度を、もっと深く学ぶ。→
HOW TO READ THE NUMBERS数字の読み方

この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。

効果量
差や関連の「大きさ」を、単位の違う研究どうしでも比べられるようにした共通の物差し。「効果があるか」ではなく「どれくらいか」を表します。
効果量 d・g
2つのグループの平均の差を、ばらつきの大きさで割った値。一般的な目安では 0.2=小、0.5=中、0.8=大。g は d を小規模研究向けに補正したものです。
95%信頼区間
推定値の「ばらつきを見込んだ幅」。同じ研究を何度もやり直したら、結果の多くがこの幅に収まると期待できます。幅が0(差なし)をまたぐときは、明確な差とは言い切れません。
メタ分析
同じテーマの研究をたくさん集めて統合し、平均的な効き目を推定する方法。1本の研究より安定しますが、集めた研究の質と偏りに左右されます。
観察研究・前向き研究
介入せずに経過を追いかける研究。「関連がある」までは言えますが、「それが原因だ」とは言い切れません。

Next in learning & growth

VIEW ALL
ISSUE 197あの配分は、本から来た。ISSUE 199教わる前に、選ばれている。
ALIFE · ISSUE 198

本コンテンツは学習目的であり、診断や治療の代替ではありません。