IN WAYS OF THINKING · ISSUE 178
● 12 SEC「何件そろえば、そう言っていいのか」。1971年の質問紙は、その見積りを、答える側の専門性ごと測りました。配り先は数理心理学の研究会と、心理学会の総会の会場。答えたのは専門の心理学者84人。
問いは1つ——20人の実験で有意な差が出た。追加の10人で繰り返しても有意になる確率は(有意は、偶然では起こりにくいと判定される目安)。回答の中央値は .85(小さい順のまん中)。理論上の値はおよそ .48。.40 から .60 と答えたのは、84人のうち9人だけでした。
この号が扱うのは、事例の集め方ではなく、何件で線を引いてよいかがどこまで測られているか、です。この号も、正しい件数は渡しません。6本のどれにも書かれていないからです。
帰納(Induction)は、たくさん集めれば確からしくなる気分の名前ではなく、まだ見ていない残り全部へ線を引く手つきの名前です。資料は二系統。理論値とのずれを見た質問紙と、発表済みの研究を数え直した集計で、物差しは同じではありません。
この号の6本に、参加者を無作為に割り付けた実験は1本もありません(質問紙2本・集計3本・論考1本)。だから「効く」「減らす」とは書けない。書けるのは、そう答えた、そう報告された、まで。

では、それぞれどこまで測られているのか。まず測られたのは、この3本です。
0184人の見積りは、理論値の倍近くだった。この質問紙は、問いごとに答えた人数が違います。中央値 .85 と .40〜.60 の9人は84人の側。意外な結果に追試を勧めたのは75人中66人、勧めた標本は中央値20匹で元の半分。その追試が有意にならなかったときの選択肢に答えたのは77人で、84・75・77は一致しません(原典が回答者数をそろえていないため)。最多は「2群の差の説明を探す」30人で、原典自身が「弁護できない」と呼ぶ選択肢でした。
02Stanford学部生97人は、逆向きの形でも当てなかった。翌1972年、同じ2人の病院問題。1日およそ45人が生まれる大きい病院と、およそ15人の小さい病院。男の子が60%以上の日が多いのはどちらか(小さい標本ほど偏るので、正解は小さいほう)。答えたのは、確率も統計も履修していないStanford学部生97人。形は2つ。「60%より多い」形の50人は大きい12・小さい(正解)10・ほぼ同じ28、「60%より少ない」形の45人は正解が「大きい病院」に反転して9人・小さい11・ほぼ同じ25。50+45=95 で、97人と2人ぶん合いません(原典は説明していません)。結論は内訳ではなく「最頻回答はほぼ同じ、正解への有意な選好はなかった」。
03印刷された論文の側でも、見積りは足りていなかった。1962年の調査は、ある心理学専門誌の1960年の巻を1本ずつ読み、本当に差があるとき見つけられる確率=検出力を計算しました。78本から、検定を含まない6本と主要な検定を含まない2本を除いた70本が対象で、主要な仮説に関わる検定は2,088(巻全体では4,829)。平均は小さい差 .18・中くらい .48・大きい差 .83、同じ表の中央値は .17 / .46 / .89。ただし原典自身が「迷う場合は検出力を高く見積もる側で解決した」と断り、さらに"the ones most needing such repetition are least likely to have appeared in print"(もっとも追試が必要な研究ほど、印刷物になる見込みが低い)。2013年の点検は、神経科学の検出力の中央値をおよそ8%から31%と見積もりました(たどれたのは、そのKey Pointsと抄録まで)。

数字そのものは動きません。動くのは引用の途中です。落ちやすいのは3か所。
01「24年後もほぼ同じ」で止めると、結論が消える。1989年の報告は24年後、同じ雑誌の後身の1984年の巻を数え直しました。56本から2本を除いた54本・64実験。「およそ50%で変わっていない」は、原典の結論ではありません。平均どうしなら、多重比較の調整(まぐれ当たりを増やさないための手当て)を除いて1960年と同条件で計算した中くらいの差の平均が .50 で、.48 とほぼ同じ。中央値どうしなら、実際に調整を使った実験が64のうち31あり、含めた中央値は .37 で、1960年の .46 より下(除けば .44)。原典の結論は"we must conclude that 24 years later, the power of the tests has decreased instead of increased."(24年後、検定の検出力は増えるどころか減ったと結論せざるをえない)。平均か中央値か、調整を含むか除くか。組み合わせ次第で正反対の要約が作れます(原典は外れ値ゆえ中央値を代表と明記)。
02慎重な論考が、途中で「有意に低下する」に化ける。もとになった資料の一文「自己懐疑を訓練した思考者は確証バイアスが有意に低下(2009年)」。2009年の論文は実在しますが、実験の報告ではありません。デバイアス(バイアスを減らす手法)が実社会でどこまで役立つかの論考で、結論はほとんど逆です。「反対を考える」型に一定の効果は報告されているとしつつ、持ち出す際の障害を6つ並べています。慎重な論考が、引かれ、要約されるうちに威勢のよい一文になった——というのが、この号の読み筋です。
03正解当てのクイズにすると、標本が消える。原典が測っているのは、「小さい病院と答えられたか」ではありません。正解は形で入れ替わり(「60%より少ない」形の45人では正解が大きい病院で、選んだのは9人)、片方だけでは、言葉に反応した回答との区別が消えます。結論は選好の不在で、能力の話でもありません——"People can be taught the correct rule, perhaps even with little difficulty. The point remains that people do not follow the correct rule, when left to their own devices."(正しい規則は教えられる。問題は、放っておかれると人がそれに従わない、というところに残る)。並べた6本のうち5本は、独立していません。1962年の調査は1971年の質問紙に引かれ、以降の3本もそれを引く。1本の鎖が、5か所に見えているだけです。

答えたのは、学会の会場の専門の心理学者84人(問いによっては75人・77人)と、確率も統計も履修していない学部生97人(病院問題は95人)。標本の性別も年齢も書かれていません。現場は英語圏の学会の会場と米国の大学の教室、英語の学術誌に寄り、日本語での追試は範囲外。数えているのは印刷された論文だけです。全文まで読めたのは6点のうち5点。読めていないものについては書きません。
正しい件数は、ここにありません。「訓練すれば直る」も「訓練しても無駄だ」も、この6本からは出ません。1971年の報告は「明らかな予防策は、計算することである」と書き、24年後にそれを測った1989年の答えは"We argue that the impact is nil"(その影響は皆無だと、私たちは主張する)。正しいと分かっている手当てが、正しいと分かったままで実行されない——というのが、この号の読み筋です。
84人のうち、当てたのは9人。
24年たっても、上がらなかった。
次の3手も、研究が命じた順番ではありません。測られたのは見積りと、印刷された検定の大きさ。判定も採点もしません。
TRY IT TODAY
- 01PICK
紙かメモアプリを開く。**直近1週間で「いつもこうだ」と思ったことを1つだけ**書き写す。すでに思っていることを1行にするだけ。
- 02COUNT
その下に、その判断のもとになった出来事を思い出せるだけ挙げ、件数を数字で書く。「たぶんあっただろう」は数えない。3件なら3、0件なら0。
- 03SPLIT
最後に、その件数を直接見た分と人から聞いた分に分け、2つの数字にする。分けられなければ「不明」と書いて閉じる。
確かめられたのは4つ。専門家84人の見積りが中央値 .85、理論値およそ .48 で、近い値は9人だったこと。2つの形の病院問題で正解が反転したこと。1960年の70本の平均検出力 .18 / .48 / .83 が、24年後は調整を含めた中央値で .46 から .37 へ下がったこと。「有意に低下する」の出どころが、実験ではなく論考だったこと。
何件そろえば足りるかは、どこにも書かれていません。書かれているのは、その見積りが、訓練を受けた側でも印刷された設計の側でも同じ向きに外れていたことまで。——今日残せるのは判定ではありません。「いつもこうだ」が1行、根拠の件数が1つ、直接見た件数が1つ。記録が1件、残るだけです。
SECOND LAYER · FULL SYLLABUS帰納を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 統計的に有意
- 「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
- 中央値
- 全員を並べたときの、ちょうど真ん中の人の値。平均と違って、極端な値に引っ張られません。

