IN WAYS OF THINKING · ISSUE 183
● 12 SECまったく同じ1つのデータを、29の研究チームに配る。問いも1つ——サッカーの審判は、肌の色が濃い選手に、薄い選手より赤いカードを多く出しているか。分析のやり方だけは各チームに任せる。2018年の共同研究です。答えはオッズ比〔起こりやすさの比。1.0が差なし〕で0.89から2.93まで散らばり、中央値〔まん中の値〕は1.31。
20チーム(69%)が有意〔偶然では起こりにくいという目安〕な正の関係を報告し、9チーム(31%)は見つけず、負の関係を有意だとしたチームは1つもありません(参加は29チーム・61人、共変量〔計算へ入れて影響を取り除く変数〕の組み合わせは21通り)。この号が扱うのは、根拠の数ではなく、その何件が、どこで作られ、どこを通って来たかです。正しい確かめ方の手順は渡しません。6本のどれにも無いからです。
証拠とは、数の多さではなく、ある主張を支えている材料が、互いにどれだけ独立しているかを見る手つきの名前です。合流は、数えているあいだは見えません。資料は三系統——同じ材料を配って散らばりを見たもの、発表された研究を数え直したもの(追試2件と追跡1件)、引用の網を追ったもの。6本のうち、無作為に割り付けた実験は2つだけ。その2つは、わざと偽の結論を作ってみせる実演でした。

では、どこまで測られているのか。まず測られたのは3本です。
01同じデータを配ると、20対9に割れた。配られたのは、ヨーロッパの4リーグの試合記録(肌の色の判定に使えた写真は、選手2,053人中1,586人ぶん)。ばらつきは「下手なチームのせい」ではありません。専門性が高い9チームは78%が有意、それ以外は68%。原典の結論は「同じデータを使ってもなお、研究者の選択と前提によって効果の大きさに幅が生まれる」。肌の色が原因だと特定する機会は与えていない、とも明記されています。
02差の無いデータから、60.7%が出てきた。2011年の論文は、本当は差の無いデータ(乱数)でそれぞれ15,000回の模擬実験を回しました。試したのは、指標の選び直し・観測の追加・変数の投入・条件の削除という四つの選択肢。1つずつ使うと偽陽性率〔差が無いのに差があると判定する率〕は9.5%から12.6%、四つ全部を重ねると60.7%、1%の厳しい基準でも21.5%。不正ではありません。論文に書かなければ現れない、というだけです。同じ論文は、報告20人・実際34人の学部生に音楽を聴かせ、父親の年齢を入れたときだけ効果が出る実演も並べています。
03追試すると効果は半分になり、残らない結果はそもそも書かれていなかった。2015年の再現性プロジェクトは、心理学の3誌の2008年の号から選ばれた100件を事前登録して追試しました。元の97件(97%)が有意で、追試でも有意は、その97件のうち35件(36.1%)。効果量〔研究どうしで比べられるようそろえた差の大きさ〕は元の.403から.197へ。2018年の報告は社会科学21件を2段階で追試し、有意13件(61.9%)、効果量は元の46.2%。2014年の報告では、実施された研究が全部記録に残る米国の助成事業の221件で、強い結果は帰無の結果より、出版で40、執筆で60パーセントポイント高い。段階は査読ではなく——「著者が、帰無の結果を書かず、投稿しない」。

動くのは、要約され、引用されていく途中です。落ちやすいのは3か所。
01「36%」を100件のうち36件と読むと、分母が消える。5つの指標が並んでいて、それぞれ分母が違います。「元の研究の97%が有意」は100件のうち97件。「追試で有意は36%」は、その97件のうち35件であって、100件のうち36件ではありません。「主観的な判定は39%」は100件のうち39件、「統合しても有意は68%」は75件のうち51件(偏りが無いと仮定した場合)、「元の効果量が追試の幅に入ったのは47%」は、73件の30件(41.1%)と22件の68.2%の合わせ技で、全体は47.4%。成否をよく予測したのは、元の証拠の強さでした。
02「全チームが互いに査読した」で止めると、手続きが総当たりに化ける。この研究は「全チームが互いの分析を査読している」と要約されがちです。原典の手続きは、総当たりではありません。相互評価は、結果を外した記述を無作為の順で配り、最初の3件に必ず講評を書かせるもの。受け取った講評は平均5.32チームぶん(標準偏差2.87)。専門家評価は、詳しいと自己申告した分析者に1〜3件を割り当てるもの(自チームは除外)で、1分析あたり平均2.55人。評価が高い分析も低い分析も、中央値は1.31と1.28。「事前登録をしていたとしても、この散らばりは防げなかっただろう」とも書かれています。
03「複数の情報源に当たれば確か」は、合流を数えない。この助言が壊れる仕組みを、引用の網で追った解析があります。2009年の論文は、ある医学的主張を支えるために242本の論文が付けた675の引用を分類しました。一次データへの214件の引用のうち94%が支持側へ流れ、弱めるか否定するデータを含む6本が受け取ったのは6%。支持を運ぶ経路の63%(13万9,391本)が、一次データを1つも報告しない1本の総説〔新しい実験データを載せない、まとめの論文〕を通っていた。否定的なデータは、「反駁も批評もされず、ただ無視されていた」。下位の主張(蓄積が先に起きる)を述べた27本の37引用のうち9件(24%)は、前後関係を何も述べない論文へ流れた。63%や94%とは、分母も対象も別です。3つの記事が同じことを言う状態は、1つの証拠が3回運ばれた状態でありうる——というのが、この号の読み筋です。

測られたのは、4リーグの試合記録、乱数の模擬実験と2つの実演、100件と21件の追試、助成事業の221件、242本の論文と675の引用。現場は英語圏の学術界の内側で、日本語圏の追試は、たどった範囲に入っていません。原典自身が範囲を断っています——「扱ったのは主張が信じられていく過程であって、その主張が正しいかどうかを確かめる実験は、一つも行っていない」。この号も、その当否には立ち入りません。
並べた6本のうち3本は、独立していません。29チームの研究・100件の追試・21件の追試の3件すべてに名前があるのは3人。29チームの研究と100件の追試には10人、21件の追試とは7人が重なります。3件とも同じ研究センターの連作。残る2本——研究の追跡と、引用の網の解析——だけが、この重なりの外。独立しているかを見よと言うために並べた資料自身が、その一部は独立していない。
同じデータで、20対9に割れた。
63%が、1本を通っていた。
次の3手も、研究が命じた順番ではありません。測られたのは、分析の散らばり、偽陽性率、追試の成否、引用の流れ方。出どころに札を付けたら何が起きるかを確かめた研究は、扱っていません。判定もしません。
TRY IT TODAY
- 01PICK
紙かメモアプリに、自分が正しいと思っていることを3つ書き出す。**医療や投資の判断は選ばないでください。**
- 02TAG
それぞれに、出どころの札を1つだけ付ける——(1)見出しやまとめ記事、(2)人から聞いた、(3)原典を読んだ。3件とも(1)でかまいません。
- 03CHECK
3つの出どころが同じ場所に合流していないかを見る。同じ人・同じ番組・同じまとめ記事なら「合流」と1行書いて閉じる。
確かめられたのは三つ。同じデータと同じ問いを29チーム・61人に配ると答えは20対9に割れ、そのばらつきは専門性でも講評でも説明されなかったこと。四つの選択肢を重ねれば、差の無いデータからでも偽陽性率は60.7%に達したこと。97件のうち追試で有意は35件、支持を運ぶ経路の63%が1本の総説を通っていたこと。手順は、どこにも書かれていません。書かれているのは、証拠が、作られる途中でも、残る途中でも、運ばれる途中でも、同じ向きに形を変えていたことまで。——今日残せるのは、正しいと思うことが3行と、出どころの札が3つ、合流していれば1行。記録が1件、残るだけです。
SECOND LAYER · FULL SYLLABUS証拠を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 効果量
- 差や関連の「大きさ」を、単位の違う研究どうしでも比べられるようにした共通の物差し。「効果があるか」ではなく「どれくらいか」を表します。
- オッズ比
- ある状態の「起こりやすさの関連」を表す倍率。1なら差なし、1より大きいほどその群で起こりやすい関連です(確率が何倍、という意味ではありません)。
- 統計的に有意
- 「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
- 中央値
- 全員を並べたときの、ちょうど真ん中の人の値。平均と違って、極端な値に引っ張られません。
- 標準偏差
- ばらつきの大きさを表す値。大きいほど、人によって結果がばらばらだったことを意味します。
