IN DATA · ISSUE 535
● 12 SEC「統計で差が出たのだから、意味のある差だ」。そう受け取りたくなります。この号は、統計の検定で出る p値の読み方を、6点で確かめます。1点は米国統計学会の声明、1点は誤解を並べた解説、1点はモデルで論じた論考、1点は短報、1点は論文の p値を集めた分析、1点は800人超が署名した論説です。
先に向きを言うと、声明はp値は差の大きさも、結果の重要性も測らないと表明しました。声明は研究の結果ではなく、専門家の合意をまとめたものです。この号は、店の数字の判定の仕方を勧めることも、科学論文をめぐる話を日本の小さな店にそのまま当てはめることもしません。
p値は、ある統計のモデルを仮定したとき、観察した差と同じか、より極端な差が出る確率です(声明の略式の定義)。仮定が成り立つなら、小さいほどデータはそのモデルと合いません。2016年の声明は原則5で “A p-value, or statistical significance, does not measure the size of an effect or the importance of a result”(p値や統計的有意性は、効果の大きさも結果の重要性も測らない)と書きました。

同じ原則は、どんなに小さな効果でも、標本が大きいか測定が精密なら p値は小さくなりうる、逆に大きな効果でも標本が小さければ目立たない p値になりうる、と続けます。問題は、「差が出た」という一語が、差の大きさや重要性の代わりに読まれやすいことです。
01p値は、差の大きさも結果の重要性も測らない(声明)。2016年の声明の原則5です。統計的有意は科学的・人間的・経済的な重要性と同じではなく、p値が小さいほど効果が大きいとも、大きいほど重要でないとも言えないとします。声明は、学会の理事会が幅広い立場の専門家を集め、議論を重ねてまとめた合意です。
02仮説が正しい確率も、偶然だけで生じた確率も測らない(声明)。原則2です。p値は、ある仮の説明に照らしたデータについての言明で、説明そのものについての言明ではないと声明は書きます。2016年の疫学の雑誌の解説も、p値を仮説が正しい確率と読む誤りを、25の誤解の目録の1番目に挙げました。
03「差あり」と「差なし」の差は、それ自体「差あり」とは限らない(短報)。2006年の短報は理論上の例で論じます。推定値25・標準誤差(ぶれの目安)10の研究は1%水準で有意、10・10の研究は有意でない(明確な差とは言えない)。それでも両者の差は15・標準誤差約14で、有意にほど遠いと著者らは書きます。

以下の三つは、「差あり」というラベルが思うほど頑丈な保証ではないことを扱った文書です。性格はそれぞれ、モデルによる論考、論文の p値を集めた分析、署名つきの論説で、どれも科学論文の世界の話です。店の数字を調べたものではありません。
01発表された知見の多くは偽でありうると、モデルで論じた。2005年の論考は医学の雑誌に載った方法論の論文で、研究や効果が小さい、設計や解析の自由度が大きいといった条件で、知見が真である見込みは下がるとモデルと模擬計算で論じました。実データの集計ではありません。2022年に表の数式の括弧を直す訂正が出ています。
02p値の分布に、基準へ寄せる操作の跡が広く見えた。影響は弱い。2015年の分析は、医学・生命科学の公開論文から p値を機械的に集め、有意になるまでデータや解析を選ぶ p-hacking が広いと報告しました。一方で著者らは “its effect seems to be weak relative to the real effect sizes being measured”(影響は本当の効果の大きさに比べ弱いようだ)と書き、メタ分析の合意を大きくは変えないだろうとしています。
03800人超の署名つきの論説が、重要かもしれない効果の切り捨てをやめるよう求めた。2019年の論説は研究ではなく意見の表明で、リード文は “call for an end to hyped claims and the dismissal of possibly crucial effects”(誇張された主張と、重要かもしれない効果の切り捨ての終わりを求める)です。読めたのはリード文と冒頭の一文までです。

声明自身、統計の実践の問題をすべて解くものでも “nor to settle foundational controversies”(根本の論争に決着をつけるものでもない)と断っています。原則3は、科学の結論も事業や政策の判断も、p値が一定の線を越えたかだけで決めるべきではないとしますが、代わりにどの数字を使うかは定めていません。
6点はどれも科学論文の読み方をめぐるもので、日本の小さな店の売上やアンケートを調べたものはありません。p-hacking の広がりは医学・生命科学の論文の p値からの推定で、影響は弱いと著者らが書いています。全文まで読めたのは6点のうち5点で、読めていないものについては書きません。
声明は、p値が
差の大きさも結果の重要性も
測らないと表明した。
シラバス側の看板「有意と重要は別物、p値は差の大きさも仮説の真偽も測らない」は、声明の原則5と原則2の文そのものに支えがあります。ただし声明は研究ではなく合意です。「有意でなかったから差はない」という読みは、2016年の解説が誤解の一つとして退けています。
TRY IT TODAY
- 01DATE
今日の日付と、最近「差が出た」または「差が出なかった」と受け取った出来事を一つ書く(先月と今月の売上、二つの告知の反応、アンケートの点数など)。何の差かを一言添える。
- 02LOG
その差について、大きさ(どれくらいか)・重要性(自分の商いにとって意味があるほどか)・確かさ(たまたまの揺れではないとどこまで言えそうか)を一言ずつ書く。
- 03SORT
三つのうち、言葉にできたものに「書けた」、できなかったものに「書けない」の印をつける。有意かどうかの判定や、採用するかどうかは決めない。
この号が運べたのは三段です。2016年の声明が、p値は差の大きさも重要性も、仮説が正しい確率も測らないと表明したこと。2006年の短報が、境目の内と外の差そのものは有意とは限らないと論じたこと。2015年の分析が p-hacking の広がりを報告し、同時に影響は弱いと書いたこと。次の号は、定性と定量を組み合わせます。
SECOND LAYER · FULL SYLLABUS「差の意味を確かめるには?」を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- メタ分析
- 同じテーマの研究をたくさん集めて統合し、平均的な効き目を推定する方法。1本の研究より安定しますが、集めた研究の質と偏りに左右されます。
- 統計的に有意
- 「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
