IN DATA · ISSUE 539
● 12 SEC「計算の式より、経験を積んだ人の勘のほうが確か」。そう思いがちです。この号は、統計の式と人の判断の当たり具合を比べた研究と、人が式の予測をどう受け止めるかの実験を、6点で確かめます。2点は研究を束ねたメタ分析、1点は総説的な論文、1点は学術書、2点は実験の研究です。元の分野は、医療・臨床心理の研究と、採用・入学の選抜の研究です。
先に向きを言うと、平均では統計の式が人の判断を上回ることが多く、しかし人は式の誤りを見ると避け、素人は式の助言に従いやすく、専門家は頼らずに精度を落としていました。この号は、予測を式に任せるべきかを勧めることも、心や健康の判断に当てはめることもしません。
予測モデルは、過去の数字から決まった手順で次を見積もる仕組みです。凝った機械でなくても、いくつかの数字を決まった重みで足す式もその仲間です。研究では、決まった規則で材料を組み合わせるやり方を「統計的」「機械的」、人が材料を見渡して総合判断するやり方を「臨床的」と呼び、二つの当たり具合を比べてきました。

比べる試みは古く、1954年の学術書は当時の研究を概観し、16〜20の比較のうち1つを除いて、統計の側の予測はほぼ同等か上回っていたとまとめました。1989年の総説的な論文は、診断や治療計画の場面を念頭に、二つを比べた研究は統計的な方法が優れていることを示すと整理しています。
01採用と入学の予測では、職務成績との相関が式で.44、人の判断で.28だった。2013年のメタ分析は、同じ材料を式で組むか人が総合判断するかを比べました。職務成績では9研究を束ね、補正した母集団の相関(0なら無関係、1に近いほどよく当たる)が.44対.28で、予測の改善は50%を超えると報告。最も厳しい見積もりでは2つの基準で差が消えましたが、逆転はしていません。
02心の健康の専門職の予測では、最も厳しい48の効果量で、統計の正確さが13%上回った。2006年のメタ分析は、56年分の67研究から92の効果量を集め、全体では統計の方法がやや正確でした。最も厳しい48の効果量のうち、統計が上52%・差なし38%・臨床が上10%。予測の対象は自殺の危険・暴力・治療への反応などで、元の分野は医療・臨床心理の研究です。
03専門家が判断した研究では、差がはっきりしない結果もあった。同じ2006年の分析で、判断者が課題の専門家だった7研究の効果量は-.05(0に近いほど差が小さい)で、信頼区間が0をまたぎ、明確な差とは言えませんでした。専門家でない41研究では-.12で差がありました。一方、2013年の分析は、職務や組織を知る専門家が組んでも予測の力が落ちたと書いています。

以下の三つは、人が式の予測をどう受け止めるかを調べた2本の実験の結果です。2015年の実験は大学の研究室とオンラインで、大学院の入学者の成績や州の順位を当てる課題を使いました。2019年の実験は6本からなり、素人と、予測を仕事にする専門家を比べています。どちらも心や健康の予測ではありません。
01式が人より当たるのを見ても、外れるのを見た人は式を選びにくくなった。2015年の5本の実験で、式の予測ぶりを見た参加者は式への自信を下げ、劣る人の予測者を選びやすくなりました。同じ誤りでも式のほうに早く自信を失うためと著者らは説明し、“even when they see them outperform a human forecaster”(式が人を上回るのを見たときでさえ)と書きます。
02素人は、同じ助言でも、人からより式からと聞くほうが従いやすかった。2019年の実験では、見た目の推定、曲の人気や相手への好意の予測で、素人は式の助言により従いました。研究者たちは逆の結果を予想していました。ただしこの選好は、式の見積もりを他人の助言ではなく自分の見積もりと比べるときには弱まりました。
03予測を仕事にする専門家は、素人より式に頼らず、精度を落とした。同じ2019年の研究で、日ごろ予測をする専門家は式の助言に素人ほど頼らず、著者らは “which hurt their accuracy”(それが正確さを損なった)と書きます。この研究が示したのは素人の従いやすさと専門家の頼らなさで、頼りすぎの害ではありません。

シラバス側の看板には、モデルは環境が変わると劣化する、という柱もありました。全文まで読めた4点(1点は全文検索)にそれを確かめた記述は無く、要旨まで読めた2点の要旨にもありません。2013年の分析の著者らはむしろ選抜の文脈で、状況が変わると式が合わなくなるという反論に “there is no empirical evidence supporting this scenario in the literature”(文献にこの筋書きを支える実証はない)と答えています。
束ねた研究の中心は採用・入学と心の健康の専門職の予測、実験は研究室とオンラインの参加者です。日本の小さな店の需要や仕入れの見積もりを調べたものではありません。全文まで読めたのは6点のうち4点で、読めていないものについては書きません。
実験では、人より当たる計算も、
外れるのを見ると、
選ばれにくくなった。
シラバス側の看板は、予測モデルは平均では人より正しいが、避けすぎ・頼りすぎ・劣化で正しさは条件づきになる、というものです。6点で支えられるのは、平均では式が上回ることが多いこと、人は式の誤りを見ると避けること、素人は従い専門家は頼らないことまでで、頼りすぎと劣化はこの6点からは運べません。
TRY IT TODAY
- 01DATE
今日の日付と、自分の商いで勘で見積もっている数字を一つ書く(来月の来客数、次の仕入れの量、頒布の部数など)。
- 02LOG
同じ数字を、決まった計算でも見積もって隣に書く(直近3か月の平均、前年同月の値など)。結果が出たら、実際の値とそれぞれの差を書き足す。
- 03SORT
数回分がたまったら、勘が近かった回と計算が近かった回を数え、対象ごとに「安定した数字」「変動の大きい数字」の印をつける。良し悪しは決めない。
この号が運べたのは二段です。臨床心理や採用・入学の予測を束ねた研究で、平均では統計の式が人の判断を上回ることが多く、専門家の判断では差がはっきりしない結果もあったこと。そして実験で、人は式の誤りを見ると避け、素人は式の助言に従いやすく、専門家は頼らずに精度を落としたこと。どの見積もりをどこまで式に委ねるかは、この6点のどれも答えていません。次の号は、AIに仕事を任せることを扱います。
SECOND LAYER · FULL SYLLABUS「予測モデルを業務に使うには?」を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 効果量
- 差や関連の「大きさ」を、単位の違う研究どうしでも比べられるようにした共通の物差し。「効果があるか」ではなく「どれくらいか」を表します。
- 95%信頼区間
- 推定値の「ばらつきを見込んだ幅」。同じ研究を何度もやり直したら、結果の多くがこの幅に収まると期待できます。幅が0(差なし)をまたぐときは、明確な差とは言い切れません。
- メタ分析
- 同じテーマの研究をたくさん集めて統合し、平均的な効き目を推定する方法。1本の研究より安定しますが、集めた研究の質と偏りに左右されます。
