IN WAYS OF THINKING · ISSUE 189
● 12 SEC手順のほうは、たしかに引けます。当たらないのは日付です。1994年の論文で、カナダ・オンタリオ州の大学の卒業論文の最終学期にいた学生37人に、提出日を電話で聞きました。予想の平均は33.9日、実際は55.5日(t(32)=3.43、p<.002)。予想日までに終えたのは29.7%。日数の平均は分析できた33人ぶん、残る4人は打ち切り時点で未提出です。
同じ電話で、あと2つ。「可能なかぎりうまく運んだ場合」は27.4日、「悪く運んだ場合」は48.6日。実際は55.5日で、3つとも手前です。その日までに終えた割合は10.8%・29.7%・48.7%(この割合の分母は、原典に明示がありません)。
ただし「最悪を想定すれば足りる」とはなりません。悲観の48.6日と実際55.5日の差は偶然の範囲と区別がつかず(t(32)=1.03、非有意)、結論は"pessimistic predictions fared no better than their best estimates"(悲観的な予想は、最善の見積りより良くはならなかった)。差の絶対値は23.2日と22.6日(t(32)<1)。教示は偏りを減らし、正確さは上げていません。
逆算思考(backward planning)は、終点をひとつ置き、そこから手前へ「その直前に何が要るか」を繰り返す道具です。確かめられていない前提がひとつ——並びが正しければ、日付も正しい。
2016年の論文は自らを"the first empirical test"(最初の実証的な検証)と位置づけます。推奨が先に流通し、検証はあとから来ました。
設計の層も揃いません。無作為な割り付けの明記は2本だけ——1994年は5研究のうち研究4、2016年は4実験すべてで、残る行は電話調査、観察、完了した事業の集計です。割り付けのある行だけ「〜させた条件のほうが多かった」と書きます。

では、当てにいく手は何が測られているのか。この号がたどれたのは、3つです。
01思い出させるだけでは動かず、結びつけさせた条件だけが動いた。研究2は101人に1週間で終える課題を挙げさせ、終わったのは学業97人で37.1%、学業以外78人で42.5%。日数の平均は完了した91件と62件で、予想5.8日対実際10.7日、5.0日対9.2日。研究3の78人が申告した平均83.5%の確からしさは、間に合ったかどうかと関係していません。唯一の無作為割り付けの研究4は123人を3×2の6条件へ。思い出させただけでは統制と変わらず(5.3日対5.5日)、今回とどう関係するかまで答えさせた条件でだけ7.0日へ。終えた割合は29.3%・38.1%・60.0%(χ²(2, N=123)=7.63、p<.01)。
02逆向きに並べると予想は締切へ寄り、実際の日は動かなかった。2016年の4実験は並べる向きだけを変え、いずれも無作為割り付け。値は締切の何分前・何日前かの予想、逆向き/前向き/指定なしの順です。実験1(仮想)232人で31.01/42.90/44.89分前、実験2(仮想)136人で2.25/3.44/3.79日前。実験3は実際の課題、240人から93人を除いた147人が2.77/3.87/4.03日前。完了日まで記録した唯一の実験4は初回の187人が2.57/4.11/3.33日前、完了を報告した125人では予想2.82/3.91/3.00日前に対し実際に終えた日は2.64/1.98/1.79日前。予想と実際の有意差は前向き(t(42)=3.85)と指定なし(t(37)=2.85)だけ。
03中身を見るのをやめる手続きは、実務にひとつだけ落ちている。3つめの手は2008年の論文です。参照クラス予測〔似た計画が実際どうなったかの分布から見積もる手続き〕。実務での最初の適用は2004年のエディンバラのトラム2号線。2020年の英国運輸省の見直しでは、事業計画が固まる段階の上乗せは、鉄道が中央値19%・上位20%の水準で60%(355件、1964-2011年)、道路16%と47%(977件、1954-2019年)。〔上位20%の水準=参照した事業の8割がこの上乗せ以内〕。鉄道の平均は30%です。2008年時点は40%と57%ですが、参照クラスは46件から355件へ入れ替わっています。

数字そのものは動きません。動くのは、引用されていく途中のほうです。落ちやすいのは3か所。
01「最悪の場合を想定すれば直る」と読むと、原典の結論そのものが落ちる。幅を広げて悪いほうの数字を書く。この効き方を1994年の論文が測っています。3つの日付は、幅を広げるほど実際に近づきました。ところが予想と実際の差の絶対値は、悲観的にと言われたとき23.2日、正確にと言われたとき22.6日で区別がつきません(t(32)<1)。むしろ悲観の側がわずかに大きい。平均は近づき、1件ごとの当たりは良くなっていません。
02「上乗せは腕前と無関係」と読むと、原典が明示的に否定している側を引くことになる。「中身を見ないで決まる」までは原典どおり。「だから誰が作った計画でも同じ」を、原典は名指しで否定します。"Only if planners have historical evidence … would the planners be justified in using lower uplifts"(同僚より費用見積りが上手だと示す履歴的な証拠がある場合にかぎり、低い上乗せが正当化される)。下手だという証拠があればより高い上乗せを、とも続きます。退けられているのは、自分と他人の能力を推し量ることです。腕前についての主観的な自信のほうで、記録として示せる実績は、上乗せを下げる根拠になりえます。
03「逆算すれば当たる」と読むと、動いたのが予想だけだったことが消える。4実験とも予想は締切に近づき、実験4では逆向きでだけ差が偶然の範囲に収まりました。ただし一般考察の逐語はこうです——"Backward planning eliminated bias because it prompted later predicted completion times without a corresponding impact on actual completion times."(偏りを消したのは予想の完了時期を後ろへずらしたからで、実際の日に影響したからではない)。実際に終えた日の差(2.64/1.98/1.79日前)は偶然の範囲。動いたのは予想で、行動ではありません。実際の課題は実験3と4だけで、実験3では締切超過を予想した17人が除かれています。著者たちも、集団の場面で有効かは分からないと書きます。

全文まで読めたのは6点のうち5点。読めていないものについては書きません。2016年の実験の著者所属はカナダですが、参加者の国は原典に明記がありません。実施地はカナダと、国名の無いオンラインの募集だけで、日本での実施はありません。残る2本は交通インフラの事業記録で、独立してもいません。2004年の英国のガイダンスは2008年の論文の著者自身が作ったもので、2020年の見直しはその更新版です。
読めた範囲に、逆算そのものの効果を測った報告は、この4実験の外にありません。2023年の体系的レビューは、2020年に6誌へ載った全数695本から、手法を提案していた18本を調べています。よく引かれるのは「1本も無かった」ですが、無かったのは効果の測定ではありません——13本が有効性を、5本が現場での効き方を報告し、無かったのは証拠の連鎖のすべてを1本の論文が報告した例です。「効果が無い」という報告ではありません。
最悪の日付を、実際が越えた。
予想は動いた。日は動かなかった。
次の3手も、研究が命じた順番ではありません。見積りと実測を並べたとき何が起きるかを測った研究を、この号は扱っていません。「自分の過去の記録の分布から取れ」という助言もしません——研究4で思い出された「いつも終える時期」は締切の約1.3日前でしたが、原典は"they would have been far too pessimistic, on average"(平均としては、はるかに悲観的すぎる予想になっていただろう)と書いています。
TRY IT TODAY
- 01PICK
**直近で終わった作業を1件だけ**紙かメモに書く。自分の手元で完結したものにします。医療や投資の判断は選ばないでください。
- 02LOG
その下に数字を2つ。(1)着手前に見積もっていた所要時間、(2)実際にかかった時間。**片方しか思い出せなければ、そこで止めて構いません。**
- 03DIFF
2つの差を引き算して、数字を1つ記録する。マイナスなら**マイナスのまま。**残すのは作業名・見積り・実測・差の4つだけです。
確かめられたのは4つ。予想の平均33.9日に対し実際は55.5日で、「悪く運んだ場合」の48.6日ですら手前だったこと。悲観の教示は偏りを減らしたが正確さを上げず、誤差が23.2日と22.6日だったこと。過去と結びつけさせた条件でだけ、終えた割合が29.3%から60.0%へ動いたこと。予想は4回とも締切へ寄り、実際の日は違わなかったこと。締切から逆に数えるための手順表は、どこにも書かれていません。記録が1件、残るだけです。
SECOND LAYER · FULL SYLLABUS逆算思考を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 統計的に有意
- 「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
- p値
- 差がないと仮定したとき、偶然でこの結果以上が出る確率の目安。小さいほど偶然では説明しにくいことを表しますが、効果の大きさは表しません。
- 中央値
- 全員を並べたときの、ちょうど真ん中の人の値。平均と違って、極端な値に引っ張られません。
