IN BUSINESS PROCESS · ISSUE 222
● 12 SEC「小さく作って、測って、学ぶ。」手順の名前としては申し分ありません。この号が見るのは、その言い方を支える数字が原典まで戻るとどうなるか、です。
いちばん引かれるのは、新しい事業がうまくいかない原因の42%は誰も欲しがっていないものを作ったことだ、という割合。出どころは、ある調査会社の査読誌ではない自社調査です。更新日2026年3月5日の現行版を開くと、その項目がありません。走査すると、42%も市場ニーズに当たる語も0件。
並べたのは8つの文書——査読誌の論文4本(うち1本は要旨が違うので著者公開版と刊行版を別に)、会議録1本、それが指す報告1本、自社調査の2版です。
現行版の母集団は、2023年以降に公に畳んだベンチャー資本出資の431社。割合の分母は431社ではなく、理由が特定できた385社。複数回答のため合計は100%を超える、とも。
ところが報告書自身が、資本が尽きたの70%はほぼ常に最終的な死因で根本の問題ではなく、より多くを語るのは製品と市場の噛み合わせ(43%)・時期(29%)・単位あたりの採算(19%)だと書きます。数が多い項目と、主因に置かれた項目は別です。
では42%はどこに。2014年10月8日公表の旧版です。図の見出しは101件の事後の説明文にもとづく、最上段が市場ニーズが無い42%、2位が資金が尽きた29%。2018年2月の改訂版でも42%と101件はそのまま、本文は42%の事例で指摘されたと書き、生存者バイアスは確かにない、とも。読んだのは畳んだ会社の説明文101件、続いている会社の分は集計の外——というのが、この号の読み筋です。

同じ画面を二通り用意して無作為に分けた相手へ同時に出し、決めた指標で差を見る記録です。取り出すのは三つ、当たる割合、散らばり方、途中で覗いたとき。
01狙った指標を改善したのは3分の1だけ——測ったのは、別の報告。2013年の KDD 会議録(査読誌ではありません)。米国だけで月約1億人・32億件超の検索、同時に走る実験は200超という規模です。「ある大手ソフトウェア企業で試されたアイデアのうち、狙った指標を改善したのは3分の1だけだった」——参照番号が指すのは2009年の別の報告。この会議録の測定ではなく、到達していないので中身は書きません。同じ段落の約10%・80%・90%・3分の1くらいも他所の数字。最後に、どの領域もこれほど悪い数字なわけではない、という例外節。
021,450件は、四つの制限を通した分析標本。分布の裾は厚い。2020年の論文 Journal of Political Economy(査読誌)。読めたのは著者公開版(2018年4月30日初版・2019年8月9日版)、刊行版は未到達。基盤が2013年1月〜2016年6月に走らせた実験のうち、均質な領域・基本の模型に近い実験・米国市場・利用体験の領域という四つの制限を通した1,450件が分析標本。全実験ではありません(対象者平均1,944万人・200万5,051〜1億2,583万7,134人、期間平均10.84日・7〜28日、差の平均−0.001%・−0.220%〜0.283%、有効確率0.52、確かめた観測の50%に懸念)。裾は厚く、多くはゼロの近く、端の数件が形を作る。上位2%が利得の74.8%は生の集計ではなく、採用の運用を仮定して推定値を縮めた推計値です(80対20の極端な版)。
03途中で覗きながら止めると、ふつうのp値と信頼区間は信頼できない。2022年の論文 Operations Research(査読誌)。読めたのは抄録まで。「利用者が検定を継続的に監視して標本の大きさを選ぶなら、ふつうのp値と信頼区間による推測は全く信頼できない。」提案は、常に妥当なp値と信頼区間。倍率は抄録にも読んだ範囲にも無いので書きません。数十万件を分析した基盤に実装、とありますが実装の記述です。

2009年の総説 Data Mining and Knowledge Discovery(査読誌)は全文まで読めました。統制実験は因果関係を確立する最良の科学的設計だと書く一方、効き目は私たちの経験によれば、に変わります。効果の証拠を背負わせる文ではありません。この総説・2013年の会議録・その指す2009年の報告は第一著者が同じ、2020年にも2013年と共通の著者が1人。独立した別々の証拠ではありません。
1998年の論文 Management Science(査読誌)は集積回路の設計を比べ、試作を多く反復する方式が人月で2.2倍上回り、差の43%超が実験の進め方の違いに帰せられると報告します。開発期間ではありません。国名も件数も抄録に印字が無く、読めたのは抄録までです。
01「3分の1しか当たらない」——書いた報告が測った数字ではない。一文が会議録に実在することも、参照番号が別の報告を指すことも確かめました。だから、その会議録が測ったとは書けません。最後の例外節を落とすと、あらゆる職場に当てはまる話に化けます。
02「小さく試し続ければ少しずつ良くなる」——結論には条件が付く。平均改善率を出しても、どの1件も表しません。2020年の論文は、裾が非常に厚いとき、より多くの着想を小さめの標本で試すほうがよいと結びます。そのすぐ前には、裾がそれほど厚くないのなら少数の大きな実験が最適だ、と逆側が置かれています。
03「失敗の原因の42%」——落ちるのは数字ではなく、分母と版。説明文が集められ、分類され、割合が原因と呼ばれ、母集団の記述が落ちる——101件か、431社か、385社か。逆向きにはまず動きません。どれも査読誌ではありません。

全文まで読めたのは8つのうち5つ——2020年の著者公開版、2013年の会議録、2009年の手引き、現行版と旧版。抄録までが2つ(2022年・1998年)、未到達が1つ(2009年の報告)。読めていないものの中身は書いていません。著者公開版の要旨の「きわめて厚い裾を見出した」は刊行版に無い(1件と0件)。
無作為な割り付けがあるのは画面を出し分けた実験(2013年・2009年・2020年・2022年)、1998年は設計どうしの比較で抄録に記述は無く、調査会社は説明文の分類。同じ強さの証拠として並べられません。人ひとりの手際を測ったものは1本もありません。国名の印字は2か所だけ、2013年の米国だけでという行と、2020年の米国市場への制限。8つのどれにも日本の印字はありません。
測られた効果の分布は裾が厚い。多くの実験は差がとても小さく、一握りが大きな利得を示す——2020年の著者公開版。
「資本が尽きた」の70%はほぼ常に最終的な死因であって、根本の問題ではない——調査会社の現行版。
次の3手も、研究が命じた順番ではありません。測られたのは、手元の1件ではない。確かめに行きません。訊きにも行きません。判定もしません。
TRY IT TODAY
- 01WRITE
今日、**確かめずに前提にしていたこと**を1つ、紙かメモアプリに書く。この手順のほうが速い、あの人はもう知っている——その程度でよい。日付も。
- 02PAIR
その隣に、**これを確かめるなら何を見るかを1行だけ**書く。書くのは見る先の名前だけ(時刻・件数・返事など)。思いつかなければ、そう書く。
- 03MARK
最後に、比べる相手が手元にあるかないかを、ありかなしの2文字で書く。判定も割合も出しません。4点が残れば終わり。
年代順に。1998年、人月2.2倍・差の43%超。2009年、実務の手引きと、のちに3分の1として引かれる報告(未到達)。2013年、会議録が引く。2014年、101件の説明文と42%。2020年、四つの制限を通した1,450件。2026年、42%は消え、431社・385社に。28年で細かくなったのは、条件のほうでした。
確かめられたのは四つ。3分の1の一文は会議録に実在するが、測ったのは未到達の別の報告。1,450件は四つの制限を通した分析標本で、上位2%が74.8%は縮小をかけた推計値、たくさん試すほうがよいは裾が厚いときの条件つき。途中で覗くとp値と信頼区間は信頼できず、倍率は範囲外。42%は2014年の版の数字で、現行版に項目ごと無く、分母は431社ではなく385社。今日残せるのは判定ではありません。
SECOND LAYER · FULL SYLLABUS実験・検証サイクル(Build-Measure-Learn)を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 95%信頼区間
- 推定値の「ばらつきを見込んだ幅」。同じ研究を何度もやり直したら、結果の多くがこの幅に収まると期待できます。幅が0(差なし)をまたぐときは、明確な差とは言い切れません。

