IN SOURCING & SUPPLY · ISSUE 305

(仮ビジュアル)暗い寝室で、白い枕に頬をつけて目を閉じ、白い掛け布団にくるまって眠っている女性を横から写した写真● 12 SEC
Visual: ALIFE Editorial

「機械学習を入れれば、需要は当たるようになる。」この号が見るのは当てる腕ではなく、同じデータを大勢に配り、同じ物差しで順位を付けた公開の競技が何を出したか、です。

需要予測〔過去の実績から、これから必要になる量を見積もること〕を測ってきたのは、M競技と呼ばれる公開競技。同じ時系列を全員に配り、多数の手法を同じ土俵で走らせ、決めた指標で順位を付けます。競わせているのは手法で、会社ではありません。

扱うのは6本。うち4本は同じ筆頭著者で、独立した6つの検証ではありません。

出発点は2000年。International Journal of Forecasting 16巻4号のM3競技の報告で、対象は3,003本の時系列。よく引かれる結論はM3の新発見ではなく、先行するM競技の四つの主要な結論がこの3,003のデータにも当てはまるかを見た再確認の節です。

その第1項——"Statistically sophisticated or complex methods do not necessarily produce more accurate forecasts than simpler ones."(高度あるいは複雑な手法が、より単純なものより必ずしも正確な予測を出すわけではない)。上位2手法の追加の改善は全18期間の平均で約0.5%(1%の半分)。sMAPE〔対称平均絶対百分率誤差。小さいほど誤差が小さい〕が約13%なので、sMAPEにして約4%の改善。ただし、高度な手法のどれも良い成績を出さない意味ではない、とも。

芯は第2項です——"The rankings of the performance of the various methods vary according to the accuracy measure being used."(各手法の成績の順位は、使う精度指標によって変わる)。測り方が違えば、同じ予測でも良し悪しが入れ替わります。

(仮ビジュアル)薄暗い部屋の黒枠の大きな鏡の前で、黒いローブ姿の女性が鏡に映った自分と静かに向き合っている写真
2000年のM3競技は3,003本の時系列。結論の二つ目は、順位は使う精度指標によって変わる、でした。 Visual: ALIFE

では、機械学習を入れたら。同じ土俵で三度測られ、三度の答えは同じ形をしていません。

012018年の論文は、M3の月次1,045系列で機械学習が統計手法8種に劣ったと報告した。PLOS ONE 13巻3号。二つの精度指標のいずれでも、調べたすべての予測期間でも劣位。指標はsMAPEとMASE〔平均絶対スケール誤差。1より小さければ、季節つきの素朴な予測より誤差が小さい〕。計算資源もかなり大きい、と。対象はこの部分集合の単変量予測に限られます。

02同じ年のM4の報告は、17手法のうち12が「組み合わせ」だったと抄録に書いている。34巻4号。到達できたのは公式の抄録までで、本文は購読の壁の向こうです。逐語は"Out Of the 17 most accurate methods, 12 were 'combinations' of mostly statistical approaches."(最も正確だった17の手法のうち12は、主として統計的な取り組みの「組み合わせ」だった)。六つの純粋な機械学習はどれも、その組み合わせのベンチマークより正確ではなかった、とも。12/17は手法の本数の比で、参加者の割合ではありません。

032020年のM5では、いちばん強い目安を上回れたのは5,507チームのうち415(7.5%)。材料は米国の小売の日次の販売数量。3,049品目・10店舗の約5.4年ぶん、42,840本の系列を28日先まで。参加は101か国7,092人・5,507チーム。素朴な目安を上回れたのは2,666チーム(48.4%)、季節を考えた素朴な目安では1,972チーム(35.8%)、いちばん強いベンチマーク〔指数平滑をボトムアップで積み上げた目安〕では415チーム(7.5%)。大半はその目安に13%超の差で下回られ、優勝チームの改善は22.4%。

(仮ビジュアル)ベージュの空間で、黒い石の細長い天板を、灰青のガラス・銀の金属・赤い漆という3本の異なる脚がそれぞれ支えているコンソールテーブル
月次1,045系列で統計手法に劣位・17手法のうち12が組み合わせ・5,507チームのうち415チーム。まず測られたのは、この三つの回。 Visual: ALIFE

その前に、物差しのほうです。2005年11月2日付の作業論文は、M競技とM3競技で使われた指標の多くが、よく起こる状況で退化すると論じました——ゼロで割れば無限大、ゼロをゼロで割れば未定義。代わりの提案が平均絶対スケール誤差です。

この二つはつながっています。M5が順位付けに使ったWRMSSE〔12の集計水準を同じ重みで足す誤差の指標〕は、その作業論文が提案したMASEの変種。測る側の論文と、測られた競技は地続きでした。だから「7.5%」は、どの指標で、どの分母について数えた割合かと一緒に読む必要があります。

01「機械学習を入れれば当たる」——そう単純でもなく、「役に立たない」でもない。値切りの側は、2018年の劣位の報告と、M4の抄録が、六つの純粋な機械学習はどれも組み合わせのベンチマークより正確ではなかったと書いていること。ただし反対側へ振り切ると、M5を落とします。優勝チームは22.4%上回り、原典の言い方は、機械学習は予測の応用の主流に入った、少なくとも小売の販売予測という領域においては。名前だけでは順位が決まりません。

02「7.5%しか勝てない」——分母は参加チーム。どの提出を数えるかで12.2%に変わる。7.5%の分母は参加チーム5,507。予測した回数でも品目でもありません。原典の但し書き——"these numbers refer to the forecasts selected by each team for the final evaluation of their performance and not to the 'best' submission made per case while the competition was still running."(これらの数字は、各チームが最終評価のために選んだ予測についてのもので、競技中の「最良の」提出についてのものではない)。後者なら、同じ順に3,510(63.7%)・2,685(48.8%)・672チーム(12.2%)。同じ競技、同じ参加者で7.5%と12.2%が並びます。415チームのうち249は5%超の改善。「誰も勝てなかった」ではありません。

03「精度が上がれば費用は下がる」——原典自身が、精度は運営費用と直結しないと書く。逐語で。——M5精度競技のもう一つの限界は、点予測の精度に焦点を当てたことであり、それは対象企業の基盤にある運営費用と直接には結びついていない。精度のわずかな改善が在庫保有の削減につながりうることは経験的に見出されてきたが、その翻訳は自明ではない。順位は出た。金額は出ていない。

(仮ビジュアル)縦に3分割された写真。左は乱れた寝具のベッド、中央は窓の外へ目を向ける女性、右は玄関の床に脱ぎ置かれたコートと鍵
手法の名前では決まらない・7.5%の分母は参加チーム・精度は費用に翻訳されていない。読み違えるのは、この三か所。 Visual: ALIFE

全文まで読めたのは6本のうち5本。読めていないものについては書きません。材料は公開競技の時系列と、米国の小売の日次の販売数量。これから出す新しい商品は、この土俵に乗っていません——訓練に5年を超えるデータがある品目しか入らないからです。逆に、ゼロの多いまばらな需要の系列は焦点に入っています。所見はデータが覆う領域を超えて一般化できない、とも原典自身が書きます。

方法をめぐる論争も残ります。2015年に Journal of Business Research 68巻8号へ出た総説は——"found 97 comparisons in 32 papers. None of the papers provide a balance of evidence that complexity improves forecast accuracy. Complexity increases forecast error by 27 percent on average in the 25 papers with quantitative comparisons."(32本の論文に97の比較。複雑さが精度を高めるという証拠の均衡を示した論文は一つも無く、定量的な比較のある25本では、複雑さは予測誤差を平均で27%増やしていた)。ただし単純さを主張する側の総説で、どの比較を含めるかの判断は著者ら自身のもの。どちらかを「正しい値」にはしません。

点予測の精度は、運営の費用と直接には結びついていない。
誤差の減りを費用の節約へ訳すことは、まったく自明ではない。

だから次の3手も、研究が命じた順番ではありません。見積もりの根拠と外れの向きを書き出したとき何が起きるかを確かめた研究は、この号にはありません。ここからはALIFEが提案する実践の入口です。

TRY IT TODAY

  1. 01LIST

    紙かメモアプリに、いま**「だいたい何個くらい」と見積もって用意している品目を三つ**書き出す。材料でも消耗品でも、席や枠の数でも。

  2. 02WHY

    その三つそれぞれに、**何を根拠にその数にしたかを1行**添える。思い当たらなければ「根拠は思い出せない」と書いて先へ進みます。

  3. 03SIDE

    各品目について、**外して困るのはどちらか——切らすほうか、余らせるほうか**を一言書き、理由を1行。どちらとも言えないなら、そう書きます。

5分。採点はありません。仕入先や同僚を評価する課題でもありません。誰にも見せず、提出もしません。**この記録は、発注量を決め直す根拠にも、契約や取引を見直す材料にも使えません。**苦しいときは、この課題より先に相談できる相手へ。

年代順に。2000年、高度な手法が単純な手法より必ずしも正確ではないと再確認され、順位は精度指標で変わるとも書かれた。2005年、それまでの指標の多くは無限大や未定義になりうると論じられた。2018年、機械学習が月次1,045系列で統計手法8種に劣位。同年のM4では17手法のうち12が組み合わせ。2020年のM5では機械学習が上位に立ち、優勝は22.4%改善。いちばん強い目安を上回れたのは5,507チームのうち415。

そして、重なりです。4本は同じ筆頭著者、うち3本は同じ3人の共著、2018年の1,045系列は2000年の3,003系列の部分集合、M5の指標は2005年の作業論文が提案した指標の変種。独立した6つの検証が同じ結論に集まった形ではありません。独立していたのは2015年の総説1本だけ。今日残せるのは、三つの品目と、その根拠と、外れて困る向き。記録が1件、残るだけです。

SECOND LAYER · FULL SYLLABUS「需要を予測するには?」を、もっと深く学ぶ。→

Next in sourcing & supply

VIEW ALL
ISSUE 304同じ由来に、四つの数があった。ISSUE 30610%は、著者が仮に置いた数字。
ALIFE · ISSUE 305

本コンテンツは学習目的であり、診断や治療の代替ではありません。