IN MARKETING · ISSUE 358
● 12 SECクリックの数も、そのあとの購入の数も、管理画面にきれいに並びます。数字が出ているのだから、効いたかどうかは分かる——そう読みたくなります。ところが、広告を見た人という集団は、最初から偏っています。
広告を見た日は、検索も閲覧も買い物も、何もかもが増えています。見た人のほうがよく買っていたとしても、増えていたのは買い物だけではなかったのかもしれません。この号は、どの広告を出すべきかも、いくら使うべきかも書きません。測り方の設計と、その落とし穴だけを見ます。
コンバージョンとは、購入・申込み・来店など、狙った行動が実際に起きることです。アトリビューションとは、その行動に、どの広告・どの接点がどれだけ効いたかを割り当てる作業のこと。「広告の効果を測る」と言うとき、たいていこの割り当てを指しています。そして、この割り当てが、思っているよりずっと難しい。

測り方は、大きく二つに分かれます。ひとつは、広告を見た人と見ていない人をあとから比べるやり方(観測データ)。もうひとつは、対象をくじ引きのように二群へ分け、片方だけに広告を当てる無作為化した実験です。この二つが同じ答えを返すのかを、実際に突き合わせた研究があります。
01同じ広告で、実験は5.4%、観測法は871%以上だった。2011年の国際会議の予稿は、3つの統制実験を使って観測データの推定を検証しました。大手サイトのトップページに1日だけ出た広告で、関連キーワードを検索した人の数の押し上げは5.4%(0.05水準で有意)。同じ場面を、対照群を使わず露出者と非露出者の比較で推定すると——“our estimates of search lift ranged from 871% to 1198%, all of which differ wildly from the truth.”(推定は871%から1198%にわたり、いずれも真実から大きく外れた)。彼らはこの偏りを活動バイアスと名づけています。
02160万人の実験でも、検出力は低いと著者は書いた。2014年の研究は、1,600,000人を無作為に二群へ分け、オンライン広告が実店舗を含む売上に与える効果を測りました。著者ウェブサイト版の要旨は、購買が5%増え、その93%が実店舗で、78%は広告をクリックしなかった人だと書いています。そのうえで同じ版の本文は——“The high variance in the individual data implies surprisingly low power for our statistical tests.”(個人データの分散が大きく、検定の検出力は驚くほど低い)。検出力は、本当に差があるときにそれを統計的に見つけ出せる見込みのことです。
03663件の実験に当てても、近道は答えに届かなかった。2022年に公開され2023年に学術誌へ載った研究は、663件の大規模実験を使い、機械学習による手法(DML)と傾向スコアの層化マッチング(SPSM)が実験の答えを再現できるかを調べました。実験側の押し上げの中央値は29%・18%・5%(見込み客に近い側から購入に近い側へ)。同じものを近道で推定すると83%・58%・24%と173%・176%・64%でした——“Although DML performs better than SPSM, neither method performs well”。

自分がいま、どちら側の数字を見ているのか。日常の言い方に、手がかりが出ます。
01クリックの後の購入を、広告の成果として数えている。2011年の3つの統制実験が突いたのは、ここでした。ネットでよく動く人は広告にも当たりやすく、同時に買い物もよくする。クリックの後に購入があったことは、クリックが購入を生んだことを意味しません。その研究で、対照群を使わない推定は真の値から大きく離れました。
02数字が出ていることを、正しく測れたことだと思っている。2018年の短い反論は、2017年の3つの調査に的を絞り、利用者が条件へ無作為に割り当てられていないことを指摘しました。報告された相対的な増加の95%信頼区間は[25%, 90%]・[9%, 58%]・[5%, 27%]。25%・9%・5%の偏りがあれば、効き目に差がなくてもこの結果は説明がつく、というのが指摘の中身です。
03数えられない仕掛けを、効かなかった側に入れている。ここで引いた実証は、大量に配信されるオンライン広告と、テレビ広告の場面で採られたものです。手渡しのチラシ、店頭の声かけ、常連への一言は、そもそもこの種の研究の視野に入っていません。数えられていないことは、効いていないことではありません。

大規模にきちんと測れた研究もあります。2021年の計量経済学の専門誌の研究は、288ブランドのテレビ広告について、弾力性と採算を推定しました。公式の要旨は——“The ROI analysis shows negative ROIs at the margin for more than 80% of brands”(限界的な出稿のROIが、8割を超えるブランドでマイナス)。続けて、観察された出稿計画の全体のROIが正だったのは3分の1のブランドで、弾力性はこれまでの文献より実質的に小さいとも書かれています。
ただし、これはテレビ広告の288ブランドについての推定で、この号が読めたのは公式の要旨までです。そして、ここまでの数字を自分の商いへそのまま持ち込むことはできません。この号は、出稿をやめるべきだとも、増やすべきだとも書きません。言えるのは、測り方の設計しだいで、同じ出稿が「効いた」にも「割に合わない」にも見える、ということまでです。この号が使った研究は5つ。全文まで読めたのは4つで、読めていないものについては書きません。
測れることと、正しく測れることは、
別のことでした。
2011年から2023年にかけて確からしくなったのは、「広告の効果は簡単に測れる」という側ではありませんでした。素朴に測ると過大に見え、正しく測るには桁違いの人数が要り、近道は実験の答えに届かない——それぞれ別の研究が、別の場面で、別の向きから示しています。測定の技術が進むほどはっきりしてきたのは、測るのが難しい、ということのほうでした。
TRY IT TODAY
- 01PICK
過去に「効いた」と感じた自分の告知を一つ選び、今日の日付と一緒に書く。
- 02LIST
そのとき見た数字を書き出す。クリック・反応・購入・来店など、手元に残っているものだけでよい。
- 03TEST
「広告がなくても、その人たちはどのみち買っていた」でも同じ数字になるかを、一行で書く。成り立つなら、その数字は効果の証明にはなっていないと添える。
管理画面は、いつでも何かの数字を返してきます。返ってきた数字が、広告のおかげだったのか、それとも最初からよく買う人を数えていただけなのか。2011年の3つの統制実験が示したのは、対照群がなければそこを見分けられない、ということでした。測りやすい仕掛けほど数字になりやすく、数えにくい仕掛けは数字にならない。だから、いちばん静かに効いていた販促はたいてい数えられていない——というのが、この号の読み筋です。
SECOND LAYER · FULL SYLLABUS「広告の効果を測るには?」を、もっと深く学ぶ。→HOW TO READ THE NUMBERS数字の読み方+
この号に出てくる統計の言葉です。数値は原典のまま、意味だけをほどいています。
- 95%信頼区間
- 推定値の「ばらつきを見込んだ幅」。同じ研究を何度もやり直したら、結果の多くがこの幅に収まると期待できます。幅が0(差なし)をまたぐときは、明確な差とは言い切れません。
- 無作為化比較試験
- くじ引きの要領で「介入を受ける群」と「受けない群」に分けて比べる実験。「効いたかどうか」を言うための標準的な設計です。
- 統計的に有意
- 「偶然だけでは説明しにくい」という意味の専門用語。効果が大きい・重要だという意味ではありません。ごく小さな差でも、人数が多ければ有意になります。
- 中央値
- 全員を並べたときの、ちょうど真ん中の人の値。平均と違って、極端な値に引っ張られません。
