あるボタンのクリック率が上がった。だが、そのボタンの先で読者が迷い、離脱し、翌週には戻ってこなくなったとしたら。改善したのは体験か、それとも押される数字だけか。

サイトの見出し、会員登録画面、レコメンド、商品の説明文。事業の現場では毎週のように何かを変える。変更の前後で数字を比較すると、判断できた気になる。さらにA/Bテストで差が出れば、答えが確定したようにも感じる。しかし実験の力は、何を成功と呼ぶかによって決まる。数字を測る前に、その数字と事業の価値がどうつながるかを設計しなければならない。

Microsoft Researchはオンライン実験の指標を、データ品質、全体評価指標、機能や診断の局所指標、悪化を防ぐガードレールに分けている。クリック率は多くの場合、局所指標だ。変更された場所で何が起きたかを見るには役立つが、製品全体の成功を一つで代表するとは限らない。[1]

ここから見えてくるのは「数字を増やす」より手前の仕事だ。改善によって誰のどんな行動が変わり、その変化が本人にとって価値を持ち、事業にとっても続けられるのか。この因果の道筋を先に描く。そのうえで実験は、道筋のどの部分が実際に動いたかを確かめる。

クリック率が勝っても、読者が負けることがある

架空の情報メディアを考えよう。トップページに「この記事を読む」という大きなカードを置く。旧デザインでは100人中10人がカードを押し、新デザインでは13人が押した。押される率は10%から13%、相対的には30%増だ。この例の数字は説明用であり、実在するサイトの実測値ではない。

新デザインを採用するには、少なくとも三つの問いが残る。第一に、押した人は読み始めたのか。誤って押して直ちに戻っていないか。第二に、他の重要な記事やカテゴリーへの到達を奪っていないか。第三に、初回の閲覧が増えたとして、次にも読みたいと思える体験だったか。

カードを画面いっぱいに広げれば、そのカードのクリック率は上がるかもしれない。一方で、選択肢が見えにくくなり、探していた内容にたどり着く人は減るかもしれない。局所的な勝ちを全体の勝ちと取り違えるのは、改善対象のすぐ近くしか測らないときだ。Microsoftの実務資料も、ある機能での利用増と製品の別の領域での利用減、情報量を増やしたことによる読み込み時間の悪化など、同時に動く指標を見る必要を説く。[1]

FORWARD BASISの見方では、実験結果は「数字が増えた/減った」という判決文ではない。変更によって価値がどこへ移動したかを示す地図である。読者の注意が別の記事から一つのカードへ移っただけなら、新しい価値を作ったとは言えない。時間の前借りや場所の移動と、実際の体験改善を区別する。

成功指標は一つ、確認する数字は一つではない

実験の前に、何が改善したら採用するかを文章で書く。たとえば「初めて来た読者が関心に合う記事へたどり着き、内容を読み、後日また戻る」。ここに対する短期の手掛かりとして、記事への到達や一定の読了行動を見る。一方で、戻るボタンの連打、読み込み時間、検索からの離脱、カテゴリー間の偏りを悪化の警戒指標として置く。

記事を最後までスクロールした人を「読了者」と呼ぶ場合も、注意が要る。ページ最後まで一気に飛んだだけかもしれない。滞在時間が延びた場合も、深く読んだからか、ページが使いづらくなったからかは指標だけでは分からない。だから、複数の指標と実際の画面、必要なら定性的な観察を組み合わせる。

Microsoftがいう全体評価指標(OEC)は、製品が全体として何を最適化するかを表すものだ。しかし短期の数字が長期の価値を正しく予測するとは限らない。同社の長期実験に関する論文は、検索結果の質を下げると利用者が検索を繰り返し、短期の検索回数は増えても、離脱が増え得る例を挙げる。検索回数が多いことを「満足」の代理にすれば、まさに逆の判断をしてしまう。[2]

ここで重要なのは、万能の成功指標を探し出すことではない。今使う短期指標が、どんな条件なら読者価値の代理になり、どんな条件で裏切るかを明記することだ。数字の名前より、その解釈条件のほうが意思決定を守る。

実験には「成立しているか」という先決問題がある

結果を見る前に、そもそも比較が成立していたか確かめる。ランダムに半分ずつ割り当てたはずなのに、新旧の利用者数が大きく偏っていたら、割り当てや記録に問題があるかもしれない。これはサンプル比率の不一致、SRMと呼ばれる。Microsoftは、こうした不一致がある実験の結果は通常信頼しにくいとして、早い段階での検知を勧めている。[1]

もっと見つけにくい失敗もある。新しい画面だけクリックの記録方法を変えてしまい、新旧で拾うイベント数が違う。あるいは表示対象が限定されていたのに、全利用者に起きた効果として報告する。Microsoftの実務記事は、Skypeの実験で新しい仕様側の通話ログ記録が改善し、指標の解釈を難しくした例を紹介する。[3]

「計測が変わった」ことと「行動が変わった」ことは別だ。実験の最初に、表示対象、分配比率、計測イベント、欠損、期間を確認する。数字が意外なほど良ければ、施策の成功を喜ぶ前に、数字がどこから生まれたか追う。

途中で何度も見ると、偶然を勝利と呼びやすい

実験を始めた翌朝に有利な数字が出ると、その場で終わらせたくなる。反対に不利なら、もう少し続けようと思う。都合のいい時点で止めれば、偶然の振れを選んで拾いやすい。Microsoftは途中の結果を見て重大な不具合を止めること自体は勧める一方、何度も見て早期終了を判断するなら統計手法上の考慮が必要とし、明白でない場合は予定した期間まで続けるよう説明している。[1]

新奇性もある。初日に珍しいものがクリックされ、慣れれば消えるかもしれない。週末だけ効果が出る変更を平日だけ見ても誤る。実験期間をあらかじめ決め、曜日の構成、立ち上がりと終盤での傾き、再訪者と新規来訪者の差を確認する。期間を延ばせば必ず真実になるわけではない。長期の比較には利用者の追跡の不安定さや、生き残った人だけを見る偏りも入り得る。[2]

記事タイトルを十通り試して、後から一番よかったものだけを「検証済み」と呼ぶ場合も同様だ。候補を増やすほど偶然の当たりを見つけやすくなる。仮説と主要指標を先に決め、追加で見た発見は「次回検証する仮説」として扱う。探索を禁じる必要はない。探索で見つけたことと、あらかじめ検証するつもりだったことを混ぜなければよい。

小規模事業では、実験の前に「何がまだ分からないか」を書く

訪問者の少ないサービスに大企業のA/Bテストをそのまま移すと、結果がなかなか定まらない。差が見えないことは、効果がゼロだという証明にならない。少数の利用者では大きな差しか見つけられず、小さな改善を判定できない場合がある。

そのときは、判断を二段にする。まず、使いやすさに明白な問題がないか、誤解や操作の詰まりがないかを数人の利用場面で確かめる。次に、十分な量が集まる変更だけ比較実験へ進める。問い合わせ内容、離脱した場所、使った人の言葉なども仮説形成には役立つ。ただし数人が言ったことを「全員がそう思う」に変えない。

例えば会員登録率が低い理由を「ボタンの色」と決めつけず、登録に必要な説明が足りないのか、入力が長いのか、そもそも登録後の価値が見えないのかを分ける。色だけを変えて良い結果が出ても、根本の問題は残り得る。現象を見つけ、仕組みを仮定し、測る。この順序にすれば、テストは細部の競争ではなく、読者を理解する手段になる。

事業の数字には、遅れて効くものがある

月曜日に表示を変えて、火曜日のクリックが増えた。これは変更が注意を引いた証拠にはなり得る。しかし、その体験が読者との関係を強めたかは翌日には分からない。今日の会員登録が増えても、三か月後の継続を待たなければ見えない部分がある。短期の結果を無視する必要はないが、短期で見える現象に合わせて最終目標を小さくしないことだ。

たとえば無料登録を促す説明文を強くした場合、登録率は増えるだろうか。増えたとして、その後に内容を読んで使った人が増えたか。登録したものの期待と違い、すぐ離脱した人は増えていないか。実験時点で未来は観察できないので、過去のデータから「どんな初期行動をした人が後にも価値を得ていたか」を確かめる。ただし、過去に関係があった指標が、施策でその指標自体を操作した後にも同じ意味を保つとは限らない。

ここで、単純な「売上を上げる施策」は特に判断が難しい。短期には有料化や値上げで一人当たりの収入が増えても、体験が損なわれれば継続率は落ちるかもしれない。Microsoftの長期実験論文が示すのは、短期の代理指標と長期価値のずれを警戒する必要である。[2] その論文だけで、どの業種の何円の値上げが失敗するかまでは導けない。

小さな事業ほど、長期の数字が出る前に判断しなければならない。だからこそ「今見える良いきざし」「まだ見えない結果」「早期に取り返しがつかない悪化」を分ける。数日の比較で決めてよいのは、数日の結果だけで判断できる範囲だ。読者の信頼のような遅れて現れる価値については、実験が終わっても追跡する。

数字が割れたときは「多数決」にしない

クリック率は上昇、読了の目安は横ばい、読み込み時間は悪化。こんな結果に「三つのうち二つが良いから採用」という投票は使えない。各指標が測っている価値も、悪化したときの重さも違うからだ。読み込みが遅いことで一部の人だけが深刻に使えなくなるなら、平均のわずかな上昇では埋め合わせられない。

逆に、軽微な表示の遅れを許容しても、重要な情報へ届きやすくなる場合はある。Microsoftは全体評価指標とガードレールが逆方向に動いた場合、機械的な正解はなく、重み付けを使うなら実験の結果を見てから都合よく決めるのではなく、事前に決めるべきだと説明する。[3] 「この結果なら良しとする」という境界を、変える前に考えておく価値がある。

特に平均値だけで判断しない。スマートフォンの通信が遅い人、新規ユーザー、読み上げ機能を使う人など、特定の層で大きな不便が起きていないか。区切って見ると偶然の差を拾いやすくなるため、見つけた差の一部は次の実験で確かめる。切り口を無限に増やして「良かった層」だけを後から採用することも避ける。全体と部分、効果と副作用を、一つの物語に無理やりまとめない。

「一回で勝つ」より、負け方から学ぶ

変更しても差がはっきりしなかった場合、企画が無価値だったとは限らない。変更が利用者に届いていなかったのかもしれない。十分な人が見ていなかったのかもしれない。そもそも説明文より前に、商品そのものの価値が伝わっていないのかもしれない。「差なし」という結果も、どこを変え、誰へ見せ、何を測ったかで意味が変わる。

実験ごとに「どの仮説が外れたか」を一文で残すと、次の企画に接続できる。「見出しの短さは読了行動を押し上げなかった。ただしカテゴリを選ぶ場面での迷いは観察された」なら、次はカテゴリーの見せ方を試せる。反対に単に「テスト失敗」と記録すると、解釈の過程が消える。事業の資産になるのは、当たったデザインの一覧だけでなく、読者の行動について積み上がった説明だ。

FORWARD BASISの判断基準:数字を三層で読む

第一層は成立。割り当て、記録、対象、期間は妥当か。第二層は体験。利用者が本当に目的へ近づいたか、他の体験を傷つけていないか。第三層は継続。その変化は慣れや時間の経過でも残り、事業と読者の両者に価値を生むか。下の層が崩れていれば、上の数字が良く見えていても採用を急がない。

実務で使うなら、一枚の実験メモに「変える場所」「読者に起きるはずの変化」「主要指標」「悪化させたくない指標」「記録と割り当ての確認」「実施期間」「採用・再検証・中止の条件」を書く。結果の欄には、予想と違った指標も残す。これは形式的な書類ではない。後から都合のよい説明を作らず、失敗を次の仮説へ変えるための道具だ。

実験の目的は、きれいな勝率を積み上げることではない。どんな変更が、どんな読者に、どう役立つのかを一歩ずつ理解すること。クリックが増えたら、その先へ進んで確かめる。数字が証明していないことまで数字に語らせない。その慎重さが、結局は改善の速度を上げる。

SOURCE / 原典

この記事の出典

本文の事実確認に使用した原典です。FORWARD BASIS独自の解釈・整理は本文内で区別しています。

  1. 公式Microsoft Research — Patterns of Trustworthy Experimentation: During-Experiment Stage
  2. 論文Dmitriev et al. — Pitfalls of Long-Term Online Controlled Experiments (IEEE Big Data, 2016)
  3. 公式Microsoft Research — Patterns of Trustworthy Experimentation: Post-Experiment Stage