A/Bテストの前提はシンプルです。
2つ(またはそれ以上)の異なるバージョンを比較して、どちらがより優れたパフォーマンスを発揮するかを確認し、最も優れたバージョンをすべてのユーザーに展開することで、最適な全体的なユーザーエクスペリエンスを実現します。
そのため、A/BテストやCROチームの実践は、サイト、ネイティブアプリ、メール、その他のデジタルチャネル全体にわたるさまざまな領域やエクスペリエンスを改善するために、あらゆる種類の実験に多額の投資を行い、その後、コンバージョンや特定のKPIを徐々に向上させるために、それらを継続的に最適化することにある。
しかし、企業が膨大なトラフィックを生み出し、実験を行うための広大なデジタル環境を持っていない限り、実験の成果(どれだけ多くのテストを実施しても、どれだけ大規模で高度な実験であっても)が、これらのチームからの投入という観点から見て最大の効果に達する、収穫逓減の法則が働く時点が来る可能性がある。
これは主に、従来のA/Bテスト手法では訪問者の嗜好を二元的にしか捉えることができず、個々の訪問者を特徴づけるあらゆる要因や行動を十分に把握できないという事実に起因している。
さらに、A/Bテストは、セグメントの大多数の嗜好に基づいて、より一般的な結果をもたらします。あるブランドは特定の体験が平均的に高い収益をもたらすと見込んだとしても、それをすべてのユーザーに展開することは、異なる嗜好を持つ多くの消費者にとって不利益となるだろう。
いくつか例を挙げて説明しましょう。
もし私とウォーレン・バフェットの純資産が平均で1173億ドルだったとしたら、私たちに同じ商品を勧めるのは理にかなっているだろうか?
おそらく違うだろう。
あるいは、男性用と女性用の両方の商品を扱う小売業者が、ホームページで最もパフォーマンスの高いヒーローバナーのバリエーションを特定するために、古典的なA/Bテストを実施することにしたとしましょう。しかし、顧客の70%が女性であるため、女性向けのバリエーションが男性向けのバリエーションよりも優れたパフォーマンスを発揮するかもしれません。
このテスト結果は、女性の英雄という称号を全人口に適用すべきであることを示唆しているが、それは決して正しい判断ではないだろう。
簡単に言うと:
- 平均値は、異なるユーザーグループを比較する際には誤解を招くことが多い。
- 最もパフォーマンスの高いバリエーションは、顧客セグメントとユーザーごとに異なります。
- 結果は、地理、天候などの状況要因によっても影響を受ける可能性があります。
もちろん、より一般的な結果を活用すべき時と場所がないというわけではない。例えば、新しいウェブサイトやアプリのデザインをテストする場合、異なるユーザー向けに数十、数百、あるいは数千ものUIバリエーションを用意するよりも、平均的に最も効果的な一貫したUIを一つ目指す方が理にかなっています。
しかし、ページのレイアウト、メッセージ、コンテンツ、おすすめ、オファー、その他のクリエイティブ要素に関して、「勝者総取り」のアプローチを忠実に採用する時代は終わりました。そしてそれは良いことです。なぜなら、個々のユーザーに最適なバリエーションを提供しないことで生じるパーソナライゼーションの機会損失によって、収益を逃すことがなくなるからです。