広告運用・改善/解説

広告のA/Bテストのやり方|Google広告の実験機能で判定する手順

広告のA/Bテストのやり方を、Google広告の実験機能の公式ヘルプから整理します。分割はcookieベースと検索ベースで何が変わるか、推奨の50%、7〜14日の安定化と2〜3週間という期間、既定80%の信頼区間の読み方まで扱います。

広告のA/Bテストは、2つの広告を順番に出して数字を見比べることではありません。先週と今週では、競合の出稿量も検索の量も変わります。同じ期間に配信を分けて並走させて、はじめて差の原因を「変えた1か所」に帰すことができます。

Google広告はこの仕組みを「実験」として持っています。公式ヘルプは、元のキャンペーンと実験の間で予算またはトラフィックを分け、一定期間の結果を比較できること、そして実験のほうがよい結果なら元のキャンペーンに適用するか、元のキャンペーンを置き換えられることを説明しています。

この記事では、Google広告ヘルプの記載にもとづいて、実験の設計で決める項目、分割方式の違い、期間の目安、結果の読み方を整理します。確認日は2026年10月2日です。引用はいずれも英語版ヘルプの記載を訳したもので、日本語の管理画面では語が違うことがあります。ランディングページやフォーム側のテストと検索への影響はWebサイトのA/Bテストとは?進め方と検索への影響を抑える方法で扱っているため、ここでは配信側だけに絞ります。

実験が答えるのは「どちらを採用するか」だけ

最初に、期待してはいけないことを決めておきます。実験で分かるのは、2つの状態のうちどちらの数値が良かったか、そしてその差を偶然で説明できるかどうかの2点だけです。なぜ良かったのかは答えません。

ですから、成果が出ていない原因が分からない段階で実験を始めると、時間だけが過ぎます。計測が壊れている、審査に落ちている、リンク先が開かない、といった不具合は、実験ではなく点検で見つけるものです。原因の切り分けの順番は広告CPAを改善する方法|獲得単価が高いときの見直しポイントにまとめています。

実験に回すのは、点検では決着がつかない「どちらがよいか分からない選択」のほうです。見出しの書き方、入札戦略、リンク先のページ、オーディエンス。これらは議論では決まらないので、配信して比べます。

何を変えたいかで、使う機能が変わる

実験のページには複数の機能が並んでいて、変えたいものによって入口が違います。公式ヘルプの説明と、それぞれが向いている変更は次のとおりです。

機能 公式ヘルプの説明 向いている変更
広告バリエーション バリエーションの成績を確認し、修正した広告をアカウントへ適用できる 見出し、説明文、最終ページURL、表示パス
カスタム実験 検索、ディスプレイ、デマンドジェネレーション、動画のキャンペーンへの変更を提案してテストできる スマート入札、キーワードのマッチタイプ、リンク先ページ、オーディエンス、広告グループ
AI Max実験 検索キャンペーン向けのワンクリックのテスト。コピーを作らずキャンペーンを50/50に分割する 検索語句のマッチングやアセットの最適化といったAI機能
Performance Max実験 機能、設定、キャンペーンをA/Bテストして結果を改善するための道具 Performance Maxキャンペーンの設定
デマンドジェネレーション実験 どの画像や動画がいちばん関心と反応を引き出すかをテストする 画像、動画
動画実験 YouTubeでどの動画広告がより効果的かを判定する。2〜4の実験グループを作れる 動画クリエイティブ(ブランドリフトまたはコンバージョンで評価)
アプリアセット実験 アプリキャンペーンの中のテキストと画像をテストし、インストールにつながるアセットを選ぶ アプリ広告のテキスト、画像

広告文だけを試したいなら、キャンペーンを作って分けるカスタム実験よりも、広告バリエーションのほうが手数が少なくなります。バリエーションで変えられるのは、見出しと説明文の書き換え、最終ページURL・表示パス・最終モバイルURLの差し替え、そして文字列の置換です。公式ヘルプが挙げている置換の例は「Book now」を「Call now」に変えるというものです。

設計で決めるのは5項目

実験を作るときに上から順に決める5項目。変更を1つに決める、分割の方式を選ぶ、分割の割合を決める、目標を最大2つ選ぶ、開始日と期間を入れる、の各段に公式ヘルプの記載を添えた工程図
入力欄があるのは下の4項目だけです。いちばん上の「変更を1つに決める」には入力欄がありません。出典:Google広告ヘルプ「Set up a custom experiment」、「Monitor your experiments」、「About custom experiments」(確認日 2026-10-02)

画面で実際に入力するのは、分割方式、割合、目標、開始日と期間です。目標は成功指標を測るために最大2つまで選べ、公式ヘルプの例では「クリック数」と「増加」の組み合わせが挙げられています。スケジュールでは開始と期間を選び、終了日はプログラムが決めます。

残る1項目、つまり「変更を1つに決める」には入力欄がありません。ここだけは人が守るしかない約束です。見出しと入札を同時に変えれば、差が出ても出なくても、どちらの手柄なのか分けられません。実験を2本に分けるか、片方を次の回へ回してください。

分割は「同じ人に片方だけ見せるか」で選ぶ

cookieベースと検索ベースの分割方式を、割り当ての単位、同じ人の見え方、有意になる速さ、選ぶときの目安の4軸で左右に比較した表
違いは速さではなく、1人の人に両方を見せるかどうかです。公式ヘルプが推奨しているのはcookieベースのほうです。出典:Google広告ヘルプ「Set up a custom experiment」、「About custom experiments」(確認日 2026-10-02)

cookieベースは、ユーザーを無作為に元か実験へ割り当て、あるユーザーが元か実験のどちらか一方だけを見るようにします。公式ヘルプが推奨しているのはこちらです。広告バリエーションも同じ考え方で分割され、ユーザーは何回検索しても広告の片方のバージョンしか目にしない場合がある、と説明されています。

検索ベースは、検索が起きるたびに無作為に割り当てます。同じ人が複数回検索すれば、元と実験の両方を見ることがあります。公式ヘルプは、この方式について、cookieベースの分割より早く統計的に有意な結果を得られる場合がある、と書いています。

割合は50%が推奨です。理由も明記されていて、元のキャンペーンと実験のキャンペーンをいちばんよく比較できるからです。Campaign Guidanceの側でも、より早く結果を得たいなら対照群と処置群を50対50にすることが挙げられています。

実験側の取り分を小さく絞りたくなる気持ちは分かります。外したときの損失が小さくなるからです。ただし、後で見るとおり分割が小さすぎることは、結果が有意にならない理由として公式ヘルプが挙げている3つのうちの1つです。損失を抑えたいなら、割合ではなく、どのキャンペーンでテストするかと期間のほうで調整してください。

露出が半分ずつにならないのは異常ではない

設定した割合どおりに表示回数や費用が割れないことがあります。公式ヘルプは、これを想定された挙動として説明しています。分割を設定していても片側の露出が多くなることがあり、理由は広告枠ごとに新しいオークションが行われるためです。実験側の入札やアセットが違えば、勝つオークションの数も変わります。キーワードや広告の品質の変更も、広告が表示される頻度に影響します。

ここを知らないと、開始して数日のうちに「配信量が揃っていないのでやり直す」という判断をしてしまいます。揃わないのが普通です。こちらが揃えるのは期間と分割の設定であって、結果として出てくる表示回数ではありません。

期間は、7〜14日を読まずに2〜3週間

開始から7日から14日が処置群の安定にかかる区間、データ収集の推奨が2週間から3週間であることを1本の時間軸に重ね、2週間で止めると安定直後の数日しか比較に使えないことを示した図
2つの記載は別々のページにあります。重ねると、2週間での判定がどれだけ際どいかが分かります。出典:Google広告ヘルプ「About custom experiments」、「Monitor your experiments」、「Build better experiments with Campaign Guidance」(確認日 2026-10-02)

期間についての記載は、公式ヘルプの2か所に分かれて出てきます。カスタム実験の解説では、処置群が安定するまで7〜14日見るように書かれています。結果の見方の解説では、データを集めるために2〜3週間実行することが推奨されています。

この2つを1本の軸に重ねると、短いほうの判断がどれだけ際どいかが見えます。2週間で止めた場合、安定までに最大14日かかりうるのですから、比較に使える安定後のデータは数日ぶんしか残りません。3週間取れるなら取ってください。

Campaign Guidanceは、最低期間について、信頼できる結論の出る結果にするためにキャンペーンの規模とトラフィックに応じた最低期間を走らせるべき、とだけ書いていて、日数は示していません。代わりに Experiment Power という0〜99%のスコアを出し、過去のキャンペーンのデータ、見込まれる改善幅、期間から、統計的に有意になる見込みを評価します。必要なコンバージョン数の下限は、公式ヘルプには記載がありません。

結果は信頼区間で読む。既定は80%

机の上に置かれたタブレットとスマートフォン。実験の結果を読むために数値を確認する場面のイメージ画像
結果を読む作業のイメージ画像です。Google広告の管理画面ではありません。写真: AS Photography(Pexels)

実験のスコアカードには、既定でクリック数、クリック率、費用、表示回数、すべてのコンバージョンが並びます。ここで見るのは、数値の大小そのものではなく、差がどこまで確からしいかです。

公式ヘルプは、統計的に有意であるとは、データが偶然によるものではない可能性が高く、キャンペーンへ変換した場合に同様の結果が続く可能性が高いことだ、と説明しています。

もう1つが信頼区間で、これは実験と元のキャンペーンの間にありうる成績差の範囲です。公式ヘルプは表示の例として [+8%, +12%] を挙げ、実験のほうが8%から12%の改善になりうる、と読むことを示しています。この区間は自分で選べて、既定は80%です。

読み方は3つに分かれます。区間の下限も上限もプラスなら、改善の向きで一致しています。下限も上限もマイナスなら、やめる判断ができます。区間がゼロをまたいでいるなら、改善にも悪化にも転びうるということで、採用の根拠になりません。既定の80%は緩めの設定なので、予算の大きい変更を決めるときは区間を上げて確かめてください。区間を上げれば幅は広がり、判定は慎重になります。

有意にならないときに疑う3つ

公式ヘルプは、結果が統計的に有意にならない理由を3つ挙げています。どれも設計の問題で、広告文や入札の善し悪しとは関係がありません。

公式ヘルプが挙げている理由 次にやること
実験の実行期間が足りない 推奨の2〜3週間まで延ばす。途中で設定を変えない
キャンペーンのトラフィックが足りない 配信量の大きいキャンペーンで試す。小さい案件では差を検出できない
分割が小さすぎて、実験側にトラフィックが届いていない 推奨の50%へ近づける

3つとも、始める前に決まってしまう要因です。配信量の少ないキャンペーンで小さな分割を短期間だけ走らせても、結果は「分からない」以外になりません。テストできる規模のキャンペーンが社内に1つもないなら、A/Bテストではなく、計測の修正と大きなボトルネックの解消を先に置いてください。

実験が1回も配信されない設定

公式ヘルプが名指しで注意しているのが、元のキャンペーン側の状態です。実験は元のキャンペーンに依存するため、元のキャンペーンが一時停止や無効になっていたり、実験の予定終了より前に終了したりすると、実験は実行されず表示も発生しません。

実験を作ったあとに元のキャンペーンを整理する、終了日を前倒しする、といった操作をすると、気づかないうちに実験が止まります。実験の期間中は元のキャンペーンに触らない、と決めておくほうが安全です。

広告バリエーションにも似た制約があります。終了した、または適用したあとは終了日を変更できず、期限切れのバリエーションは再開できません。やり直す場合は作り直しになります。なお開始日を今日にした場合は、まもなく配信が始まると説明されています。

採用のしかたと、採用後に確かめること

実験のほうがよい結果だったときは、公式ヘルプのとおり、元のキャンペーンへ適用するか、元のキャンペーンを置き換えられます。

ただし、採用後に同じ数値が再現するかどうかは、公式ヘルプには書かれていません。季節も競合も学習の状態も変わるためです。採用した日と、採用時点の信頼区間を記録しておき、数週間後の実績と並べて見てください。記録がなければ、次に数字が動いたときに原因を切り分けられません。

採用しなかった実験も同じように残します。「この変更は効かなかった」という結果は、次の担当者が同じ実験を繰り返さないための資産です。実験の履歴は画面にも残りますが、何を期待して何が起きたかまでは画面に書かれていません。

測れていないものはテストできない

最後に前提を1つ置きます。実験の判定は、設定したコンバージョンの数で行われます。コンバージョンの定義が事業成果とずれていれば、実験はずれた成果を増やすほうを勝たせます。資料請求の件数だけを成果にしていれば、受注につながらない請求を増やす変更が勝ちます。

成果の定義と計測のそろえ方はWeb広告の効果測定方法|見るべき指標と改善の進め方、タグとコンバージョンの設定はGoogle広告のコンバージョン設定方法|成果計測の基本を解説で扱っています。実験を始める前に、この2つが済んでいることを確認してください。

公式ヘルプに書かれていなかったこと

推測で埋めないために、探しても見つからなかった項目を挙げます。

統計的に有意と判定されるために必要なコンバージョン数の下限は、今回参照したどのページにも書かれていません。Experiment Power は過去のデータから見込みを出す仕組みで、必要数そのものを示すものではありません。採用後に実験と同じ結果が再現するかどうかにも記載がありません。日本語の管理画面での表記も、英語版ヘルプからは判断できません。

これらは、自社の実験記録を積み上げて埋めていくしかない部分です。1本目の実験から、設計と結果を同じ形式で残してください。

まとめ

広告のA/Bテストは、Google広告では「実験」として用意されています。入口は変えたいものによって分かれ、広告文なら広告バリエーション、入札やリンク先やオーディエンスならカスタム実験です。

設計で決めるのは、変更を1つに絞ること、分割方式、割合、目標、期間の5つです。分割は公式の推奨どおりcookieベースと50%から始め、7〜14日は結果を読まず、2〜3週間走らせます。その間は元のキャンペーンに触りません。

判定は、数値の大小ではなく信頼区間で行います。既定は80%で、区間がゼロをまたいでいる間は採用の根拠になりません。有意にならないときは、広告文を疑う前に、期間、配信量、分割の割合という3つの設計要因を確認してください。

この分野の実務を相談したい方へ

記事で扱っている内容は、当社が実務として支援している領域です。 自社で進めるか外部に任せるかの判断からご相談いただけます。

支援サービスを見る 相談する