AI検索の効果測定とは、ChatGPT・Perplexity・Google AI OverviewsなどのAI検索において、自社が「候補入り・言及・推薦・引用」のどの状態にあるかを、条件を固定した反復測定と証拠保存によって定量的に把握する活動です。 検索順位のような単一の指標が存在しないため、「何を・どの状態として・どう記録するか」の設計がそのまま測定の質を決めます。
この記事で分かること
- AI回答の評価が従来の検索順位計測と根本的に違う理由
- 測るべき4つの状態(候補入り・言及・推薦・引用)の定義と違い
- 単発の目視確認が判断材料にならない理由と、証拠保存の設計
- 競合Win/Loss分析と施策前後の再測定(Measure→Act→Remeasure)の回し方
- AEOのKPIツリー設計例と、自社で代替する場合の簡易指標
- GA4等でのAI経由流入計測の限界
AI回答は「検索順位」と何が違うのか
従来のSEOでは「対策キーワードで何位か」を毎日記録すれば、現状も施策効果もほぼ説明できました。AI検索ではこの前提が3つの点で崩れます。
| 観点 | 従来の検索順位 | AI検索の回答 |
|---|---|---|
| 順位 | 1位〜n位が明確に存在 | 順位という概念がない。回答文に入るか入らないか |
| 再現性 | 同条件ならほぼ同じ結果 | 同じ質問でも実行ごとに回答が変動(確率的出力) |
| 評価の単位 | URL単位の順位 | 「引用(出典として提示)」と「推薦(薦められる)」が分離 |
特に3点目は見落とされがちです。自社記事がAIの出典リンクに載っていても、回答本文では競合が推薦されている、という状態は普通に起こります。逆に、出典には載らないのに社名だけ言及されることもあります。「引用されているか」と「選ばれているか」は別の指標として測る必要があります。
なお、Googleは公式の「生成AI機能向け最適化ガイド」で、生成AI検索についても基礎的なSEO(クロール・インデックス可能性、人間向けの独自コンテンツ)が中心であり、Google向けにllms.txtやAI専用マークアップは不要だと説明しています。つまり「施策そのもの」は従来SEOと連続的ですが、「効果の測り方」はまったく別物になった、というのが2026年時点の実態です。
測るべき4つの状態:候補入り・言及・推薦・引用
AI検索における自社の状態は、「候補入り」「言及」「推薦」「引用」の4段階に分けて定義すると、測定も改善も設計しやすくなります。 それぞれの定義は次のとおりです。
| 状態 | 定義 | 例 |
|---|---|---|
| 候補入り | 比較・推薦系の質問への回答で、自社が候補集合(挙げられた選択肢の中)に入っている | 「おすすめ5社」の中に自社名がある |
| 言及 | 回答本文のどこかで自社名・製品名が言及されている(肯定・中立・否定を問わない) | 「〇〇という選択肢もあります」 |
| 推薦 | AIが自社を明示的に薦めている、または最有力として位置づけている | 「この用途なら〇〇社が適しています」 |
| 引用 | 自社ドメインのURLが回答の出典・参照リンクとして提示されている | 回答末尾のソースに自社記事 |
4つの関係を整理すると、こうなります。
- 候補入りは入口です。候補に入らなければ推薦は絶対に起こりません。
- 言及は最も広い状態で、ネガティブな文脈の言及も含みます。言及率だけをKPIにすると文脈を見落とします。
- 推薦は商談・購買に最も近い状態ですが、質問の聞き方に大きく依存します。
- 引用はコンテンツ資産の評価であり、社名の推薦とは独立に動きます。引用されるのに推薦されない場合、コンテンツは読まれているが比較軸で負けている、という診断ができます。
自社がどの段階で止まっているかによって、打つべき施策は変わります。そもそも言及すらされない場合の原因整理は「生成AIに引用されない原因と対策」で詳しく解説しています。また、AEO・LLMO・GEOという用語の整理は「LLMO・GEO・AEOの違いとは」をご覧ください。
単発の目視確認では判断材料にならない理由
「ChatGPTに聞いてみたら自社が出た(出なかった)」という単発確認は、現状把握の入口としては有効ですが、意思決定の根拠には使えません。理由は3つあります。
- 回答が揺らぐ — AI回答は確率的に生成されるため、同じ質問を5回実行すれば結果が割れることは珍しくありません。1回の結果は「たまたま」を含みます。
- 条件差が大きい — 質問の言い回し(「おすすめは?」と「比較して」)、実行するAIやモデル、日時によって結論が変わります。条件を固定しない確認は比較になりません。
- 記録が残らない — 画面上で確認しただけでは、1ヶ月後に「あのとき本当に出ていたか」を検証できません。施策前後の比較が成立しなくなります。
正しい測り方は、質問セットを固定し、同じ条件で複数回実行し、結果を「出現割合」として記録することです。たとえば「質問20問 × 週1回 × 3実行」であれば、候補入り率を60回分の割合として追跡できます。測定に使う質問設計の実例は「AI検索最適化に使えるプロンプト集」にまとめています。
AIごとに回答は違う:横断測定の必要性
同じ質問でも、AIサービスごとに結論が異なるのは一般的な現象です。参照するインデックスやデータソース、回答生成の方針が異なるためで、あるAIでは候補入りしているのに別のAIでは一切言及されない、という状態は頻繁に起こります。
したがって、効果測定は単一のAIではなく複数のAIを横断して行い、AIごとに分けて記録する必要があります。「どのAIで強く、どのAIで弱いか」が分かれば、施策の優先順位も引用元チャネルの分析も具体的になります。業種別にAI検索での見え方がどの程度違うかは「AI検索可視性ベンチマーク」も参考になります。
証拠保存:「実測ゼロ」と「測定失敗」を区別する
AI検索の効果測定において、証拠保存は集計と同じくらい重要です。保存すべき最低限の項目は次の4つです。
- 回答本文(全文。要約ではなく原文)
- 引用URL(出典として提示された全リンク)
- 実行日時
- 実行条件(質問文の原文、利用したAIサービス・モデル、ログイン状態などの条件)
これが必要な理由は、検証可能性だけではありません。「実測した結果、言及ゼロだった」ことと「測定自体が失敗していた(質問が不適切・取得漏れ・条件の混在)」ことを区別するためです。証拠が残っていれば、ゼロという結果を「測定は正しく行われた上でのゼロ」として報告でき、改善の起点になります。証拠がなければ、そのゼロは誰にも検証できない数字になります。
社内やクライアントへの報告では、集計値(率)と証拠(生ログ)をセットで提示するのが誠実な形です。証拠付きレポートの構成例は「HackⅡサンプルレポート」で公開しています。
競合Win/Loss分析の考え方
自社の候補入り率だけを見ていると、「なぜ外れたか」が分かりません。そこで有効なのが競合とのWin/Loss分析です。
考え方はシンプルで、同じ質問セットに対して「自社が選ばれた回(Win)」「競合が選ばれ自社が外れた回(Loss)」「どちらも選ばれなかった回」を記録し、Lossの理由を回答本文から読み取るというものです。
| 分析項目 | 見るもの | 分かること |
|---|---|---|
| Win/Loss比率 | 質問ごとの勝敗 | どの質問領域で勝てて、どこで負けているか |
| Loss時の推薦先 | 代わりに選ばれた競合 | 主要な競合が誰か(想定と違うことが多い) |
| Loss時の理由記述 | AIが競合を薦めた根拠の文 | 価格・実績・機能など、負けている比較軸 |
| 引用元の差 | 競合が引用されているサイト | 自社が取れていない引用チャネル |
特に「Loss時の理由記述」は、AI回答ならではの分析材料です。検索順位では「なぜ2位なのか」は分かりませんが、AI回答には「〇〇の点で△△社が適しています」という理由が文章として残るため、負け筋を言語化できます。
施策前後の再測定:Measure→Act→Remeasure
効果測定の目的は現状把握ではなく、施策の検証です。基本サイクルは次の3ステップです。
- Measure(測定) — 固定した質問セットで基準値を取る。候補入り率・言及率・引用率と、証拠一式を保存する。
- Act(施策) — 構造化データの実装、コンテンツの定義文・数字・出典の強化、引用チャネルの開拓など。プリンストン大学等のGEO研究(arXiv:2311.09735)では、こうしたコンテンツ最適化によりAI可視性が最大30〜40%向上することが実証されています。
- Remeasure(再測定) — 同一の質問セット・同一条件で再度測定し、基準値との差分を見る。
注意点は2つあります。第一に、質問セットを施策後に変えないこと。質問を変えれば数字は動きますが、それは施策効果ではありません。第二に、1回の再測定で結論を出さないこと。回答の揺らぎがあるため、差分が揺らぎの範囲か実際の変化かは、複数回の測定で判断します。
KPI設計例:AEOのKPIツリー
ここまでの要素を組み合わせると、AEOのKPIは次のようなツリーとして設計できます。
最上位:AI経由の商談・指名検索数(ビジネス成果)
├─ 候補入り率(比較・推薦質問で候補集合に入る割合)
│ └─ 競合Win/Loss(誰に・どの比較軸で負けているか)
├─ 引用率(自社URLが出典として提示される割合)
│ └─ 引用元チャネル(自社サイト/第三者メディア/レビューサイト等の内訳)
└─ 施策効果(施策前後の再測定による差分)
HackⅡ(AI Recommendation Intelligence)では、この構造を AI Decision Share(候補入り率)/Recommendation Win・Loss(競合勝敗)/Citation Channel Map(引用元チャネル分析)/Measure→Act→Remeasure(施策前後の再測定) という4つの測定フレームとして体系化しています。
一方で、この構造は考え方さえ押さえれば自社でも簡易的に代替できます。内製で始める場合の最小構成は次のとおりです。
| フレーム | 内製での簡易代替 |
|---|---|
| 候補入り率 | 固定質問20問を週次で実行し、候補入りの有無をスプレッドシートに記録 |
| 競合Win/Loss | 同じシートに「選ばれた競合名」列を追加して集計 |
| 引用元チャネル | 引用URLのドメインを分類(自社/メディア/レビュー等) |
| 再測定 | 施策実施日を記録し、前後4週の率を比較 |
質問数が少なく競合が2〜3社であれば、この方法で十分に定点観測になります。工数が破綻するのは、質問数・AI数・競合数・実行頻度を掛け算したときです。内製と外部ツール・外部支援の分岐条件は「内製/外注判断ガイド」で整理しています。ツールを比較検討する場合は「AEO計測ツールおすすめの選び方」が判断軸の参考になります。
HackⅡが支援する範囲(誠実開示)
HackⅡは、AI検索で「出たか」ではなく、なぜ選ばれ、なぜ外れたかまでを扱うAI Recommendation Intelligenceです。支援するのは測定の代行ではなく、質問設計 → 測定 → 証拠保存 → 競合Win/Loss分析 → 施策 → 再測定という一連のサイクルの体系化です。前述の4つの測定フレーム(AI Decision Share/Recommendation Win・Loss/Citation Channel Map/Measure→Act→Remeasure)は、このサイクルをそのまま製品構造に落とし込んだものです。
現在のステータスは限定商用検証・導入相談受付中です。対応するAIサービスの範囲は、契約時点で本番検証済みの範囲をご案内しています。また、AI検索での表示・問い合わせ・売上といった成果を保証するものではありません。この記事で説明した内製の簡易代替で十分なケースも多くあります。製品の詳細はHackⅡ製品ページをご覧ください。
GA4等でのAI経由流入計測の限界
最後に、アクセス解析側からの計測についても触れておきます。GA4等で「AI経由の流入」を捉えようとする試みには、構造的な限界があります。
- 参照元が付かない遷移が多い — AI回答から社名を知ったユーザーが、後からブラウザで指名検索して訪問した場合、GA4上はOrganic SearchやDirectに分類されます。AI回答の影響は参照元からは見えません。
- 参照元の付き方がサービスごとに異なる — 参照元情報を付けて遷移するAIサービスもあれば、そうでないケースもあり、参照元だけを頼りにするとAI経由の流入を過小評価します。
- 「引用されたが流入しなかった」影響を測れない — AI回答内で完結してユーザーがクリックしない場合、認知への影響はアクセス解析には一切現れません。
したがって、GA4でのAI参照元セグメントは補助指標として使い、主指標はAI回答側の測定(候補入り・言及・推薦・引用)に置くのが現実的な設計です。両者を組み合わせることで、「回答での可視性」と「実際の行動」の両面から効果を説明できます。
よくある質問(FAQ)
Q. AI検索の効果測定とは何ですか?
A. ChatGPT・Perplexity・Google AI OverviewsなどのAI検索において、自社が「候補入り・言及・推薦・引用」のどの状態にあるかを、条件を固定した反復測定と証拠保存によって定量的に把握する活動です。順位という概念がないため、状態の定義と記録設計が測定の質を決めます。
Q. 最初に見るべき指標はどれですか?
A. 候補入り率です。比較・推薦系の質問で候補集合に入っていなければ、推薦も商談への波及も起こりません。候補入り率を基準値として取り、次に競合Win/Lossで「外れた理由」を分析する順番が効率的です。
Q. ChatGPTに1回質問して確認するだけでは不十分ですか?
A. 不十分です。AI回答は実行ごとに変動する確率的な出力であり、1回の結果は「たまたま」を含みます。固定した質問セットを複数回・複数条件で実行し、出現割合として記録してください。
Q. 証拠保存はスクリーンショットだけで足りますか?
A. 最低限にはなりますが、回答本文の全文・引用URL・質問文原文・日時・利用AIの条件をテキストでも残すことを推奨します。後から集計・検索・比較ができる形式でないと、再測定時の差分分析に使えません。
Q. GA4でAI検索経由の流入は計測できますか?
A. 部分的にしか計測できません。参照元が付かない遷移や、回答を見た後の指名検索はGA4上で判別できないためです。GA4は補助指標とし、主指標はAI回答側の候補入り・言及・引用の測定に置いてください。
Q. 効果測定は自社(内製)でもできますか?
A. 小規模なら可能です。固定質問20問程度の週次実行とスプレッドシート記録で、簡易的な定点観測は成立します。質問数・AI数・競合数が増えて工数が破綻し始めた段階で、ツールや外部支援を検討するのが現実的です。
まとめ
AI検索の効果測定の要点を整理します。
- 順位ではなく状態を測る — 候補入り・言及・推薦・引用の4つを分けて定義する
- 単発確認ではなく反復測定 — 固定した質問セットを複数回実行し、割合として記録する
- 証拠を保存する — 回答本文・引用URL・日時・条件を残し、「実測ゼロ」と「測定失敗」を区別する
- 競合Win/Lossで負け筋を言語化し、Measure→Act→Remeasureで施策を検証する
まずは自社の業界で、AI検索での見え方の現在地を確認するところから始めてください。業種別の傾向は「AI検索可視性ベンチマーク」、証拠付きレポートの実例は「HackⅡサンプルレポート」が参考になります。
参考文献・一次情報
本記事は株式会社Trillion Bankが独自に作成したものです。記事内容は公開時点の情報に基づいており、最新の状況と異なる場合があります。記載内容は情報提供を目的としたものであり、特定のサービスの利用を推奨するものではありません。
この記事のテーマを、自社・競合で実際に確認する
HackⅡは、AI回答内での候補入り・競合との勝敗・引用された情報源を証拠付きで測定し、次に改善すべき情報を特定するAI Recommendation Intelligenceです。詳細資料・実際の画面は30分のオンライン面談でご説明します。
HackⅡの測定の考え方を見る ※ 成果(AIでの表示・問い合わせ・売上)を保証するものではありません。