音声検索
音声検索とは、クエリを入力する代わりに声に出して話すことで情報を見つける方法であり、Siri、Google アシスタント、Alexa などの音声アシスタントが自然言語の質問を解釈し、通常は1つの回答を読み上げるか表示します。クエリはより長く会話的になり、結果が1つの回答に絞られる傾向があるため、音声検索はテキスト検索とは異なる方法で最適化されます。
音声検索とは、音声アシスタントが話し言葉の自然言語の質問を解釈し、通常は1つの回答を返す検索方法です。
クエリは「近くで今すぐ営業している花屋」のように長く会話的であるため、ロングテールキーワードと質問形式のキーワードが中心になります。
Backlinkoの調査によると、音声回答の40.7%はfeatured snippetから取得されており、スニペットを獲得することが最も直接的な戦略です。
同じ調査では、音声検索結果ページの読み込み時間は平均4.6秒で、回答は平均29語、読みやすさはおよそ9年生レベルであることがわかりました。
GoogleはSpeakable 構造化データを提供しており、どのセクションを音声で読み上げられるかを示せますが、まだベータ版であり、米国英語とGoogle Homeに限定されています。
音声検索とは何ですか?
音声検索は、ユーザーが入力の代わりに質問を話し、音声アシスタントが音声認識と自然言語処理を使って意図を理解したうえで、結果を読み上げるか画面に表示する検索方法です。AppleのSiri、Google Assistant、Amazon Alexaが代表的な例で、スマートフォン、スマートスピーカー、スマートテレビ、車載インフォテインメントシステムなど、幅広いデバイスで利用されています。
SEOとGEOの観点から音声検索が重要なのは、結果が「単一回答」に絞られるためです。テキスト検索では10本の青いリンクが表示されますが、スマートスピーカーのように画面のない環境では、音声アシスタントは通常1つの回答だけを読み上げます。つまり、音声検索では上位1位が事実上唯一のポジションであり、その回答のソースとして自社ページが選ばれなければ、露出はまったく得られません。
テキスト検索とどう違うのか?
音声クエリは、実際の会話のように長く、会話調で、質問形式になる傾向があります。Search Engine Landのガイドでは、テキストで入力する「weather Pennsylvania」のようなクエリとは異なり、音声クエリでは「Alexa, what's the weather in Pennsylvania today?」のように、自然言語の完全な文で尋ねると説明しています。この違いは、キーワード戦略とコンテンツ構造に直接影響します。
次元 | テキスト検索 | 音声検索 |
|---|---|---|
クエリ形式 | 短いキーワードの文字列 | 長い文 / 質問(会話調) |
キーワード | ヘッドターム | ロングテール / 質問ベース |
結果形式 | 複数リンクの一覧 | 通常は1つの音声回答 |
主要な露出面 | 上位ランキング + リッチリザルト | Featured snippet/ 直接回答 |
意図 | 幅広い探索とリサーチ | 迅速な回答、地域情報、アクション指向 |
証拠とデータ
Backlinkoによる10,000件のGoogle Home検索結果の分析は、音声検索最適化に関する具体的な数値を示しています。主な調査結果は以下のとおりです。
音声回答の40.7%は強調スニペットから取得されています。したがって、スニペットを獲得することが、音声での露出への最も直接的な道です。
音声検索の結果ページの読み込み速度は平均で4.6秒で、一般的なページよりも高速です。ページ速度は音声検索結果と相関しています。
一般的な音声回答は平均29語で、読みやすい文で書かれています。9年生レベル。
およそ9,800万人の米国人がスマートスピーカーを所有しており、世界では16歳から64歳のインターネット利用者の27.6%が毎週音声アシスタントを使っています。
Search Engine Landも、音声アシスタントが引用しやすい形式として、50〜60語の簡潔な回答を勧めています。質問を見出しにし、その直下に短く明確な答えを置くことで、音声アシスタントが読み上げやすい構成になります。
読み上げ可能構造化データ
GoogleはSpeakableschema.org を基盤とした構造化データで、音声で読み上げるのに最適なページ内セクションを明示的に示します。とはいえ、公式ドキュメントではこの機能は「beta版であり、変更される可能性がある」とされており、対象範囲は「英語に設定された Google Home を使用する米国のユーザー、および英語コンテンツを公開する出版社」に限定されています。韓国語の文脈では、その直接的な効果をまだ当てにできるものではありませんが、音声向けマークアップの標準的な形を示しています。
Speakable は、読み上げ対象のセクションを、次のいずれかを使用して指定します。cssSelectorまたはxPathをSpeakableSpecification内で指定します。
{
"@context": "https://schema.org",
"@type": "Article",
"headline": "Voice Search Optimization Guide",
"speakable": {
"@type": "SpeakableSpecification",
"cssSelector": [".headline", ".summary"]
},
"url": "https://example.com/voice-search"
}世界的により広く使われている音声関連のマークアップには、質問応答形式のためのFAQ schemaが含まれます。HowTo schemaをステップごとの手順に使用し、LocalBusiness schemaを「near me」クエリに使用します。大きなshare of voiceクエリはローカル情報を求めるため、営業時間、住所、電話番号を構造化データとして提供することが特に重要です。
実装チェックリスト
中心となる質問を見出しとしてそのまま記載し(
<h2>/<h3>)、その直下に50〜60語の簡潔で直接的な回答を配置します。ターゲットfeatured snippetは、定義、リスト、表などのスニペット向けの形式で回答を構成することで
構造化データを適用し、FAQ、HowTo、LocalBusiness など、意図に合ったものを使って、検索エンジンが回答セクションを理解しやすくします。
"near me" や "open right now" のようなローカル意図や行動意図に備えて、営業時間、所在地情報、モバイル体験を強化します。
ページの読み込み速度を改善します。ページが速いほど、音声検索結果として選ばれる可能性が高まります。
短く、簡潔な文(9年生レベル程度)で書き、音声アシスタントが自然に読み上げられるようにします。