BERT
BERT(Bidirectional Encoder Representations from Transformers)は、Googleが開発したTransformerベースの自然言語理解モデルで、各単語を前後の文脈とともに読み取り、前置詞のような意味を微妙に変化させる要素まで捉えます。2019年にGoogle Searchに導入され、会話調のクエリやロングテールクエリの背後にある意図を、はるかに正確に解釈できるようになりました。
BERTはBidirectional Encoder Representations from Transformersの略で、両方向の文脈を同時に使って各単語を解釈する自然言語理解モデルです。
Googleは2019年にBERTをSearchに導入し、公開時に米国の英語検索のおよそ10件に1件に影響したと発表しました。
前置詞や語順のように意味を微妙に変える単語を理解できるため、会話調のクエリやロングテールクエリの意図を読み取るのに特に強みがあります。
コンテンツの順位付けを支援する機械学習システムであるRankBrainとは異なり、BERTはクエリ自体の言語を理解することに重点を置いています。
SEOの観点では、BERT時代の鍵は、キーワードを詰め込むのではなく、人に向けて明確かつ自然に書くことです。
概要
BERT(Bidirectional Encoder Representations from Transformers)は、GoogleのAI研究者によって導入されたTransformerベースの自然言語理解(NLP)モデルです。従来の言語モデルが左から右のように一方向で文を読むのに対し、BERTは単語の前後の文脈を同時に重み付けすることで双方向に意味を把握します。Googleが2019年にこの技術をSearchに導入した際、同社はこの変更を「過去5年間で最大の飛躍であり、Searchの歴史の中でも最大級の飛躍の一つ」と表現しました。
要点は、BERTが前置詞や語順のように、クエリの意味を完全に変えうる小さくても決定的な単語を理解することです。たとえば「2019 brazil traveler to usa need a visa」というクエリでは、前置詞「to」がブラジル人が米国へ向かって旅行していることを示します。BERT以前のSearchでは、この関係を見落とし、逆方向の結果を表示することがありました。
仕組み
BERTは、masked language modelアプローチを用いて、大量のラベルなしテキストで事前学習されています。文中の一部の単語を隠し、モデルは左右両側の完全な周辺文脈を使ってそれらを予測することで、各単語を周囲のすべての単語との関係の中で解釈できるようになります。この双方向の文脈処理により、同じ単語でも文ごとにどの意味が意図されているのかを区別できます。
実際の検索例として、「do estheticians stand a lot at work」というクエリでは、BERTは「stand」が物理的に立っていることを指すと理解します。以前のシステムでは、「stand-alone」のような無関係な表現と誤って結び付けられることがありました。
Searchへの影響
Googleは展開を発表した際、BERTが米国の英語検索のおよそ10件に1件に影響したと述べました。特に影響が大きい分野は以下のとおりです。
会話調のクエリ: 人々が話すように入力する、長文の文章形式の検索の背後にある意図を、より正確に解釈します。
ロングテールで具体的なクエリ: 誰が、どの方向に、どのような状況で、など、少数のキーワードだけでは伝えきれない詳細な文脈を捉えます。
Featured snippets: Googleは24か国にわたってBERTでfeatured snippetの品質を改善し、特に韓国語、ヒンディー語、ポルトガル語で大きな向上があったと報告しました。
RankBrainとの違い
BERTはしばしばRankBrainと並んで言及されますが、両者は異なる役割を担っています。RankBrainは検索結果のランキングを調整する機械学習システムに近いのに対し、BERTはクエリそのものに含まれる言語の意味を理解することに重点を置いています。両者は競合関係にあるわけではなく、Googleがクエリを解釈し、結果を並べる際に、それぞれ異なる段階を補完し合う同じ系統の言語理解コンポーネントです。
SEOへの影響
BERTは、キーワードを機械的に詰め込む手法を無効化します。モデルが文脈と意図を理解するため、読者向けに明確で自然に書かれたコンテンツは、不自然にキーワードを繰り返すコンテンツよりも高い成果を上げます。実務上は、以下が推奨されます。
会話調で、かつロングテールを含む、実際のユーザーが本当に投げかける質問形式で書く。
前置詞や修飾関係が曖昧にならないよう、文を明確にする。
クエリの意図に的確に答えられるよう、十分な文脈を持ってトピックを扱う。
keyword densityの最適化よりも、意図の充足と読みやすさを優先する。。
根拠
BERTの技術的基盤は、Devlin et al. (2018) の "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding"(arXiv:1810.04805)に示されており、公開当時、GLUEを含む11の自然言語処理ベンチマークで最先端の結果を達成しました。検索への適用に関する数値、すなわち米国における英語検索の10件中1件とfeatured snippetの24か国にわたる改善は、Googleの公式ブログ投稿「Understanding searches better than ever before」(2019)に由来します。