TrustRank
TrustRankは、人手で検証された少数のシードサイトから開始し、リンクを通じて信頼を伝播させ、信頼がほとんど届かないページをスパムの可能性が高いものとしてフラグ付けする半自動のリンク解析アルゴリズムです。これは、ウェブスパム対策の手法として、2004年にスタンフォード大学とYahoo!の研究者によって提案されました。
TrustRankは、人間が検証した信頼できるシードサイトから始まり、リンクに沿って信頼を広げ、信頼がほとんど届かないページをスパムとして分類する半自動アルゴリズムです。
これは2004年に、スタンフォード大学のZoltan GyöngyiとHector Garcia-Molina、Yahoo!のJan Pedersenによって、論文Combating Web Spam with TrustRankで紹介されました。
その中核となる考え方は、近似的隔離の原理です。良質なページは他の良質なページにリンクする傾向があり、スパムへはほとんどリンクしません。
報告によると、200未満の高品質なシードであっても、ウェブ全体の広い範囲にわたってスパムを効果的に除外するのに十分だとされています。
概要
TrustRankは、検索結果で不当に高いランキングを獲得しようとするWebスパムを見分けるために設計された、リンクベースの信頼伝播アルゴリズムです。ウェブ全体を手動で調査するのは非常にコストが高いため、この手法は人間が信頼できると判断した少数のシードページから始め、ウェブのリンク構造に沿ってその信頼を自動的に広げます。ページがシードから離れているほど受け取る信頼は少なくなり、信頼がほとんど届かないページはスパムの可能性が高いものとして扱われます。
この手法を特徴づけているのは、シードを選ぶ人間主導のステップと、信頼を伝播するアルゴリズムのステップを組み合わせた半自動設計です。人間の判断と機械のスケーラビリティを組み合わせることで、わずかな手動作業でウェブの広い範囲にわたるスパムの除外を目指しています。
仕組み
オラクル関数とシード選定
TrustRankでは、ページがスパムか高品質かを判断する人間の専門家を、オラクル関数として扱います。そのようなレビューにはコストがかかるため、アルゴリズムは、評価が必要なページ数をできるだけ少なくするようにシード候補を選びます。候補の選定には逆PageRankが用いられ、ウェブグラフのインリンクとアウトリンクを反転させ(転置行列でPageRankを実行し)、多くの他ページへ効率的に信頼を広げられる高い伝播到達力を持つページを浮かび上がらせます。その後、人間の専門家がこれらの候補を評価し、最終的な信頼済みシード集合を構築します。
信頼の伝播と減衰
信頼できるシードが一度固定されると、それらに割り当てられた信頼スコアはリンクをたどって隣接ページへと伝播します。これはPageRankと同様に反復的に進み、各ステップでノードの信頼スコアは指し示す隣接ノードへ分配され、固定の係数(減衰)によって低減されます。その結果、シードからのリンク距離が大きいほど到達する信頼は低くなり、信頼がほとんど届かないページは低い信頼スコアになります。
近似的隔離の仮定
この伝播を意味のあるものにしているのは、良質なページは他の良質なページへリンクし、スパムへはほとんどリンクしないという経験的観察であり、これは良質集合の近似的隔離として知られています。この仮定のおかげで、信頼できるシードに由来する信頼は主として高品質なページの間を流れ、スパム領域に届くことはまれだと期待されます。
歴史とSEO上の誤解
TrustRankは、スタンフォード大学とYahoo!による共同研究として、2004年8月に第30回VLDB(Very Large Data Bases)国際会議で発表されました。この論文は、200ページ未満の高品質なシード集合で、ウェブのかなり広い範囲にわたるスパムを効果的に分離できることを示しました。この考え方は、GoogleのPageRankがリンク操作に対して脆弱であるという懸念から生まれたものであり、信頼の起点をシードに明示的に固定している点が異なります。
SEO業界では、「GoogleはTrustRankをそのまま使っている」や「すべてのサイトに公開されたTrustRankスコアがある」といった見解が広く流通していますが、これは正確な理解を反映したものではありません。Wikipediaなどの情報源では、この系統のアルゴリズムの考え方がYahoo!やGoogleの検索エンジンに取り入れられていると記されていますが、Googleが論文のTrustRankを実運用のランキングで使っていることを公式に確認したことは一度もありません。Googleが別途出願した「Trust Rank」の商標や、いくつかのツールが持つ独自の指標も、元論文のTrustRankとは区別して考える必要があります。実務上の要点は、いかなるスコアそのものではなく、信頼できるソースからのリンク距離や良い近隣関係がスパム判定のシグナルになり得るという原理レベルの洞察にあります。