Knowledge Cutoff
知識カットオフとは、大規模言語モデル(LLM)が学習したデータの終了日を示す日付のことです。この時点以降に作成された出来事や情報は、モデル自身の知識には含まれません。それ以降の情報については、ウェブ検索やRAGのような外部ツールで補う必要があり、そうしなければモデルは正確には把握できません。
知識のカットオフとは、LLMの学習データがカバーする最終時点のことであり、それ以降に起きたことや公開されたものは、モデル自身の知識の範囲外にあります。
カットオフ以後の出来事についての質問では、モデルはそれを知らないと認めることもあれば、古い情報を現在の情報として自信を持って提示してしまうこともあります。これはハルシネーションの一種です。
Anthropicは、自社モデルのドキュメントにおいて、reliable knowledge cutoffと、training data cutoffという、より広い概念を区別しています。
RAGとWeb検索(grounding)は、回答時に最新情報を取り込むことで、このギャップを埋めます。
GEOの観点では、AIシステムがコンテンツを取得して引用できるように最適化することは、将来のモデルに組み込まれるのを待つよりも、カットオフを回避する現実的な方法です。
その意味
知識のカットオフとは、LLMの事前学習に使用されたデータの終点を指します。モデルはその日付までに収集されたテキストから世界の理解を形成しており、その後に起きた出来事、発表、統計、製品発売については、別途与えられない限り本来的には認識していません。カットオフが2025年1月のモデルに2025年6月の出来事について尋ねても、正確には答えられません。その出来事については学習していないからです。
重要な注意点として、知識のカットオフはモデルのリリース日と同じではありません。学習、安全性評価、デプロイには数か月かかるため、リリース日は通常カットオフより後になります。言い換えれば、「新しい」モデルだからといって、自動的に新しい情報を知っているわけではありません。
Reliable Cutoff と Training Data Cutoff
最近では、モデル提供者はカットオフを単一の日付ではなく、2つの異なる概念として説明するようになっています。Anthropicの公式ドキュメントでは、次のように定義されています。reliable knowledge cutoffは、モデルの知識が最も網羅的で信頼できる時点を指し、training data cutoffは、実際に学習データが及ぶ日付範囲の広がりを指します。この区別により、より後の日付の素材が一部含まれていたとしても、カバーが疎であるため信頼性が低くなりうることが明確になります。
下の表は、Anthropicの公式モデルドキュメントに記載されている実際のカットオフを示しています(2026年6月時点)。
モデル | Reliable knowledge cutoff | Training data cutoff |
|---|---|---|
Claude Opus 4.8 | 2026年1月 | 2026年1月 |
Claude Sonnet 4.6 | 2025年8月 | 2026年1月 |
Claude Haiku 4.5 | 2025年2月 | 2025年7月 |
他のプロバイダーも、モデルごとにカットオフを公開しています。OpenAIの開発者向けドキュメントによると、GPT-5.5の知識カットオフは2025年12月1日、GPT-5.4は2025年8月31日です。GoogleのGeminiも同様に、各モデルにカットオフ日を設定しており、新しい情報が必要な場合はSearch Groundingツールの利用を案内しています。
制限:最新性とハルシネーション
知識カットオフには、実務上2つの問題があります。1つ目は、最新性の欠如です。価格変更、新製品のリリース、法規制やポリシーの変更、スポーツの結果など、カットオフ以降の出来事はモデルには分からないため、そのような質問には答えを控えるか、不完全な回答を返します。
2つ目はハルシネーションです。分からないと認める代わりに、モデルが学習期間中の古い事実を現在の情報であるかのように自信を持って提示したり、もっともらしいが実在しない情報を作り出したりすることがあります。カットオフ付近の出来事は、学習データに断片的にしか現れないため、特に誤りが起きやすくなります。このため、モデルが自己申告するカットオフ日でさえ、必ずしも信頼できるとは限りません。公式ドキュメントで確認するほうが安全です。
回避方法
知識カットオフの制約は、モデルを再学習させずに外部情報を注入することで対処できます。一般的な方法は2つあります。
ウェブ検索とグラウンディング: モデルが回答を生成する前にリアルタイムでウェブを検索し、最新の情報を取り込みます。ChatGPTのウェブ検索、Perplexity、GoogleのSearch Groundingはいずれもこの仕組みで動作します。これにより、モデルは出典付きでカットオフ以降の情報にも対応できます。
RAG(Retrieval-Augmented Generation): 関連文書を外部の知識ベース(社内文書や最新のデータベースなど)から取得し、プロンプトに挿入します。モデルの重みは変更せず、回答時に必要な最新情報や専門情報をコンテキストとして供給することで、カットオフに関係なく精度を向上させます。
両者に共通しているのは、モデルのパラメータ(学習済みの知識)を変更せず、代わりに推論時に外部情報をコンテキストとして取り込むことです。その結果、検索や検索インデックス上で十分に可視化されていれば、カットオフ後に作成されたコンテンツでもAIの回答に反映されます。
SEOとGEOにとっての意味
knowledge cutoff は、生成エンジン最適化(GEO)において非常に重要です。コンテンツが直接モデルの学習に使われ、「知識」として組み込まれるのを待つのは現実的な戦略ではありません。素材が学習データに含まれるかどうかを外部からコントロールする余地はほとんどなく、たとえ含まれたとしても、次のモデルが学習・公開されるまでに数か月、場合によっては数年かかることがあります。さらに、cutoff 付近の情報は信頼性が低くなります。
より効果的な戦略は、AI システムが回答を作成する際に、リアルタイムで検索・引用できるようにコンテンツを最適化することです。cutoff 後の情報を扱う AI の回答は、ほぼ例外なく web search や RAG を通じて外部コンテンツを取り込みます。そのため、見つけやすく、引用しやすい形式でコンテンツを作ること、つまり明確な出典、structured data、簡潔で事実重視の文章が、cutoff を回避する鍵になります。実際、OpenAI と Google はどちらも、鮮度が重要なクエリでは、学習済み知識ではなく web search と grounding を使うよう設計されているため、インデックス化され、引用可能なコンテンツの価値はさらに高まります。
実行チェックリスト
価格、統計、ポリシー、スケジュールなど、鮮度が重要な情報については、ページ上に明確な更新日を表示し、AI searchがどの程度最新かを判断できるようにします。
主要な事実は、出典や根拠とあわせて簡潔に示し、AI が引用しやすくします。
structured data と明確なタイトル、要約を用意し、search と RAG の段階でコンテンツが見つかりやすくなるようにします。
モデルの学習済み知識に依存する回答と、リアルタイム検索に基づく回答を区別し、後者に表示されるようコンテンツを最適化します。
出典
Anthropic — Models overview (Claude API Docs, reliable knowledge cutoff vs training data cutoff)
Anthropic — How up-to-date is Claude's training data? (Claude Help Center)
OpenAI — Models (Developer API Docs, GPT-5.5 / GPT-5.4 knowledge cutoff)
Google — Gemini API Docs (knowledge cutoff & Search Grounding)