Transformer
Transformerは、自己注意メカニズムを用いて入力シーケンス内のすべてのトークン間の関係を並列に計算するニューラルネットワークアーキテクチャです。Googleの2017年の論文「Attention Is All You Need」で提唱され、GPT、Claude、BERTなどの現代の大規模言語モデル(LLM)の基盤となっています。
Transformerは、再帰(RNN)や畳み込み(CNN)を排し、attentionのみでシーケンスを処理するニューラルネットワークアーキテクチャです。
その核心にあるのがself-attentionで、文中の各単語が他のすべての単語を同時に参照し、文脈的な意味を計算します。
これは、Googleの2017年の論文「Attention Is All You Need」(arXiv:1706.03762)で初めて紹介されました。
逐次処理を行わないため、GPUやTPU上で大規模な並列学習を可能にし、このスケーラビリティが現在のLLM時代への扉を開きました。
GPT、Claude、BERTを含む、現代の主要な大規模言語モデルの多くはTransformerを基盤としています。
Transformerとは何ですか?
Transformerは、self-attentionメカニズムを用いて、入力シーケンス内のすべてのトークン間の関係を1回の処理で計算するニューラルネットワークアーキテクチャです。Googleの研究者による2017年の論文「Attention Is All You Need」で初めて紹介され、シーケンスモデリングを支配していた再帰ニューラルネットワーク(RNN)や畳み込みニューラルネットワーク(CNN)を排し、attentionだけで言語を扱うことで、大きな転換点となりました。
以前のRNNベースのモデルは、単語を前から後ろへ1語ずつ読み進める方式だったため、離れた単語同士の関係を学習しにくく、並列化にも限界がありました。Transformerは文全体を一度に見て、単一の操作で単語間の依存関係を捉え、この設計によってGPUやTPU上での大規模な並列学習が可能になりました。まさにこのスケーラビリティこそが、以下のような大規模言語モデル(LLM)の基盤です。GPT,Claude, andBERTが登場することができました。
コアコンポーネント
自己注意機構
自己注意とは、文中の各単語を他のすべての単語と比較し、それらが互いにどれだけ関連しているかをスコア化したうえで、そのスコアに基づいて各単語の表現を再構成する処理です。たとえば、「The animal didn't cross the street because it was too tired.」という文では、自己注意はその単語を処理する際に、「it」が「animal」を指しているという関係を直接学習します。RNNとの決定的な違いは、単語同士がどれだけ離れていても、その関係を1回の操作で解決できる点にあります。
注意計算は、各単語の埋め込みに学習済みの重み行列を掛けることで得られる3種類のベクトル、Query、Key、Value に基づいて行われます。注意スコアは query と key の類似度から算出され、そのスコアを使って value ベクトルの重み付き和を取ることで、新しい文脈対応の表現が得られます。
マルチヘッド注意機構と位置エンコーディング
Transformer は注意を1回だけ行うのではなく、それぞれが独自の重み行列セットを持つ複数の注意「ヘッド」を並列に実行します(マルチヘッド注意機構)。これにより、モデルは統語的関係と意味的関係のような、異なる種類のつながりを同時に捉えられます。同時に、モデルは単語を順序通りではなく並列に処理するため、語順に関する情報は失われます。これを補うために、位置エンコーディングは位置情報を含むベクトルを各単語の埋め込みに追加します。
エンコーダーとデコーダー
元の論文における Transformer は、複数の層を積み重ねて構成されたエンコーダーとデコーダーで成り立っていました。エンコーダーは入力系列を文脈対応の表現に変換し、デコーダーはその表現を使って出力系列を生成します。後の応用ではこの構造を分離し、それぞれの目的に合わせて適応させました:BERTはエンコーダーのみを使用し、以下のGPTファミリーはデコーダーのみを使用します。
意義と証拠
論文「Attention Is All You Need」(Vaswani et al., 2017)は、Transformerが従来モデルよりも高品質な機械翻訳を実現しただけでなく、学習速度が速く並列化もしやすいことを実験的に示しました。具体的には、WMT 2014の英独翻訳で28.4 BLEUを記録し、当時の最先端を2 BLEU以上上回りました。また、英仏翻訳では41.8 BLEUを達成し、当時の単一モデルとして最高の結果を残しました。
同年、Google AIブログ(Jakob Uszkoreit、2017年8月31日)は、RNNやCNNとは異なり、Transformerは一定数の演算で文中のすべての単語を関連付けられ、学習を最大で1桁高速化できると説明しました。この学習効率と拡張性は、モデルが大きくなるほど性能が向上するという傾向に直結し、その後、会話型AIや生成検索を支える中核アーキテクチャとなりました。