ニューラルネットワーク、CNN、RNN、Transformer、活性化関数、最適化手法に関するG検定対策問題
TransformerのSelf-Attention機構において、QueryベクトルとKeyベクトルの内積(またはScaled Dot-Product)によって計算されるアテンションスコアの主な役割は何ですか?
TransformerモデルにおけるSelf-Attention(自己注意)機構は、入力シーケンス内の要素同士の関係性を捉える上で中心的な役割を果たします。この機構を理解する上で、アテンションスコアの計算とその意味を知ることが重要です。
Query, Key, Value ベクトル
まず、Self-Attentionでは、入力シーケンスの各要素(単語の埋め込みベクトルなど)から、以下の3種類のベクトルが生成されます。
アテンションスコアの計算と役割
アテンションスコアは、特定の要素のQueryベクトル (Q) と、シーケンス内の全ての要素(自身を含む)のKeyベクトル (K) との類似度を計算した結果です。Transformerでは通常、Scaled Dot-Product Attentionが用いられ、内積をキーベクトルの次元数の平方根で割ることで計算されます。
このスコアの直接的な役割は、Queryベクトル(注目している要素)と各Keyベクトル(比較対象の要素)との間の関連性の強さを示すことです。スコアが高いほど、そのQueryとKeyを持つ要素同士の関連性が高いと解釈されます。したがって、選択肢1が正しい役割を示しています。
アテンションウェイトと出力計算への流れ
計算されたアテンションスコアは、それ自体が最終出力ではありません。通常、以下のステップを経て、文脈を考慮した要素の表現が生成されます。
つまり、アテンションスコアは、最終的な出力ベクトルを計算するための中間的な値であり、要素間の関連性を定量化する重要なステップです。
他の選択肢の評価