定義
注意シンクとは、Transformerの自己注意機構において、意味的な関連性が薄いにもかかわらず特定のトークン(多くは先頭トークン)に注意重みが集中する現象のこと。
注意シンク (Attention Sink)とは(詳しく解説)
注意シンクは2023年にStreamingLLMの研究で報告された現象で、Transformer系LLMの自己注意機構において先頭付近の特定トークンが意味的重要性とは無関係に高い注意重みを受け続けることを指すとされる。これはsoftmaxの正規化特性上、注意を「捨てる先」が必要になるためと説明される。長文脈推論でKVキャッシュを削減する際、この注意シンクトークンだけを残せば古い文脈を破棄しても出力品質が大きく劣化しにくいことが知られており、StreamingLLMやそれに続く効率化手法の基盤になっている。2026年時点の実運用では、長文脈対応をうたうモデルやフレームワークの多くがこの性質を前提にKVキャッシュ圧縮を行っているため、独自にコンテキスト管理を実装する場合は注意シンクの扱いを誤るとコスト削減と引き換えに文脈追跡精度が落ちる落とし穴がある。現場でモデルやライブラリを選ぶ際は、長文脈での応答一貫性が実際に保たれるかをベンチマークで確認し、単純なトークン数の相場感だけで判断しないことが望ましいとされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「注意シンク (Attention Sink)とは」 https://aipicks.jp/glossary/attention-sink
注意シンク (Attention Sink)の使用例
- 長文脈チャットボットの設計時に「先頭トークンを常にKVキャッシュへ残す」設定は、注意シンクを保持するための典型的な対策とされる。
- 「なぜLLMは会話の最初の発言に妙に注意を向け続けるのか」という疑問への説明として、注意シンクの存在が挙げられることが多い。