定義
Many-shotジェイルブレイクとは、プロンプト内に禁止行為を許容する大量の偽対話例を詰め込み、LLMの安全制御を段階的に突破する攻撃手法のこと。
Many-shot ジェイルブレイクとは(詳しく解説)
Many-shotジェイルブレイクは、大規模言語モデルの長いコンテキストウィンドウを悪用し、禁止行為を許容するダミー対話を数十〜数百件連続で入力することで、モデルに「この形式の応答は許可されている」と誤学習させ安全策を回避する攻撃手法とされる。2026年時点ではコンテキストウィンドウが数十万トークン規模のモデルが主流となり、攻撃者が詰め込める偽事例数も増えリスクが相対的に高まっているとされる。実運用の現場では入力トークン数の異常検知や会話履歴内の反復パターン検出をガードレールに組み込む対策が広く採用されているが、検知ロジック整備には追加のコストがかかるため、専用のAIセキュリティツール導入可否を含めた選定が求められる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「Many-shot ジェイルブレイクとは」 https://aipicks.jp/glossary/many-shot-jailbreak
Many-shot ジェイルブレイクの使用例
- システムプロンプトの後に、模擬的な有害回答のやり取りを100件以上連続で並べ、最後に本来の禁止質問を投げる入力形式。
- 長いコンテキストウィンドウを持つモデルほど詰め込める偽事例数が増え、攻撃の成功率が上がるとされる。