定義
CoT監視可能性とは、AIモデルが出力を導く思考過程(Chain of Thought)を人間や監視システムが読み解ける状態を保つ性質のこと。
CoT監視可能性 (CoT Monitorability)とは(詳しく解説)
CoT監視可能性とは、LLMが最終出力に至るまでの中間的な思考過程(Chain of Thought)を、外部の監視機構が意味のある形で読み取り、危険な意図や欺瞞的な推論の兆候を検知できる度合いを指す概念とされる。OpenAIやAnthropicなど主要AIラボが2025年以降のセーフティ研究で重視し始めた指標で、モデルの推論が自然言語に近いほど監視しやすく、強化学習で圧縮・最適化された思考過程ほど人間には読めなくなるというトレードオフが指摘されている。2026年時点の実運用では、コーディングエージェントや自律型AIエージェントの推論ログをそのまま信頼せず、出力結果との整合性チェックを併用する現場が増えている。導入コストは推論ログの保存・監査体制の構築次第で変動するため、まずは重要度の高いタスクに絞って監視範囲を絞り込む選び方が現実的とされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「CoT監視可能性 (CoT Monitorability)とは」 https://aipicks.jp/glossary/cot-monitorability
CoT監視可能性 (CoT Monitorability)の使用例
- コーディングエージェントが出力した思考過程ログを確認し、意図しないファイル削除の兆候がないか監査する運用例。
- 強化学習で最適化されたモデルの思考ログが、人間には解釈しにくい記号列に変質してしまうケースが指摘されている。