AI PICKS
キャンペーンOpenAI公式発表6日前 更新

OpenAI、ChatGPTエージェント対象の安全性バグバウンティ開始 50%再現性を条件に

結論(先に3行)
  1. OpenAIが安全性バグバウンティを開始しました。
  2. ChatGPTエージェントを含むリスクを扱います。
  3. 重大な悪用や安全性リスクの報告を受け付けます。
画像: OpenAI

OpenAIは2026年3月25日、製品全体におけるAIの悪用や安全性リスクの特定に重点を置いた、一般公開のセーフティバグバウンティプログラムを開始しました。ChatGPTエージェントを含むエージェント型製品のリスクも対象です。

対象には、攻撃者のテキストが被害者のエージェントを乗っ取り、有害な操作や機密情報の漏えいを引き起こす第三者プロンプトインジェクションとデータ流出が含まれます。この挙動は少なくとも50%の確率で再現可能である必要があります。

OpenAIのエージェント型製品が、OpenAIのウェブサイト上で許可されていない操作を大規模に実行する場合も対象です。上記以外でも、現実的で重大な被害が見込まれる潜在的に有害な操作は受理される場合があります。

同プログラムは既存のセキュリティバグバウンティを補完します。セキュリティ上の脆弱性の基準を満たさない場合でも、重大な悪用や安全性に関するリスクを伴う問題を受け付けます。

つまり、どういうこと?

つまり、AI が悪用されかねない穴を見つけた人に、OpenAI が報奨金を払う窓口を作ったという話です。

狙いのひとつは、外から届いた文章がそのまま命令として働いてしまい、ChatGPT エージェントが持ち主の意図しない操作をしたり、情報を漏らしたりするケースです。報告が認められるには、その現象を少なくとも 50% の確率で再現できる必要があります。

編集部の見方AI PICKS編集部

「50% の確率で再現できること」という条件に、筆者はちょっと引っかかりました。たまたま一度おかしな動きをした、という報告は受け付けない線引きです。それだけ再現しない怪しい挙動の報告が集まっている、という裏返しにも読めます。

ジェイルブレイクは対象外。不適切な言葉づかいを引き出しただけでは、被害の実証が無い限り受け取ってもらえません。

目を引くのは、モデルの言葉づかいよりも、エージェントが実際に何をしてしまうかに寄せている点です。ブラウザでの調べもの、社内資料の要約。そういう使い方が職場に広がるほど、外から届いた文章がそのまま命令として効いてしまう場面も増えそうです。

そこで気になるのが、OpenAI が予告している非公開のバグバウンティキャンペーンです。ChatGPT エージェントのどのリスクが次に名指しされるのかを見たいところです。

誰に関係するか

ChatGPTエージェントを検証する安全性研究者やセキュリティ研究者に関係します。

出典: OpenAIITmedia AI+も報道

このニュースのツールAIチャットボット
ChatGPT icon
ChatGPT4.65最低料金¥0〜チャット文章生成コード生成
この発表の背景AI PICKS編集部

ChatGPTは、自然な対話を通じて質問回答、文章作成、情報整理、アイデア出しを支援するAIチャットボットです。

AI PICKSの総合評価は4.65(5点満点)、AIチャットボットカテゴリ88ツール中3位、最低料金は¥0〜です。

同じ用途の候補: ClaudeGeminiPerplexity

関連ニュースニュース一覧 >
法人の方へChatGPTの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。