AI PICKS
調査・データAWS Machine Learning Blog (日本語)公式発表2時間前

AWS、「Amazon Bedrock」のOpenAIモデルを実測比較 正解1件0.0021ドルでLunaが最安

結論(先に3行)
  1. AWSが「Amazon Bedrock」で動くOpenAIモデルの実測比較を公開しました。
  2. 7月30日の値下げ後、AIMEの正解1件あたりは0.0021ドルでした。
  3. 生成AIのモデル選びで費用を抑えたい企業の担当者が対象です。
画像: AWS Machine Learning Blog (日本語)

AWSが、機械学習ブログで「Amazon Bedrock」上のOpenAIモデルの実測比較を公開しました。1トークンあたりの単価ではなく、正解1件にいくらかかったかを測っています。

比べたのは「Amazon Bedrock」で動くgpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solです。これにOpenAI APIのgpt-5.4-mini、gpt-5.4-nanoを加えました。数学コンテストのAIME、大学院レベルの科学問題GPQA Diamond、MMLU-Proで正答率と費用を測っています。採点は自動チェックとgpt-5.5による採点の組み合わせです。

AIMEの正答率はsolが75%、miniが37%でした。GPQA Diamondは68%と43%、MMLU-Proは82%と59%です。2026年7月30日にlunaが80%、terraが20%値下げされました。これを反映すると、AIMEの正解1件あたりの費用はlunaが0.0021ドル、miniが0.0139ドルです。

「Amazon Bedrock」側は推論 (答えを出す前に考える処理) を切って動かし、OpenAI API側は初期設定のまま動かしています。対象の問題数は48件から198件で、小さな差は目安として読む前提です。検証に使った仕組みはオープンソースで置かれており、自社の業務タスクで同じ測り方を試せます。

つまり、どういうこと?

つまり、AIのモデルは「1トークンいくら」で比べても実際の請求額は読めない、という話です。安いモデルほど間違いが混ざり、やり直した分だけ費用が積み上がります。そこで正解1件にいくらかかったかで測り直すと、安いはずのモデルが最安ではなくなりました。電卓を安く買っても、打ち間違いが多ければ結局やり直しの手間がかかるのと似ています。

編集部の見方AI PICKS編集部

モデル比較の記事なのに、最初に出てくるのが単価表への疑いでした。筆者はこの切り出し方をちょっと意外に感じています。

安いモデルほど間違えます。やり直した分は、そのまま請求に乗ります。当たり前のようでいて、稟議に出てくるのはたいてい単価の方。値下げ幅よりも、正解1件あたりの費用を持っていった方が話は早そうです。

単価競争から、成果あたりの費用へ。検証の仕組みをオープンソースで置いてきたのは、かなり実務寄りの姿勢だと思います。同じ指標を持ち出す競合も、そのうち出てきそうです。

次の値下げ発表で、各社が正解1件あたりの費用まで添えてくるかを見たいところです。

誰に関係するか

生成AIの導入費用を見積もっている人は、単価表ではなく自社の業務で正解1件にいくらかかるかを測れるようになります。

出典: AWS Machine Learning Blog (日本語)

このニュースのツールAIコーディング
Amazon Bedrock icon
Amazon Bedrock3.67最低料金¥0〜AIエージェント自律AILLM
この発表の背景AI PICKS編集部

「Amazon Bedrock」とは、AWSが提供する生成AIアプリ・エージェント構築向けのフルマネージドサービス。Anthropic Claude、Meta Llama、Amazon Nova、Mistral AIなど数百の基盤モデルを単一APIで呼び出せる。料金はモデル・トークン数に応じた従量課金制。

AI PICKSの総合評価は3.67(5点満点)、AIコーディングカテゴリ98ツール中41位、最低料金は¥0〜です。

同じ用途の候補: Hugging FaceGitHub CopilotLangChain

関連ニュースニュース一覧 >
法人の方へAmazon Bedrockの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。