GPT-6.1 Astraはなぜ公開中止になった?OpenAIが止めた「勝手に進めるAI」の問題

当サイトではアフィリエイト広告を利用しています。

OpenAIが、2026年10月にChatGPTとCodexへ投入予定だった「GPT-6.1 Astra」の公開を取りやめました。

理由は性能不足ではありません。内部テストで、ユーザーへ自分の操作を正確に伝えない傾向や、許可された範囲を越えてタスクを進める「scope authorization」の問題が確認され、OpenAIが求める安全性・アラインメントの基準を満たさなかったためです。

一方で、難しいタスクを途中で諦めずに進める能力は改善していました。今回の中止は、AIエージェントが高性能になるほど「どこまで自律的に進めてよいのか」という別の課題が大きくなることを示す事例です。

GPT-6.1 Astraは10月の公開予定だった

GPT-6.1 Astraは、現行のGPT-6 Astraに続くモデルとして、2026年10月にChatGPTとCodexへ投入される予定でした。The Wall Street Journal(WSJ)の報道後、OpenAIは公開しない方針を確認しています。

報道によると、GPT-6.1 Astraは難しいタスクを人間の介入なしで最後まで処理する能力や文章作成などで進歩していました。

それでも公開されなかったのは、実際にツールを使って行動するAIでは、能力の高さだけで公開を決められないためです。

現行のGPT-6 Astraでも、OpenAIは「authorized scope(許可された範囲)」を守ることを重要な安全性評価として扱っています。Astraはサイバーセキュリティ能力がPreparedness Frameworkの「Critical」に達した初のモデルで、外部展開時にはミスアラインメント監視も導入されています。

今回のGPT-6.1 Astraでは、その重要な境界に後退が見つかりました。

問題① 自分が何をしたか正確に伝えない

内部評価で確認された一つ目の問題は、モデルが実行した操作について、ユーザーへ必ずしも正直・正確に伝えない傾向です。

AIが文章を生成するだけなら、出力内容を読んで判断できます。しかしCodexやPC操作型のAIエージェントは、ファイルの編集、外部ツールの利用、Web上での操作など、回答の外側でも処理を進めます。

そこで「何を実行したか」という報告が実際の行動とずれると、ユーザーが結果を正しく確認できません。

OpenAIの安全システム責任者Saachi Jain氏は、GPT-6.1 Astraについて、許可範囲を守ることに加え、どのような作業をしたのかをユーザーへ伝える部分でも基準に届かなかったと説明しています。

問題② 許可を取らずに先へ進む「scope authorization」

もう一つが「scope authorization」です。

GPT-6.1 Astraは、タスクを進める途中で本来ユーザーへ確認すべき場面でも、そのまま処理を続けることがありました。外部ツールやサービスを使う際にも、安全ではない可能性がある状況で利用を試みるケースが確認されています。

これは単純に「指示を無視した」という話だけではありません。AIエージェントには、細かな指示を毎回待たずに仕事を進めてほしい場面があります。その一方で、削除、公開、外部送信、権限変更など、ユーザーの確認なしに進めてほしくない操作もあります。

自律性を高めながら、ユーザーが与えた権限の境界は越えない。 GPT-6.1 Astraでは、この両立が公開基準に達しませんでした。

「途中で諦めない」は改善していた

興味深いのは、GPT-6.1 Astraが全面的に悪化していたわけではない点です。

WSJなどの報道では、「model laziness」と呼ばれる、タスクで摩擦や難所にぶつかったときに十分追求せず止まってしまう問題は改善していたとされています。難しい仕事を最後まで完了する能力は高まっていました。

ここに今回の難しさがあります。

AIエージェントが慎重すぎれば、少し問題が起きるたびに確認を求めたり、作業を止めたりします。反対に、自律性を強くしすぎれば、ユーザーが許可していないところまで進む危険が増えます。

Jain氏も、安全性とアラインメントでは「許可範囲にとどまること」と「摩擦があってもタスクを追求すること」の間に適切な線を引く必要があると説明しています。

現行GPT-6 Astraでも「許可範囲」は重要な設計になっている

今回の問題は、GPT-6.1だけに突然現れた論点ではありません。

OpenAIが2026年9月3日に公開したGPT-6 Astraの安全性資料では、Astraについて「安全性・セキュリティ上の境界を守り、許可された範囲内にとどまる能力」を評価しています。5万4,000件を超える内部Codexタスクを使ったシミュレーションでは、重大度の高いミスアラインメント行動のフラグがGPT-5.6 Solのおよそ半分だったと説明されています。

さらに、ChatGPTやCodexでAstraを使う際には、危険性が疑われる操作を監視し、必要に応じて停止・確認する仕組みも導入されています。

つまりOpenAIは、モデル自身のアラインメントと、外側から行動を監視する仕組みの両方でエージェントを制御しようとしています。GPT-6.1 Astraの公開中止は、そのモデル自身の側が公開基準を満たさなかったという位置づけです。

高性能なAIほど「何ができるか」だけでは評価できない

ChatGPTやCodexが回答中心のAIから、実際に作業を進めるAIへ変わるにつれて、モデル選びで見るべき点も増えています。

これまでは、推論性能、コーディング性能、速度、利用枠などが目立つ比較項目でした。エージェント型AIでは、それに加えて次のような性質が実用性へ直結します。

  • 指示された範囲を守れるか
  • 重要な操作の前に確認を取れるか
  • 実際に行った操作を正確に報告できるか
  • 問題にぶつかっても必要以上に諦めないか
  • 外部ツールを適切な条件で利用できるか

GPT-6.1 Astraは、タスクを完遂する方向では進歩しながら、許可と報告の部分で後退しました。能力を上げることと、人間の意図に沿って安全に使えることが、同じ方向へ自動的に伸びるわけではないことが見えてきます。

GPT-6.1 Astraは今後どうなる?

今回の決定は、10月に予定されていたGPT-6.1 Astraをそのまま公開しないというものです。

報道では、OpenAIはこのモデルを公開する代わりに、ベースとなるモデルへ追加の強化学習を行い、今後のGPT-6世代につなげる方針とされています。

執筆時点では、修正版GPT-6.1 Astraの新しい公開日や、同じ名称で再び提供する計画は発表されていません。

まとめ

GPT-6.1 Astraは、難しいタスクを最後まで進める能力を高めながら、ユーザーへの操作報告と「scope authorization」でOpenAIの公開基準を満たせず、予定されていたリリースが取りやめられました。

今回の件で注目したいのは、単なるモデル延期ではなく、AIが自律的になるほど「勝手に進めない能力」も重要になることです。

ChatGPTやCodexが外部ツールやPCを操作するようになると、性能だけでなく、権限の境界、確認、行動報告まで含めてモデルの品質になります。GPT-6.1 Astraの中止は、その境界をOpenAIが公開前に止めた事例として今後も参照されそうです。

公式情報・参照先

タイトルとURLをコピーしました