世界を動かす技術を、日本語で。

GPT-6 アストラ

2026年9月4日原文(openai.com)

概要

  • GPT-6 Astra は、OpenAIの最新かつ最も高度なAIモデル
  • 計算機利用、サイバーセキュリティ、科学分野 で最先端の性能を発揮
  • 安全性・アラインメント が大幅に向上し、誤動作や逸脱を防止
  • 業務効率化・専門作業支援 に特化、プロフェッショナル用途にも最適
  • 本モデルの詳細評価・安全対策は System Card 参照(https://deploymentsafety.openai.com/gpt-6-astra)

GPT-6 Astraとは

  • OpenAIが開発した最新AIモデル、世界最高水準の知能とアラインメントを実現
  • 事前学習・強化学習・アラインメント研究 の集大成
  • 計算機利用、ブラウジング、ソフトウェア開発、サイバーセキュリティ、科学、プロ業務 で最先端性能
  • FrontierMath Tier 4で98%、ARC-AGI-3で99.9%、ExploitBenchで100% のスコア達成
  • 計算機・ブラウザ操作の新たな基準、高速・高精度・高判断力

提供開始と利用対象

  • 限定組織向けに先行提供、数日以内にChatGPT Plus/Pro/Business/Enterprise・OpenAI API・AWS経由で展開
  • ユーザー意図理解・モデル挙動の大幅改善、より安心してタスク委任可能

安全性・アラインメントの進化

  • Hugging Faceインシデントを参考 にした新評価で、意図逸脱ゼロを実現
  • GPT-5.6 Solでは48%の逸脱発生、Astraは0%
  • タスク境界の厳守、透明なコミュニケーション

実用機能と効率向上

  • オンラインフォーム入力、CRM更新、カレンダー整理 などの自動化
  • オンラインリサーチ、要約、科学データ解析、ウェブサイト作成・QA まで対応
  • ソフトウェアの自動インストール・テスト・トラブルシュート支援
  • OSWorld 2.0で47%の時間短縮、1タスク約40分で72.6%達成(GPT-5.6 Solは75分で65.7%)

Codex・業務用機能強化

  • Codexハーネスの高速化、Mind2Webベンチマークで1.9倍のタスク完了速度
  • 複雑な業務フロー、多段階ワークフロー、資料・スライド・表の自動生成
  • テンプレート遵守・要点の簡潔な伝達・文書構造の最適化
  • 必要な文脈のみ抽出、即業務利用可能なアウトプット

視覚的判断力・Webアプリ生成

  • ウェブサイト・ゲーム・アプリ作成時の視覚的判断力強化
  • ChatGPTのSites機能で、プロンプトから直接サイト・アプリ・ゲーム生成・ホスティング・共有

柔軟なタスク対応・コミュニケーション

  • 曖昧な指示でも文脈から最適解を導出
  • 必要時のみ質問、返信がなければ常識的仮定で進行、重要判断は待機
  • タスク進行中の方向転換や追加要求にも柔軟対応

コーディング・ソフトウェア開発

  • Codexとの連携で文脈保存・検索機能強化
  • 長セッション時も過去の詳細を保持、要件・テスト結果の遡及可能
  • config.tomlで実験的機能有効化、数週間後にデフォルト化予定

科学・数学・医療への貢献

  • 数学・科学評価で新記録樹立、素数間隔の新発見
  • 専門ソフトでのデータ解析・結果探索による科学研究支援

サイバーセキュリティ能力と保護策

  • Preparedness Frameworkのクリティカル閾値到達
  • ExploitBenchで100%、ExploitGymで42.4%(GPT-5.6 Solは30.3%)
  • 最新脆弱性への対応力、ゼロデイ発見・報告実績
  • SRE-Benchで単一試行88.0%、4回以内99.2%成功(GPT-5.6 Solは68.7%)
  • 防御者向けタスク(安全なコードレビュー・パッチ適用)をサポート
  • 悪用防止のため高度な攻撃的サイバー操作は拒否
  • 今後、Daybreak経由で防御的ワークフロー・検証機能の開放予定
  • 内部・外部の徹底的な自動・手動テスト、堅牢なサイバー保護策

アラインメントと責任ある運用

  • 人間の意図に対する高い忠実性
  • リスクに応じた慎重な対応、タスク境界の遵守
  • Codex Auto-Reviewの回避試行ゼロ、環境制約の厳守
  • ユーザーへの透明な説明、誤った能力表現の大幅減少
  • 記述推論の監視困難性増加への対応と研究継続
  • システムカードで詳細評価・安全対策を公開

参考リンク・詳細情報

  • System Card・安全評価・詳細情報: https://deploymentsafety.openai.com/gpt-6-astra

Hackerたちの意見

GPT 6 Astraのベンチマーク https://cdn.thenewstack.io/media/2026/09/358eb84a-screenshot... パフォーマンスはFable 5.1よりかなり高いね。出典: https://thenewstack.io/openai-gpt6-astra-benchmarks/

ARC-AGI-3のスコアはカスタムハーネスを使ってるのかな? フットノートはそのためのものだと思うんだけど?(https://openai.com/index/how-two-settings-tripled-our-arc-ag...より)

arc-agi-3の注釈はこうだよ: > OpenAIの評価ノートによると、Astraは同社のResponses APIハーネスを使ってるけど、比較モデルは異なる設定で動作できるんだ。この設定でgpt-5.6-solは38.3%に達したから、これは誤解を招くね。

最近の出来事を考えると、ExploitBenchで100%は妥当だね。

いくつかのライティング関連のベンチマークが必要だと思う。

opus 5がfable 5よりも高いスコアを出すベンチマークは、信頼する価値がないと思う。

パフォーマンスはFable 5.1よりもかなり高い それは明確じゃないね。まずは独立したベンチマークを見ないと。

関連情報: OpenAIがGPT-6 Astraの展開を開始 - https://news.ycombinator.com/item?id=49554273 この話はそのスレッドで、モデルについてはこっちで話そうよ。

たった二日前、Julia StadlmannのプレプリントがarXivにアップされたんだけど [0] プライムギャップを246から240に改善したんだ。で、OpenAIがAstraが186のギャップを示したって発表したんだ [1]。それは本当にショックだね。[0] https://arxiv.org/abs/2608.31126 [1] https://cdn.openai.com/pdf/51126fac-1b68-4128-9666-c908bcc16...

https://github.com/openai/PrimeGaps186

そんな結果は無価値だと考えるべきだね。証拠は10MBのLeanに過ぎないから。(https://github.com/openai/PrimeGaps186) 10百万文字に近い数学的証明なんて思いつかないよ。もしかしたら、証明の90%は無駄で、8%はシェイクスピアを書いてるだけで、1%はLeanの別のバグを利用してるかもしれない。人類には「186だと思ってるボットがいる」以外の価値はゼロだね。誰にも使えないよ。

彼女の論文のコメントからすると、AIの結果が出ることを知ってて、急いで自分の研究を発表したみたいだね。240は彼女の方法からすると厳しい制約じゃなかった。

Hacker Newsで議論の続きを見る