2026年7月30日未明、OpenAIが4つの重大発表を一挙に公開した。断片的なニュースに見えるが、貫く一本の軸がある──「AIがAI自身を作り、最適化する」段階への移行だ。今朝の記事で扱ったDeepMindのAlphaFoldチーム解散(post-190)が「専用モデルから研究する智能体へ」の転換だったとすれば、今回のOpenAIの発表はその同じ潮流を、自社のインフラという最も現実的な場所で証明したものである。
1. GPT-5.6 Solが自社インフラを書き換えた──コスト20%減、Token効率15%増
最大の発表は、旗艦モデルGPT-5.6 SolがOpenAI自身の本番推論スタックの最適化に投入され、実測で成果を出したという点だ。
| 最適化対象 | GPT-5.6 Solがやったこと | 成果 |
|---|---|---|
| 負荷分散・ルーティング | Codex上で本番トラフィックを解析し、見落とされていた算力の偏りを特定。新ルーティング戦略を自らテスト・反復 | スケジューリング規則の自動改善 |
| GPUカーネル | Triton・Gluonでの記述能力を訓練済み。前向き伝播を担う中核コードを自律的に書き換え・最適化 | 推論サービスコスト -20% |
| 推測デコード | ドラフトモデルの規模・構造・モジュールで数百組のアーキテクチャ比較実験を実施。訓練の全工程を自律的に監視し、ハード障害や訓練振動にも自動対処 | Token生成効率 +15%以上 |
| KVキャッシュ・超パラメータ | 従来は「経験則」で粗く設定するしかなかった巨大な設定空間を、実負荷を解析して精密チューニング | シナリオ別の最適配置 |
ポイントは、これが「モデルが自分で自分を書き換える」というSF的なRSIではなく、Codexという道具を介して推論スタックの最適化ループを回す、極めて工程学的な自己改善だという点だ。データ収集 → ボトルネック特定 → 改善実装 → 効果検証、という閉ループを人間の手を大きく減らして回している。
2. 「智能体調度基座」の3つの設計原則
もう一つの主戦場が、ChatGPT WorkやCodexが依存するエージェント・ハーネス(智能体調度基座)だ。1回のユーザー操作でCodexはソース閲覧・デプロイ履歴検索・障害報告参照・ファイル編集・テスト実行と何十回もモデル呼び出しを行う。30回の呼び出しで1秒ずつ遅延が乗れば、損失は積み上がる。
OpenAIの答えは「モデルを速くする」ではなく「システム全体の重複計算と冗長操作を削る」だった。
- コンテキスト膨張の抑制:MCPツール・プラグイン・統合コンポーネントは、実際に呼ばれた時のみコンテキストに遅延ロード。加えて、単一ツールの返却は既定で10,000 Token以内に制限(モデル側から上限変更を申請可能)
- プロンプトキャッシュ前置の保全:モデルに見える履歴データをすべて追記専用(append-only)に。新規メッセージ・ツール返却・環境変更は末尾に足すだけで、前文は書き換えない。これにより前置キャッシュが安定して効く
- 計算結果の再利用:権限承認ルールのような実行時設定は、ツール定義ファイルに固化せず、タスク実行段階で動的に適用
3. ARC-AGI-3の「7.8%」はモデルの欠陥ではなかった
今回もっとも示唆的なのが、この一件だ。GPT-5.6 Solは円周被覆予想などの長年の数学未解決問題を攻略した一方、二次元パズル評価ARC-AGI-3では正答率わずか7.8%(GPT-5.5は0.4%)にとどまっていた。
OpenAIの調査結果は「モデルの能力不足ではなく、エージェント・ハーネスの設定が原因」というものだった。
- 問題1:私的推論の消去 — 1手指すごとに私的な思考過程が全消去され、毎回ルールをゼロから解析させられていた。操作履歴と短い注記は見えても、その背後にある計画・法則認識・思考連鎖は取り出せない
- 問題2:ローリング切り捨て — 累積17.5万文字を超えると古いメッセージから自動破棄。推論どころか自分が何をしたかの記録すら失っていた
そこでResponses APIを使い、推論内容の永続保持とコンテキスト圧縮という2つの設定を有効にしただけで、結果は激変した。
| 条件 | ARC-AGI-3スコア | 出力Token |
|---|---|---|
| ARC-AGI-3の標準ハーネス | 7.8% | 基準 |
| OpenAI公式ハーネス(公開テストセット) | 13.3% | 大幅減 |
| 推論保持+圧縮を完全維持 | 38.3% | 約1/6 |
スコア3倍、Token消費1/6。これはベンチマーク文化そのものへの問題提起だ。モデル同士を比べているつもりで、実際にはハーネスを比べていた可能性がある。OpenAIも「API開発者は自社製品と同じ設定を使うか、モデル比較の際はこの設定で評価されたものを選べ」と明確に推奨している。
4. 翁荔(Lilian Weng)がRSI専任チームを率いて復帰
人事面での最大のニュースが、翁荔(Lilian Weng)のOpenAI復帰だ。
翁荔は7月28日、共同創業者を務めていたThinking Machines Lab(TML)を退社。社内書簡では「過去7か月間、前例のない病苦に見舞われ、継続的なストレスと業務負荷が身体の限界を超えた。スタートアップに必要な高強度のペースを維持できない」と説明し、次の職は「責任範囲がより明確で、環境がより予測可能な、共同創業者ではないポジション」を望むと記していた。
ところがわずか1日後、OpenAI広報がTechCrunch・Business Insider・The Informationに対し復帰を確認。「自ら陣頭指揮を執り、再帰的自己改善(RSI: Recursive Self-Improvement)に特化したチームを率いる」という。退社のタイミングは、TMLが初のオープンウェイト基盤モデル「Inkling」を公開した直後だった。
| 時期 | 経歴 |
|---|---|
| 2018年 | 北京大学卒業後、OpenAI入社。初期はロボティクスに従事 |
| 〜2023年 | 応用AI研究チームを統括。GPT-4公開後、Safety Systemsチームの統合を担当 |
| 2024年8月 | 研究・安全担当バイスプレジデントに昇任 |
| 2024年11月 | OpenAI退社。Mira Murati創業のThinking Machines Labへ |
| 2026年7月 | TML退社 → 翌日OpenAI復帰、RSIチーム統括 |
そしてこの一件は、TMLにとって深刻な出血でもある。創業6名の共同創業者のうち、Andrew TullochはMetaへ、Barret ZophとLuke Metzは翁荔より先にOpenAIへ復帰済み。残るのはCEO Mira Muratiと首席科学者John Schulmanの2名のみだ。創業時42名のチームからも複数の離脱が報じられている。フロンティア研究の人材が、再び少数の拠点へ再集中しつつある。
5. OpenAIの「AI研究者」ロードマップ──2026年9月と2028年3月
RSIはOpenAIにとって思いつきの研究テーマではない。首席科学者Jakub Pachockiは今年3月、全自動の「AI研究者」構築が今後数年の「北極星」だと明言している。内部で設定された段階目標は具体的だ。
- 第1段階:2026年9月 — 少数の具体的な研究課題を独立して処理できる「自律AI研究インターン」の実現
- 第2段階:2028年3月 — 自ら仮説を提起し、実験を設計し、結論を導く全自動マルチエージェント研究システムの投入
第1段階の期限は、あと2か月足らずである。
6. 規模・ハードウェア・そしてAltmanの警告
- ユーザー規模:10億人を初突破、法人顧客200万社。モデル性能だけでなく、配布網でも他社を引き離した
- ハードウェア:社長Greg Brockmanが「OpenAIはAIハードウェアを開発中。ユーザーは間もなく目にするかもしれない」と示唆。形態については「大半のケースで、人はコンピュータと対話することを選ぶだろう」との見解
- Altmanの警告:同じ7月30日、Sam Altmanは「AIの過小評価されているリスクの一つは、人々が思考をAIに過度に依存し、自らの思考能力が徐々に退化することだ」と発言。自社が自己改善の加速を誇示した同じ日に、CEOが人間側の劣化を警告するという構図になった
7. まとめ──競争軸は「モデル」から「フルスタック工程」へ
今回の一連の発表から読み取れる論点は3つだ。
- RSIは既に現実になっている、ただし地味な形で:AIが自分の重みを書き換えるのではなく、AIが自分を動かすインフラを最適化する。コスト-20%・効率+15%という数字は、その最初の実測値である
- ベンチマークの信頼性が揺らいだ:同じモデルがハーネスの設定次第で7.8%にも38.3%にもなる。今後のモデル比較は「どのハーネスで測ったか」の明記なしには意味を持たない
- 競争は全スタック工程化の勝負へ:アルゴリズム研究・推論最適化・エージェント調度が層をなして積み上がる。低コスト・高効率・大規模展開を提供できるかどうかが、AI応用の敷居を決める
朝のAlphaFoldチーム解散と、夕方のOpenAI RSI。方向は同じだ──AIは「作られる対象」から「作る主体」へ移りつつある。2026年9月の「AI研究インターン」が本当に登場するかどうかが、次の答え合わせになる。
本記事は、2026年7月30日付 智东西、AI快看、IT之家、Business Insider、TechCrunch、The Information などの報道に基づいて作成。