Codex のモデルが目まぐるしく変わり、レビュー役に合うモデルが分からなくなったので測りました。2026年10月2日時点では、Codex のレビュー役は Astra でなくても GPT-6.1 Sol の xhigh で足りました。
同じ effort どうしで比べると、GPT-6 Astra は5時間枠を Sol の約3〜5倍使い、見つけたバグは1〜2個多いだけでした。重大なバグは、どの組み合わせでも全部見つかっています。
この記事では、測り方と結果の表、Sol の xhigh で足りたと判断したところ、superpowers を入れたときのトークンの増え方を順に書きます。計測の数字は、バグを仕込んだ同じアプリを各条件1回ずつレビューさせた結果で、モデルが替われば変わります。
先に結論
- 重大なバグ3個は、4つの組み合わせすべてが見つけた。誤指摘は0件
- GPT-6.1 Sol の xhigh は14個中13個。5時間枠の使用率は5%進んだ
- GPT-6 Astra の xhigh は14個すべて。5時間枠は14%進んだ
- medium どうしでは Sol が11個、Astra が13個。5時間枠は2%と10%
- Astra の medium は Sol の xhigh と同じ13個で、5時間枠は2倍、時間は約3分の1
- superpowers を入れた Codex はレビュー中に手順書を読みに行き、トークンが25〜37%増えた。見つけた数は増えなかった
Codex の既定は Astra から Sol へ替わったばかり
Codex CLI の既定のモデルは、日本時間の2026年9月5日に公開された 0.153.4 で GPT-6 Astra になり、9月30日の 0.159.1 で GPT-6.1 Sol に替わりました(GitHub のリリースノート: 0.153.4・0.159.1)。設定でモデルを指定していなければ、レビューもこの既定のモデルで回ります。
私はコードを変えたら、Codex にレビューを頼んで直す往復(ラリーと呼んでいます)で確かめています。回し方はラリーのルールの記事に書きました。
9月の5時間制限の記事では、1往復で5時間枠の16%を使っても、レビューの effort は下げないと決めました。ただ、そのときはモデルを比べていません。
OpenAI のヘルプ記事には、モデルを替えると、低い effort でも別のモデルの高い effort を上回ることがある、と書かれています(Managing usage with GPT-6 Astra in Work and Codex・2026年10月2日確認)。Sol の High で良い結果が出ているなら、Astra の Low か Medium から試すように、という一文です。今回の表には、この一文に近い組み合わせが入っています。
Codex のレビューをどう比べたか
バグを仕込んだ小さなアプリを用意して、Codex CLI から同じ依頼文でレビューさせました。返ってきた指摘を正解の一覧と突き合わせて数える道具も、この計測のために作りました。
- 題材: Python の小さなアプリ(6ファイル・約420行)
- 正解: 仕込んだバグ10個と、最初の計測でモデルが見つけた本物の欠陥4個の、計14個。重さは重大3・中8・軽3
- 組み合わせ: GPT-6.1 Sol と GPT-6 Astra を、それぞれ medium と xhigh で。スキル・プラグイン・MCP などは無効にして回した
- 測ったもの: 見つけた数と誤指摘、トークン数(Codex のセッションログ)、5時間枠と週枠の使用率(計測の前後に読んだ値の差)、かかった時間
- 推定クレジット: トークン数に、料金ページの単価を掛けた計算値
テスト用のアプリと正解の一覧は載せません。公開した内容がどこかで学習に使われると、次から測れなくなるためです。
Codex の Sol と Astra の比較結果
測定日は2026年10月2日、Codex CLI 0.160.0、ChatGPT Plus、Windows 11 です。どの数字も各条件1回の結果で、表の Sol は GPT-6.1 Sol、Astra は GPT-6 Astra を指します。
| 組み合わせ | 見つけた数 | 5時間枠 | 推定クレジット | トークン | 時間 |
|---|---|---|---|---|---|
| Sol medium | 11 / 14 | 2% | 2.74 | 13.4万 | 2.2分 |
| Sol xhigh | 13 / 14 | 5% | 5.42 | 22.4万 | 6.9分 |
| Astra medium | 13 / 14 | 10% | 15.88 | 13.7万 | 2.5分 |
| Astra xhigh | 14 / 14 | 14% | 24.44 | 18.3万 | 5.0分 |
重大なバグ3個は、4つの組み合わせすべてが見つけました。誤指摘は、どの組み合わせも0件です。差が出たのは、中と軽の11個のほうでした。
同じ effort どうしで比べると、Astra の5時間枠の減りは、medium で Sol の5倍(2%と10%)、xhigh で2.8倍(5%と14%)でした。見つけた数の差は、medium で2個、xhigh で1個です。週枠の使用率が増えた幅は、どれも0〜2%でした。5時間枠と週枠は整数の%でしか読めないので、1%の差は誤差の範囲です。
推定クレジットでは、Astra は Sol の4.5〜5.8倍でした。料金ページの単価は、Astra が GPT-6.1 Sol の5倍(キャッシュされた入力は10倍)です(2026年10月2日確認)。トークン数は medium でほぼ同じ、xhigh では Astra のほうが2割ほど少なめでした。そのため、推定クレジットの差は、ほぼ単価の差から来ています。
5時間枠の減りの差は、クレジットの差より小さく出ました。料金ページにも、単価だけではプランに含まれる枠の減る速さは決まらない、と書かれています。ヘルプ記事の目安では、Plus の5時間あたりのメッセージ数は Astra が5〜45回、GPT-6.1 Sol が15〜160回です(2026年10月2日確認)。3倍以上の開きがあります。
Sol の xhigh で足りたと判断したところ
今回の計測で Sol の xhigh が見落としたのは、重さが中の1個だけでした。その1個のために Astra の xhigh へ替えると、5時間枠の減りは5%から14%に増えます。
重大なバグ3個を全部見つけた組み合わせのうち、推定クレジットが一番少なかったのは Sol の medium です。ただ medium は中と軽を3個見落としていて、xhigh より2個少ない結果でした。
5時間制限の記事で、レビューの effort は下げないと決めました。今回の計測では、下げると見つける数が実際に減っています。レビュー役は Sol の xhigh のままにしました。
Astra の medium は、Sol の xhigh と同じ数でした
ヘルプ記事の一文に近い組み合わせも、表から読めます。私が比べたのは Sol の High ではなく、それより上の xhigh(Extra High)です。Astra の medium は Sol の xhigh と同じ13個を見つけ、5時間枠は2倍の10%を使いました。
かかった時間は、Astra の medium が2.5分、Sol の xhigh が6.9分で、約3分の1です。今回のアプリでは、Astra の medium に替えても見つけた数は増えず、枠の減りは2倍になりました。待ち時間を縮めたいなら、選ぶ理由はあります。
superpowers を入れると、Codex はレビューの途中で手順書を読みに行きます
superpowers は、作業の進め方をスキル(手順書)の形でまとめたものです。私は Claude Code と Codex の両方に入れていて、superpowers は Codex、特に Astra には重いのではないかと思っていました。そこで superpowers だけを有効にした組み合わせも足しています。
9月にラリーから起動した Codex のログを数えると、49回中48回で、Codex が superpowers のスキルの本文(SKILL.md)を自分で読んでいました。レビューしか頼んでいないのに、手順書を開いていたことになります。
同じ日の計測で superpowers を有効にすると、トークンは Sol の xhigh で25%、Astra の xhigh で37%増えました。推定クレジットは11%と22%増えています。見つけた数は増えず、Sol は13個のまま、Astra は14個から13個に減りました。
セッションログで内訳を見ると、増えた分の大半は、スキルの一覧ではありませんでした。Codex がレビューの途中で SKILL.md を3つ読みに行き、その本文が以後のやり取りに毎回含まれていた分です。一覧そのものは、最初の送信で750トークン前後でした。
依頼文に「レビューの手順として、スキル(SKILL.md)を読み込まない」と1行足して、Sol の xhigh で1回回しました。読んだ SKILL.md は3つから1つに減り、トークンは27.9万から22.8万になりました。superpowers なしの22.4万とほぼ同じで、見つけた数は13個のままです。
ラリーで Codex に渡す依頼文の雛形には、同じ1行を入れました。この1行で SKILL.md を読まなくなったかは、次のラリーのログで確かめます。
この数字の限界
- 各条件1回の結果。ほぼ同じ条件で2回回したときも、見つけたバグが1個入れ替わった
- 5時間枠と週枠は整数の%で、1%の差は誤差の範囲
- 題材は約420行の小さなアプリ。私のラリーでは1往復で16%使った記録があり、%の値はそのまま当てはまらない。比べられるのは倍率のほう
- Codex CLI 0.160.0・ChatGPT Plus・Windows 11 での結果。モデルや CLI が更新されれば数字は変わる
- 推定クレジットは単価から計算した値で、請求額ではない
まとめ
Codex のレビューを Sol と Astra で比べると、2026年10月2日の時点では GPT-6.1 Sol の xhigh で足りました。Astra は5時間枠を Sol の約3〜5倍使い、見つけたバグは1〜2個多いだけでした。
枠の使用率は、タスクバーに出している残量バーと同じところから、計測の前後に読んでいます。モデルが替わったら、同じアプリでまた測って決め直すつもりです。
関連
-
-
Codex の5時間制限は実際どのくらい使えるか。AIレビュー1往復で16%、3往復で枠の半分でした
2026/9/12 AI副業, Claude Code, Codex, コードレビュー
Codex の5時間制限は実際どのくらい使えるか。AIレビュー1往復で使用率16%、3往復で枠の半分の実測と、失敗投入でも減ること、足りないときの回し方、Pro で解けるかを自分の記録で書きます。
-
-
Claude CodeとCodexの使用量をタスクバーに常時表示する。「残量バー」を自作した記録
2026/9/14 Claude Code, Codex, Python, 自作ツール
Claude Code と Codex CLI の残り使用量は /usage・/status を打たないと見えません。タスクバーに常時表示する Windows 常駐ツールを自作し、使用量エンドポイントの実測仕様と、AIレビューで出た欠陥19件をまとめました。
-
-
AIレビューを往復させるルールを作ったら、4往復目に重大指摘がまた4件出ました
2026/8/16 AI副業, Claude Code, Codex, コードレビュー
AIに書かせたコードを別のAIにレビューさせると、1回では終わりません。上限5往復・終了の条件・意見が割れたら人間が裁く、というルールを決めて4件回した実測記録です。重大指摘は一直線に減らず、修正が新しい穴を開けることもありました。