AI副業実践記

Codex の Sol と Astra をレビューで比較。Astra は5時間枠を約3〜5倍使い、見つけたバグは1〜2個多いだけでした

Codex のモデルが目まぐるしく変わり、レビュー役に合うモデルが分からなくなったので測りました。2026年10月2日時点では、Codex のレビュー役は Astra でなくても GPT-6.1 Sol の xhigh で足りました。

同じ effort どうしで比べると、GPT-6 Astra は5時間枠を Sol の約3〜5倍使い、見つけたバグは1〜2個多いだけでした。重大なバグは、どの組み合わせでも全部見つかっています。

この記事では、測り方と結果の表、Sol の xhigh で足りたと判断したところ、superpowers を入れたときのトークンの増え方を順に書きます。計測の数字は、バグを仕込んだ同じアプリを各条件1回ずつレビューさせた結果で、モデルが替われば変わります。

先に結論

  • 重大なバグ3個は、4つの組み合わせすべてが見つけた。誤指摘は0件
  • GPT-6.1 Sol の xhigh は14個中13個。5時間枠の使用率は5%進んだ
  • GPT-6 Astra の xhigh は14個すべて。5時間枠は14%進んだ
  • medium どうしでは Sol が11個、Astra が13個。5時間枠は2%と10%
  • Astra の medium は Sol の xhigh と同じ13個で、5時間枠は2倍、時間は約3分の1
  • superpowers を入れた Codex はレビュー中に手順書を読みに行き、トークンが25〜37%増えた。見つけた数は増えなかった

Codex の既定は Astra から Sol へ替わったばかり

Codex CLI の既定のモデルは、日本時間の2026年9月5日に公開された 0.153.4 で GPT-6 Astra になり、9月30日の 0.159.1 で GPT-6.1 Sol に替わりました(GitHub のリリースノート: 0.153.4・0.159.1)。設定でモデルを指定していなければ、レビューもこの既定のモデルで回ります。

私はコードを変えたら、Codex にレビューを頼んで直す往復(ラリーと呼んでいます)で確かめています。回し方はラリーのルールの記事に書きました。

9月の5時間制限の記事では、1往復で5時間枠の16%を使っても、レビューの effort は下げないと決めました。ただ、そのときはモデルを比べていません。

OpenAI のヘルプ記事には、モデルを替えると、低い effort でも別のモデルの高い effort を上回ることがある、と書かれています(Managing usage with GPT-6 Astra in Work and Codex・2026年10月2日確認)。Sol の High で良い結果が出ているなら、Astra の Low か Medium から試すように、という一文です。今回の表には、この一文に近い組み合わせが入っています。

Codex のレビューをどう比べたか

バグを仕込んだ小さなアプリを用意して、Codex CLI から同じ依頼文でレビューさせました。返ってきた指摘を正解の一覧と突き合わせて数える道具も、この計測のために作りました。

  • 題材: Python の小さなアプリ(6ファイル・約420行)
  • 正解: 仕込んだバグ10個と、最初の計測でモデルが見つけた本物の欠陥4個の、計14個。重さは重大3・中8・軽3
  • 組み合わせ: GPT-6.1 Sol と GPT-6 Astra を、それぞれ medium と xhigh で。スキル・プラグイン・MCP などは無効にして回した
  • 測ったもの: 見つけた数と誤指摘、トークン数(Codex のセッションログ)、5時間枠と週枠の使用率(計測の前後に読んだ値の差)、かかった時間
  • 推定クレジット: トークン数に、料金ページの単価を掛けた計算値

テスト用のアプリと正解の一覧は載せません。公開した内容がどこかで学習に使われると、次から測れなくなるためです。

Codex の Sol と Astra の比較結果

測定日は2026年10月2日、Codex CLI 0.160.0、ChatGPT Plus、Windows 11 です。どの数字も各条件1回の結果で、表の Sol は GPT-6.1 Sol、Astra は GPT-6 Astra を指します。

組み合わせ見つけた数5時間枠推定クレジットトークン時間
Sol medium11 / 142%2.7413.4万2.2分
Sol xhigh13 / 145%5.4222.4万6.9分
Astra medium13 / 1410%15.8813.7万2.5分
Astra xhigh14 / 1414%24.4418.3万5.0分

重大なバグ3個は、4つの組み合わせすべてが見つけました。誤指摘は、どの組み合わせも0件です。差が出たのは、中と軽の11個のほうでした。

同じ effort どうしで比べると、Astra の5時間枠の減りは、medium で Sol の5倍(2%と10%)、xhigh で2.8倍(5%と14%)でした。見つけた数の差は、medium で2個、xhigh で1個です。週枠の使用率が増えた幅は、どれも0〜2%でした。5時間枠と週枠は整数の%でしか読めないので、1%の差は誤差の範囲です。

推定クレジットでは、Astra は Sol の4.5〜5.8倍でした。料金ページの単価は、Astra が GPT-6.1 Sol の5倍(キャッシュされた入力は10倍)です(2026年10月2日確認)。トークン数は medium でほぼ同じ、xhigh では Astra のほうが2割ほど少なめでした。そのため、推定クレジットの差は、ほぼ単価の差から来ています。

5時間枠の減りの差は、クレジットの差より小さく出ました。料金ページにも、単価だけではプランに含まれる枠の減る速さは決まらない、と書かれています。ヘルプ記事の目安では、Plus の5時間あたりのメッセージ数は Astra が5〜45回、GPT-6.1 Sol が15〜160回です(2026年10月2日確認)。3倍以上の開きがあります。

Sol の xhigh で足りたと判断したところ

今回の計測で Sol の xhigh が見落としたのは、重さが中の1個だけでした。その1個のために Astra の xhigh へ替えると、5時間枠の減りは5%から14%に増えます。

重大なバグ3個を全部見つけた組み合わせのうち、推定クレジットが一番少なかったのは Sol の medium です。ただ medium は中と軽を3個見落としていて、xhigh より2個少ない結果でした。

5時間制限の記事で、レビューの effort は下げないと決めました。今回の計測では、下げると見つける数が実際に減っています。レビュー役は Sol の xhigh のままにしました。

Astra の medium は、Sol の xhigh と同じ数でした

ヘルプ記事の一文に近い組み合わせも、表から読めます。私が比べたのは Sol の High ではなく、それより上の xhigh(Extra High)です。Astra の medium は Sol の xhigh と同じ13個を見つけ、5時間枠は2倍の10%を使いました。

かかった時間は、Astra の medium が2.5分、Sol の xhigh が6.9分で、約3分の1です。今回のアプリでは、Astra の medium に替えても見つけた数は増えず、枠の減りは2倍になりました。待ち時間を縮めたいなら、選ぶ理由はあります。

superpowers を入れると、Codex はレビューの途中で手順書を読みに行きます

superpowers は、作業の進め方をスキル(手順書)の形でまとめたものです。私は Claude Code と Codex の両方に入れていて、superpowers は Codex、特に Astra には重いのではないかと思っていました。そこで superpowers だけを有効にした組み合わせも足しています。

9月にラリーから起動した Codex のログを数えると、49回中48回で、Codex が superpowers のスキルの本文(SKILL.md)を自分で読んでいました。レビューしか頼んでいないのに、手順書を開いていたことになります。

同じ日の計測で superpowers を有効にすると、トークンは Sol の xhigh で25%、Astra の xhigh で37%増えました。推定クレジットは11%と22%増えています。見つけた数は増えず、Sol は13個のまま、Astra は14個から13個に減りました。

セッションログで内訳を見ると、増えた分の大半は、スキルの一覧ではありませんでした。Codex がレビューの途中で SKILL.md を3つ読みに行き、その本文が以後のやり取りに毎回含まれていた分です。一覧そのものは、最初の送信で750トークン前後でした。

依頼文に「レビューの手順として、スキル(SKILL.md)を読み込まない」と1行足して、Sol の xhigh で1回回しました。読んだ SKILL.md は3つから1つに減り、トークンは27.9万から22.8万になりました。superpowers なしの22.4万とほぼ同じで、見つけた数は13個のままです。

ラリーで Codex に渡す依頼文の雛形には、同じ1行を入れました。この1行で SKILL.md を読まなくなったかは、次のラリーのログで確かめます。

この数字の限界

  • 各条件1回の結果。ほぼ同じ条件で2回回したときも、見つけたバグが1個入れ替わった
  • 5時間枠と週枠は整数の%で、1%の差は誤差の範囲
  • 題材は約420行の小さなアプリ。私のラリーでは1往復で16%使った記録があり、%の値はそのまま当てはまらない。比べられるのは倍率のほう
  • Codex CLI 0.160.0・ChatGPT Plus・Windows 11 での結果。モデルや CLI が更新されれば数字は変わる
  • 推定クレジットは単価から計算した値で、請求額ではない

まとめ

Codex のレビューを Sol と Astra で比べると、2026年10月2日の時点では GPT-6.1 Sol の xhigh で足りました。Astra は5時間枠を Sol の約3〜5倍使い、見つけたバグは1〜2個多いだけでした。

枠の使用率は、タスクバーに出している残量バーと同じところから、計測の前後に読んでいます。モデルが替わったら、同じアプリでまた測って決め直すつもりです。

関連

上半分の砂が半分落ちた金色の砂時計と、その向こうに立つサイトのマスコット。「3往復で枠の半分」の文字が重なっている
Codex の5時間制限は実際どのくらい使えるか。AIレビュー1往復で16%、3往復で枠の半分でした

Codex の5時間制限は実際どのくらい使えるか。AIレビュー1往復で使用率16%、3往復で枠の半分の実測と、失敗投入でも減ること、足りないときの回し方、Pro で解けるかを自分の記録で書きます。

青と金の配色のイラスト。マスコットの横顔の前に、金色に光る2段の横長ゲージが浮かんでいる
Claude CodeとCodexの使用量をタスクバーに常時表示する。「残量バー」を自作した記録

Claude Code と Codex CLI の残り使用量は /usage・/status を打たないと見えません。タスクバーに常時表示する Windows 常駐ツールを自作し、使用量エンドポイントの実測仕様と、AIレビューで出た欠陥19件をまとめました。

高さの不揃いな光る柱が横一列に並び、4本目だけ金色に高い。右端でマスコットが腕組みして眺めている。文字は「1回では終わらない」
AIレビューを往復させるルールを作ったら、4往復目に重大指摘がまた4件出ました

AIに書かせたコードを別のAIにレビューさせると、1回では終わりません。上限5往復・終了の条件・意見が割れたら人間が裁く、というルールを決めて4件回した実測記録です。重大指摘は一直線に減らず、修正が新しい穴を開けることもありました。


  • この記事を書いた人
myska のプロフィール画像。ネイビーの背景に金色の光の弧、黒い短髪に襟付きシャツの男性のイラスト

myska

2025年8月よりブログ開設! AIを使った副業・自動化の実践記録を中心に、 試行錯誤しながら収益化を目指すリアルな過程を発信していきます。

-AI副業実践記
-, ,