【結論】現行Codexと公平に比較する
現在のCodexは過去の単純な補完Modelではなく、OpenAIが提供する現役のCoding Agentです。
Claude CodeとCodexはいずれもRepository調査、編集、Command、Test、Review、PR作業を扱えるため、古い世代と新世代という比較は不正確です。
比較ではModel性能だけでなく、Sandbox、Approval、Cloud・Local実行、IDE、Account、Data policy、Costを確認します。
# ターミナルで実行:両CLIのVersionを記録
claude --version
codex --version
# ターミナルで実行:共通Fixture用Repositoryを作成
mkdir agent-benchmark && cd agent-benchmark && git init
# ターミナルで実行:Claude CodeをPlanモードで開始
claude --permission-mode plan
# ターミナルで実行:CodexのHelpを確認
codex --help具体的な手順・設定方法
同一Repository、同一Issue、同一受入条件、同一Testを用意します。
両者のApprovalとSandboxを安全側へ揃えます。
成功率、変更行数、Test、再試行、Tool call、所要時間を記録します。
契約・料金・Data利用は各公式資料を別々に確認します。
実践プロンプト / 活用テクニック
# 両Agentへ同じ内容を入力
Issueの原因を調査し、まだ編集せず修正計画を作成してください。
受入条件、変更対象、Test、Risk、Rollbackを示してください。
Repository外のアクセスと外部通信は禁止です。注意点・よくあるエラーと対処法
Codexを廃止済みの旧補完Modelとして扱わないでください。
一方を絶対的に優位と断定せず、対象Taskと利用環境ごとに評価します。
Agentごとに認証、保存、学習利用、Network accessが異なるため組織Policyを確認してください。