【結論】AI開発ツールを公平に比較する
Claude Code、OpenAI Codex、GitHub Copilot、Cursorはいずれもエージェント機能を持ち、補完対エージェントという単純な二分法は現行仕様に合いません。
比較では対応IDE、ローカル・クラウド実行、sandbox、レビューUI、モデル選択、料金、組織管理、Git連携を確認します。
同じ実務課題で品質、時間、再試行、権限、費用を測定します。
# ターミナルで実行:比較用worktreeを作成
git worktree add ../eval-claude -b eval/claude
# ターミナルで実行:共通テストを記録
npm test -- --runInBand > baseline-test.log
# Claude Codeで実行:読み取り専用の計画を作成
claude --permission-mode plan
# ターミナルで実行:比較後の差分を確認
git diff --stat具体的な手順・設定方法
同じリポジトリ、Issue、制限、テスト、時間上限を用意します。
各ツールを別worktreeで実行し、同じ成功条件で評価します。
正答率、変更量、テスト結果、レビュー負荷、権限要求、費用を記録します。
実践プロンプト / 活用テクニック
# 評価対象ツールの入力欄で共通利用
auth.tsの期限判定バグを調査してください。
対象はauth.tsと関連テストだけです。
最初に原因、根拠、変更計画を示し、承認まで編集しないでください。
依存追加、外部通信、Git操作は禁止します。注意点・よくあるエラーと対処法
CodexやCopilotを行補完だけの製品として説明するのは不正確です。
Claude Codeをターミナルだけの製品として比較しないでください。
価格、モデル、利用上限、対応機能は頻繁に変わるため、比較時点を明記します。