【結論】解決策 / 実行コマンド
Gemini CLIとClaude Codeの速度、品質、トークン効率は、言語、リポジトリ、モデル、認証、ツール設定で大きく変わります。
特定の一回の検証からClaude Codeが45分速い、80%自律的などの数字を一般化することはできません。
公平な比較には、同一コミット、同一Issue、同一テスト、別worktree、同じ制限時間を使います。
評価項目は完了率、テスト成功、差分の正確さ、手動介入回数、総時間、利用枠または費用です。
git worktree add ../eval-gemini -b benchmark/gemini
git worktree add ../eval-claude -b benchmark/claude
具体的な手順・設定方法
測定条件をファイルへ固定します。
benchmark-task.mdに対象範囲、禁止操作、完了条件、時間上限を記載します。各ツールの安定版、モデル、認証方法、設定ファイル、開始時刻を記録します。
3回以上実行し、中央値と失敗理由を集計します。
生成されたコードは同じ人がブラインドレビューし、テストだけで見つからない保守性やセキュリティも確認します。
gemini --version
claude --version
/usr/bin/time -p gemini
/usr/bin/time -p claude
実践プロンプト / 活用テクニック
両方へ同じベンチマーク指示を渡します。
benchmark-task.mdを読み、記載された範囲だけを変更してください。
テストを先に実行して失敗を確認し、修正後に再実行してください。
質問は最大1回、コミットは禁止、制限時間は20分です。
最後に変更ファイル、テスト結果、手動介入が必要だった点をJSONで出力してください。
注意点・よくあるエラーと対処法
ツール自身の自己申告やベンダーのマーケティング表現を、独立した品質ベンチマークとして扱わないでください。
無料枠と定額プランとAPI従量課金は単位が異なるため、単純な1セッション価格だけで比較しないでください。
自動コンパクションの有無だけで効率を判断せず、実際の再読み込み、失敗、追加修正まで測定してください。
結果を公開する場合は、実行日、バージョン、モデル、ハードウェア、リポジトリ規模を明記してください。