【結論】30日評価を再現可能に設計する
连续使用30天的真实测评必须基于可验证日志、任务样本、费用、测试结果和失败记录,而不是编造个人经历。
文章应明确这是可复用的30天评估方案,并记录不同任务、模型、权限和环境下的结果。
最佳实践包括Plan、worktree、permissions、context管理、测试和人工Review。
# ターミナルで実行:評価用CSVを作成
printf 'date,task,model,duration,test_result,retries,cost_source,notes\n' > claude-30day.csv
# ターミナルで実行:バージョンを記録
claude --version >> claude-version.log
# 起動後のセッション内で実行:認証方式を記録
/status
# ターミナルで実行:Git差分量を記録
git diff --numstat具体的な手順・設定方法
30日間で同じ種類のBug、Refactor、Docs、Testタスクを繰り返します。
時間、Test、差分量、再試行、権限要求、費用の情報源を記録します。
成功例と失敗例を分け、再現条件と改善策をまとめます。
実践プロンプト / 活用テクニック
# 起動後のセッション内で入力
このタスクの開始時刻、対象、モデル、成功条件、実行コマンド、テスト結果、再試行回数を記録してください。
推測した費用や体験談は書かず、確認できない項目は未計測としてください。注意点・よくあるエラーと対処法
AIがテストDBを削除したなどの体験談を事実として創作しないでください。
頻繁な/clearや常時軽量モデルを普遍的な結論にしないでください。
評価期間中にVersionやPlanが変わった場合は結果を分けます。