【結論】規約・robots.txt・公式APIを確認してから収集する
Claude Codeはスクレイピングコードを生成できますが、対象サイトの許諾、利用規約、robots.txt、著作権、個人情報、アクセス負荷を先に確認する必要があります。
公式APIやデータ出力機能がある場合は、HTML解析よりそちらを優先します。
# ターミナルで隔離環境を作成
python -m venv .venv && . .venv/bin/activate
# ターミナルで必要最小限のライブラリを導入
python -m pip install requests beautifulsoup4
# ターミナルで対象サイトのrobots.txtを確認
curl -fsSL https://example.com/robots.txt具体的な手順・設定方法
収集目的、対象URL、必要項目、保存期間、再配布可否を書面化します。
静的ページはrequests、JavaScript描画が必要な場合だけPlaywrightを検討し、認証回避やCAPTCHA突破は行いません。
User-Agent、Timeout、Retry上限、間隔、最大ページ数、HTTPエラー時停止、重複排除、監査ログを実装します。
実践プロンプト / 活用テクニック
安全なスクリプト設計を依頼する例です。
# 起動後のセッション内で入力
許諾済みのURL一覧だけを対象に、1リクエスト毎に3秒待機し、最大20ページで停止するPythonスクリプトを作成してください。
# 続けて検証を依頼
robots.txtと利用規約に反する可能性がある処理は実装せず、判断できない点を未確認事項として列挙してください。注意点・よくあるエラーと対処法
ログイン制限、アクセス制御、CAPTCHA、IP制限を回避するコードは作らないでください。
DOM変更をClaudeへ任せても、取得データの正確性や法的利用可能性は保証されません。
本番実行前に数ページのDry runを行い、サーバー負荷、文字コード、個人情報、保存先権限を人間が確認してください。