CLI を使い始める

research web

URL探索、ページ取得、クロール、構造化抽出、保存済みインデックス・履歴、サイト管理の9操作です。

orc login でユーザー認証し、アクセス可能な --workspace を指定してください。APIキーとエージェント委任には対応していません。ORCHESTOR_API_KEY が設定されている場合は優先されるため、ユーザーログインを使う環境では解除してください。既存のベータアクセス条件が適用されます。

orc login
orc research web --help
orc research web map --url https://example.com --fallback none --workspace YOUR_WORKSPACE_ID --format json

--fallback none は外部プロバイダーへのフォールバックを無効にします。mapの既定値は firecrawl です。

web crawl

orc research web crawl [flags]

POST /v1/research/crawl

フラグ必須型・制約
--fallback—string; enum=["none", "firecrawl"]; default="none"
--formats—array; default=["markdown"]; minItems=1
--limit—integer; default=5; minimum=1; maximum=10
--max-age—integer; default=86400; minimum=0; maximum=86400
--max-depth—integer; default=1; minimum=0; maximum=3
--url✓string; maxLength=2048

web extract

orc research web extract [flags]

POST /v1/research/extract

フラグ必須型・制約
--fallback—string; enum=["none", "firecrawl"]; default="none"
--max-age—integer; default=86400; minimum=0; maximum=86400
--mode—string; enum=["selectors", "jsonld"]; default="selectors"
--selectors—array; default=[]; maxItems=20
--urls✓array; minItems=1; maxItems=10

web history get

orc research web history get [flags]

GET /v1/research/history

フラグ必須型・制約
--url✓string; maxLength=2048

web index get

orc research web index get [flags]

GET /v1/research/index

フラグ必須型・制約
--url✓string; maxLength=2048

web map

orc research web map [flags]

POST /v1/research/map

フラグ必須型・制約
--fallback—string; enum=["none", "firecrawl"]; default="firecrawl"
--limit—integer; default=100000; minimum=1; maximum=100000
--max-age—integer; default=86400; minimum=0; maximum=86400
--sitemap—string; enum=["include", "only", "skip"]; default="include"
--url✓string; maxLength=2048

web scrape

orc research web scrape [flags]

POST /v1/research/scrape

フラグ必須型・制約
--fallback—string; enum=["none", "firecrawl"]; default="none"
--formats—array; default=["markdown"]; maxItems=2
--max-age—integer; default=86400; minimum=0; maximum=86400
--urls✓array; minItems=1; maxItems=10

web sites list

orc research web sites list [flags]

GET /v1/research/sites

個別の引数はありません。

web sites create

orc research web sites create [flags]

POST /v1/research/sites

フラグ必須型・制約
--domain✓string; maxLength=253

web sites discover

orc research web sites discover [flags]

POST /v1/research/sites/discover

フラグ必須型・制約
--domain✓string; maxLength=253

入力例と取得範囲

--urls と --formats はカンマ区切りです。--max-age は秒、--max-depth はリンクの深さです。URLに認証情報や任意のポートは指定できません。

orc research web scrape --urls https://example.com,https://example.com/docs --formats markdown --max-age 0 --workspace YOUR_WORKSPACE_ID
orc research web crawl --url https://example.com --limit 5 --max-depth 1 --fallback none --workspace YOUR_WORKSPACE_ID
orc research web extract --urls https://example.com --mode jsonld --workspace YOUR_WORKSPACE_ID
orc research web extract --urls https://example.com --mode selectors --selectors '[{"name":"title","selector":"h1","multiple":false}]' --workspace YOUR_WORKSPACE_ID
orc research web index get --url https://example.com --workspace YOUR_WORKSPACE_ID
orc research web history get --url https://example.com --workspace YOUR_WORKSPACE_ID
orc research web sites create --domain example.com --workspace YOUR_WORKSPACE_ID
orc research web sites discover --domain example.com --workspace YOUR_WORKSPACE_ID
orc research web sites list --workspace YOUR_WORKSPACE_ID
  • mapはサイトマップ・llms.txt・リンクから最大100,000 URLを探索します。ページ本文の一括取得ではありません。
  • scrape・extractは1回最大10 URL、crawlは最大10ページ・深さ3です。CLIのcrawlはリンク探索です。サイト画面の「Crawl」による最大1,000ページのバッチ処理とは別の操作です。
  • extractはCSSセレクターまたはJSON-LDの抽出です。LLMによる推論ではありません。selectorsモードでは1〜20個の一意な名前とselectorが必要です。attribute で属性値、multiple: true で複数の一致を返します。複雑な入力は --stdin でJSONを渡せます。
  • scrapeで本文を保存してメタデータだけ返す場合、JSON入力に "formats": [] を指定してください。
  • sites createはドメイン登録だけを行い、取得や定期実行を開始しません。discoverはホームページのリンクから最大30件の未登録サイトを返し、登録・保存・有料フォールバックを行いません。

レスポンス・保存・エラー

JSON出力の data 内にAPIレスポンス全体を保持します。取得系では data.data の各URLの status、data.truncated、data.warnings、data.usage を確認してください。HTTP 200でも一部失敗・打ち切りがあります。usageはリクエスト回数であり、料金ではありません。サイト一覧・履歴は data.data、indexは data.result と data.fetchedAt を返し、未保存ならnullです。

取得内容は保存されます。匿名の共有可能なキャプチャは最大24時間再利用され、クエリ付きURL・非共有レスポンス・Firecrawl取得内容はWorkspace単位です。履歴は最大20件、参照期間は30日です。--max-age 0 は新規取得を要求します。raw本文に元サイトの認証Cookieは送りません。

mapは最大90秒、その他の取得操作は最大40秒の同期処理です。robots拒否や内部ネットワークURLは回避しません。mapの firecrawl フォールバックはサイトマップ探索が不完全な場合、それ以外は明示指定時のブロック応答で外部呼び出しが発生し得ます。

--dry-run は送信・保存せずにリクエストを表示します。--raw はCLIの外枠を省略します。自動巡回の --page-all は使えません。終了コードは成功0、API・認証・通信失敗1、引数エラー2です。401/403ではログイン・Workspace・アクセス条件を確認してください。部分失敗を再実行する際は各URLの結果を確認してください。