万能コンテンツスクレイパー | Octoparse テンプレート

万能コンテンツスクレイパー | Octoparse テンプレート

このテンプレートは、設定されたクロール深度、ページ制限、除外ルールに従い、ユーザーが提供した公開ウェブサイトから構造化されたページコンテンツとページメタデータを収集します。コンテンツリサーチャー、ナレッジベースチーム、データ運用チームにとって便利です。

データはユーザーが提供した公開ウェブサイトから収集されます。このテンプレートは単一のソースウェブサイトに限定されません。ユーザーが提供した公開ウェブサイトのURLから開始し、設定されたクロール範囲内のページコンテンツを抽出します。

このテンプレートは現在 無料 で、行ごとの使用料はかかりません。Octoparseのプランやリソース制限が適用される場合があります。

現在公開されている実装では、以下のフィールドを返すことができます:

結果は、実行時にソースサイトが公開している内容に依存します。ソースページが値を提供しない場合、リストされている出力フィールドは空になることがあります。上記の入力制限はテンプレートによって強制されます。

大規模なバッチを開始する前に、具体的で有効な入力を使用し、代表的な結果を確認してください。繰り返しレコードが不要な場合は、重複した入力を削除してください。

Pythonオートメーションは、送信された各ウェブサイトURLから開始し、設定された深度とページ制限内で適格なリンクをたどり、提供されたglobに一致するリンクを除外し、ページコンテンツを選択された形式に変換し、処理されたページごとに1つのレコードをアップロードします。

入力セクションに示されているフィールドと許容値を使用してください。ユーザーに関連する制限と選択可能なオプションのみがリストされています。

現在の出力フィールドと代表的なJSONのデータプレビューは、出力セクションにリストされています。ソースページに値が表示されない場合、フィールドの可用性は異なることがあります。

現在 無料 で、行ごとの使用料はかかりません。Octoparseのプランやリソース制限が適用される場合があります。

ソースページは、すべてのレコードに対してすべての値を常に公開しているわけではなく、レイアウトはアイテム、市場、または現在のサイトの応答によって異なる場合があります。テンプレートは、現在のページがフィールドを提供する場合にそれを返します。

Octoparseで構造化された行を確認し、お使いのOctoparse環境でサポートされているオプションを使用してエクスポートまたは処理することができます。

Recommended articles