Servidor MCP

scrapewright

io.github.Ozymandias-Owens-2/scrapewright
Datos y analítica Público y accesible MCP 2025-11-25

Qué hace este MCP

Detects website platforms and extracts structured data from individual pages or crawled sites using reusable parsing recipes.

account
Credits left and this month's usage for the key in use.
Esquema de entrada
{'type': 'object', 'title': 'accountArguments', 'properties': {}}
Esquema de salida
{'type': 'object', 'title': 'accountDictOutput', 'additionalProperties': True}
crawl_site
Walk a site from one listing URL and extract every item. Waits up to four minutes; a longer crawl returns a job_id to pass to crawl_status.
Esquema de entrada
{'type': 'object', 'title': 'crawl_siteArguments', 'required': ['listing_url'], 'properties': {'js': {'type': 'boolean', 'title': 'Js', 'default': False}, 'fields': {'anyOf': [{'type': 'array', 'items': {'type': 'string'}}, {'type': 'null'}], 'title': 'Fields', 'default': None}, 'scroll': {'type': 'integer', 'title': 'Scroll', 'default': 0}, 'max_items': {'type': 'integer', 'title': 'Max Items', 'default': 25}, 'listing_url': {'type': 'string', 'title': 'Listing Url'}}}
Esquema de salida
{'type': 'object', 'title': 'crawl_siteDictOutput', 'additionalProperties': True}
crawl_status
Fetch a crawl that outlived its call.
Esquema de entrada
{'type': 'object', 'title': 'crawl_statusArguments', 'required': ['job_id'], 'properties': {'job_id': {'type': 'string', 'title': 'Job Id'}}}
Esquema de salida
{'type': 'object', 'title': 'crawl_statusDictOutput', 'additionalProperties': True}
detect_site
Report what platform a site runs on and which strategy to use. Cheap; call it before a large job.
Esquema de entrada
{'type': 'object', 'title': 'detect_siteArguments', 'required': ['url'], 'properties': {'url': {'type': 'string', 'title': 'Url'}}}
Esquema de salida
{'type': 'object', 'title': 'detect_siteDictOutput', 'additionalProperties': True}
extract_page
Extract structured data from ONE page. ``fields`` declares your own schema, e.g. ["title", "salary:number", "tags:list"]; omit it for the product schema. First call on a new site compiles a recipe (300 credits); later calls replay it for 1 credit per row.
Esquema de entrada
{'type': 'object', 'title': 'extract_pageArguments', 'required': ['url'], 'properties': {'js': {'type': 'boolean', 'title': 'Js', 'default': False}, 'url': {'type': 'string', 'title': 'Url'}, 'fields': {'anyOf': [{'type': 'array', 'items': {'type': 'string'}}, {'type': 'null'}], 'title': 'Fields', 'default': None}}}
Esquema de salida
{'type': 'object', 'title': 'extract_pageDictOutput', 'additionalProperties': True}
Añadido
account
21 de September de 2026 a las 02:40
Añadido
crawl_status
21 de September de 2026 a las 02:40
Añadido
crawl_site
21 de September de 2026 a las 02:40
Añadido
extract_page
21 de September de 2026 a las 02:40
Añadido
detect_site
21 de September de 2026 a las 02:40