MCP 服务器

Web Content Extract Mcp

io.github.varvararatta/web_content_extract_mcp
媒体与内容 搜索与研究 公开且可连接 MCP 2025-11-25

此 MCP 可以做什么

Fetches public web pages, extracts article and page text, returns metadata, and enumerates page links.

extract_article
Extract main article content from a news/blog URL. Returns: {title, description, body, author, date}
输入模式
{'type': 'object', 'title': 'extract_articleArguments', 'required': ['url'], 'properties': {'url': {'type': 'string', 'title': 'Url'}}}
fetch_url_content
Fetch and extract clean text content from a public URL. Returns: {title, text, url, word_count}
输入模式
{'type': 'object', 'title': 'fetch_url_contentArguments', 'required': ['url'], 'properties': {'url': {'type': 'string', 'title': 'Url'}, 'max_chars': {'type': 'integer', 'title': 'Max Chars', 'default': 5000}}}
get_page_links
Extract all links from a page. Returns: {links: [href], internal_count, external_count}
输入模式
{'type': 'object', 'title': 'get_page_linksArguments', 'required': ['url'], 'properties': {'url': {'type': 'string', 'title': 'Url'}, 'same_domain_only': {'type': 'boolean', 'title': 'Same Domain Only', 'default': True}}}
get_page_metadata
Get metadata from a page: title, description, og tags, keywords. Returns: {title, description, keywords, og_title, og_image, og_type}
输入模式
{'type': 'object', 'title': 'get_page_metadataArguments', 'required': ['url'], 'properties': {'url': {'type': 'string', 'title': 'Url'}}}
health_check
Server health check.
输入模式
{'type': 'object', 'title': 'health_checkArguments', 'properties': {}}
已添加
health_check
2026年9月17日 12:53
已添加
get_page_metadata
2026年9月17日 12:53
已添加
get_page_links
2026年9月17日 12:53
已添加
extract_article
2026年9月17日 12:53
已添加
fetch_url_content
2026年9月17日 12:53