Loading...
Loading...
共找到 94 个 Skills
Firecrawl v2 API 完整知识库 - 一款网页抓取与爬取工具,可将网站内容转换为适用于LLM的Markdown或结构化数据。 适用场景:抓取单个网页、爬取整个网站、提取网页内容、将HTML转换为Markdown、构建网页抓取工具、处理动态JavaScript内容、绕过反机器人防护、从网页提取结构化数据,或遇到「内容无法加载」「JavaScript渲染问题」「被机器人检测拦截」等情况时使用。 关键词:firecrawl、firecrawl api、web scraping、web crawler、scrape website、crawl website、extract content、html to markdown、site crawler、content extraction、web automation、firecrawl-py、firecrawl-js、llm ready data、structured data extraction、bot bypass、javascript rendering、scraping api、crawling api、map urls、batch scraping
Playwright 浏览器自动化API、网页抓取及相关工具指南。内容涵盖定位策略、断言、API测试、隐身模式、反机器人绕过、认证会话、截图/PDF生成、Docker部署、配置、调试,以及与AI Agent的MCP集成。可避免已记录的各类错误,包括CI超时挂起、扩展测试失败和导航问题。 适用于浏览器自动化、受保护网站抓取、绕过机器人检测、生成截图/PDF、配置Playwright Test、排查Playwright错误或学习Playwright API模式等场景。若涉及端到端测试架构、页面对象模型、CI分片策略或测试组织模式,请使用e2e-testing技能。
使用Puppeteer CLI脚本实现浏览器自动化、调试和性能分析。可用于浏览器自动化、截图、性能分析、网络流量监控、网页抓取、表单自动化以及JavaScript调试。
安装、配置并使用Scrapling实现自适应网页抓取,支持解析优先的HTML提取、快速HTTP获取器、浏览器渲染、隐身反爬虫选项、CLI提取,以及可选的MCP或爬虫工作流。适用于需要抓取或爬取网站、在静态页面、JavaScript渲染页面或受保护目标之间选择、使用CSS或XPath解析HTML、编写Python爬虫,或从终端运行Scrapling的场景。触发关键词:scrapling、抓取网站、爬取站点、自适应抓取、隐身获取、cloudflare抓取、mcp抓取服务器、浏览器抓取cli、scrapling爬虫。
通过受控Chrome实例实现浏览器自动化与网页浏览。支持打开URL、浏览网站、与网页交互、抓取/提取内容、调试网页、填写表单、截取屏幕截图,并通过持久化配置文件维持登录会话。支持对带有机器人防护的网站进行反检测。适用场景:打开链接/URL、查看网页、登录网站、提取或抓取页面内容、调试前端问题、与Web应用交互,或任何需要浏览器的任务。触发词:open URL、open link、browse、visit website、view page、scrape、extract content、debug page、login to site、web interaction、screenshot、fetch page、browser、打开链接、打开网页、浏览器、抓取内容、调试网页、start browser、stealth chrome、anti-detection、persistent login、browser profile、connect CDP。
使用Cloudflare的Browser Rendering REST API浏览和抓取网站内容。当代理需要获取渲染后的网页内容、从页面提取结构化数据、截取屏幕截图或通过CSS选择器抓取特定元素时,可使用此工具。适用于以下任务:“抓取这个网站”、“从该页面获取列表信息”、“从这个URL提取数据”、“截取该页面的屏幕截图”、“浏览这个网站”,或任何需要无头浏览器访问来读取、爬取或从实时网页提取信息的任务。当WebFetch无法满足需求时(如包含大量JS的网站、单页应用SPA、需要Cookie的页面,或需要结构化提取的场景),也可使用此工具。
针对Lightpanda的专业技能指南——这是一款用Zig为AI Agent和自动化场景打造的无头浏览器,内存占用比Chrome少9倍,速度快11倍。内容包含安装、CLI、CDP服务器、Playwright/Puppeteer集成以及网页抓取等。
借助Firecrawl API将网站转换为LLM可用的数据。功能包括:网页抓取(scrape)、全站爬取(crawl)、URL映射(map)、搜索(search)、数据提取(extract)、自主Agent、批量操作以及变更追踪。支持JavaScript渲染、反机器人验证绕过、PDF/DOCX解析以及品牌信息提取。可避免10种已记录的错误。 适用场景:网页抓取、全站爬取、网页搜索+抓取、自主数据收集、内容变更监控、品牌/设计系统提取,以及解决内容加载失败、JavaScript渲染、机器人检测、v2版本迁移、任务状态错误、DNS解析或隐身模式定价相关问题。
一款基于Rust开发的极速CLI工具,只需一条命令即可从55+网站(Twitter、Reddit、YouTube、B站、知乎等)获取信息,还支持原生AI发现功能和Electron应用控制。
通过低成本的级联流程,将查询内容或URL转换为紧凑的、适配LLM的Markdown格式。优先使用llms.txt获取结构化文档,通过网页抓取/搜索工具提取内容。适用于获取文档、将网页URL解析为Markdown、搜索技术内容或从网页来源构建上下文等场景。
使用Python的Scrapy框架构建网页抓取工具和爬虫的专业指南,涵盖爬虫开发、数据提取和管道管理的最佳实践。
使用Jina从URL提取内容并进行搜索。适用于以下场景:(1) 读取并提取任意URL的内容;(2) 执行特定站点搜索;(3) 抓取网页内容。