Loading...
Loading...
共找到 94 个 Skills
使用Python中的BeautifulSoup进行HTML/XML解析的专家指南,涵盖DOM导航、数据提取和高效网页抓取工作流的最佳实践。
使用Puppeteer进行浏览器自动化的专业指南,包含无头Chrome中的网页抓取、测试、截图捕获和JavaScript执行的最佳实践。
追踪SpecStory AI编码会话期间抓取的所有URL。当用户说出“显示我的链接轨迹”、“我访问了哪些URL”、“列出已抓取链接”或“显示网页抓取记录”时运行。
仅使用python3标准库即可搜索Naver博客、读取完整帖子内容并下载图片,无需API密钥。
在本地机器上使用Playwright构建浏览器自动化与网页抓取功能。可预防10种已记录的错误,包括CI超时挂起、扩展测试失败以及Ubuntu兼容性问题。包含用于绕过反机器人检测的隐身模式、已认证会话处理、无限滚动支持、截图/PDF生成,以及v1.57版本的Speedboard性能分析功能。 适用场景:浏览器自动化操作、抓取受保护网站、使用真实IP进行测试、绕过机器人检测、生成截图/PDF,或排查“目标已关闭”“page.pause()导致CI挂起”“权限提示阻塞测试”“Ubuntu 25.10安装失败”等错误。
操作Teable数据库——包括表格、字段、视图、记录、SQL查询、自动化、应用和网页抓取。当用户提及Cuppy、Teable、teable CLI或Teable格式的ID(bseXXX、tblXXX、fldXXX、recXXX、viwXXX),或者需要管理表格/字段/记录、构建仪表盘/应用、生成图表、创建自动化、导入/导出数据、触发AI填充,或抓取网站(LinkedIn、Amazon、YouTube等)时触发——即使用户没有明确提及“Teable”,但显然正在使用Teable数据库的情况也会触发。
当用户提出‘网页搜索’‘从URL获取内容’‘提取页面内容’‘使用Tavily搜索’‘抓取该网站’‘从该链接获取信息’或‘网页搜索X’这类需求时,应使用本Skill。
使用Playwright CLI实现无头浏览器自动化。适用于需要无头浏览、并行浏览器会话、UI测试、截图、网页抓取或可在后台运行的浏览器自动化场景。关键词:playwright、headless、browser、test、screenshot、scrape、parallel。
Zyte API集成。管理数据、记录并自动化工作流。当用户需要与Zyte API数据交互时使用。
从任意URL导入单个网页,将其转换为结构化HTML内容,以便在AEM Edge Delivery Services中进行创作。该工具会抓取页面、分析结构、映射到现有区块,并生成可立即本地预览的HTML。当出现“migrate”“migration”或“migrating”等词汇时也会触发该工具。
通过hasdata CLI获取实时网页数据。适用于用户需要搜索结果、新闻、事实核查、产品或卖家信息、当前价格、评论、房产列表或已售房源、度假租赁、本地商家联系方式、招聘信息、薪资调研、搜索趋势、图片、航班、社交资料,或抓取任意URL(HTML / Markdown / AI提取的JSON)的场景。也适用于用户要求总结网页、用当前信息支撑提示词、验证URL是否可用或渲染JavaScript密集型页面、长期监控价格变化、查找商家电话或地址、构建竞品地图、识别近期已售可比房源、收集雇主评价、将物品列表展开为单个物品详情,或查看当前网上关于某一话题讨论内容的场景。该工具由Google、Bing、Amazon、Shopify、Zillow、Redfin、Airbnb、Yelp、YellowPages、Indeed、Glassdoor、Instagram、Google Maps / Trends / News / Images / Flights / Events等API提供支持。
自托管Firecrawl的部署、故障排查及最佳实践。触发场景 - firecrawl、自托管网页抓取、网页爬取、抓取器包装器、littleblack、ZeroTier抓取。