scenepilotLLM/sparkfetch
一个把任意网页转换成干净markdown或JSON、方便大模型直接使用的开源API
SparkFetch是一个可自行部署的API,输入任意URL就能去掉广告、导航栏等杂乱内容,返回干净的Markdown、结构化JSON或纯文本。它提供单页抓取、按深度递归爬取整个网站、以及快速发现某个域名下所有链接的地图功能。项目基于Node.js 24和Express 5用TypeScript构建。
它做什么
- 抓取接口输入单个URL,返回Markdown正文以及标题、描述、链接等元数据的JSON结果
- 爬取接口可设置递归深度和页面数量上限,以异步任务方式运行,可查询进度
- 地图接口能立即列出某个域名下所有可访问的URL,输出清理功能会自动去除nav、footer等无用标签
- API规范用OpenAPI 3.1定义,用Zod做校验,数据库层使用Drizzle ORM
- 项目以MIT许可证开源,可在Node.js 18及以上环境用pnpm自行安装部署
为什么重要
如果你在搭建把网页内容喂给大模型的RAG系统或做研究自动化,这个工具能省去自己写HTML解析器的麻烦,直接拿到干净文本。由于可以自行部署,你能掌控自己的数据流程,不必依赖第三方抓取服务。
本仓库术语
- Markdown · 用简单符号表示标题、列表等结构的文本格式,便于大模型解析
- RAG流程 · 检索外部文档为大模型回答提供依据的系统结构
- 爬取 · 自动沿着链接访问并收集网站多个页面的操作
- OpenAPI 3.1 · 用于描述API请求和响应格式的标准规范
- Zod · TypeScript中用于校验输入数据格式是否正确的库
仓库简介(英文)
🔥 Turn any URL into clean, structured, LLM-ready content. The open-source web fetching & extraction API.
在 GitHub 打开热门仓库
- openai/codexOpenAI的编程智能体现在可以直接在终端里运行了
- cordiverse/cordis一个可以随时插拔功能模块的TypeScript编程框架
- ripienaar/free-for-dev一个仓库汇总了开发者能用的所有免费云服务、API和协作工具
- Wei-Shaw/sub2api让一份Claude、OpenAI、Gemini、Grok订阅可以被多人拼车共用的中转服务器
- multica-ai/andrej-karpathy-skills一份指令文件,防止AI编程助手偷偷瞎猜、乱改代码
- eneskirca/nodeterm把散乱的终端标签页和AI编程代理统一摆到一张可拖拽的画布上
- affaan-m/ECC让AI编程助手养成工程师式工作习惯的工具集
- n8n-io/n8n不用写代码,靠拖拽连接模块就能搭建自动化流程和AI智能体的工具n8n