程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
网页抓取 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
Scrapling 开源:自适应爬虫框架,网站改版不再让脚本全废,比 BS4 快 700 倍
编程
Scrapling 开源:自适应爬虫框架,网站改版不再让脚本全废,比 BS4 快 700 倍
2026-09-12 09:50:12
Scrapling 是自适应 Web 爬虫框架:解析器学习网站结构,页面改版后自动重新定位元素;StealthyFetcher 开箱即用绕过 Cloudflare Turnstile;内置并发爬虫、断点续爬、代理轮换,文本提取比 BeautifulSoup 快 700 倍,还带 MCP Server 可直接接入 Claude。
Scrapling
爬虫框架
反爬绕过
Python
网页抓取
构建机器可支付 API:x402 Web Scraper on Base 介绍
编程
构建机器可支付 API:x402 Web Scraper on Base 介绍
2026-09-06 05:13:51
x402 Scraper API是一个基于402支付协议的网页提取服务,为AI Agent提供干净的网页数据。文章介绍了AI Agent对网页数据的需求和传统方式的摩擦(订阅、API密钥、信用卡、人工干预)、402支付协议的工作原理(HTTP 402状态码、支付流程、优势)、x402 Scraper API的核心功能(网页提取、HTML转Markdown、结构化数据提取、动态网页渲染、批量处理)、选择Base区块链的原因(低费用、快速确认、EVM兼容)、应用场景,以及与传统API商业模式的对比。
402协议
机器可支付
x402
网页抓取
Base
区块链
AI Agent
API经济
bot.sannysoft.com全绿通过之后:5万token的网页被压到2000,抓取成本砍到二十五分之一
编程
bot.sannysoft.com全绿通过之后:5万token的网页被压到2000,抓取成本砍到二十五分之一
2026-09-05 19:22:08
介绍BrowserAct这个Agent浏览器自动化工具:通过环境层反检测伪装、执行层结构化数据提取、人机交互层远程接管三层架构,解决Agent操作浏览器时的反爬拦截、Token爆炸和经验不能积累三大问题,抓取成本从Playwright MCP的1.75美元降到0.07美元。
BrowserAct
浏览器自动化
Agent
反爬
网页抓取
Claude Code搜不到文档就换它:wigolo用18个搜索引擎加本地知识库给Agent装上网络工具箱,零密钥零成本
编程
Claude Code搜不到文档就换它:wigolo用18个搜索引擎加本地知识库给Agent装上网络工具箱,零密钥零成本
2026-09-05 19:16:11
介绍 wigolo 这个为 AI Agent 设计的本地网络工具箱:集成 18 个搜索引擎多引擎搜索、智能网页抓取、本地知识库和深度研究,无需 API 密钥零成本,支持 MCP/REST/CLI/SDK 多协议,可与 Claude Code、Cursor、Codex 集成,GitHub 已获 2000 Star。
wigolo
AI搜索
网页抓取
本地知识库
Agent工具
给RAG系统喂网页数据不用自己写爬虫:Firecrawl用12种引擎并发抓取,输出干净Markdown直接进AI工作流
编程
给RAG系统喂网页数据不用自己写爬虫:Firecrawl用12种引擎并发抓取,输出干净Markdown直接进AI工作流
2026-09-05 19:15:56
介绍 Firecrawl 这个网页数据抓取与结构化平台:内置 12 种抓取引擎并发处理 JS 渲染和反爬,输出 Markdown/JSON 等 LLM 就绪格式,支持 Agent 自动导航搜索,集成网页抓取、内容提取和结构化输出,GitHub 已获 14.9 万 Star。
Firecrawl
网页抓取
RAG
AI Agent
数据提取
Wigolo:把搜索、抓取、爬取全部跑在本地,无 Key 无额度的 AI 网页能力工具
资讯
Wigolo:把搜索、抓取、爬取全部跑在本地,无 Key 无额度的 AI 网页能力工具
2026-08-26 15:10:35
wigolo 是一款本地优先的开源 AI 网页能力工具,以 MCP Server 形式接入 Claude Code、Cursor 等 Agent,支持搜索、抓取、爬取、结构化提取、本地缓存和页面监控等 10 个功能。核心功能无需 API Key、无额度限制,数据全部留在本机。本文详细介绍其功能、安装与实战体验。
AI
Agent
网页抓取
本地优先
开源
为 AI Agent 打通数据血脉:Firecrawl 深度实战,从网页抓取到 LLM-ready 结构化数据(附 RAG 全链路代码)
编程
为 AI Agent 打通数据血脉:Firecrawl 深度实战,从网页抓取到 LLM-ready 结构化数据(附 RAG 全链路代码)
2026-07-10 02:43:14
深度实战 Firecrawl,讲透如何把任意网站变成 LLM 可直接消费的结构化数据:四动词原理、流水线架构、REST/SDK 调用、自建 Mini-Firecrawl、RAG 全链路代码与成本控制。
Firecrawl
AI Agent
RAG
网页抓取
LLM
数据管道
Python
万字深度解析 Scrapling:当现代爬虫遇见「反爬终结者」——从智能指纹伪装到生产级数据采集的完整工程化实践(2026)
编程
万字深度解析 Scrapling:当现代爬虫遇见「反爬终结者」——从智能指纹伪装到生产级数据采集的完整工程化实践(2026)
2026-07-01 11:14:40
2026年GitHub爆火爬虫框架Scrapling深度解析:从TLS指纹伪装、自适应选择器到生产级数据采集管道的完整工程化实践,涵盖四大核心架构、四个实战场景和七个性能优化方向。
爬虫
Python
网页抓取
反爬虫
TLS指纹
Cloudflare
数据采集
Scrapling 深度实战:当爬虫学会「自适应进化」——从 StealthyFetcher 隐身引擎到自适应解析的生产级完全指南(2026)
编程
Scrapling 深度实战:当爬虫学会「自适应进化」——从 StealthyFetcher 隐身引擎到自适应解析的生产级完全指南(2026)
2026-06-11 09:21:13
Scrapling 是2026年GitHub最火的下一代Python爬虫框架,通过StealthyFetcher隐身引擎(JA3/JA4指纹伪装)和AdaptiveParser自适应解析,让Cloudflare通过率从5%提升到92%,网站改版不再导致爬虫报废。本文深度拆解架构设计、生产级实战代码、性能对比及分布式调度方案。
Scrapling
Python
爬虫
反爬虫
Cloudflare
StealthyFetcher
自适应解析
网页抓取
数据采集
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调