编程 bb-browser:复用真实浏览器登录态的网站数据抓取工具,3.1K Star

2026-09-05 18:59:33

bb-browser:复用真实浏览器登录态的网站数据抓取工具,3.1K Star

想让 AI Agent 去知乎看热榜,或者搜个 X,听起来挺简单。想稳定运行,还是有很多问题要考虑的。要么找 API Key,但 99% 的网站压根没 API;要么写爬虫——网站一改版代码就炸,还得担心被限制;要么用 Playwright 那种无头浏览器——每次重新登录,Cookie 管理一堆破事儿,网站还能识别出来你是机器人。

最恼火的是,你的 Chrome 明明已经登录了所有网站,Agent 却要从头折腾一遍。

GitHub 上有个项目,叫 bb-browser。BadBoy Browser,坏孩子浏览器。项目开源,目前已经获得 3.1K Star。开发者在 Reddit r/LocalLLaMA 发了长文讲项目诞生故事,引发病毒式传播,Hacker News 首页讨论,知乎专栏推荐,即刻社区热议。作者自己都说这做法"很坏",但优雅到没法反驳。

一个灵光一闪

最初只是想让 AI Agent 访问 Reddit。传统方案全都麻烦——重新登录、管理 Cookie、对抗限制。然后他看了已经登录的 Chrome 想:我明明已经登录了,为什么还要再弄一遍?直接在浏览器里跑代码不就行了?

他试了一下。在 X 页面里调用 webpack 模块,让页面自己签名请求。Status 200,搜索结果完美返回。他盯着屏幕愣了半天——这玩意儿是在他的真实浏览器里跑的,用的是他的真实登录态。网站完全分不出来是人在用还是 Agent 在用。

他在 Reddit 原话是:"The website literally cannot tell this apart from me using it normally."

那一刻项目名字就定了。bb-browser,BadBoy Browser,坏孩子浏览器。"The approach is bad. But it's so elegant."

核心思路就一句话:直接用你已经登录好的真实浏览器。AI Agent 在你的 Chrome 里跑代码,用你的登录态,拿结构化 JSON。网站看到的就是你自己在操作。

36个平台,全是社区写的

bb-sites 仓库里,每个命令一个 JS 文件。X、Reddit、GitHub、StackOverflow、B站、arXiv——你能想到的网站基本都有人写好了适配器。

bb-browser site twitter/search "AI agent"
bb-browser site zhihu/hot
bb-browser site arxiv/search "transformer"
bb-browser site eastmoney/stock "茅台"

返回的全是结构化 JSON。标题、链接、热度,该有的都有。所有命令支持 --json 输出,还支持 --jq 内联过滤:

bb-browser site xueqiu/hot-stock 5 --jq '.items[] | {name, changePercent}'

直接给你过滤好的数据。

10分钟CLI化任何网站

更野的是这个。你跟 AI Agent 说:"帮我把 XX 网站 CLI 化。"Agent 自动读教程,用 bb-browser network --with-body 抓包逆向,写 adapter,测试,提 PR 到社区仓库。全程自动。作者实测过,20 个 AI Agent 并发运行,每个独立逆向一个网站,全都成功了。

他说:"将一个新网站纳入 Agent 可访问范围的边际成本,趋近于零。"

一个 Agent 可以在一分钟内完成跨平台调研:arXiv 搜学术论文、X 看社交讨论、GitHub 找开源项目、StackOverflow 查技术问答、知乎看中文社区、36氪看行业新闻。六个平台,六个维度,结构化 JSON。比任何人类研究员都快。

三行命令

npm install -g bb-browser
bb-browser site update
bb-browser site zhihu/hot

装工具,拉适配器,开搞。

三种运行模式:OpenClaw 模式(--openclaw,直接用 OpenClaw 内置浏览器,无需扩展)、Chrome 扩展模式、MCP 模式(接入 Claude Code / Cursor)。

坑点:Windows 上 --openclaw 可能报 spawnSync npx ENOENT,用 --port 指定 CDP 端口。macOS 有 IPv6 问题,Daemon 需要 --host 127.0.0.1 绑定 IPv4。

有人做过安全审计,发现了 4 个严重漏洞——零认证、CORS 通配符、eval 注入。作者后来都修复了。但提醒一句:不要在登录银行账户的时候跑 bb-browser。这种"伪装成用户"的做法可能违反某些网站的服务条款,用的时候心里得有数。

"互联网是为浏览器设计的。AI Agent 一直在试图通过 API 访问它,但 99% 的网站根本没有 API。bb-browser 反过来:与其强迫网站提供机器接口,不如让机器直接用人的接口。"

BadBoy Browser。做法很坏,但确实优雅。

GitHub 地址:https://github.com/epiral/bb-browser

推荐文章

程序员茄子在线接单