关注 · AI一手 · 每天分享最前沿的AI技术与应用

图片

✍️ 作者: AI一手

前两天,我在 WorkBuddy 里装了 BrowserSkill。

这是腾讯开源的浏览器操控工具。装完之后,我让它进公众号后台,分析最近数据为什么不好。

结果它真的进去了,把后台的数据分析翻了一遍,把原因和结论直接回给我。

为什么要特别提这件事?因为同样的活,我之前用 Codex+Chrome 试过,直接被安全策略拦了

当时给 Codex 的提示词是:

帮我分析一下我最近的公众号的数据不好的原因,可以打开账号检测;我的公众号后台已经打开过了,去分析一下吧;

等了一会儿,它回了一句:

“微信公众号平台被浏览器安全策略禁止自动读取,无法绕过。”

Codex 被拦截

我查了一下原因,翻到 GitHub 上的相关 issue 才搞明白:这压根不是配置问题,是 OpenAI 在服务端站点策略里把 mp.weixin.qq.com 等微信域名拦了,本地怎么设都绕不过去。

换成 WorkBuddy+BrowserSkill 之后,同一个后台、同一个 Chrome 登录态——进去了,点了,分析出来了。

今天这篇就讲两件事:怎么装 BrowserSkill、它能干什么 Codex+Chrome 干不了的活。

补一句:BrowserSkill 是开源项目,不只有 WorkBuddy 能用。Cursor、Codex、Claude Code 等任何能跑 shell 命令的 Agent 都能接。这次用 WorkBuddy 演示,是因为它配合 BrowserSkill 操作最直观、开箱体验最好。

BrowserSkill 概念图

另外这次演示我用的是 WorkBuddy 里的 Hy3(混元思考模型)。截稿时它还在限时免费:每天有免费额度,标签上也写着夜间加速;官方说明是 23:00–8:00 资源更足,错峰会更畅。跑浏览器这类偏长任务,晚上试往往更舒服。

Hy3 限时免费与夜间加速

01为什么 Codex+Chrome 被拦,BrowserSkill 能过

先用一张表说清差异,后面再展开:

特性 Codex + Chrome 插件 BrowserSkill
控制链 Codex 云端策略层 → Chrome 扩展 Agent → 本机 bsk CLI(127.0.0.1)→ 扩展
站点限制 OpenAI 服务端站点策略会拦,微信系在列 没有这层云端禁令
Agent 窗口 在你的 Chrome profile 里操作 单独开 Agent Window,不抢你的浏览器
登录态 复用已登录 Chrome 同样复用已登录 Chrome
谁能用 只有 Codex WorkBuddy / Cursor / Codex / Claude Code 等

简单说就是:Codex 的 Chrome 插件在帮你操作网页之前,会先把你要去的网址拿去跟 OpenAI 自己维护的一张禁止访问清单对一下。微信公众号后台、微信支付这些域名都在这张清单上,直接就被拒了。

你在本地加白名单没用——因为拦你的不是你本地的 Chrome,是 OpenAI 的服务端。

BrowserSkill 走的是完全不同的路:你电脑上装了一个 bsk 的本地程序 + 一个浏览器扩展,Agent 给本地程序下命令,本地程序通过 WebSocket 把指令传给扩展,扩展在一个独立的浏览器窗口里帮你点——全程在你自己电脑上转圈,没有任何外部策略网关挡你。

所以结论很简单:不是 BrowserSkill 有什么魔法,是 Codex 那边多了一道"我不让你去"的墙。BrowserSkill 把去哪的决定权还给你自己了。

再补一句背景,免得误会:Codex 那套 Chrome 插件是 OpenAI 官方做的,拦微信域名也是 OpenAI 自己的服务端站点策略——不是微信故意不给 Codex 自动化。BrowserSkill 是 腾讯开源的,走本机桥接,本来就没有这层远程禁令。所以也不是腾讯专门给自家后台开后门,而是两边架构不一样:一边出门先过 OpenAI 的关,一边在你自己电脑上干活。

02怎么装 BrowserSkill(两种方式)

装的东西一共就两块:本地 CLI + 浏览器扩展。我把两种安装方式都写出来,选适合你的那种。

方式一:让 WorkBuddy 自己装(推荐,最省事)

BrowserSkill 官方仓库准备了一条给 Agent 用的安装指令。你不需要自己研究命令,直接复制粘贴给 WorkBuddy 就行。

第一步:打开 BrowserSkill 的 GitHub 仓库

仓库地址:

https://github.com/Tencent/BrowserSkill

GitHub 仓库页

第二步:把官方安装提示词发给 Agent

不用自己翻文档抠命令,直接把下面这句复制进 WorkBuddy(Cursor / Codex 也一样):

按照 https://raw.githubusercontent.com/Tencent/BrowserSkill/main/AGENT_INSTALL.md 的说明,在本机安装并配置 browser-skill

官方 README 里也是这一句,截图留个对照:

官方安装提示词位置

第三步:粘贴到 WorkBuddy 里发送

新建一个任务,把上面这句粘贴进去,直接发送。WorkBuddy 会自己读文档、装 CLI、配置技能目录。

WorkBuddy 开始执行安装

第四步:等它装完,看检查表

装完后它会跑 bsk doctor。一般来说 CLI、daemon、技能文件都能自动搞定,唯一需要你手动做的是装浏览器扩展——检查表里通常只剩 extension connected 是 FAIL。

检查表只剩扩展未连接

第五步:安装浏览器扩展

扩展商店地址直接给你,打不开自动跳转就手动打开:

https://chromewebstore.google.com/detail/browserskill/hhcmgoofomhgciiibhipgmgkgnoenaoi

打开后点"添加至 Chrome"→ 弹窗里点"Add extension"→ 搞定。

Chrome 应用商店安装页

确认添加扩展

然后把扩展固定到浏览器右上角:点拼图图标 → 找到 BrowserSkill → 点图钉。

固定扩展到工具栏

点开扩展弹窗,确认状态是 Connected / READY(绿灯)。

扩展已连接

第六步:回到 WorkBuddy 告诉它装好了

回复一句"扩展安装好了,你看下是否可以了",它会再跑一遍检查。全部通过就能用了。

全部检查通过

方式二:扩展用 ZIP 压缩包手动装(打不开 Chrome 应用商店时用)

如果你网络环境打不开 Chrome 应用商店,就别硬走商店了。BrowserSkill 在 GitHub Releases 里单独放了扩展安装包,路径跟装 CLI 不是一回事。

第一步:进 Releases 页

发布页地址:

https://github.com/Tencent/BrowserSkill/releases

也可以从仓库页右侧 Releases 点进去。

仓库右侧 Releases 入口

第二步:找 BrowserSkill Extension 这一条

注意:列表里会同时出现 bsk CLI 和 BrowserSkill Extension。手动装扩展要找的是 BrowserSkill Extension(我截图时是 0.1.5),不是 CLI 那条。

选择 Extension 发行版

第三步:在 Assets 里下载 chrome.zip

往下翻到 Assets,下载类似这样的文件:

browser-skill-extension-v0.1.5-chrome.zip

下载扩展 ZIP

第四步:解压,拖进 Chrome 扩展页

解压后会得到同名文件夹。浏览器地址栏输入 chrome://extensions → 打开右上角"开发者模式"→ 把解压出来的文件夹拖进去(或者点"加载已解压的扩展程序"选这个文件夹)。

开发者模式加载解压文件夹

加载成功后,扩展列表里能看到 BrowserSkill,开关是开着的。

扩展已加载

第五步:固定扩展 + 确认 Connected

和方式一一样,固定到右上角,点开确认显示 Connected / READY。CLI 那边如果还没装,再让 WorkBuddy 按官方 Agent 安装指令把 bsk 装上即可。

装好之后怎么用

新建一个任务 → 点输入框左边的 + 号 → 技能 → 选 browser-skill → 然后直接用自然语言告诉它你想让它在浏览器里干什么。

点加号

选择 browser-skill

03案例一:公众号后台——Codex 翻车,BrowserSkill 全程跑通

装好之后我马上测了一个 Codex 死活进不去的活。提示词就跟开场那句一样:

帮我分析一下我最近的公众号的数据不好的原因,可以打开账号检测;我的公众号后台已经打开过了,去分析一下吧;

不用写得很细。后台我已经登录过,它自己进 mp.weixin.qq.com,该看数据面板就看。提示词里我提了可以开账号检测,但这次它实际主要逛的是数据分析——内容分析、用户分析这些页面。

Codex+Chrome 的结果

直接被策略拦了。折腾一会儿后告诉我:无法自动读取,让我自己截图或导出表格再发给它。

等于什么都没做。

Codex+Chrome 分析公众号被拦截

BrowserSkill 的结果

它自动打开了一个独立的 Agent 浏览器窗口——用的是我已经登录好的 Chrome,所以不用重新扫码。

然后它开始在后台里走:首页 → 内容分析 → 用户分析,把能看到的流量和用户数据读出来,再回到 WorkBuddy 给我一份分析结论。

最后分析结果:

BrowserSkill 公众号分析最终结果

速度不算快,我自己手点可能更快一点。

但重点不在速度——Codex+Chrome 连门都没进去的事,BrowserSkill 从头到尾走完了。 而且它没有搞任何 hack、没有伪造请求头、没有注入脚本,就是帮我点了我自己本来就能点的东西。

04案例二:X 书签+关注流——把吃灰的收藏变成选题库

第二个案例换个场景,但逻辑一样:没有我的号就干不了的活。

我平时逛 X,看到好的 AI 动态就顺手收藏——官方发布、大 V 分析、开源项目 demo、产品更新……收了一大堆。

但这些书签基本全在吃灰。

收的时候觉得"这个以后能写篇文章",然后就再也没打开过。时间一长,到底收了什么、哪些还有时效性、哪些可以串成一个选题——完全不记得了。

问题是:X 的书签、关注流、私人 List 都是绑在你账号上的,不登录什么都看不到。

X 有 API 吗?有。但书签相关的接口在比较贵的权限档里。为了偶尔整理一次收藏,去申请开发者账号、配 OAuth、维护 token——属实没必要。

所以我给 BrowserSkill 下了这样的指令:

进入我的 X 书签和关注流,帮我做三件事:1. 整理最近收藏的内容——发帖人、核心信息、原始链接2. 从中提炼"最近 AI 圈在密集讨论什么"——哪些技术、产品、事件出现频率高3. 推荐 5 个可以写成公众号文章的选题方向,标明素材来源是哪几条收藏

下达书签+关注流任务

我做的是公众号 AI一手,定位就是前沿 AI 技术与应用。这些书签里的内容全是一手信息——但散着没人帮我归纳,跟没收一样。

第一步:书签,一次就对了。

Agent 自己打开 x.com/i/bookmarks,在独立窗口里翻"所有书签"。这一步没翻车,书签内容顺利抓出来了。

Agent 进入 X 书签页)

中间出了个小插曲:关注流第一次没抓对。

书签拿到之后,它去抓关注流时出了问题——x.com/following 在 Agent 窗口里返回了 0 条。它自己打了个补丁:拿我首页的"为你推荐 / For You"流顶上,还写进了说明,说主题差不多、不影响结论。

但对我来说这不够。我要的是关注流,不是推荐流。 所以我当场指正:别用 For You 凑数,重新去拿真正的 Following。

关注流第一次抓偏后的说明

指正之后:关注流抓到了,完整报告也出来了。

它重新进首页,点到"正在关注",这次拿到了真实关注流(报告里记了 94 条),再把之前误用的推荐流替换掉,选题来源也重新标了一遍g)

最终落盘的文件标题就是:

X 书签 & 信息流分析报告

里面有书签主题归类、关注流补充视角,以及 5 个带素材来源的公众号选题方向。

完整报告:X 书签与关注流分析

这事儿反而挺有参考价值:BrowserSkill 不是一键完美黑盒。 它能进你的私人页面,但路径走偏了你得盯一眼、说一句。盯住之后,它又能自己把错的那一段改回来,把完整报告交出来。

这就是 BrowserSkill 在这种场景下真正的用处——不是帮你复制网页内容,是进入你的私人信息库,把一堆吃灰的收藏变成你马上能用的选题线索。

没有你的号就进不去,没有浏览器操控就翻不了,进去了不分析就还是一堆灰。三个条件缺一个都白搭。

05什么时候该用,什么时候别碰

最后说一个我觉得很重要的事:不是什么活都值得用浏览器插件。

你要是拿 BrowserSkill 去干"帮我搜一下 XXX 最新消息"这种事,那纯属浪费时间——Agent 自带的搜索能力就够了,何必等它慢悠悠开个浏览器窗口再一页页翻。

什么时候才真的需要它?一句话:

**没有你的号就干不了的活。

场景 用不用 为什么
自己的后台/管理面板 ✅ 该用 绑着你的登录态,别人进不去
书签/收藏/关注流/私人 List ✅ 该用 绑你的号,外面搜不到
有 API 但申请很烦,你只是偶尔用一次 ⚡ 可以偷懒用 为一次活去配密钥不值得
公开信息搜集(新闻/文档/开源项目) ❌ 不需要 Agent 自带搜索就够了
已有专属插件覆盖的平台(GitHub/Slack/Notion) ❌ 不需要 用官方集成更快更稳

判断标准就这一条:换一个没登录你账号的人,能不能拿到同样的信息?

如果能——说明这是公开信息,用搜索就够了。如果不能——那才是 BrowserSkill 的战场。

别乱用的另一个原因:部分平台对自动化操作有风控。你拿它去干本来就能搜到的事,不光浪费时间,还可能白白触发风控。

06几句实话

▸ BrowserSkill 遇到验证码、扫码登录这种需要人工确认的环节,会停下来等你处理。它不是全自动黑盒,有些地方还是得你亲自上手。

▸ Agent 操作浏览器通常比你自己手点慢。一个你三分钟能做完的事,它可能要五六分钟。它真正省的不是一次操作的时间,是你以后不用每次都从头教 AI"第一步点哪、第二步进哪"的成本。

▸ 公众号后台虽然能进,但别拿它来搞高频自动化——风控不管你用什么工具,看的是行为模式。偶尔用一次两次完全没事,天天循环刷数据那就是你自己找麻烦了。

▸ 第一次用的时候,先拿一个简单任务试试整条链路通不通,别上来就搞复杂操作。

▸ 用 WorkBuddy 跑的话,可以留意一下 Hy3 的限免窗口和夜间时段——长任务放晚上,体感往往会好一点。

但它确实解决了一个真问题:Codex+Chrome 在策略层被拦的站点,BrowserSkill 直接走本地、没有这道墙。能不能进,取决于你自己的浏览器能不能进——而不是某个远程策略表说了算。


以上,如果觉得不错,随手点个在看转发三连吧~如果想第一时间收到推送,也可以给我个星标 ⭐谢谢你看我的文章,你的关注是我持续更新的动力~

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐