做浏览器自动化的同学大多被同一件事折磨过:browser-use、Playwright 起的浏览器是「空白的」——公众号后台、飞书、淘宝、公司内网,它一个登录态都看不到,打开就被踢回登录页。腾讯 2026 年 6 月开源的 BrowserSkill,思路反过来:直连你本机已登录的 Chrome / Edge。本篇不讲虚的,用我自己的两场「真机器实测」说话。
传统浏览器自动化(Playwright、browser-use 这类)默认起一个全新浏览器实例。它干净得过头——没有你的 Cookie、没有登录态、没有已保存的密码。结果就是:
一句话总结:BrowserSkill 的解法是——你看到的页面 = Agent 看到的页面;你不给的权限 = Agent 拿不到。
BrowserSkill 不在云端、也不新建浏览器。它是你本机上的一个桥:Agent → bsk CLI → 本机守护进程 → 浏览器扩展(127.0.0.1 本地 WebSocket)→ Agent Window。全链路本地闭环,零网络外传。官方列了四大优势:
同类方案横评
AI 操作浏览器的路不止一条。我把市面上主流方案按「能不能复用登录态」「会不会打扰你」「绑不绑特定生态」三个维度拉了一张表:
BrowserSkill
腾讯开源 · Rust CLI + 扩展
独立 Agent Window,共享 Profile 登录态
✅ 复用登录态 · 不中断 · Human-in-loop
⚠️ 仅 Chrome/Edge
browser-use
Python 库 · Playwright 上层
支持 Real Browser 模式复用 Chrome Profile,也可导出 storageState 跨会话
✅ 生态成熟 · 视觉理解强
⚠️ Real模式需关Chrome重开;Token偏高
bb-browser
CDP 直连 · 轻量 CLI
通过 CDP 连接正在运行的 Chrome,@ref 引用元素,Token 极省
✅ 复用登录态 · Token 低 · 启动快
⚠️ 页面跳转后@ref失效;无隔离窗口
Playwright MCP
微软开源 · 标准化框架
启动全新空白浏览器实例,API 稳定可靠
✅ 最稳定 · 无头模式 · 跨浏览器
⚠️ 无登录态;需配 MCP Server
Codex Chrome 扩展
OpenAI · 扩展直连
直接在你的 Chrome 里操作,无需中转协议,权限和身份全继承
✅ 用你的身份操作 · 装扩展即用
⚠️ 绑 Codex 生态;无独立窗口
Skyvern/Stagehand
云端 / SDK 方案
基于 Playwright 扩展 + AI,解决反爬对抗和验证码处理
✅ 反爬能力强 · 适合批量流程
⚠️ 无登录态;本质还是外包模式
选型建议:要读已登录后台(公众号/内网/电商)→ BrowserSkill 或 bb-browser 或 browser-use Real 模式;只抓公开内容或跑测试 → Playwright MCP 最稳。BrowserSkill 的差异化在于独立 Agent Window 不打扰 + 标准 CLI 不绑生态 + human-in-loop 兜底三合一,其他方案最多占其中两项。
没有手动敲命令,没有照着文档一步步点。我只是在 WorkBuddy 里发了这么一句:
帮我安装 browser-skill on this machineby following https://raw.githubusercontent.com/Tencent/BrowserSkill/main/AGENT_INSTALL.md
Agent 自己读完官方安装文档,把活儿全干完了:下载并装好 bsk CLI、把技能注册进 WorkBuddy 等 7 个 harness,最后只交代我一件事——去浏览器里装一下扩展。装完打开扩展弹窗,等它变绿就连通了。
别去背命令。直接调用 browser-skill,用大白话告诉它你想干什么。会话开合、页面快照、点击填充这些脏活,Agent 会在背后翻译成 bsk 命令自己跑——你只管说要求。我这两场实测,开局就各甩了一句:
用 browser-skill 收集我公众号各个文章的阅读量
帮我打开淘宝网站,查看一下我的订单,找出待收货商品。
关键点:你描述的是「目标」,不是「步骤」。开窗口、翻页、抓数、关窗口,全交给 Agent。
① 公众号后台:43 篇阅读量一条龙收回
它打开的是我已登录的公众号后台,走完整流程 session start → 翻 5 页抓取 → session stop,把我全部 43 篇文章的阅读量都收了回来。新 Playwright 实例会被踢回登录页,根本拿不到——这就是复用登录态的硬价值。

② 淘宝:待收货订单,直接出表格
第二句甩出去,它打开我已登录的淘宝,进「我的订单」切到「待收货」标签,把待收货商品全找出来了——共 5 笔,实付合计 ¥73.63。最后交付一份 Markdown 表格,商品名、店铺、价格、下单日、状态一目了然。

综合评分
★ ★ ★ ★ ★ (五星)
复用真实登录态 + 不中断工作 + 支持任意 Agent + 内置 human-in-loop,这四点是真香;扣分在浏览器仅支持 Chrome / Edge(Firefox 计划中),且依赖本机常驻运行。
查订单、抓阅读量,只是开胃菜。一旦 Agent 能接管你已登录的浏览器,它盯着的就不是「网页」,而是你整套数字生活的工作台。下面这些才是它真正离谱的地方——
帮我打开豆瓣电影《XXX》,翻完所有短评,
按点赞数取前 20 条高赞影评,总结核心观点
和情绪走向,输出 md 表格。
🤯 一个彩蛋:你正在读的这篇
这篇文章本身就是我让 BrowserSkill 调本机浏览器,自动填进公众号草稿箱的——从排版 HTML、标题到两张截图上传 CDN,全程没离开我的编辑器。Agent 写稿、Agent 发稿,闭环了。就是整个过程有点跌跌撞撞,可以自己写skill优化一下流程。
💬 轮到你了:你最想让它替你自动干掉哪件烦人的事?每周整理竞品动态、盯着某个页面等降价、还是别的?评论区聊聊,说不定下一篇就写你的需求。
你的浏览器,本该就是 AI 的「工具箱」。
