我属于那种"标签页开了就不关"的人,日常挂着 99+ 个标签页。某天我看着一堆杂乱的标签页,突然想:AI 都这么强了,能不能让它帮我在浏览器里干活?
市面上方案不少,但总觉得差点意思——有的要起一个独立浏览器,有的要通过 CDP 中继转发,有的只读不能操作,有的必须绑定特定 agent 框架。我就想要个最简单的东西:装在浏览器里,说句话就能干活,不折腾。
于是一个月前的 idea 终于磨磨蹭蹭端出来了, —— Browser Agent。
它能干什么
说几个日常高频用的场景:
整理标签页
"帮我把所有 YouTube 标签页放到一个窗口"
"把未读的标签页存到书签然后关掉"
"按域名给所有标签页分组"
说一句话,十几秒搞定。以前手动拖来拖去要三五分钟。
找回历史页面
"我上周看过一篇关于 Rust async 的文章,帮我找出来"
"把最近 7 天访问过的 GitHub 仓库整理成列表"
比在 chrome://history 里翻快太多了。
管理书签
"把当前没分组的标签页存到「待处理」文件夹"
"帮我清理书签里失效的链接"
日常操作
"截取当前页面的可见区域"
"读取这篇文章的主要内容"
"关闭所有域名不是 work 相关的标签页"
目前内置了 47+ 个工具,覆盖标签页、窗口、标签组、书签、历史、下载、Cookie 、页面内容读取、截图、会话快照……基本上你能想到的浏览器操作,它都能干。
安全方面: 涉及敏感操作(删书签、清历史、改 Cookie ),会弹确认框让你点头,不会偷偷摸摸干事。
用起来什么样: 安装后浏览器右侧多一个侧边栏,像聊天一样打字就行。支持 OpenAI / Anthropic / Google / Cohere 等多家 LLM ,也支持任意兼容 API 接本地模型。纯前端,没有后端服务器,API Key 存在本地。
扩展商店链接
- Chrome: https://chromewebstore.google.com/detail/browser-agent/ocdmppclkippfbdhephcacmpmomkmdip
- Firefox: https://addons.mozilla.org/zh-CN/firefox/addon/browser-agent/
演示视频:
https://www.bilibili.com/video/BV126ga6hEMR
欢迎来 GitHub 提 issue / PR / star Github: https://github.com/devcxl/browser-agent