Browser Use 与 CDP 智能体自动化范式 (Browser Use & CDP Agents)
在构建能够自主操作网页的 AI 智能体(Web Agent)时,传统的“计算机视觉截图 + 像素坐标点击(Vision-based GUI click)”方案往往存在延迟高、Token 消耗大、分辨率漂移以及抗动态交互差等痛点。Browser Use 结合 CDP(Chrome DevTools Protocol,Chrome 开发者工具协议) 代表了更具工程鲁棒性的结构化浏览器自动化范式。
Source: 2026-08-20-note-CDP---Browser-Use--通常不依赖-22674ae412.md(来源未公开)
1. 核心架构与运作机理
- DOM 与无障碍树(Accessibility Tree)提取:智能体不单纯依赖渲染后的位图图像,而是直接通过 CDP 获取当前页面的 DOM 节点树与 ARIA 无障碍树,将页面可交互元素转换为紧凑的语义化标记(Interactive Index);
- 协议级精准指令注入:Agent 做出决策后,通过 CDP 原生接口(如
Input.dispatchMouseEvent、DOM.querySelector)直接派发点击、输入与滚动事件,完全规避了像素级坐标定位漂移; - 状态感知与双工监听:利用 CDP 监听网络请求完成状态(
Network.requestWillBeSent、Page.lifecycleEvent)与控制台报错,实现确定性的“等待页面稳定后再执行下一步”,大幅降低幻觉与误操作率。
2. 与视觉智能体的混合协同
在面对含有复杂 Canvas 绘图、滑块验证码或非标自绘 UI 时,现代智能体 Harness 会采用“CDP 语义为主 + 轻量 Vision 为辅”的双模态混合路由策略,在保持超低 Token 开销的同时确保全场景覆盖能力(深度契合 harness-in-agentic-systems 与 agentic-systems)。