Agent Browser 是一个为 AI 代理而非人类构建的 Rust 原生浏览器自动化命令行工具。它不使用脆弱的 CSS 或 XPath 选择器,而是暴露无障碍快照,为页面结构分配稳定的元素引用,如 @e1,以及基于角色、标签、文本或占位符的语义定位器。它返回代理可读的 Markdown 或 JSON,因此规划器和工具可以基于页面内容而非原始点击坐标进行推理。由于它是一个小巧且快速的二进制文件,团队可以将其嵌入工具链或从代理运行时调用,无需重型框架,将开放的网络转变为自主工作流的更结构化表面。
可靠性是其差异化特征。引用能在轻微的 DOM 变动和滚动中存活,且当目标被遮挡时命令会提前失败,帮助代理确定性地处理同意横幅和对话框。稳定的标签页标识符(t1、t2)和框架控制在导航过程中保持句柄。与 ARIA 角色和标签对齐的语义查找命令反映了用户对 UI 的感知,减少了对瞬态类名的耦合。结合带注释的截图和用于提取结构化文本的阅读模式,该技术栈将模糊页面转换为代理可以重试、解释和验证的可预测目标,降低了脆弱性。
在操作层面,该工具降低了延迟和成本。批量模式将多步骤脚本压缩为单个进程,消除了每条命令的启动开销。流式传输支持事件驱动控制,而读取模式在不需要渲染时可获取内容,无需启动 Chrome。网络路由、Cookie 和存储控制支持端到端任务,如登录、付费墙和 A/B 变体。允许域、内容边界和输出限制等安全措施减少了提示注入的爆炸范围。结果是代理运行更少的失败,恢复路径更快,且为安全和质量团队提供了更清晰的审计轨迹。
适用场景:当代理必须稳健地导航消费级网页应用、生成可解释的摘要或完成多步骤表单时,使用 Agent Browser。将重量级测试框架保留用于深入的组件测试或定制的进程内控制。对于生产代理,将快照与确定性重试配合,捕获 HAR 文件用于回归,并在任务间持久化标签页或框架上下文。将浏览器视为一种能力,而非拐杖——首先用文本读取进行规划,仅在计划需要副作用时才与引用交互。


