Tenten 首選的通用 Agent CLI
Rust CLI · accessibility refs · 狀態、網路、效能與除錯工具
以 accessibility snapshot 產生穩定 refs,提供 click、fill、upload、tabs、cookies、network、HAR、trace、Web Vitals 與 a11y 稽核。適合 Codex、Claude Code 與 CI 中需要逐步證據的瀏覽器操作。
Browser Automation 已分化為四種產品:操作型 CLI、推理型 Agent、資料爬取管線與本機 AI 瀏覽器。本報告依控制介面、執行環境、登入狀態、反偵測需求與資料輸出整理十個專案,提供可直接採用的選型與組合建議。
Tenten 不以 Stars 決定單一冠軍。瀏覽器自動化的首要問題是:由程式精確控制,還是由 LLM 自主規劃;執行在乾淨瀏覽器、現有登入工作階段,還是反偵測環境;交付物是完成操作、測試證據,還是大規模資料集。
agent-browser 與 playwright-cli 把瀏覽器能力變成短指令。Agent 可逐步 snapshot、click、fill、screenshot,並把失敗點留在終端紀錄中。
browser-use 讓 LLM 規劃頁面操作,適合「找出資料並完成表單」等目標導向任務。代價是模型成本、非確定性與更高的執行觀測需求。
BrowserOS、Nanobrowser 與 web-ui 偏向沿用本機互動環境;camofox-browser 將反偵測 Firefox 封裝為 Agent API。兩者不應混為同一種需求。
Crawl4AI 與 Crawlee 針對佇列、並行、代理、重試與結構化輸出設計。批次索引或 RAG 資料管線不應由互動式 Agent 逐頁點擊完成。
把瀏覽器動作交給 coding agent、LLM 規劃器或反偵測瀏覽器服務。
Rust CLI · accessibility refs · 狀態、網路、效能與除錯工具
以 accessibility snapshot 產生穩定 refs,提供 click、fill、upload、tabs、cookies、network、HAR、trace、Web Vitals 與 a11y 稽核。適合 Codex、Claude Code 與 CI 中需要逐步證據的瀏覽器操作。
token-efficient · sessions · live monitoring dashboard
Microsoft 將 Playwright 常用操作封裝為 CLI 與 Skills。支援持久 session、儲存狀態、截圖、PDF、tabs、網路與 dashboard;適合已採 Playwright 的工程與測試團隊。
CLI 適合一次性任務;Python library 適合可重複產品流程
讓 LLM 自主開頁、點擊、輸入與擷取資料,支援自訂工具、模型與瀏覽器。官方 README 將一次性 Agent 任務導向 CLI,將產品內嵌與細粒度控制導向 Python library。
Camoufox · REST API · stable refs · proxy 與 GeoIP
以 Camoufox 的 C++ 層 fingerprint spoofing 為基礎,提供 accessibility snapshots、元素 refs、session 隔離、cookie 匯入、proxy、VNC 登入與 OpenAPI。用於一般 Playwright 容易被封鎖的站點。
將網站內容轉成 LLM、RAG、搜尋索引或資料產品可使用的結構化輸出。
Markdown 產出 · structured extraction · dynamic crawling
針對 AI 資料工作流提供 Markdown、結構化擷取、JavaScript 頁面處理、快取、hooks、截圖與部署 API。適合建立知識庫、RAG 語料與研究型批次擷取。
HTTP + browser · Playwright + Puppeteer · proxy rotation
以一致介面整合 HTTP 與真實瀏覽器爬取,提供自動重試、request queue、儲存、代理輪替與 browser management。適合需要長時間運作、可恢復與可擴展的資料採集服務。
讓非工程使用者操作 Agent、沿用登入狀態,或把結構化代理方法延伸到其他媒體。
BrowserClaw + BrowserOS · MCP · session replay · local-first
同一 repo 提供 Agent 驅動的 BrowserClaw 與內建 AI 的 Chromium fork BrowserOS。可沿用登入帳號、連接 MCP、觀看即時工作並在本機重播 session;適合高互動、需人工接管的日常營運。
Chrome extension · 自帶 LLM key · planner + navigator
在 Chrome extension 內執行多 Agent 工作流,支援多種 LLM provider 與既有瀏覽器環境。適合希望低部署成本、可視化操作與自帶模型金鑰的個人使用者。
多模型 · 自訂瀏覽器 · persistent sessions · Docker
為 browser-use 提供 Gradio UI,支援多家 LLM、自訂 Chrome 路徑、持久 session、螢幕錄製與 Docker。適合示範、內部工具與需要人工觀察的 Agent 實驗。
transcript → EDL → render → self-eval
此 repo 不是瀏覽器控制器。它把「用結構化表示降低模型負擔」的思路用於影片:以逐字稿與按需視覺檢查產生 EDL、渲染並自我驗證。適合參考 Agent 工作流設計,不應列入瀏覽器 runtime 比較。
先選主要控制面,再按反偵測、資料規模與登入狀態加入第二層。避免同一任務同時疊加多個瀏覽器控制器。
適用表單、後台、登入後操作、部署驗證與網站 QA。需要 Playwright 原生生態或既有測試資產時,改用 playwright-cli;兩者擇一作為單次任務的主控制器。
適用目標明確、步驟未知的任務。若站點有反自動化阻擋,將執行環境切到 camofox-browser 或受管 stealth browser;保留人工確認與執行紀錄。
Python/LLM-ready Markdown 優先選 Crawl4AI;TypeScript、生產級 request queue、代理輪替與長時間任務優先選 Crawlee。互動式 Agent 僅處理爬蟲無法覆蓋的例外頁。
適用郵件、行事曆、CRM 與需觀看 Agent 行為的營運流程。偏好 Chrome extension 與自帶模型金鑰時選 Nanobrowser;需要 browser-use 示範介面時選 web-ui。
Tenten 協助團隊把瀏覽器 Agent 接進研究、內容、QA、後台營運與資料管線,並建立登入狀態管理、人工確認、證據留存、失敗恢復與權限邊界。