LongHorizon-Harness 是面向 Claude Code、Codex、OpenCode 與 DeepSeek Harness 的開源執行閉環系統。它在跨桌面 App 與終端環境中持續管理目標狀態、分配邊界明確的單步執行、在真實系統中獨立稽核,並在失敗或上下文刷新後自動恢復。
模型能力決定了 Agent 單輪推理的上限;LongHorizon-Harness 負責工程化模型外部的執行閉環。它解決單輪對話結束後的後續規劃、真實系統驗證、進度持久化,以及在執行失敗或上下文刷新後的狀態恢復。
系統支援跨桌面 GUI 與命令列 CLI 混合工作流。單一任務可在瀏覽器蒐集資料、在命令列執行處理腳本、於桌面軟體產出交付物,再回到終端進行測試驗證。目標、進度與稽核證據全程由統一狀態系統維持。
執行架構將單一閉環拆分為三種專注職責:Manager 負責狀態與步驟規劃、Executor 在全新上下文中執行單步動作、Auditor 獨立檢查真實檔案與系統回饋。未通過驗證的結果僅保留為失敗證據,不計入有效進度。
環境需求包含 Python ≥3.10、Node.js 22.19+ 或 24+,以及至少一組受支援的 Agent CLI(Claude Code、Codex CLI、OpenCode 或 DeepSeek Harness)。使用 uv 或 pip 安裝核心套件。
若任務涉及桌面 GUI 操作,需依使用的 Agent 安裝對應外掛。外掛在全機安裝一次即可供所有專案共用,並自動生成各 Agent 專屬的 MCP 設定。
lh-harness doctor 可自動檢查 Python、Node.js、Agent 二進位檔及外掛授權狀態。
LongHorizon-Harness 將複雜的長時間任務分解為同一閉環內的專注職責與可插拔組件。不同角色可在設定檔中獨立指定模型與後端,兼顧執行品質與 token 成本。
| 使用情境 | 推薦入口 | 適用動作 |
|---|---|---|
| 互動式任務與視覺監控 | lh-harness web --workspace-root . |
瀏覽器工作台、角色模型切換、審批互動與多輪追問 |
| 自動化腳本與 CI 流程 | lh-harness run --task @task.md |
命令列單次執行、排程執行、--no-dashboard 模式 |
| 環境檢查與二進位排查 | lh-harness doctor |
檢查 Python、Node.js、CLI 二進位檔與 macOS 權限 |
| 桌面 GUI 外掛管理 | lh-harness plugin install <name> |
安裝或移除 open-computer-use / codex-computer-use |
| 基準評測與論文重現 | eval/<benchmark>-harness/ |
重現 WeaveBench、OSWorld 2.0 或 Terminal-Bench 2.1 |
以下原則整理自 LongHorizon-Harness 官方 README 與論文(arXiv:2608.01964)。執行長時間任務時,先確立狀態隔離、全新上下文與獨立稽核機制,以維持執行穩定度與結果可信度。
每輪 Executor 皆以乾淨的 context 啟動,僅接收當前目標、最新已驗證狀態與上一輪失敗記錄,避免歷史訊息膨脹導致指令偏離。
來源 · 官方架構設計Auditor 獨立檢查實體檔案系統、UI 截圖、終端日誌與測試回傳碼,不直接信任 Executor 的文字回報。
來源 · 官方 README僅有通過 Auditor 驗證的步驟才會被寫入已驗證進度(checkpoint)。未通過的嘗試保留為失敗證據,作為下一輪規劃依據。
來源 · 官方狀態管理Manager 與 Auditor 建議配置高推理能力模型(如 Claude 3.7 / GPT-5),Executor 則可搭配成本效益較高的模型以降低 token 總花費。
來源 · 官方設定指南任務執行預設作用於當前工作目錄,而 ./.lh-harness/ 狀態目錄保持受保護,避免 Agent 誤改自身日誌與歷史。
任務結束後在 Web 工作台直接追問,系統會沿用該任務已完成的 round ledger 繼續推進,不需從頭重複執行。
來源 · v0.1.7 更新日誌Computer-use 外掛設定存放於 ~/.lh-harness/plugins/,不改動全域 config;當安裝多個外掛時按優先序自動選取。
在 WeaveBench 混合任務達到 80.7%(提升 28.9%)、OSWorld 2.0 桌面任務達 3.0 倍完成率,並在 TB 2.1 節省 24% token。
來源 · arXiv:2608.01964以下示範一項典型任務:從命令列或 Web 工作台啟動,先在桌面瀏覽器中排查系統錯誤,再於命令列中修復後端 API 與更新測試,最後由 Auditor 執行端到端驗證並持久化檢查點。
每次任務執行會在 ./.lh-harness/runs/<run-id>/ 建立獨立目錄,完整記錄每輪次之規劃步驟、操作截圖、終端歷程與稽核報表 logs/report.json。
在 Web 工作台直接輸入追問時,系統會自動繼承既有 round ledger 與檢查點狀態,無縫接續後續工作,避免重複消耗 token 與時間。
config.toml 明確配置 max_rounds 與 [run.timeouts] 防止無限循環。
run.timeouts 上限時,代表該角色未在時限內完成,不等於網路連線中斷;下一輪 Manager 會讀取未完成狀態進行復原。
./.lh-harness/config.toml 等可能被提交至版控的檔案中。
codex-computer-use > open-computer-use > clawdcursor。
LongHorizon-Harness 的進階延伸包含自訂角色模型權限、撰寫自訂 AgentAdapter、掛載專屬 MCP 伺服器,以及重現官方論文的評測基準。
1. 角色專屬模型與推理配置。在 ./.lh-harness/config.toml 設定 [run.roles.manager] 與 [run.roles.auditor] 分別指定 model 與 reasoning_effort,實作精準分工。
2. 自訂 Agent 轉接器。繼承 AgentAdapter 介面實作自訂 Agent 呼叫邏輯、權限邊界管理與輸出結果結構化正規化。
3. 掛載私有 MCP 伺服器。使用 --claude-mcp-config 或 --codex-mcp-config 連接企業內部資料庫、API 工具或自訂除錯工具。
4. 重現論文基準評測。進入 eval/WeaveBench-harness/ 或 eval/OSWorldv2-harness/ 依專屬 README 配置環境,重現實驗數據。
5. 整合 CI/CD 自動化任務。透過 lh-harness run --task @task.md --no-dashboard 串接 GitHub Actions,建立夜間長時間自動化重構與驗證流程。
① arXiv:2608.01964:LongHorizon-Harness 論文全文,詳解 Loop Engineering 數學架構與評測方法。
② eval/ 目錄評測套件:WeaveBench、OSWorld 2.0 與 Terminal-Bench 2.1 凍結重現指令。
③ 專案官方網站:完整實驗軌跡、案例分析與 Web 工作台最新功能預覽。