將舊配置直接複製至 Opus 5.5,只會讓帳單成倍上升
核心哲學
Effort 降級:5.5 的 Medium 勝過 5 的 High
官方預設 effort 已從 high 降為 medium,且 Opus 5.5 在 medium 下的表現已持平或超越舊版 high。在多數編碼與流程審計中,
effort: "low"即可達到極佳準確度。直接沿用舊配置只會迫使模型進入不必要的高思考週期。快取讀取 $0.20/M 是長會話的真正生命線
Prompt 快取讀取成本降至 $0.20/M,僅為輸入單價的 0.05 倍(前代為 $0.50/M)。一個擁有 200k 前綴且重複讀取 50 次的真實 Agent 會話,無快取需花費 $40,Opus 5 需 $5,而 Opus 5.5 僅需 $2,大幅降低長上下文團隊成本。
一 Agent 一職能,嚴禁無意義轉發型 Orchestrator
高效率團隊控制在 3 到 5 人以內。每個 Agent 擁有嚴格定義的輸入、輸出與門禁標準。拒絕單純轉發任務的調度層,審查員不得評估自身產出,涉及合併程式碼、線上發布、資金支付與資料刪除的操作必須強制保留人工確認。
調校與定價 Optimization & Pricing
完整掌握 Opus 5.5 四大 400 報錯規則、靜默 Agent 修復、快取前綴固化與精確定價公式。
調校與定價
API BREAKING CHANGES · ECONOMICS & PRICING
排名 01/04
API Spec · 四大引發 HTTP 400 的致命異動移除舊版強制工具與手動預算,全面轉向自適應規範
沿用舊版 SDK 參數將直接遭到 API 與雲端平台拒絕
Thinking 嚴禁停用:傳送
thinking: {"type": "disabled"}或手動budget_tokens一律返回 400;必須省略欄位或改傳{"type": "adaptive"},需要低延遲請降為effort: "low"。 2. 強制工具調用廢除:tool_choice的any與具體工具強制指定已廢除並回傳 400;一律維持auto,在 Prompt 內明示工具名稱並開啟strict: true確保結構化驗證。 3. 思考區塊會話綁定:5.5 僅相容 Opus 5 思考區塊;2026 年 8 月 31 日後建立之帳號,修改思考區塊前之任何歷史訊息均返回 400,歷史必須維持 append-only。 4. 舊版電腦操作廢棄:computer_20251124工具在原生 API 與 GCP 上回傳 400;必須升級至computer_toolset_20260801。
- ! 400 報錯規避
- Adaptive Thinking
- strict: true
- Append-Only History
- /
- 04
- Breaking
- 4 Rules
- Tool Choice
- auto only
- Thinking
- Adaptive
排名 02
Runtime · 靜默 Agent 修復與思考更新串流告別十分鐘無響應轉圈,開啟思考狀態與自銷毀提醒
模型在工具調用間的過渡思考轉為思維區塊,預設文字為空
在預設 display: "omitted" 下,模型過渡筆記文本為空,造成使用者以為系統假死。解法: 1. 啟用 thinking={"display": "updates"} 並帶上 Beta 標頭 thinking-display-updates-2026-08-18,並嚴格按型態讀取區塊,切忌按位置索引。 2. 若長任務連續 5 步無可視反饋,附加單輪即自毀之系統提醒:{"role": "system", "clear_at": "next_user_message", "content": "簡要說明目前進度後繼續。"}(搭配標頭 mid-conversation-system-clear-at-2026-08-21),既不中斷執行,亦完全保留 Prompt 快取命中。
- ✓ 官方建議方案
- display: updates
- clear_at
- 快取相容
- Beta Header
- 2026-08-18
- Silent Gap
- -50% Time
排名 03
Pricing Sheet · 快取前綴 60% 折扣經濟模型快取讀取降至 $0.20/M,奠定長上下文團隊優勢
輸入 $4 / 輸出 $20,快取讀取費用僅為全新輸入的二十分之一
官方規格:輸入 $4.00、輸出 $20.00;快取讀取 $0.20/M(較前代 $0.50 暴跌 60%);快取寫入 5 分鐘 $5.00、1 小時 $8.00;Batch 半價 $2.00 / $10.00。支援 1M 上下文與 128K 輸出(Batch 搭配 output-300k-2026-03-24 可達 300K)。 **200k 前綴重複讀取 50 次實測:**全新無快取需 $40.00,Opus 5 快取需 $5.00,Opus 5.5 快取僅需 $2.00。固定系統提示與工具定義前綴,是控制 Agent 團隊成本的絕對核心。
- ★ 60% 成本暴跌
- $0.20 Cache Read
- 1M Context
- 128K Output
- Cache Read
- $0.20/M
- Ratio
- 0.05x Input
排名 04
Effort Tuning · 動態思考深度與快取保護以 medium 為基準,透過單輪覆蓋保護全域快取
請求間擅自改動頂層 effort 將使整個 Prompt 快取失效
鎖定頂層基準:連線層級宣告
output_config={"effort": "medium"}作為會話基線,全程不變動,確保快取鎖定。 2. 單輪動態覆蓋:遇到複雜規劃步驟,透過單輪訊息覆蓋messages=[..., {"role": "system", "content": [], "output_config": {"effort": "high"}}, {"role": "user", ...}](需 Beta 標頭mid-conversation-output-config-2026-07-01)。 3. 預留 max_tokens:Thinking tokens 即使未明文輸出也計入 max_tokens 額度。設定過小會造成截斷,官方建議長 Agent 任務直接給足 128,000 上限。
- ✓ 快取保護機制
- Per-Message Effort
- 128k Max Tokens
- Baseline
- Medium
- Max Tokens
- 128k
八步架構法 Architecture & Anti-Patterns
遵循嚴格順序設計最精簡實用陣容,杜絕臃腫層級與自審漏洞,落實故障恢復六大原則。
八步架構法
MINIMAL AGENT ARCHITECTURE · SYSTEM SPEC
排名 01/04
Build Sequence · 八步極簡團隊建構順序嚴禁跳過審計直接寫名單,依序建立可存活的自主系統
從手動工作流基線出發,設計能度過真實工作週考驗的最少 Agent
流程審計 (Workflow audit):釐清交付目標、執行瓶頸與重複步驟,記錄既有純手動路徑。 2. 委派邊界 (Delegation scan):切分哪些交由 Agent 接管,哪些必須由人類緊握。 3. 團隊設計 (Team design):上限 3 至 5 人,每一位都具備存在之必要性,命名如真實職稱。 4. 角色定義 (Role definition):明確單一任務、具體輸入、交付格式、使用工具與一分鐘可驗收之成功標準。 5. 交接映射 (Handoff mapping):定義工作如何在 Agent 間傳遞,以及必須隨身攜帶之型態化資料。 6. 提示詞包 (Prompt pack):為每位 Agent 打造生產級提示詞,包含失敗防護邊界。 7. 審查門禁 (Quality gates):獨立審核迴圈、量化評分閾值與人工斷點。 8. 上線計畫 (Launch plan):七日漸進推進,以真實日誌驗證留存。
- ✓ 嚴格循序建構
- 3-5 Agents
- Prompt Pack
- Quality Gates
- /
- 04
- Order
- Strict 1-8
- Scope
- Lean Team
- Validation
- 1-Min Test
排名 02
Anti-Patterns · 必須即刻否決的六大反模式識破表面精巧的無效設計,剔除轉發節點與無閾值假門禁
任何在提示詞或架構草案中出現的以下形態,均應直接駁回
只轉發不幹活的調度器:純粹轉發任務卻無實質運算或判斷價值的 Orchestrator。 2. 二人分拆一職:將單一狹窄工作生硬切分給兩個 Agent,造成交接損耗。 3. 審查者自評自改:讓編寫內容的同一 Agent 自行審查自己的產出。 4. 垃圾場式記憶:所有對話無差別全量儲存,卻缺乏精準檢索機制(Memory Dump)。 5. 無數值之憑感覺門禁:缺乏具體及格分數或閾值,僅靠模型模糊感覺判斷通過。 6. 湊圖表充數角色:只因視覺流程圖看起來單薄而硬塞進去的額外 Agent。
- ! 6 大禁忌
- 剔除假調度器
- 禁止自審
- 量化門禁
- Rejection
- 6 Patterns
- Bias
- Fewer Roles
排名 03
Failure Recovery · 異常中斷與故障恢復六原則執行失控時的安全底線:兩次同錯即停,嚴禁臆造工具
建立自律終止機制,防止 Agent 在錯誤迴圈中消耗 token 且掩蓋真相
兩次同錯即停:相同錯誤連續發生兩次時立即終止,絕對不嘗試第三次。 2. 工具缺失明示:缺少必要工具時明文上報其名稱,嚴禁私自臆造替代方案。 3. 低信心帶證上報:推論置信度不足時,必須附帶所有參考證據向上呈報。 4. 矛盾並存不代選:面對互有衝突的資訊,完整呈現雙方依據,禁止擅自二選一。 5. 未完工作保留標記:部分完成的產出完整封存並打上未完成標籤,嚴禁充當成品。 6. 凡失敗必留日誌:每一次失敗都必須在日誌中留下一行明確記錄,絕不無聲靜默。
- ✓ 確定性容錯
- 2x Stop
- No Silent Fail
- Log Evidence
- Max Retry
- 2 Times
- Log Policy
- Mandatory
排名 04
Human Control · 人在迴路(HITL)四項絕對防線寄發、合併、付款與刪除,永遠鎖定在人類手中
將高風險與不可逆動作完全隔離在自主代理權限之外
自主 Agent 負責研究、草擬、對比分析與格式轉換,但在以下四項操作抵達門禁時必須強制暫停並等待人類授權: • Sending:對外發送郵件、客戶通知或正式公文。 • Merging:將程式碼分支合併進 Production 主幹或發布 Release。 • Paying:觸發金流支付、雲端資源大規模擴展或簽署合約。 • Deleting:刪除生產資料庫資料表、雲端儲存槽或核心環境檔案。任何企圖繞過人類核准直接執行的操作,均違反架構安全規格。
- ! 人工鐵律
- Sending
- Merging
- Paying
- Deleting
- Guarded
- 4 Actions
- Authority
- Human Only
交接與指標 Handoffs & Operational Metrics
把 Agent 之間的溝通規範為強型態合約,以七天為週期漸進部署,並透過六大關鍵數字驅動團隊持續演進。
交接與指標
TYPED HANDOFFS · 7-DAY LAUNCH · 6 METRICS
排名 01/04
Handoff Contract · 六欄型態交接合約規格任何交接均必須顯式宣告、型態化且留存紀錄
拒絕口語化模糊傳遞,每筆交接紀錄必須精準滿足六大欄位
單行可行動任務 (Task in one line):人類或下級 Agent 可直接採取行動的明確指示。 2. 具名具型輸入 (Named & typed inputs):列明前置步驟已具備的資產型態與路徑。 3. 預先完成定義 (Definition of Done):在動作開始前即書面寫下的及格驗收規格。 4. 置信度與比對基準 (Confidence score):當前產出的信心數值及其參照之內部標竿。 5. 歷史失敗紀錄 (Failed attempts):已嘗試但無效的解法,防範下一棒重蹈覆轍。 6. 阻塞終止負責人 (Owner if stopped):若鏈路中斷等待時的最終人類處置者。
- ✓ 強型態合約
- Typed Input
- Pre-defined DoD
- Audit Trail
- /
- 04
- Contract
- 6 Fields
- Type
- Strict Schema
- Logging
- Full State
排名 02
Cadence · 七天漸進上線與末位淘汱排程七天循序漸進驗證,未證明價值之 Agent 一律裁撤
從手動到自動化、從單一到鏈路,拒絕一次性過度架構
• Day 1:單一 Agent、單一任務,完全由人類在終端手動輸入執行。 • Day 2:為其撰寫量化成功測試標準,直到能完全信任其輸出。 • Day 3:引入第二個 Agent,並嚴格實裝雙方之交接合約。 • Day 4:引入獨立審查員(Reviewer),此階段嚴禁增加第三個幹活工人。 • Day 5:用團隊自身的真實生產案例,校準審查門禁的分數閾值。 • Day 6:全鏈路端到端運轉,為每一步決策、輸入與指標落盤日誌。 • Day 7:末位淘汰 — 毫不猶豫地剔除在這一週內未能賺回其算力成本的任何 Agent。
- ★ 漸進發布週期
- Day 4 Reviewer
- Day 7 Pruning
- Duration
- 7 Days
- Discipline
- Prune Unused
排名 03
Measurement · 上線後僅追蹤之六項核心數字告別虛榮指標,聚焦工時節省、人工重工與靜默率
只有能直接轉化為商業回報與系統可靠性的數字才值得度量
節省工時 (Time saved):每次自動化執行對比手動路徑所節省之分鐘數。 2. 總成本 (Cost tracking):每次運算、每日、每月的真實 Token 支出帳單。 3. 人工呈報 (Escalations):遇到阻塞呈報至人類的頻率,觀察其是否穩定遞減。 4. 人工重工 (Rework volume):產出交付後,人類在正式使用前手動修改的內容比例。 5. 完成重試 (Retries):平均每次成功完成任務所耗費之重試次數。 6. 靜默無產 (Silence runs):無產出且無報錯說明的無效消耗次數,目標恆等於零。
- ✓ 商業與可靠性度量
- Rework Ratio
- Zero Silence
- Cost per Run
- Metrics
- 6 Only
- Target Silence
- 0 Runs
排名 04
Deliverable Contract · 終局交付五件套規格架構規劃回答完結時,必須精確以這五項內容作結
結構化合約的最終防線,杜絕空泛總結與發散論述
所有由 Agent Team Architect 產出的方案,結尾必須精確交付五大元素: • 花名冊 (The Roster):嚴格一 Agent 一行,標註角色與職稱。 • 交接圖譜 (The Handoff Map):以具體有序清單呈現,禁止使用模糊概念圖。 • 開箱即用提示詞 (Prompt Templates):每位 Agent 均附帶 Copy-ready 的生產提示詞。 • 下週三項關鍵指標 (Three numbers to watch):上線後首週核心檢驗數字。 • 工期不足第一砍件 (One thing to cut):當交付時限緊迫時,最優先剔除的邊緣環節。
- 交付標準
- Copy-Ready
- One Thing to Cut
- Deliverable
- 5 Artifacts
- Execution
- Immediate
Anthropic 官方九大提示詞法則與實戰架構母版
官方規範與實戰指令庫
由 Anthropic 官方調校文件淬煉出的 9 條長程任務法則,搭配 Claude Code 落地設定與 @zodchiii 完整的 Agent Team Architect 母版提示詞。
01 · 官方調校指南 · 9 Prompt Rules
Anthropic 文件淬煉的 九大行為修正常規
無人值守中斷修復:在系統提示末尾明示「無工具調用之訊息即結束輪次;禁止為匯報進度而停下,將狀態筆記與工具調用合併輸出」。 2. 跨應用上下文探索:「行動前先行探索:列出並開啟可能相關之郵件、文件與表格」。 3. 時間節奏感知預算:訊息附加
elapsed 340s / 1200s讓模型自律調節思考深度。 4. 既定歷史鎖定:宣告「已回答問題視為定論,後續輪次專注當前問題,禁止重複質疑前期結論」。 5. 注入隔離標籤:以<pasted_content id="xyz">隨機識別碼包覆外部貼上內容。 6. 禁用回覆中提取推論:移除要求回覆中給出思維的指令,改讀display: "summarized"。 7. 以 effort 替代陳腔爛調:刪除「Think carefully」,直接以參數控制;快速回答給出「直接回答」。 8. 視覺模式具名否定:明確排除米色背景、斜體強調詞、藥丸按鈕等通用 AI slop 風格。 9. 密集圖表原生閱讀:5.5 在 low effort 下對圖表數據的讀取準確度已超越舊旗艦,無需多餘視覺鷹架。
02 · Claude Code 實戰配置 · CLAUDE.md & Harness
將規範固化於 CLAUDE.md 與 TASKS.md
• 任務形狀三要素:單一訊息給出全量任務、預先定義「Done means(所有端點替換、測試通過、舊客戶端移除)」以及明確的提問中斷點。 • CLAUDE.md 流程守則:「步驟不需要我的輸入時請持續推進。狀態說明與下一個動作放在同一訊息中。僅在無法繼續、或執行具破壞性動作(刪除資料、force-push、修改倉庫外部)時暫停。」 • Subagent 證據查驗法:在大規模審計中派發子代理後,主代理在接收報告時必須先查驗證據再行採納,否則主代理將盲信子代理的口頭回報。 • TASKS.md 實體文件錨點:長程執行在上下文壓縮時,透過實體檔案保留檢查清單,避免依賴滾動歷史。
03 · 生產母版 · Master Agent Team Architect Prompt
發送至 Opus 5.5 的 架構師全量提示詞
將以下結構化 XML 發送至 Claude Opus 5.5,即可驅動模型為你的業務工作流自動產出最適陣容: <prompt> <role>You are an elite agent team architect and Claude Opus 5.5 workflow strategist...</role> <objective>Design the smallest useful team for one real workflow...</objective> <build_process>1. Audit 2. Scan 3. Design 4. Role 5. Handoff 6. Prompts 7. Gates 8. Launch</build_process> <rules>One agent one narrow job. Reviewers never review their own work. Sending, merging, paying and deleting stay with a human.</rules> <failure_recovery>Same error twice: stop. Low confidence: hand up with evidence. Contradiction: present both.</failure_recovery> </prompt>
04 · 發布前查核 · Pre-Flight Checklist
上線前 六大自省審查點
在最終確認 Agent 團隊陣容前,架構師必須在自省中確認以下六點: 1. 每個 Agent 是否真正具備不可替代的必要性? 2. 交接合約是否顯式且具備型態定義? 3. 哪裡可能滋生重複或模型憑空臆造? 4. 哪些環節依舊嚴格需要人類審查與批准? 5. 上線後使用者將以哪項具體指標度量成功? 6. 若下個月要精簡編制,最先被剔除的是哪位 Agent?
AI-First 設計與技術顧問公司。15+ 年、300+ 品牌。我們把 Claude、MCP、Agentic Commerce 接進 Headless CMS、Webflow、Shopify Plus 的企業級交付 — 讓 AI 透過 GEO (AEO) 找到你的品牌,讓 B2B ABM 把買家轉成營收。
解決方案
By Topic
資源
公司
© 2026 Tenten Inc. · Opus 5.5 Agent Architect · 策展自 @zodchiii 深度實踐。轉載與引用請保留來源。