在生成式 AI 領域,原型設計 Agent 是一類典型的複雜任務系統。它的目標是將自然的語言需求轉化為可互動、可執行的完整產品原型。

這一過程涵蓋「需求理解 → 方案制定 → 頁面拆分 → 並行實作 → 整體驗證 → 迭代修復」等多個環節,構成一個動態任務圖。隨著原型複雜度的提升,任務節點之間的關聯度成倍增加:局部頁面的元件失配、視覺規範偏離或互動斷層,都會引發多輪震盪修復;而全域設計的偏差,更可能導致整個任務圖的失效與重構。

這類系統的最佳化目標需要圍繞三個核心架構問題展開:

  1. 終局邊界:怎樣的結果才構成真正的「完成」;
  2. 推理邊界:哪些狀態轉折點值得引入大模型的非確定性推理;
  3. 控制邊界:已確定的計算與規則工作流應當如何高效執行。

本文梳理該系統在過去數月演進中的架構迭代邏輯:系統從最初依賴模型自由探索的 ReAct 模式,逐步收斂為基於契約解耦、確定性工作流與上下文拓撲最佳化的高效率架構。


1. 演進困境:當事後審查成為成本與時延的黑洞

在早期架構中,系統採用 ReAct 機制驅動整個生成生命週期。Agent 根據當前狀態推理下一步動作,呼叫工具撰寫或校驗程式碼,並依據回饋決定繼續生成、修復還是終止任務。

為了確保交付品質的下限,設計者在 ReAct 迴圈中逐漸疊加了多層審查機制。每次頁面生成後強制進入審查環節,若發現缺陷則觸發修復,修復完成後再次校驗。

graph LR
    A[頁面實作] --> B[審查評估]
    B -- 發現問題 --> C[修復]
    C --> B
    B -- 透過 --> D[交付]

這一階段的架構在效果維度攔截了低品質產物到達交付門禁。但在系統工程維度,過度依賴事後審查產生了顯著的副效應:

  • 計算鏈路膨脹:每一輪審查都伴隨著完整的上下文裝載、模型推理與工具互動。修復過程可能改寫原本正確的模組,引發連鎖式的二次審查。
  • 長尾時延顯著:在複雜場景下,單次任務的模型成本經常超過 20 美元,端到端耗時突破 60 分鐘。
  • 結果確定性降低:即便簡單任務也可能因模型評估的波動陷入多輪審查,導致服務時延承諾難以保持穩定。

在一組複雜度分佈一致的代表性樣本中,Review-heavy 版本已經出現了非常典型的長尾:

指標P50P95極大值
單任務模型成本21.3 美元28.6 美元34.7 美元
端到端耗時27.6 分鐘55.4 分鐘68.7 分鐘

這組數字揭示了一個反直覺現象:更多 Review 確實抬高了效果下限,卻沒有同步提高有效交付能力。相反,它讓系統用越來越多的成本,換取越來越不確定的完成時間。

在此背景下,系統的改進方向從單純追求高成功率,轉向在可控成本與時延約束下提供工程可用性。


2. 指標重塑:定義「有效交付效率」

為衡量架構演進的實際收益,系統引入了有效交付效率這一核心工程指標。

在傳統服務中,吞吐量統計處理的請求數,有效吞吐量則強調滿足服務品質目標的請求。在 Agent 系統中,單次使用者請求包含數十次模型呼叫與多次內部修復,因此最小評估單元應當設為完整的交付結果

系統將有效交付效率定義為:

\[\text{有效交付效率} = \frac{\text{在規定 SLA 內達到品質標準的合格交付數}}{\text{全量任務產生的總算力成本}}\]

這一指標用於衡量:系統每消耗 100 美元算力,能在承諾時限內交付多少個合格的產品原型。

公式對分子與分母施加了明確約束:

  • 分子篩選:僅包含同時滿足「產品完整度達到標準」且「端到端耗時在規定範圍內」的任務;
  • 分母核算:包含全量算力開銷,涵蓋模型 Token、工具執行、中間審查、失敗任務的重試及未完成任務消耗的資源。

有效交付效率明確了架構最佳化的先後順序:在效果達到交付標準的前提下,首先將時延收斂至合理區間,在此基礎上最小化完成任務的算力成本。

為了讓不同階段能夠橫向比較,以下資料採用同一組任務結構進行歸一化:每個階段取 40 個代表性任務,共 200 個樣本,覆蓋 2~6 個頁面,並統一以 8 分鐘作為交付 SLA。成本分母包含失敗、取消前消耗和重試;舊版本資料由歷史架構表現與同任務集回放估算,當前版本以 staging trace 的量級進行校準。因此,這些數字用於表達架構趨勢,而不是生產經營或財務審計口徑。

階段SLA 內合格交付平均任務成本每 100 美元有效交付數相對 5 月穩定版
4 月:開放 ReAct14 / 405.20 美元6.76.5×
5 月:疊加 Review(穩定版)9 / 4021.80 美元1.01.0×
6 月:Plan 前置與並行30 / 403.40 美元22.121.4×
7 月:Prefix Cache33 / 401.90 美元43.442.1×
8 月:Workflow 與門禁35 / 400.88 美元99.496.3×

合格原型

每 100 美元完成的有效交付數

每 100 美元完成的有效交付數6.7, 1.0, 22.1, 43.4, 99.46.74 月ReAct1.05 月Review22.16 月Plan43.47 月Cache99.48 月Workflow
5 月穩定版 → 8 月 Workflow:96.3 倍

真正的拐點不是換用了更便宜的模型,而是系統先減少了不必要的推理,再讓剩餘推理以更高併發、更高快取命中率執行。疊加 Review 的 5 月反而形成效率低點,也說明單獨提升效果下限,並不等於系統整體更有效。


3. 階段一架構重構:規劃前置與不確定性的集中壓縮

指標演進推動系統將不確定性的壓縮集中到執行階段之前。

新架構在實作階段之前引入了顯式的規劃節點。規劃節點集中定義了三類系統級契約:

  1. 任務拆分契約:確定產品包含的具體頁面樹與邊界;
  2. 共享約束契約:收斂全域視覺規範、通用元件庫與資料流模式;
  3. 驗收契約:明確判定任務完成的客觀條件。
graph TD
    subgraph 舊架構
        O1[頁面 A 獨立理解需求] --> O2[實作] --> O3[全域審查發現偏差] --> O4[重構]
    end

    subgraph 新架構
        N1[規劃節點生成全域契約] --> N2[頁面 A 邊界內實作]
        N1 --> N3[頁面 B 邊界內實作]
        N1 --> N4[頁面 C 邊界內實作]
        N2 --> N5[確定性門禁校驗]
        N3 --> N5
        N4 --> N5
    end

在舊架構中,每個頁面生成節點獨立理解整個產品,容易產生決策冗餘與方向偏離;規劃節點將全域設計決策前置,使下游子任務聚焦於明確邊界內的局部實作。

事後審查機制隨之轉變為確定性門禁與局部修復。系統優先校驗產物是否符合事先約定的交付契約,減少無差別的長鏈模型審查。


4. 階段二架構重構:安全並行與上下文拓撲最佳化

全域規劃契約的確立,為系統開闢了執行流並行化與上下文共享快取最佳化的空間。

4.1 基於契約的獨立並行

在獲得穩定的規劃契約後,頁面級實作任務共享相同的產品事實,可獨立並行推進。

  • 序列耗時\( T_{\text{serial}} \approx T_{\text{plan}} + \sum T_{\text{page}} + T_{\text{gate}} \)
  • 並行耗時\( T_{\text{parallel}} \approx T_{\text{plan}} + \max(T_{\text{page}}) + T_{\text{gate}} \)

系統將端到端耗時的增長模式從隨頁面數量線性累加,轉變為由最慢關鍵路徑決定。

按頁面數量分桶後,並行化的收益更加直觀:

頁面數舊架構 P50 / P95新架構 P50 / P95舊架構完整交付率新架構完整交付率
2 頁16.9 / 34.5 分鐘2.2 / 3.6 分鐘82.5%90.0%
3~4 頁27.6 / 55.4 分鐘4.4 / 6.8 分鐘85.0%90.0%
5~6 頁41.8 / 63.2 分鐘6.6 / 7.9 分鐘80.0%87.5%

舊架構的耗時隨頁面數量近似線性增長;新架構中,頁面數增加主要擴大併發寬度,而不再等比例拉長關鍵路徑。與此同時,完整交付率沒有因為並行而下降,說明 Plan 已經把原本由末端 Review 承擔的品質底線前置到了執行之前。

4.2 樹狀上下文拓撲與前綴快取

並行化後,不同頁面分支的上下文存在大量重疊,包括全域需求、產品結構與視覺約束。

新架構將輸入上下文結構化解耦為全域靜態前綴局部動態任務兩部分。

flowchart TB
    P["全域靜態前綴<br/>需求 · 結構 · 視覺約束 · 規範"]
    P -->|Prefix Cache 共享| A["頁面 A<br/>局部任務"]
    P -->|Prefix Cache 共享| B["頁面 B<br/>局部任務"]
    P -->|Prefix Cache 共享| C["頁面 C<br/>局部任務"]

全域靜態前綴利用推理引擎的 Prefix Cache 特性建立 KV 快取,後續並行分支均可複用該快取。

工程實踐表明,原型複雜度越高、頁面數量越多,前綴快取的相對成本收益越顯著。首次寫入開銷被多個分支攤薄後,複雜原型的上下文獲取成本下降超過 80%。

頁面數可快取輸入成本下降模型總成本下降完整任務成本下降
2 頁51%31%24%
3~4 頁68%49%41%
5~6 頁82%65%56%

這裡需要區分三個口徑:「超過 80%」描述的是複雜任務中重複上下文的取得成本,而不是整個任務的總成本。模型仍然需要為每個頁面生成不同的實作,工具和門禁也不會因為快取消失。即便如此,僅透過調整上下文拓撲,5~6 頁原型的完整任務成本仍下降了 56%。


5. 階段三架構重構:從開放 ReAct 到有界工作流的收斂

解耦任務邊界與上下文開銷後,系統進一步解決 ReAct 迴圈帶來的不確定性執行時長。

ReAct 適合探索未知空間。但在任務目標與驗收標準已明確的階段,繼續由模型自主決定是否持續審查,會增加執行過程的熵增風險。

新架構將確定性的執行邏輯從 ReAct 抽離,收回至確定性的狀態機工作流中。

flowchart LR
    P["規劃<br/>Agent 探索"] --> E["分支並行<br/>工作流控制"]
    E --> G["契約門禁<br/>規則校驗"]
    G -->|透過| D["交付"]
    G -->|失敗| R["異常修復<br/>局部 Agent"]
    R --> G

在新控制流中:

  • 工作流 掌控分支併發、超時控制與重試次數上限;
  • 門禁 提供客觀的校驗訊號;
  • Agent 集中在規劃階段的開放決策以及門禁未透過時的局部有界修復

當門禁校驗透過時,工作流立即終止,攔截無意義的最佳化迴圈;校驗失敗時,修復上下文限定在報錯模組內部,避免全域重跑。

這種控制收斂降低了長尾耗時。在當前標準化成功交付樣本中,端到端耗時的最小值為 2.1 分鐘,P50 為 4.1 分鐘,P95 為 7.6 分鐘,極大值為 8.0 分鐘。簡單任務因此可以在約 2 分鐘內完成,複雜任務也被控制在 8 分鐘的 SLA 範圍內。

當前工作流耗時最小值P50P95極大值
端到端交付2.1 分鐘4.1 分鐘7.6 分鐘8.0 分鐘

成本長尾也隨控制流一起收斂。當前簡單原型的單任務成本可以降至 0.6 美元;隨著頁面數和互動複雜度增加,成本仍會上升,但不會再被無限 Review 放大。

當前任務規模單任務成本 P50單任務成本 P95
2 頁0.60 美元0.84 美元
3~4 頁0.86 美元1.18 美元
5~6 頁1.22 美元1.74 美元

更重要的是,8 分鐘不只是一次較好實驗的觀測值,而是控制流設計出來的邊界:分支併發、重試預算、局部修復範圍和終止條件共同決定了系統不會再次滑入無限 Review 的極端長尾。


6. 架構反思:重構任務圖本身

當前針對 Agent 系統的效率最佳化路徑包括:

  • Anthropic 建議從極簡架構切入,按需增加複雜度;
  • OpenAI 建議建立基線後,嘗試小模型替換;
  • EvoRoute 等研究採用動態路由,為不同步驟匹配合適的模型;
  • AI21 Maestro 在多維空間中搜尋 Agent 的協同配置。

這些方法側重於在既定任務圖上最佳化模型分配與參數策略。

本系統的演進側重於重構任務圖本身:

flowchart LR
    subgraph ROUTE["模型路由最佳化"]
        R1["給定任務圖"] --> R2["選擇模型"] --> R3["最佳化路由策略"]
    end
    subgraph SYSTEM["本系統的最佳化"]
        S1["重構任務圖"] --> S2["規劃前置"] --> S3["契約解耦"] --> S4["控制流收斂"]
    end

模型路由確定執行載體;而規劃約束、確定性工作流、門禁校驗與前綴快取拓撲,從根本上減少不必要的推理發生。


7. 結語

該系統自 4 月以來的架構演變涵蓋三個階段:

  1. 粗放探索期:依靠審查機制保障品質下限;
  2. 結構解耦期:透過規劃集中壓縮不確定性,結合前綴快取與並行化最佳化算力拓撲;
  3. 控制收斂期:利用確定性工作流替換 ReAct 開放迴圈,達成時延與成本的明確控制。

以 5 月穩定版作為基線,在相同品質標準與 SLA 約束下,系統每 100 美元完成的合格原型數從約 1.03 個提升至當前的約 99.43 個,整體有效交付效率提高約 96.3 倍。更直觀地看,舊 Review 框架中經常超過 20 美元的任務,在當前架構下,簡單場景已經可以用約 0.6 美元完成。

複雜 Agent 的系統工程最佳化遵循三條原則:

系統架構的核心職責在於大模型呼叫前明確判定:這一次推理是否需要發生。