Graph Engineering 的 Agent 左右互搏之術
繼 Loop 後爆紅,我用它跑完 313 個 Agent 的產品研究,文末有可複製的 Prompt 範本
Graph Engineering 把 AI 從 Loop 排隊變成一張可以平行開火的 Graph。我在前一週剛好用同一套方法跑完產品市場研究,總共派出 313 個 Agents,得到品質很不錯的結果。當你學會如何用 Graph,或是直接複製文末的 Prompt,從此以後不用擔心 Tokens 用不完(誤)
我也發現了過去 70 年內在研究方法論能互相呼應的地方,只能說可以學習的東西太多了,我們只是在重新學習如何更好的應用 AI,這篇會著重講實測之後留下來的東西。
Prompt → Context → Harness → Loop → Graph
Loop Engineering 是單一 Agent 的循環:觀察 → 決策 → 行動 → 驗證 → 重試,一直跑重複的事。簡單任務這樣就夠用;但複雜、多步驟、需要並行或嚴格驗證的工作,單一迴圈容易崩潰,混用事實、漏掉矛盾、浪費 Token。Graph Engineering 是用明確的圖結構來協調多個迴圈。圖有三個核心:
節點 Node:是有邊界的工作單位,在這裡可以是新派出去的 AI Agents (Sub-agent or Sessions)
邊 Edge:是真實的資料流
狀態 State:沿著邊走的共享內容,可以說是 Context 傳遞
這樣的演進,很明顯 Graph 不是取代 Loop,是協調多個 Loop。Agent 從 Loop 逐步優化變成一張公司的組織架構圖,更像多個同事彼此協作的工作流程。
Loop 時常見的浪費
大部分人寫 Agentic 流程是「做 A,然後 B,然後 C」。那些「然後」多數是不必要的,也就是俗稱假邊(False edge),因為下一步根本沒有讀上一步的輸出。只因為你打字或習慣的工作順序而存在。每一條假邊,就是一段沒有理由的等待。
判斷方法只有一個:在規劃時,畫得出箭頭上流動的資料或 Context,才是真的邊。畫不出來,那兩個步驟就是獨立的,也就是可以同時跑。另外就是,把一個步驟拆分成可以是一行程式去處理的事,就不需要 Agent 去執行,也可以節省浪費。
Agent 用於推論和判斷,不用於例行水管工程。
別急著開 Graph
哪些事適合搬上 Graph?各種複雜研究是天生的候選人:
產品競品研究
市場研究
新技術調查
跨國稅務諮詢
這篇的實測是偏向新產品市場研究。其實,開發流程也有機會導入,Product Research、Coding、Review/Testing 各是一個節點,中間流動的是 Spec、Diff 和測試報告——你團隊平常的開發流程,本來就是一張由每個角色組成的 Graph。
反過來說,簡單任務繼續用 Context + Loop 就好。升級到 Graph 的判準是任務出現這幾個特徵
需要多專業分工
需要並行
需要嚴格的證據鏈驗證
需要長期記憶與中斷後可恢復
沒有這些特徵就開 Graph 是過度工程,成本和複雜度會提高一個檔次,品質也未必提升。
實測派出的 313 個 Agent
最近剛好我那三輪研究用的是同一個骨架,管它叫鑽石圖(Diamond):一個節點把問題拆開,一群節點平行工作,一個節點收攏。具體長這樣:
把研究問題拆成 5 個搜尋角度
5 個 Agent 平行搜尋,各自讀自己的來源
抓回 20 幾個來源,抽出可證偽的主張
每條主張派 3 個 Agent 投票對抗驗證
一個終局 Agent 寫報告
舉例來說:某個產品競品研究 Agent 在自己的角度抓回一句「某開源工具按席次計費」:
附上出處、標成可證偽主張 → 合併去重複後它進了驗證池 → 3 位驗證者分頭查 → 一個翻官方定價頁、一個找獨立第二來源、一個回溯原始出處。
結果:它根本不收席次費,出處只是一篇過時的社群比較文。
最終:3 票 2 個 AI 反對,主張被推翻,帶著一句否決寫入暫存的文本,這全程零人工介入。
我實測將 3 輪加起來共派出 313 個 Agent (獨立的 Session)、約 1,300 萬 Subagent tokens、332 條主張、75 條進入驗證。單一對話 Session 因為有限的 Context Window 撐不起 20 個來源同時攤開討論,但每個 Agent 只帶自己的那份,回來的只有討論後的結論,這就是 Graph Engineering 能給的廣度!
錯誤通常經不起 3 個懷疑者的圍攻
找到自己不知道 + 確定是對的事
實測下來最值錢的不是平行,是透過大量的辯論去「驗證」。實測的 3 輪的主張否決率分別是 16%、40%、28%。如果沒有對抗驗證(Adversarial verification),下面舉例:
某實驗室內部討論年花 10 億美元買 RL 環境,其實是媒體轉述的傳聞,否決!
某新創營收一年成長 15 倍,其實公司自報、無獨立佐證,否決!
歐盟 AI 法案高風險義務 2026 年 8 月生效,其實已被修正案延到 2027 年 12 月,否決!
同一個 Agent 不改自己的考卷,兩個驗證者不問同一個問題。40% 的否決率代表著我研究的領域的公開資料,將近一半經不起 3 個懷疑者圍攻。
省去重複做事能省下大量 Tokens
去除重複必須是「看過的一切」,不是只是採納的部分。被否決的主張如果沒有留下痕跡,每一輪研究都可能重新發現它、重新評估它、重新否決它,永遠付錢重訪同一條死路。修法是在確定否決時也要紀錄,附一句原因跟驗證方式。
我的經驗是 AI 常常「順手發現第二個問題」,通常很常是重複的,使用 Loop 的帳本會陷入重複的主題,每輪整份讀進 Context 只為了查重。改成 Graph 的方式之後,查詢成本降了 12 倍。因此 Graph 的思維不只讓你變快,也逼你看見在流程中,自己在哪裡付了不必要的租金。在我的角度看,Loop 進化成 Graph 是一種必然的優化路線。
大量攻擊已知
找到自以為知道,但是是錯誤的事
Graph 除了可以當探索未知的研究工具以外,也可以反過來用,也就是攻擊已知。
舉例一份對我很重要的規劃文件,自己前後改過三輪,自認相當完整。把它拆成 8 個角度,每個角度派一個 Agent,拿到的內容只有去識別化的事實和該角度的結論清單,故意設計成看不到全文,也看不到彼此。任務只有一句話:推翻我方結論。
一輪下來,有約 1/5 結論被推翻或修正,最大的一個數字被高估了近 5 倍。人工改 3 輪改不掉的錯,最後被找到,這道理跟解一個一直解不掉的 Bug 也很像。原因是 Agent 自己迭代,錯的假設會自我強化;如果是互相隔離的懷疑者,甚至是 Claude 與 Codex 模型交錯用,就沒有這個包袱。
同模型的缺點:1986 年軟體工程就證明過,獨立寫出來的程式會犯相關的錯,同一個模型多開幾份,該錯的地方會一起錯。解法是找另一個模型家族當反證者,Claude + Codex + Gemini + Grok 交錯用。左右互搏再快,兩隻手終究是同一個腦子指揮的。真正的互搏,是找不同人的手。
隔離是雙面刃。隔離買到獨立性,也買到更多雜訊,收攏的時要逐條過濾。
最值錢的發現全部來自開放題。逐條檢核挖出來的是修正;「我們完全沒想到的風險是什麼」這種事前驗屍(Premortem)式的問題,挖出來的才是翻盤。
算術儘量不外包:算術是水管,留在主迴圈。
同模型的缺點:1986 年軟體工程就證明過,獨立寫出來的程式會犯相關的錯,同一個模型多開幾份,該錯的地方會一起錯。解法是找另一個模型家族當反證者,Claude + Codex + Gemini + Grok 交錯用。
70 年前的老招
這邊是我覺得最有趣的地方。寫完上一節,我回頭查了這些招數的出身,結果我發現每一招幾乎都有名字,而且都比 LLM 老得多:
隔離的懷疑者:Delphi method(RAND,1950 年代):專家獨立作答、互不見面。理由後來被實驗證實:社會影響會摧毀群體判斷的準確度。
指定攻擊:魔鬼代言人(Devil’s Advocacy),管理決策學 1970 年代的方法。實驗結論是結構化攻擊比專家共識更能暴露隱藏假設
開放題:事前驗屍(Premortem),Gary Klein 2007 年的招——「假設計畫已經失敗了,為什麼?」實證上比直接 Review 多挖出約 30% 的風險
否決帳本:競爭假設分析(ACH),CIA 情報分析的標配——被殺的假設要留屍體防復活,連結論的信度標註都有官方標準
LLM 這邊的對應也有類似的方法。2018 年 AI Safety via Debate 就主張讓模型互相攻擊比讓模型自評更接近真相;Anthropic 2025 年發過自家 Multi-agent 研究系統的工程文,結論很類似,就是廣度上多 Agent 顯著贏,代價是 Token 用量十幾倍。
也有反方。2024 年起一批研究指出,多 Agent 辯論的增益有時只是「多算力」而不是「多視角」,同樣的錢花在單一模型多抽幾次,效果差不多。這條批評打的是「辯論到共識」的架構;獨立攻擊加上人工仲裁不在射程內,但爭議值得知道。
方法是舊的,便宜是新的——召集 8 位互不見面的專家,從幾週變成 1 個小時內。
Graph 的天花板
Graph 買的是廣度,不是判斷力。
給一個具體的案例:研究裡有兩個問題:小團隊到底為什麼付費?企業怎麼準備合規採購?——連續多輪零主張存活。猜猜為什麼?這裡不是 Agent 不夠多,是公開資料裡沒有這個答案。再開一百個 Agent 結果也會一樣。
Graph 能放大你的搜索,不能代替你去見人。研究收斂後的下一步應該會是實場的訪談,或是獨特資料點的採集,那是畫不出來的節點。
Graph 輸出比你吸收得快
另一個天花板跟人有關:8 個 Agent 一晚產出的報告,比我一週能內化知識的還多。過去文件是為了可追溯寫的,現在的文件每條結論都有帶出處、帶信度、帶修正軌跡。這對下一輪 Agent 和專業讀者是資產,但對還沒消化吸收的人是天書,我自己都讀不下去。
這部分老實說我也還在嘗試,但我相信修法不是簡化,是增加知識層。也就是文本照舊,按照人的學習方式,上面加一頁 3 分鐘讀完的入口,知識再從淺到深做呈現,比如說—現在怎樣、還在等什麼決定、可以要做什麼、想深讀開哪份。把文本的密度留給 AI 和專家,設計簡單的入口留給自己,這部分我覺得就蠻像個人 LLM Wiki 的核心,有做過的人應該會蠻有共鳴的。
廣度的帳單,注意力來付。
心得
這輪繳的學費不少。一是一開始模型分級沒做,3 百多個 Agent 全部跑在最貴的模型上,但搜尋和抓取其實是重複性工作,之後會把這些節點用的 AI 降級,判斷力留給驗證和收攏。二是好用的 Graph 建起來後沒有存檔,跑完才想到同一個骨架換個 Prompt 就可以用在不同需求。這週補存模型分級跟攻擊模式也寫進了自己的 Skill,下次應該不用重新發明吧。
Graph engineering 這個詞下一個會是什麼,我不知道,但我猜應該會更接近一家真實公司的運作流程。先畫 Graph,再平行開火這件事,可以確定把你的 Tokens 燒得淋漓盡致。
現在就開始體驗區:
Prompt 範本(複製貼給你的 Agent 就能跑)
來源
Graph Engineering con Opus 5(@angeldot_,2026-07-25)
Graph Engineering Clearly Explained(@akshay_pachaar,2026-07-25)
Graph Engineering:从 0 到 1 小白完整教程(@AdrianPunk115,2026-07-26)
Gary Klein, Performing a Project Premortem(Harvard Business Review, 2007)
Knight & Leveson, An Experimental Evaluation of the Assumption of Independence in Multiversion Programming(1986)
Richards Heuer, Psychology of Intelligence Analysis(CIA, 1999)
Irving, Christiano & Amodei, AI Safety via Debate(2018)
Anthropic, How we built our multi-agent research system(2025)
Chen et al., Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems(2024)




