LLM 工程 · Agentic System · Harness Engineering

Articles

Agentic System 把 AI-Native SDLC 真的跑起來:實戰反饋 AI-Native SDLC Playbook 的六步 loop 真的跑起來是什麼樣?我們用 Claude Code 走完八張 Task Card:/grill-me 拍板 spec、Stop hook 強制 Playwright smoke 才准收工、PR 與 Notion 卡帶同一組截圖證據,一個 milestone 從 3 個月壓到 1 到 2 週。
16 分 2026-09-05
Agentic System 錯誤即體驗:Agent 系統最反直覺的錯誤哲學與三條信任邊界 Tool 執行失敗該回 HTTP 500 嗎?不該,那是回給 LLM 的資料。Agent 系統的錯誤有兩個新讀者:螢幕前的人和 loop 裡的模型,錯誤處理的整套直覺都要重建。這篇拆解錯誤三層設計、LLM 輸出等同不可信輸入的三條信任邊界,以及 timeout 與 retry 在 agent 系統的新形狀。
12 分 2026-07-11
Agentic System 互動模式在 API 設計那天就被鎖死:User-First Agent 的 Run 模型設計 為什麼 Agent API 事後加不上停止按鈕和斷線重連?因為 UI 只能渲染 API 給得出來的東西。這篇拆解 User-First Agent 的 run 模型三支柱:SSE 事件詞彙表決定 UI 能力上限、取消是一級 API 功能、run 是活在 process 之外的公開狀態機,以及第一天就該做對的那一個決策。
12 分 2026-07-11
Agentic System Agent 系統是 I/O bound 特化系統:User-First Agent 為什麼選 TypeScript 要做一個有 Chat 介面、即時串流、隨時可中斷的 User-First Agent,該選 Python 還是 TypeScript?這篇從 workload 形狀切入:Agent 系統 99% 的時間在等 LLM 和 tool 回應,是極端 I/O bound 的特化系統,event loop 正是為這個形狀而生的併發模型。完整記錄選型推理與 trade-off。
13 分 2026-07-11
Source Code 不訓練神經網路也能打出理論最高分:Heuristic Learning 的設計邏輯 Jiayi Weng 用純程式碼打出 Atari Breakout 理論最高分 864,完全沒有神經網路。這篇拆解 Heuristic Learning 的核心機制:程式碼作為 policy、coding agent 持續維護替代梯度下降,以及為什麼 coding agent 讓啟發式系統重新值得長期維護。
16 分 2026-05-29
System Design AgenticSystem 架構全景:四個類別、五個系統的設計選擇與取捨 從 System Design 角度橫向分析五個 Agentic System 的架構類別(Agent Framework / AI Gateway / Agent Service / Hosting Platform)。涵蓋各類別設計決策、Cross-cutting ADR、Scenario 選型矩陣與 Trade-off 總表。
28 分 2026-05-28
Source Code NanoClaw 原始碼:Multi-Tenant Agent Hosting Platform 的設計邏輯 NanoClaw 不是 Agent Framework,是為 Multi-Tenant 設計的 Agent Hosting Platform。從原始碼看 Two-DB IPC 如何讓容器 crash 不影響其他 session、OneCLI 如何讓 API key 永不進容器、Continuation 如何讓 session 跨 crash 持久化,每個選擇都對應一個具體威脅。
26 分 2026-05-28
System Design Agent 要怎麼進化?六個系統的 Self-Improvement 機制比較 六個 agentic system 都說「越用越強」,但進化機制從底層就不同:GenericAgent 結晶跑通的執行路徑,HermesAgent 同時走 prompt 層和模型層,DeerFlow 更新用戶認知,NanoClaw 擴展容器能力,HolmesGPT 和 OpenClaw 刻意不自動進化。這篇把四個設計選擇攤開來比。
20 分 2026-05-22
System Design SOUL 設計決定了 Agent 是什麼:六個 Agentic System 的 system prompt 比較 六個真實 Agentic System 的 SOUL 設計與工具配置全比較:GenericAgent 無邊界全能宣言、HolmesGPT 的行為協議內嵌、HermesAgent 的模型感知 SOUL 補丁、DeerFlow 的架構取代文字。每個設計背後的假設、取捨與適用場景一次看清。
20 分 2026-05-22
LLMOps LoRA 這件事你只需要搞清楚一次 LoRA 不是省記憶體的訓練技巧,背後是一個關於「fine-tuning 的 weight 更新本質上是低維的」的假設。這篇涵蓋 LoRA 核心機制、r 與 alpha 的物理意義、target_modules 的選擇邏輯、QLoRA 的設計,以及何時該用 LoRA、何時該用 RAG,一次建立完整判斷框架。
9 分 2026-05-20
System Design K8s SRE Task Continuity Agent(一):系統架構設計 K8s 故障調查任務可能跨越幾十次 tool call,context compaction 一觸發 agent 就忘記自己在做什麼。如果你想設計一個不會在調查進行到一半就斷掉的 SRE Agent,這篇說明 Session、Memory、Knowledge 三層的邊界設計,以及 Agentic Loop 的兩個 plugin 點怎麼架構。
11 分 2026-05-16
System Design K8s SRE Task Continuity Agent(二):開發 Roadmap 與分工設計 三層架構如果同時開發,每一層都要等另一層穩定才能驗收,等於三個方向同時出問題、無從診斷。如果你拿到了 K8s SRE Task Continuity Agent 的架構設計,不知道該從哪裡動手,這篇拆解三個可獨立驗收的 Phase、兩人垂直分工設計,以及 Interface-First 為什麼是並行開發的前提。
10 分 2026-05-16
System Design K8s SRE Task Continuity Agent(三):Testing 與 Observability 設計 Agentic System 的 testing 無法用 assert output == expected 驗證:同一個 K8s 故障,Agent 可能走三步也可能走七步。如果你想知道怎麼設計 Minikube sandbox 讓每個 failure 場景可重現、怎麼讓 regression test 跨 Phase 累積不退步、以及用三層 monitoring 看系統健康,這篇說明 K8s SRE Agent 的 Testing 與 Observability 設計。
10 分 2026-05-16
Source Code Task Continuity,不是 Personal Memory:Claude Code 的 Session 設計 Claude Code 沒有跨 session 的個人記憶,tool output 在 compaction 後消失,每次都像重新開始。如果你想讓 Claude Code 跨 session 保住調查進度,而不是每次都重頭解釋,這篇從原始碼分析三個 lifecycle hook 的設計邏輯與 .tmp 工作交接單機制。
14 分 2026-05-15
Source Code Memory 01:誰決定什麼值得記——Agent 記憶的四種寫入模式 想讓 Agent 記住重要資訊,卻不知道「誰來決定值得記」這個問題應該怎麼設計?八個開源記憶系統給出了四種截然不同的答案,從 LLM pipeline 自動判斷到 agent 自己決定。這篇拆解四種寫入模式的工程邏輯,以及 context compaction 發生時為什麼第三層強制補救是所有系統都繞不開的問題。
11 分 2026-05-14
Source Code Memory 02:記憶怎麼被找到——四種搜尋模式與 Write-Search 耦合 Agent 記憶系統要選 BM25、vector search 還是 hybrid,這個決定不是獨立的,而是由你寫進去的內容決定的。這篇說明寫入模式如何鎖定搜尋策略、paraphrase 問題在 write time 還是 search time 解決各自的代價,以及為什麼 retrieval granularity 的選擇本質上是一個賭注。
13 分 2026-05-14
Source Code Memory 03:Agent 記憶住在哪裡——Storage 選擇是部署假設 為 Agent 記憶系統選 SQLite 還是 PostgreSQL,這不只是技術偏好,而是在宣告這個 Agent 為誰服務、部署在哪裡。這篇說明 8 個系統的 5 種儲存格式如何各自鎖定搜尋能力與部署假設,以及 storage、search、deployment 為什麼是三個綁在一起無法獨立選的決策。
7 分 2026-05-14
Source Code Memory 04:怎麼判斷哪個記憶系統強——Benchmark 數字的陷阱 看到 mempalace 96.6%、mem0 93.4%,直接下結論哪個記憶系統更強?這兩個數字測的根本不是同一件事。這篇說明 R@K、MRR、NDCG 三個 retrieval 指標各自問什麼、LoCoMo 和 Needle in a Haystack 哪個 benchmark 對哪種系統有利,以及怎麼根據你的設計決策判斷哪個數字才對你有意義。
6 分 2026-05-14
Source Code Memory 05:記憶活多久——8 個系統的生命週期設計 Agent 記憶系統不只要設計「存什麼」和「怎麼找」,還要決定「活多久」。如果你不確定記憶應該偏向新鮮還是重要、衰減應該在寫入時還是搜尋時發生,這篇拆解 8 個系統的 lifecycle 設計,從 Hotness 公式到 Ebbinghaus 衰減到 frozen snapshot,幫你看清各種選擇的代價。
11 分 2026-05-14
Source Code Memory 06:K8s SRE Agent 的記憶設計——真實場景的技術選型 K8s 環境的資訊時效性差距極大:pod status 幾分鐘就過期,error pattern 卻永遠有效。如果你在設計 SRE Agent 的記憶系統,不知道哪些資訊該存、哪些存了反而有害,這篇把 write、search、storage、lifecycle 四個決策串進一個具體的 K8s 場景,給出可落地的選型答案。
9 分 2026-05-14
Source Code DeerFlow:從原始碼看 LangGraph 為 Agent 系統帶來了什麼,又留下了什麼 選 LangGraph 當 Agent 執行引擎,它替你決定了哪些事?剩下的工程問題還是要自己解。如果你想知道框架邊界在哪裡,以及 12 層 Middleware 排序、虛擬路徑沙箱、LLM 驅動記憶各自在解什麼問題,這篇從 DeerFlow 原始碼給你一個具體的比較答案。
20 分 2026-05-12
Source Code 你去睡覺,它在做研究:讀 Karpathy 的 AutoResearch 想讓 AI Agent 在你睡覺時自主跑 ML 實驗,但不知道怎麼設計才能讓不同實驗結果直接可比、不被 Agent 作弊?這篇拆解 Karpathy autoresearch 的三個核心決策:固定時間預算如何讓實驗可比、Git 如何被當成實驗狀態機、以及 program.md 如何把研究判斷提前編碼成 Agent 工作協議。
11 分 2026-05-12
Source Code 資料也可以 Autoresearch:Meta AutoData 的三層 Agent 迴圈 合成訓練資料的根本問題是沒有品質回饋:生出一百道題不知道哪道有用,只能事後 filtering,但 filtering 無法告訴你怎麼生出更好的題。如果你想知道 Meta AutoData 如何把資料品質轉化為可優化的 evaluation function,以及三層 Agent 迴圈如何把 weak/strong solver 差距從 1.9pp 擴大到 34pp,這篇拆解它的架構設計。
10 分 2026-05-12
Source Code 你在用它,它也在學你:HuggingFace ml-intern 的 SFT Flywheel HuggingFace ml-intern 有一行預設開啟的設定 save_sessions: true,不是用來 crash recovery,而是把你每次 session 的完整 trajectory 上傳成公開 SFT 訓練資料。如果你想理解「使用行為即訓練資料」這個飛輪怎麼運作、trajectory 需要什麼結構才有訓練信號,以及它和 AutoResearch 的根本差異,這篇拆解 ml-intern 的設計機制。
13 分 2026-05-12
Source Code 1,039 個策略,一個晚上:當計算量打敗 Domain Knowledge 一個人幾乎沒讀題,用 1,039 個 AI 生成策略在 Hackathon 拿了第一。如果你想知道為什麼平行跑 20 個 Agent 和一個 Agent 跑 20 次根本上不同、from-scratch reset 怎麼打破增量改進的天花板、以及計算量打敗 domain knowledge 的前提條件是什麼,這篇拆解這個系統的設計哲學。
10 分 2026-05-12
Agentic System 用 n8n 把 AI 嵌進工作流程:兩種節點,一個關鍵判斷 想把 AI 嵌進自動化工作流程,但不確定哪些步驟真的需要 LLM、哪些用確定性邏輯更好?這篇說明 n8n 裡兩種節點的判斷原則:只在需要語意理解時才呼叫 Agent,其他步驟用 native 節點保持低成本、穩定可 debug,並以 SRE 監控為案例示範 Cheap Agent triage 的完整組合方式。
7 分 2026-05-04
Source Code Claude Code:從 claw-code 的分析看一個 Coding Agent 的設計關心 想知道 Claude Code 怎麼讓一個能執行任意 shell command 的 Agent 在你機器上安全工作?這篇透過 claw-code 的 29 個子系統分析,拆解 Hook 系統的三種 exit code 設計、PermissionMode 有序 enum、System Prompt Dynamic Boundary,以及 Hooks / Skills / MCP 三個擴展層的職責分工。
17 分 2026-04-29
Source Code CrewAI:從原始碼看「角色扮演」怎麼成為架構決策 想讓多個 AI Agent 像一個組織一樣分工協作,但不清楚角色設定究竟只是 prompt 技巧還是架構決策?CrewAI 把 role/goal/backstory 貫穿整個執行邏輯,這篇從原始碼拆解 Crew/Agent/Task 三元組、Task Guardrail、記憶 EncodingFlow,以及 Flow 事件驅動 DAG 各自解了什麼問題。
23 分 2026-04-28
Source Code hermes-agent vs OpenClaw:兩個 Agent 框架,同一批問題,不同的答案 想選一個適合自己場景的 Agent 框架,卻發現兩個都標榜 production-grade、卻給出截然不同的設計?hermes-agent 和 OpenClaw 在記憶架構、子 Agent 管理、執行安全、演化機制上幾乎處處相反,這篇把同一組問題下的兩套答案並排說清楚,幫你看懂取捨背後的出發點。
22 分 2026-04-27
Source Code Hermes-agent:從原始碼看一個為 Production 設計的 Agent 系統 Agent 跑起來不難,真正麻煩的問題後來才浮現:token 費用怎麼控制、context 滿了怎麼辦、記憶怎麼跨 session 保留。如果你想知道一個為 Production 設計的 Agent 系統怎麼從架構層面解這些問題,這篇拆解 hermes-agent 的 Memory Fencing、Context 壓縮、System Prompt 穩定性與 Skill RL 訓練迴路。
13 分 2026-04-25
Source Code OpenClaw:從原始碼看一個 Agent 平台的工程選擇 讓 Agent 同時接收 Telegram、WhatsApp、Slack 訊息、API Key 被 rate-limit 時自動換一個、重啟後把未完成任務撿回來繼續跑——這些加在一起需要的是平台,不是單一 Agent。如果你想理解 OpenClaw 怎麼透過 Gateway 分層、SessionKey 設計與 Auth Rotation 讓系統在沒人看的時候自己活下去,這篇從原始碼逐一說明。
21 分 2026-04-25
Source Code 打開原始碼才發現:三個 Agent 框架,三種截然不同的設計哲學 同樣叫 Agent 框架,deepagents、openclaw、hermes-agent 解的問題幾乎完全不重疊。如果你選框架時只看「LLM + tools + loop」、不知道從設計哲學角度該問什麼問題,這篇從三個框架的原始碼比較出發,拆出六個 Agent 系統設計的核心決策點。
21 分 2026-04-23