LLM 工程 · Agentic System · Harness Engineering

Articles

Source Code 你的 Agent 為什麼越跑越貴:Headroom 的 Context Compression 設計 Agent 每呼叫一次 tool,輸出就永久累積在 context 裡。Headroom 是插在 Agent 與 LLM provider 之間的本機壓縮層,透過 Live-Zone Only、CCR 可逆壓縮、Fail-Open 三個設計原則,讓 JSON array tool output 壓縮率達到 70–95%,同時保持可逆。
12 分 2026-06-28
Source Code AI 為什麼總是寫太多?Ponytail 用 YAGNI 七層梯強制過濾 AI 寫出過度設計的 code,不是因為它不聰明,而是因為沒人告訴它這個 use case 不需要那麼複雜。Ponytail 透過 SessionStart hook 把 YAGNI 七層決策梯注進每個 Claude session,讓 AI 動手前先爬一遍梯子再說。這篇說清楚七層梯機制、三個 mode 的切換時機,以及真實使用會踩的坑。
9 分 2026-06-27
Source Code 不訓練神經網路也能打出理論最高分:Heuristic Learning 的設計邏輯 Jiayi Weng 用純程式碼打出 Atari Breakout 理論最高分 864,完全沒有神經網路。這篇拆解 Heuristic Learning 的核心機制:程式碼作為 policy、coding agent 持續維護替代梯度下降,以及為什麼 coding agent 讓啟發式系統重新值得長期維護。
16 分 2026-05-29
Source Code Skill Library 的技術債:SkillOps 原始碼解析 Skill Library 會累積技術債:重複 skill 污染搜尋、缺少驗證器讓錯誤靜默傳播、型別 drift 讓計畫在 runtime 才爆。SkillOps 用 Typed Contract + HSEG 四種邊 + 雙迴圈維護,maintenance pass <1 秒 CPU。
30 分 2026-05-29
Source Code 把 Skill 文件當成可訓練參數:SkillOpt 的文字空間優化 SkillOpt 把 skill 文件當成可訓練參數,用類深度學習的優化循環自動改善 Agent 任務表現。本文解析五個核心組件如何對應 forward pass、gradient、learning rate、validation 與 momentum,以及 52/52 benchmark 組合下,validation gate 為何只接受少數 edit 反而讓增益更可靠。
16 分 2026-05-29
Source Code NanoClaw 原始碼:Multi-Tenant Agent Hosting Platform 的設計邏輯 NanoClaw 不是 Agent Framework,是為 Multi-Tenant 設計的 Agent Hosting Platform。從原始碼看 Two-DB IPC 如何讓容器 crash 不影響其他 session、OneCLI 如何讓 API key 永不進容器、Continuation 如何讓 session 跨 crash 持久化,每個選擇都對應一個具體威脅。
26 分 2026-05-28
Source Code 不預裝能力,只定義生長方式:GenericAgent 原始碼解析 GenericAgent 把上下文信息密度最大化(CIDM)當作第一原理:~3K 行、9 個工具、五層記憶,每個設計選擇都指向同一個問題——如何讓 context 裡的每個 token 都值得。解析統一 Agent Loop、No Execution No Memory 結晶機制、Reflect 自主運行的底層邏輯。
21 分 2026-05-22
Source Code 你在省 Token,還是在省思考?四種廢話假設比較 四個 token 節省工具都在解決 context window 不夠的問題,但對「廢話」的定義截然不同。了解 RTK、context-mode、caveman、code-review-graph 各自的設計假設、成立條件與失效邊界,幫助你在 agentic system 設計中做更準確的 context 管理。
14 分 2026-05-19
Source Code Task Continuity,不是 Personal Memory:Claude Code 的 Session 設計 Claude Code 沒有跨 session 的個人記憶,tool output 在 compaction 後消失,每次都像重新開始。如果你想讓 Claude Code 跨 session 保住調查進度,而不是每次都重頭解釋,這篇從原始碼分析三個 lifecycle hook 的設計邏輯與 .tmp 工作交接單機制。
14 分 2026-05-15
Source Code Memory 01:誰決定什麼值得記——Agent 記憶的四種寫入模式 想讓 Agent 記住重要資訊,卻不知道「誰來決定值得記」這個問題應該怎麼設計?八個開源記憶系統給出了四種截然不同的答案,從 LLM pipeline 自動判斷到 agent 自己決定。這篇拆解四種寫入模式的工程邏輯,以及 context compaction 發生時為什麼第三層強制補救是所有系統都繞不開的問題。
11 分 2026-05-14
Source Code Memory 02:記憶怎麼被找到——四種搜尋模式與 Write-Search 耦合 Agent 記憶系統要選 BM25、vector search 還是 hybrid,這個決定不是獨立的,而是由你寫進去的內容決定的。這篇說明寫入模式如何鎖定搜尋策略、paraphrase 問題在 write time 還是 search time 解決各自的代價,以及為什麼 retrieval granularity 的選擇本質上是一個賭注。
13 分 2026-05-14
Source Code Memory 03:Agent 記憶住在哪裡——Storage 選擇是部署假設 為 Agent 記憶系統選 SQLite 還是 PostgreSQL,這不只是技術偏好,而是在宣告這個 Agent 為誰服務、部署在哪裡。這篇說明 8 個系統的 5 種儲存格式如何各自鎖定搜尋能力與部署假設,以及 storage、search、deployment 為什麼是三個綁在一起無法獨立選的決策。
7 分 2026-05-14
Source Code Memory 04:怎麼判斷哪個記憶系統強——Benchmark 數字的陷阱 看到 mempalace 96.6%、mem0 93.4%,直接下結論哪個記憶系統更強?這兩個數字測的根本不是同一件事。這篇說明 R@K、MRR、NDCG 三個 retrieval 指標各自問什麼、LoCoMo 和 Needle in a Haystack 哪個 benchmark 對哪種系統有利,以及怎麼根據你的設計決策判斷哪個數字才對你有意義。
6 分 2026-05-14
Source Code Memory 05:記憶活多久——8 個系統的生命週期設計 Agent 記憶系統不只要設計「存什麼」和「怎麼找」,還要決定「活多久」。如果你不確定記憶應該偏向新鮮還是重要、衰減應該在寫入時還是搜尋時發生,這篇拆解 8 個系統的 lifecycle 設計,從 Hotness 公式到 Ebbinghaus 衰減到 frozen snapshot,幫你看清各種選擇的代價。
11 分 2026-05-14
Source Code Memory 06:K8s SRE Agent 的記憶設計——真實場景的技術選型 K8s 環境的資訊時效性差距極大:pod status 幾分鐘就過期,error pattern 卻永遠有效。如果你在設計 SRE Agent 的記憶系統,不知道哪些資訊該存、哪些存了反而有害,這篇把 write、search、storage、lifecycle 四個決策串進一個具體的 K8s 場景,給出可落地的選型答案。
9 分 2026-05-14
Source Code DeerFlow:從原始碼看 LangGraph 為 Agent 系統帶來了什麼,又留下了什麼 選 LangGraph 當 Agent 執行引擎,它替你決定了哪些事?剩下的工程問題還是要自己解。如果你想知道框架邊界在哪裡,以及 12 層 Middleware 排序、虛擬路徑沙箱、LLM 驅動記憶各自在解什麼問題,這篇從 DeerFlow 原始碼給你一個具體的比較答案。
20 分 2026-05-12
Source Code 你去睡覺,它在做研究:讀 Karpathy 的 AutoResearch 想讓 AI Agent 在你睡覺時自主跑 ML 實驗,但不知道怎麼設計才能讓不同實驗結果直接可比、不被 Agent 作弊?這篇拆解 Karpathy autoresearch 的三個核心決策:固定時間預算如何讓實驗可比、Git 如何被當成實驗狀態機、以及 program.md 如何把研究判斷提前編碼成 Agent 工作協議。
11 分 2026-05-12
Source Code 資料也可以 Autoresearch:Meta AutoData 的三層 Agent 迴圈 合成訓練資料的根本問題是沒有品質回饋:生出一百道題不知道哪道有用,只能事後 filtering,但 filtering 無法告訴你怎麼生出更好的題。如果你想知道 Meta AutoData 如何把資料品質轉化為可優化的 evaluation function,以及三層 Agent 迴圈如何把 weak/strong solver 差距從 1.9pp 擴大到 34pp,這篇拆解它的架構設計。
10 分 2026-05-12
Source Code 你在用它,它也在學你:HuggingFace ml-intern 的 SFT Flywheel HuggingFace ml-intern 有一行預設開啟的設定 save_sessions: true,不是用來 crash recovery,而是把你每次 session 的完整 trajectory 上傳成公開 SFT 訓練資料。如果你想理解「使用行為即訓練資料」這個飛輪怎麼運作、trajectory 需要什麼結構才有訓練信號,以及它和 AutoResearch 的根本差異,這篇拆解 ml-intern 的設計機制。
13 分 2026-05-12
Source Code 1,039 個策略,一個晚上:當計算量打敗 Domain Knowledge 一個人幾乎沒讀題,用 1,039 個 AI 生成策略在 Hackathon 拿了第一。如果你想知道為什麼平行跑 20 個 Agent 和一個 Agent 跑 20 次根本上不同、from-scratch reset 怎麼打破增量改進的天花板、以及計算量打敗 domain knowledge 的前提條件是什麼,這篇拆解這個系統的設計哲學。
10 分 2026-05-12
Source Code Claude Code:從 claw-code 的分析看一個 Coding Agent 的設計關心 想知道 Claude Code 怎麼讓一個能執行任意 shell command 的 Agent 在你機器上安全工作?這篇透過 claw-code 的 29 個子系統分析,拆解 Hook 系統的三種 exit code 設計、PermissionMode 有序 enum、System Prompt Dynamic Boundary,以及 Hooks / Skills / MCP 三個擴展層的職責分工。
17 分 2026-04-29
Source Code CrewAI:從原始碼看「角色扮演」怎麼成為架構決策 想讓多個 AI Agent 像一個組織一樣分工協作,但不清楚角色設定究竟只是 prompt 技巧還是架構決策?CrewAI 把 role/goal/backstory 貫穿整個執行邏輯,這篇從原始碼拆解 Crew/Agent/Task 三元組、Task Guardrail、記憶 EncodingFlow,以及 Flow 事件驅動 DAG 各自解了什麼問題。
23 分 2026-04-28
Source Code hermes-agent vs OpenClaw:兩個 Agent 框架,同一批問題,不同的答案 想選一個適合自己場景的 Agent 框架,卻發現兩個都標榜 production-grade、卻給出截然不同的設計?hermes-agent 和 OpenClaw 在記憶架構、子 Agent 管理、執行安全、演化機制上幾乎處處相反,這篇把同一組問題下的兩套答案並排說清楚,幫你看懂取捨背後的出發點。
22 分 2026-04-27
Source Code Hermes-agent:從原始碼看一個為 Production 設計的 Agent 系統 Agent 跑起來不難,真正麻煩的問題後來才浮現:token 費用怎麼控制、context 滿了怎麼辦、記憶怎麼跨 session 保留。如果你想知道一個為 Production 設計的 Agent 系統怎麼從架構層面解這些問題,這篇拆解 hermes-agent 的 Memory Fencing、Context 壓縮、System Prompt 穩定性與 Skill RL 訓練迴路。
13 分 2026-04-25
Source Code OpenClaw:從原始碼看一個 Agent 平台的工程選擇 讓 Agent 同時接收 Telegram、WhatsApp、Slack 訊息、API Key 被 rate-limit 時自動換一個、重啟後把未完成任務撿回來繼續跑——這些加在一起需要的是平台,不是單一 Agent。如果你想理解 OpenClaw 怎麼透過 Gateway 分層、SessionKey 設計與 Auth Rotation 讓系統在沒人看的時候自己活下去,這篇從原始碼逐一說明。
21 分 2026-04-25
Source Code 打開原始碼才發現:三個 Agent 框架,三種截然不同的設計哲學 同樣叫 Agent 框架,deepagents、openclaw、hermes-agent 解的問題幾乎完全不重疊。如果你選框架時只看「LLM + tools + loop」、不知道從設計哲學角度該問什麼問題,這篇從三個框架的原始碼比較出發,拆出六個 Agent 系統設計的核心決策點。
21 分 2026-04-23