# 一定要配温開水 > 溫煜鈞(Yujun Wen)的繁體中文技術部落格。作者是 AI Engineer,擅長從 0 到 1 build system,目前專注 Harness Engineering 與 Agentic System 架構研究。學習方式是打開做得好的開源專案(DeepSeek Harness、Pi、Hermes Agent 等)的原始碼,拆出設計概念,吸收進自己的系統。 每篇文章都提供原始 Markdown:`https://warmwater.dev/blog/.md`。全文合集:https://warmwater.dev/llms-full.txt ## 從哪裡開始(依讀者處境) - 第一次接觸 LLM Agent → [LLM Agent 四大架構模式:選型指南](https://warmwater.dev/blog/llm-agent) - 要把 Agent 上生產環境 → [把領域判斷打包進 Agent:Production Agentic System 地圖](https://warmwater.dev/blog/domain-specialized-agentic-system) - 在評估 Agent 框架選型 → [打開原始碼才發現:三個 Agent 框架,三種截然不同的設計哲學](https://warmwater.dev/blog/agent-20260423) - 在用 Claude Code 想更可控 → [你在比的是模型,但決定 Claude Code 效果的是 Harness](https://warmwater.dev/blog/claude-code-harness-over-model) ## 拆過的開源專案(原始碼解讀) - Claude Code(4 篇): https://warmwater.dev/blog?project=Claude%20Code - LangChain Middleware(4 篇): https://warmwater.dev/blog?project=LangChain%20Middleware - DeepSeek Harness(3 篇): https://warmwater.dev/blog?project=DeepSeek%20Harness - Hermes Agent(2 篇): https://warmwater.dev/blog?project=Hermes%20Agent - OpenClaw(2 篇): https://warmwater.dev/blog?project=OpenClaw - AutoResearch(1 篇): https://warmwater.dev/blog?project=AutoResearch - CrewAI(1 篇): https://warmwater.dev/blog?project=CrewAI - deepagents(1 篇): https://warmwater.dev/blog?project=deepagents - DeerFlow(1 篇): https://warmwater.dev/blog?project=DeerFlow - GenericAgent(1 篇): https://warmwater.dev/blog?project=GenericAgent - Headroom(1 篇): https://warmwater.dev/blog?project=Headroom - Heuristic Learning(1 篇): https://warmwater.dev/blog?project=Heuristic%20Learning - Meta AutoData(1 篇): https://warmwater.dev/blog?project=Meta%20AutoData - ml-intern(1 篇): https://warmwater.dev/blog?project=ml-intern - NanoClaw(1 篇): https://warmwater.dev/blog?project=NanoClaw - Paradigm AutoResearch(1 篇): https://warmwater.dev/blog?project=Paradigm%20AutoResearch - Ponytail(1 篇): https://warmwater.dev/blog?project=Ponytail - SkillOps(1 篇): https://warmwater.dev/blog?project=SkillOps - SkillOpt(1 篇): https://warmwater.dev/blog?project=SkillOpt - Superpowers(1 篇): https://warmwater.dev/blog?project=Superpowers - TradingAgents(1 篇): https://warmwater.dev/blog?project=TradingAgents ## Agentic System - [把 AI-Native SDLC 真的跑起來:實戰反饋](https://warmwater.dev/blog/ai-native-sdlc-loop-in-practice): AI-Native SDLC Playbook 的六步 loop 真的跑起來是什麼樣?我們用 Claude Code 走完八張 Task Card:/grill-me 拍板 spec、Stop hook 強制 Playwright smoke 才准收工、PR 與 Notion 卡帶同一組截圖證據,一個 milestone 從 3 個月壓到 1 到 2 週。 - [錯誤即體驗:Agent 系統最反直覺的錯誤哲學與三條信任邊界](https://warmwater.dev/blog/user-first-agent-error-trust-boundaries): Tool 執行失敗該回 HTTP 500 嗎?不該,那是回給 LLM 的資料。Agent 系統的錯誤有兩個新讀者:螢幕前的人和 loop 裡的模型,錯誤處理的整套直覺都要重建。這篇拆解錯誤三層設計、LLM 輸出等同不可信輸入的三條信任邊界,以及 timeout 與 retry 在 agent 系統的新形狀。 - [互動模式在 API 設計那天就被鎖死:User-First Agent 的 Run 模型設計](https://warmwater.dev/blog/user-first-agent-run-model): 為什麼 Agent API 事後加不上停止按鈕和斷線重連?因為 UI 只能渲染 API 給得出來的東西。這篇拆解 User-First Agent 的 run 模型三支柱:SSE 事件詞彙表決定 UI 能力上限、取消是一級 API 功能、run 是活在 process 之外的公開狀態機,以及第一天就該做對的那一個決策。 - [Agent 系統是 I/O bound 特化系統:User-First Agent 為什麼選 TypeScript](https://warmwater.dev/blog/user-first-agent-typescript-decision): 要做一個有 Chat 介面、即時串流、隨時可中斷的 User-First Agent,該選 Python 還是 TypeScript?這篇從 workload 形狀切入:Agent 系統 99% 的時間在等 LLM 和 tool 回應,是極端 I/O bound 的特化系統,event loop 正是為這個形狀而生的併發模型。完整記錄選型推理與 trade-off。 - [用 n8n 把 AI 嵌進工作流程:兩種節點,一個關鍵判斷](https://warmwater.dev/blog/n8n-agentic-workflow): 想把 AI 嵌進自動化工作流程,但不確定哪些步驟真的需要 LLM、哪些用確定性邏輯更好?這篇說明 n8n 裡兩種節點的判斷原則:只在需要語意理解時才呼叫 Agent,其他步驟用 native 節點保持低成本、穩定可 debug,並以 SRE 監控為案例示範 Cheap Agent triage 的完整組合方式。 ## Tutorial - [讓 Agent 把 Codebase 畫成圖:用 archify 畫出 DeepSeek Harness 的三張系統圖](https://warmwater.dev/blog/archify-agent-draws-codebase): code 交給 agent 寫之後,審設計最快的介面是圖。這篇實測 archify:讓 agent 直接讀 DeepSeek Harness 的 codebase,畫出 Architecture、Sequence、Lifecycle 三張可互動的系統圖,並整理五種圖型的選型心法。 - [第一個 Claude Skill:用 skill-creator 打包可重用工作流程](https://warmwater.dev/blog/create-your-own-claude-skill): Claude Skill 讓工作流程指令從每次都在 context 裡,變成只在需要時才載入。這篇用 blog-publish 示範,如何用 skill-creator 建立第一個 Skill:三層載入機制、token 前後比較,以及怎麼寫好 description 讓 Skill 在對的時機被觸發。 - [Claude Code 五個組件的觸發邏輯,以及為什麼 Hooks 是最被低估的那一個](https://warmwater.dev/blog/claude-code-hooks-guide): 把 Claude Code 的五個組件都理解成設定選項是很常見的誤解——只有 Hooks 是事件驅動、條件符合就自動執行、不需要人介入的那一層。這篇從組件關係圖切入,說清楚各組件觸發方式的根本差異、Hooks 的 exit code 機制與四種 handler type,以及七個功能類別各自在解決什麼工程問題。 - [為什麼你的 Claude Code 用起來跟別人不一樣?](https://warmwater.dev/blog/claude-code-commands-beginner): 覺得 Claude Code 跟別人用起來差很多,但不確定差在哪裡?這篇整理 13 個最實用的操作語法,分三層說明:用 @file、# 和 ! 精準控制 context 輸入,用 /clear、/rewind、/resume 管理對話節奏,再用 Plan Mode 與 Subagent 模式解鎖更複雜的工作方式。 - [給 Python/Go 工程師的 C++ 語法地圖:推論篇](https://warmwater.dev/blog/python-go-c): C++ 有太多東西可以學,但要能讀懂 ONNX Runtime 的 API 並寫出第一個推論程式,只需要 7 個概念。如果你是 Python 或 Go 工程師、想進入 C++ AI 推論領域但不知道從哪開始,這篇給你一張最小必要的語法地圖,其他先跳過。 - [Design Pattern 深度解析:不只是套模板,而是知道什麼時候不該用](https://warmwater.dev/blog/design-pattern): AI 很擅長寫出「看起來很專業」的程式碼,但它分不清楚需要彈性還是過度設計。這篇挑出實務中最常遇到的 Design Pattern,講清楚每個 pattern 解決什麼問題、什麼情況下不該用,以及用了之後要付出的代價。 - [Python 資料結構深度解析:不只是背複雜度,而是知道什麼時候該用哪一個](https://warmwater.dev/blog/python): AI 幫你寫出能跑的程式碼,但它選的資料結構不一定適合你的場景。這篇從底層實作原理剖析 Python 常用資料結構的複雜度陷阱,讓你有能力判斷 list 當 queue、lru_cache 在有時效性場景等選擇是否合理。 - [💰 LangChain Middleware 實戰(二):Summarization 讓 AI 自動壓縮對話,省錢又高效](https://warmwater.dev/blog/langchain-middleware-summarization-ai): 對話輪數一多,LLM 的 token 成本就會失控,但直接截斷歷史又會讓 Agent 失去記憶。這篇說明如何用 LangChain 1.0 的 SummarizationMiddleware 自動壓縮舊訊息,在控制成本的同時保留對話脈絡。 - [📋 LangChain Middleware 實戰(三):TodoList 讓 AI 自動管理任務清單,複雜流程零遺漏](https://warmwater.dev/blog/langchain-middleware-todolist-ai): AI Agent 處理多步驟任務時容易漏掉中間環節,又很難從外部追蹤進度。這篇說明如何用 LangChain 1.0 的 TodoListMiddleware 讓 Agent 自動拆解任務、維護狀態,確保複雜流程不遺漏任何步驟。 - [🔧 LangChain 1.0 Tool Calling 實戰:讓 AI Agent 學會使用工具](https://warmwater.dev/blog/langchain-1-0-tool-calling-ai-agent): 想讓 AI 不只是聊天,而是能自動呼叫外部工具完成任務,但不確定 LangChain 1.0 的 Tool Calling 怎麼設計?這篇從 @tool 裝飾器到 create_agent 完整示範,說明為什麼 docstring 品質直接決定 Agent 的工具選擇準確度。 - [# 🛡️ LangChain Middleware 實戰(一):Human-in-the-Loop 讓 AI 學會等待人類審核](https://warmwater.dev/blog/langchain-middleware-human-in-the-loop-ai): 如果你想讓 AI Agent 在執行刪除資料、發送郵件等敏感操作前暫停等待人工審核,而不是直接執行,這篇說明如何用 LangChain 1.0 的 HumanInTheLoopMiddleware 實作中斷、審核、恢復的完整流程。 ## Harness Engineering - [當 Agent Harness 沒有核心:DeepSeek 的 Everything is a Plugin](https://warmwater.dev/blog/deepseek-harness-everything-is-a-plugin): DeepSeek Harness 把 agent loop、tool registry 全做成可替換的 plugin,35 行設定檔就組出 headless 版。拆解 patch 層疊加與 Capability Seam,對比 Claude Code 固定核心路線,回答一人團隊自建 agent 該借鑒哪邊。 - [模型可見 ⟺ 已記錄:DeepSeek Harness 的 Runtime Invariant](https://warmwater.dev/blog/deepseek-harness-model-visible-logged): Debug agent 時答不出「模型當時看到什麼」?DeepSeek Harness 用一條 runtime 斷言強制 context 可從 session log 重建,壓縮、外溢、fork 共用同一套事件機制。企業 domain agent 要的可回溯、可控、穩定,這個設計各換到什麼。 - [一半的 code 是 AI 寫的之後,品質靠什麼守:DeepSeek Harness 的工程門檻](https://warmwater.dev/blog/deepseek-harness-quality-gates): AI 寫的 code 過半之後,重複決策、假綠燈測試、死碼堆積、文件腐爛會接踵而來。這篇從 DeepSeek Harness 的機器可驗證門檻整理三個視角:Agent Notes 決策記錄、驗證世界而非自我報告、coverage 當刪碼信號,並附上一人團隊成本最低的三個起步版本。 - [AI Agent 工具越多越選錯?從 N-class 分類看 Tool System 設計](https://warmwater.dev/blog/agent-tool-selection-design): 工具數量是 AI agent 系統最容易被忽略的設計變數。研究顯示工具從 10 個增加到 100 個,top-1 準確率明顯下降。本文解析三個獨立崩潰機制,對照 DeerFlow、HermesAgent、OpenClaw 如何在架構層控制工具可見範圍,以及語意邊界設計與 tool selection eval 的延伸思考。 - [Self Escalate Agent:刻意設計成不完整的 AI](https://warmwater.dev/blog/self-escalate-agent): Agent 遇到能力缺口時有兩個壞選擇:靜默失敗或亂猜答案。如果你在設計 Agent 系統時想知道怎麼讓 Agent 誠實說出「這件事我現在做不到」、用 GitHub Issue 把能力缺口轉成精確改進訊號、以及 SOUL.md 怎麼把行為準則從程式碼裡分離,這篇說明一個刻意設計成不完整的 Agent 原型。 - [Agent 怎麼學會新技能:Skill 系統設計與自我強化迴路](https://warmwater.dev/blog/agent-skill-self-reinforcement): Fine-tuning 讓 agent 學習要等幾天才能生效,但有另一條路:在執行框架本身設計學習迴路,任務結束幾秒後 skill 就寫入。如果你想讓 agent 把每次試錯自動轉化成可複用的 playbook,而不靠人工整理,這篇拆解 hermes-agent 的雙模式 self-improve 機制與 filter 邏輯。 - [Harness Engineering 系列收尾:AI 焦慮之後,你決定怎麼走?](https://warmwater.dev/blog/ai-anxiety-to-positioning): Prompt Engineering、Context Engineering、Harness Engineering,名詞幾個月換一輪,感覺剛學完一個又要追下一個。如果你對這個節奏感到焦慮、不確定自己該往哪個方向深入,這篇整理 Harness Engineering 系列的完整地圖,以及 Top-Down 學習法如何幫你建立自己的技術定位。 - [用 SLM 打造垂直 Domain 模型:Fine-tuning、HuggingFace 與 vLLM](https://warmwater.dev/blog/when-to-fine-tune-rl-for-domain): 通用 LLM 對企業內部 error、私有 stack、自訂 fork 的工具給出看起來合理但方向完全錯誤的答案——因為那塊知識根本不在訓練集裡,靠更大的模型或更多 prompt 補不了。如果你想知道什麼時候該做 Fine-tuning、HuggingFace + vLLM 的工具鏈怎麼選,以及什麼時候不該動模型,這篇解析 SLM 的定位與決策框架。 - [你的 Agent 為什麼漸漸不像自己了:固定知識與流動知識的設計邊界](https://warmwater.dev/blog/agent-memory-identity-design): Agent 回答技術上沒錯,但讀起來越來越不對勁——風格變了、立場也變了,你沒改過 prompt,模型版本也沒換。如果你的 agent 有個性漂移問題,這篇說明根源在於固定知識與流動知識的設計邊界,以及 SOUL.md 結構、記憶 Hygiene 機制怎麼防止這件事發生。 - [把領域判斷打包進 Agent:Production Agentic System 地圖](https://warmwater.dev/blog/domain-specialized-agentic-system): 換了更強的模型,agent 還是在同樣的地方卡住——問題不是模型能力,是 domain understanding 根本沒進入系統。如果你不知道從哪一層開始改善 agent 在特定 domain 的表現,這篇提供 Model、Knowledge、Harness、Tool 四層地圖,幫你診斷問題出在哪裡。 - [你的 Agent 跑歪了你知道嗎?LLM Agentic System 可觀測性設計](https://warmwater.dev/blog/llm-observability-design): LLM 系統不會拋 exception,它只會靜靜地漂移——prompt 一個字的修改、provider 靜默升版、tool API schema 改動,任何一個都不觸發 alert。如果你不知道 Agent 在哪一層失敗、怎麼在 Cost 飆升之前偵測異常,這篇說明 Tracing、三層 Evaluation 與行為異常偵測的設計原則。 - [Agentic Loop 的設計關卡:工具執行、錯誤分類與中斷機制](https://warmwater.dev/blog/agentic-loop-design): 讓 agent 跑幾十輪工具呼叫的迴圈,Demo 可以跑,但真實任務常在第三十幾輪靜默掛掉。如果你的 Agentic Loop 沒有設計工具並行邊界、錯誤分類、停止條件和外部中斷機制,這篇以 hermes-agent 為例,拆解五個生產環境必須解決的工程問題。 - [Harness Engineering 的地基:LLM Session 設計框架](https://warmwater.dev/blog/llm-session-harness): Agent 跑到一半 process 重啟了,它從哪裡繼續?LLM API 本質上是 stateless 的,任何「連續性」都靠呼叫方維持。這篇說明四種 Durable Session 實作策略的選擇邏輯,以及任務中斷後的三種狀態設計,幫你在任務生命週期從秒級變成小時級時做出正確的基礎設施決策。 - [從一個任務出發:怎麼疊加一個夠用的 Agent 系統](https://warmwater.dev/blog/agent-20260501): 看完四個完整的 Agent 框架之後,真正要自己做一個系統,從哪裡開始?不是每個功能都需要,也不是什麼都能省。這篇從核心迴圈出發,說明 Plugin 設計為什麼要第一天就做對、Fail Recovery 的三個子層各解什麼問題,以及 Harness 層在哪個時間點才值得加進來。 - [四個 Agent 框架,四種對「穩定性」的理解](https://warmwater.dev/blog/agent-20260430): 讀完四個 Agent 框架的原始碼,卻不知道這些設計差異代表什麼?hermes-agent、OpenClaw、CrewAI、Claude Code 各自對上下文管理、控制流、錯誤恢復、反饋迴路給出了不同答案。這篇把四個框架放在同一個維度下比較,說清楚差異從哪裡來、背後的問題意識是什麼。 - [Harness Engineering — AI 工程師的第三個維度](https://warmwater.dev/blog/harness-engineering-ai): Prompt Engineering、Context Engineering、Harness Engineering 三個詞混在一起,但它們在解三個完全不同層次的問題。如果你搞不清楚「讓 AI 輸出更好」和「讓 Agent 能在真實世界安全行動」的差別在哪,這篇是 Harness Engineering 的核心定義文章。 - [用 LangChain + LangGraph 實作 Harness Engineering:從 deepagents 學到的設計模式](https://warmwater.dev/blog/langchain-langgraph-harness-engineering-deepagents): 知道 Harness Engineering 的概念之後,要怎麼實作?如果你想看 Memory 持久化、Context 壓縮、HITL 審批、Middleware 攔截在一個真實 POC 裡怎麼用 LangChain + LangGraph 落地,這篇從 deepagents 的原始碼出發,逐一對應 Harness 的五個維度。 ## Source Code - [你的 Agent 為什麼越跑越貴:Headroom 的 Context Compression 設計](https://warmwater.dev/blog/headroom-context-compression): Agent 每呼叫一次 tool,輸出就永久累積在 context 裡。Headroom 是插在 Agent 與 LLM provider 之間的本機壓縮層,透過 Live-Zone Only、CCR 可逆壓縮、Fail-Open 三個設計原則,讓 JSON array tool output 壓縮率達到 70–95%,同時保持可逆。 - [AI 為什麼總是寫太多?Ponytail 用 YAGNI 七層梯強制過濾](https://warmwater.dev/blog/ponytail-yagni-plugin): AI 寫出過度設計的 code,不是因為它不聰明,而是因為沒人告訴它這個 use case 不需要那麼複雜。Ponytail 透過 SessionStart hook 把 YAGNI 七層決策梯注進每個 Claude session,讓 AI 動手前先爬一遍梯子再說。這篇說清楚七層梯機制、三個 mode 的切換時機,以及真實使用會踩的坑。 - [不訓練神經網路也能打出理論最高分:Heuristic Learning 的設計邏輯](https://warmwater.dev/blog/heuristic-learning-code-as-policy): Jiayi Weng 用純程式碼打出 Atari Breakout 理論最高分 864,完全沒有神經網路。這篇拆解 Heuristic Learning 的核心機制:程式碼作為 policy、coding agent 持續維護替代梯度下降,以及為什麼 coding agent 讓啟發式系統重新值得長期維護。 - [Skill Library 的技術債:SkillOps 原始碼解析](https://warmwater.dev/blog/skillops-source-code): Skill Library 會累積技術債:重複 skill 污染搜尋、缺少驗證器讓錯誤靜默傳播、型別 drift 讓計畫在 runtime 才爆。SkillOps 用 Typed Contract + HSEG 四種邊 + 雙迴圈維護,maintenance pass <1 秒 CPU。 - [把 Skill 文件當成可訓練參數:SkillOpt 的文字空間優化](https://warmwater.dev/blog/skillopt-skill-document-as-trainable-parameter): SkillOpt 把 skill 文件當成可訓練參數,用類深度學習的優化循環自動改善 Agent 任務表現。本文解析五個核心組件如何對應 forward pass、gradient、learning rate、validation 與 momentum,以及 52/52 benchmark 組合下,validation gate 為何只接受少數 edit 反而讓增益更可靠。 - [NanoClaw 原始碼:Multi-Tenant Agent Hosting Platform 的設計邏輯](https://warmwater.dev/blog/nanoclaw-agent-hosting-platform): NanoClaw 不是 Agent Framework,是為 Multi-Tenant 設計的 Agent Hosting Platform。從原始碼看 Two-DB IPC 如何讓容器 crash 不影響其他 session、OneCLI 如何讓 API key 永不進容器、Continuation 如何讓 session 跨 crash 持久化,每個選擇都對應一個具體威脅。 - [不預裝能力,只定義生長方式:GenericAgent 原始碼解析](https://warmwater.dev/blog/generic-agent-source-code): GenericAgent 把上下文信息密度最大化(CIDM)當作第一原理:~3K 行、9 個工具、五層記憶,每個設計選擇都指向同一個問題——如何讓 context 裡的每個 token 都值得。解析統一 Agent Loop、No Execution No Memory 結晶機制、Reflect 自主運行的底層邏輯。 - [你在省 Token,還是在省思考?四種廢話假設比較](https://warmwater.dev/blog/token-saving-four-assumptions): 四個 token 節省工具都在解決 context window 不夠的問題,但對「廢話」的定義截然不同。了解 RTK、context-mode、caveman、code-review-graph 各自的設計假設、成立條件與失效邊界,幫助你在 agentic system 設計中做更準確的 context 管理。 - [Task Continuity,不是 Personal Memory:Claude Code 的 Session 設計](https://warmwater.dev/blog/claude-code-task-continuity): Claude Code 沒有跨 session 的個人記憶,tool output 在 compaction 後消失,每次都像重新開始。如果你想讓 Claude Code 跨 session 保住調查進度,而不是每次都重頭解釋,這篇從原始碼分析三個 lifecycle hook 的設計邏輯與 .tmp 工作交接單機制。 - [Memory 01:誰決定什麼值得記——Agent 記憶的四種寫入模式](https://warmwater.dev/blog/agent-memory-01-write-design): 想讓 Agent 記住重要資訊,卻不知道「誰來決定值得記」這個問題應該怎麼設計?八個開源記憶系統給出了四種截然不同的答案,從 LLM pipeline 自動判斷到 agent 自己決定。這篇拆解四種寫入模式的工程邏輯,以及 context compaction 發生時為什麼第三層強制補救是所有系統都繞不開的問題。 - [Memory 02:記憶怎麼被找到——四種搜尋模式與 Write-Search 耦合](https://warmwater.dev/blog/agent-memory-02-search-retrieval): Agent 記憶系統要選 BM25、vector search 還是 hybrid,這個決定不是獨立的,而是由你寫進去的內容決定的。這篇說明寫入模式如何鎖定搜尋策略、paraphrase 問題在 write time 還是 search time 解決各自的代價,以及為什麼 retrieval granularity 的選擇本質上是一個賭注。 - [Memory 03:Agent 記憶住在哪裡——Storage 選擇是部署假設](https://warmwater.dev/blog/agent-memory-03-storage-production): 為 Agent 記憶系統選 SQLite 還是 PostgreSQL,這不只是技術偏好,而是在宣告這個 Agent 為誰服務、部署在哪裡。這篇說明 8 個系統的 5 種儲存格式如何各自鎖定搜尋能力與部署假設,以及 storage、search、deployment 為什麼是三個綁在一起無法獨立選的決策。 - [Memory 04:怎麼判斷哪個記憶系統強——Benchmark 數字的陷阱](https://warmwater.dev/blog/agent-memory-04-benchmark): 看到 mempalace 96.6%、mem0 93.4%,直接下結論哪個記憶系統更強?這兩個數字測的根本不是同一件事。這篇說明 R@K、MRR、NDCG 三個 retrieval 指標各自問什麼、LoCoMo 和 Needle in a Haystack 哪個 benchmark 對哪種系統有利,以及怎麼根據你的設計決策判斷哪個數字才對你有意義。 - [Memory 05:記憶活多久——8 個系統的生命週期設計](https://warmwater.dev/blog/agent-memory-05-lifecycle): Agent 記憶系統不只要設計「存什麼」和「怎麼找」,還要決定「活多久」。如果你不確定記憶應該偏向新鮮還是重要、衰減應該在寫入時還是搜尋時發生,這篇拆解 8 個系統的 lifecycle 設計,從 Hotness 公式到 Ebbinghaus 衰減到 frozen snapshot,幫你看清各種選擇的代價。 - [Memory 06:K8s SRE Agent 的記憶設計——真實場景的技術選型](https://warmwater.dev/blog/agent-memory-06-k8s-sre): K8s 環境的資訊時效性差距極大:pod status 幾分鐘就過期,error pattern 卻永遠有效。如果你在設計 SRE Agent 的記憶系統,不知道哪些資訊該存、哪些存了反而有害,這篇把 write、search、storage、lifecycle 四個決策串進一個具體的 K8s 場景,給出可落地的選型答案。 - [DeerFlow:從原始碼看 LangGraph 為 Agent 系統帶來了什麼,又留下了什麼](https://warmwater.dev/blog/deerflow-langgraph-agent): 選 LangGraph 當 Agent 執行引擎,它替你決定了哪些事?剩下的工程問題還是要自己解。如果你想知道框架邊界在哪裡,以及 12 層 Middleware 排序、虛擬路徑沙箱、LLM 驅動記憶各自在解什麼問題,這篇從 DeerFlow 原始碼給你一個具體的比較答案。 - [你去睡覺,它在做研究:讀 Karpathy 的 AutoResearch](https://warmwater.dev/blog/karpathy-autoresearch-design): 想讓 AI Agent 在你睡覺時自主跑 ML 實驗,但不知道怎麼設計才能讓不同實驗結果直接可比、不被 Agent 作弊?這篇拆解 Karpathy autoresearch 的三個核心決策:固定時間預算如何讓實驗可比、Git 如何被當成實驗狀態機、以及 program.md 如何把研究判斷提前編碼成 Agent 工作協議。 - [資料也可以 Autoresearch:Meta AutoData 的三層 Agent 迴圈](https://warmwater.dev/blog/meta-autodata-recursive-autoresearch): 合成訓練資料的根本問題是沒有品質回饋:生出一百道題不知道哪道有用,只能事後 filtering,但 filtering 無法告訴你怎麼生出更好的題。如果你想知道 Meta AutoData 如何把資料品質轉化為可優化的 evaluation function,以及三層 Agent 迴圈如何把 weak/strong solver 差距從 1.9pp 擴大到 34pp,這篇拆解它的架構設計。 - [你在用它,它也在學你:HuggingFace ml-intern 的 SFT Flywheel](https://warmwater.dev/blog/ml-intern-sft-flywheel): HuggingFace ml-intern 有一行預設開啟的設定 save_sessions: true,不是用來 crash recovery,而是把你每次 session 的完整 trajectory 上傳成公開 SFT 訓練資料。如果你想理解「使用行為即訓練資料」這個飛輪怎麼運作、trajectory 需要什麼結構才有訓練信號,以及它和 AutoResearch 的根本差異,這篇拆解 ml-intern 的設計機制。 - [1,039 個策略,一個晚上:當計算量打敗 Domain Knowledge](https://warmwater.dev/blog/paradigm-autoresearch-parallel-agents): 一個人幾乎沒讀題,用 1,039 個 AI 生成策略在 Hackathon 拿了第一。如果你想知道為什麼平行跑 20 個 Agent 和一個 Agent 跑 20 次根本上不同、from-scratch reset 怎麼打破增量改進的天花板、以及計算量打敗 domain knowledge 的前提條件是什麼,這篇拆解這個系統的設計哲學。 - [Claude Code:從 claw-code 的分析看一個 Coding Agent 的設計關心](https://warmwater.dev/blog/claude-code-claw-code-coding-agent): 想知道 Claude Code 怎麼讓一個能執行任意 shell command 的 Agent 在你機器上安全工作?這篇透過 claw-code 的 29 個子系統分析,拆解 Hook 系統的三種 exit code 設計、PermissionMode 有序 enum、System Prompt Dynamic Boundary,以及 Hooks / Skills / MCP 三個擴展層的職責分工。 - [CrewAI:從原始碼看「角色扮演」怎麼成為架構決策](https://warmwater.dev/blog/crewai): 想讓多個 AI Agent 像一個組織一樣分工協作,但不清楚角色設定究竟只是 prompt 技巧還是架構決策?CrewAI 把 role/goal/backstory 貫穿整個執行邏輯,這篇從原始碼拆解 Crew/Agent/Task 三元組、Task Guardrail、記憶 EncodingFlow,以及 Flow 事件驅動 DAG 各自解了什麼問題。 - [hermes-agent vs OpenClaw:兩個 Agent 框架,同一批問題,不同的答案](https://warmwater.dev/blog/hermes-agent-vs-openclaw-agent): 想選一個適合自己場景的 Agent 框架,卻發現兩個都標榜 production-grade、卻給出截然不同的設計?hermes-agent 和 OpenClaw 在記憶架構、子 Agent 管理、執行安全、演化機制上幾乎處處相反,這篇把同一組問題下的兩套答案並排說清楚,幫你看懂取捨背後的出發點。 - [Hermes-agent:從原始碼看一個為 Production 設計的 Agent 系統](https://warmwater.dev/blog/hermes-agent-production-agent): Agent 跑起來不難,真正麻煩的問題後來才浮現:token 費用怎麼控制、context 滿了怎麼辦、記憶怎麼跨 session 保留。如果你想知道一個為 Production 設計的 Agent 系統怎麼從架構層面解這些問題,這篇拆解 hermes-agent 的 Memory Fencing、Context 壓縮、System Prompt 穩定性與 Skill RL 訓練迴路。 - [OpenClaw:從原始碼看一個 Agent 平台的工程選擇](https://warmwater.dev/blog/openclaw-agent): 讓 Agent 同時接收 Telegram、WhatsApp、Slack 訊息、API Key 被 rate-limit 時自動換一個、重啟後把未完成任務撿回來繼續跑——這些加在一起需要的是平台,不是單一 Agent。如果你想理解 OpenClaw 怎麼透過 Gateway 分層、SessionKey 設計與 Auth Rotation 讓系統在沒人看的時候自己活下去,這篇從原始碼逐一說明。 - [打開原始碼才發現:三個 Agent 框架,三種截然不同的設計哲學](https://warmwater.dev/blog/agent-20260423): 同樣叫 Agent 框架,deepagents、openclaw、hermes-agent 解的問題幾乎完全不重疊。如果你選框架時只看「LLM + tools + loop」、不知道從設計哲學角度該問什麼問題,這篇從三個框架的原始碼比較出發,拆出六個 Agent 系統設計的核心決策點。 ## System Design - [AgenticSystem 架構全景:四個類別、五個系統的設計選擇與取捨](https://warmwater.dev/blog/agentic-system-architecture-landscape): 從 System Design 角度橫向分析五個 Agentic System 的架構類別(Agent Framework / AI Gateway / Agent Service / Hosting Platform)。涵蓋各類別設計決策、Cross-cutting ADR、Scenario 選型矩陣與 Trade-off 總表。 - [MCP、CLI、還是直呼 API?先看工具長什麼樣](https://warmwater.dev/blog/mcp-cli-api-integration): MCP vs CLI 的辯論少了一個前置問題:你的工具有什麼介面?gh CLI 比 GitHub MCP 省 40 倍 tokens,但沒有 terminal 的 SaaS 環境只能用 MCP remote。cli-printing-press 從 OpenAPI spec 生成 agent-native CLI,CLI-Anything 給 GUI 應用反向工程出 REPL CLI。先看介面,再選協議。 - [Agent 要怎麼進化?六個系統的 Self-Improvement 機制比較](https://warmwater.dev/blog/agent-self-improvement-design-comparison): 六個 agentic system 都說「越用越強」,但進化機制從底層就不同:GenericAgent 結晶跑通的執行路徑,HermesAgent 同時走 prompt 層和模型層,DeerFlow 更新用戶認知,NanoClaw 擴展容器能力,HolmesGPT 和 OpenClaw 刻意不自動進化。這篇把四個設計選擇攤開來比。 - [SOUL 設計決定了 Agent 是什麼:六個 Agentic System 的 system prompt 比較](https://warmwater.dev/blog/agent-soul-design-comparison): 六個真實 Agentic System 的 SOUL 設計與工具配置全比較:GenericAgent 無邊界全能宣言、HolmesGPT 的行為協議內嵌、HermesAgent 的模型感知 SOUL 補丁、DeerFlow 的架構取代文字。每個設計背後的假設、取捨與適用場景一次看清。 - [K8s SRE Task Continuity Agent(一):系統架構設計](https://warmwater.dev/blog/k8s-sre-task-continuity-agent-01-system-architecture): K8s 故障調查任務可能跨越幾十次 tool call,context compaction 一觸發 agent 就忘記自己在做什麼。如果你想設計一個不會在調查進行到一半就斷掉的 SRE Agent,這篇說明 Session、Memory、Knowledge 三層的邊界設計,以及 Agentic Loop 的兩個 plugin 點怎麼架構。 - [K8s SRE Task Continuity Agent(二):開發 Roadmap 與分工設計](https://warmwater.dev/blog/k8s-sre-task-continuity-agent-02-development-roadmap): 三層架構如果同時開發,每一層都要等另一層穩定才能驗收,等於三個方向同時出問題、無從診斷。如果你拿到了 K8s SRE Task Continuity Agent 的架構設計,不知道該從哪裡動手,這篇拆解三個可獨立驗收的 Phase、兩人垂直分工設計,以及 Interface-First 為什麼是並行開發的前提。 - [K8s SRE Task Continuity Agent(三):Testing 與 Observability 設計](https://warmwater.dev/blog/k8s-sre-task-continuity-agent-03-testing-observability): Agentic System 的 testing 無法用 assert output == expected 驗證:同一個 K8s 故障,Agent 可能走三步也可能走七步。如果你想知道怎麼設計 Minikube sandbox 讓每個 failure 場景可重現、怎麼讓 regression test 跨 Phase 累積不退步、以及用三層 monitoring 看系統健康,這篇說明 K8s SRE Agent 的 Testing 與 Observability 設計。 - [Frontier、Mini、還是自建:Production LLM 的架構沒有標準答案](https://warmwater.dev/blog/frontierminiproduction-llm): 要讓系統用上 LLM,Frontier model、Mini model、自建 HuggingFace 三條路各有取捨,但邊界很難畫。如果你在做架構決策、不確定何時該往下一個階段走,這篇把三個選項理解成一條演化路徑——從快速驗證到逐漸掌控——幫你問出「現在在哪個階段」這個更務實的問題。 - [LLM Agent 四大架構模式:選型指南](https://warmwater.dev/blog/llm-agent): 選錯 LLM Agent 架構模式,成本可以差 30 倍。從 Tool Calling 到 Reflexion,解析四大核心模式的機制差異、適用場景與成本權衡,幫 Tech Lead 在系統設計前做出正確的架構選型決策。 - [RAG System 完整指南:從原理到實踐](https://warmwater.dev/blog/rag-system): LLM 不知道你的私有資料、訓練資料有截止點、回答容易幻覺——這些限制讓它在垂直領域問答場景幾乎無法直接使用。這篇完整說明 RAG 系統的技術選型(Chunking、Embedding、Vector DB)、三大查詢優化策略,以及如何用 RAGAS 評估系統品質。 - [LLM Cache 策略:從 Prompt Cache 到 Semantic Cache](https://warmwater.dev/blog/llm-cache-prompt-cache-semantic-cache): LLM 系統每天處理大量重複性請求,即使 prompt 已最小化,成本仍居高不下。這篇解析兩層 Cache 策略的差異:Prompt Cache 如何減少重複 token 計算,Semantic Cache 如何讓語意相似的問題直接命中快取。 - [向量資料庫完全指南:為什麼 LLM 時代需要 Vector DB?](https://warmwater.dev/blog/llm-vector-db): 傳統關鍵字搜尋要求字面完全匹配,無法處理「意思相近但用詞不同」的查詢,導致 RAG 系統找不到真正相關的文件。這篇從底層原理解釋向量資料庫如何解決語意搜尋問題,以及主流方案的選型差異。 - [LangChain vs LangGraph vs DeepAgents:該選哪個 AI Agent 框架?完整場景對比指南](https://warmwater.dev/blog/langchain-vs-langgraph-vs-deepagents-ai-agent): LangChain、LangGraph、DeepAgents 同屬 LangChain 生態系,但適用場景截然不同——選錯會讓你在複雜流程上卡關。這篇從狀態管理、工作流程複雜度、生產可靠性三個維度,幫你找到正確的技術選型。 ## Implement - [用 RPG 架構評估 SRE Agent:Kube Arena 設計紀錄](https://warmwater.dev/blog/kube-arena): 評估 SRE agent 靠 pass/fail 不夠——你需要知道它在哪裡浪費步驟、有沒有形成假設。Kube Arena 用三組件架構在真實 k3d cluster 上測試任何 OpenAI-compatible agent,輸出 efficiency score 和 wasted steps 分析。 - [不靠直覺,靠實驗:用 AutoResearch 找到 C++ 的 33x 優化空間](https://warmwater.dev/blog/autoresearch-c-33x): 沒寫過 C++ 卻要做效能優化,靠直覺猜槓桿在哪沒有意義。用 AutoResearch 框架讓 Agent 系統化跑實驗,結果找到 33x 的優化空間——光是調整 loop 順序就帶來 15.8x。如果你想用「設計實驗」取代「靠經驗猜測」,這篇說明整個流程與關鍵發現。 - [把 ML 工程師的直覺,打包進 Agent](https://warmwater.dev/blog/ml-agent): 讀完 Kaggle top solution 的 insight 很快就忘掉,每場比賽又從零開始——這個問題能不能用 Agent 系統解決?這篇說明如何讓 Agent 分析競賽、蒸餾可複用的 ML 判斷力存進知識庫,把「花在 research 的時間」轉換成一個可以持續對話的 ML 專家系統。 - [AI 自主研究實驗:讓 Agent 在你睡覺時跑 100 個實驗](https://warmwater.dev/blog/ai-agent-100): ML 實驗流程能不能自動化到讓 Agent 自己跑?Karpathy 的 autoresearch 框架給了一個具體答案:AI 改 code、訓練、看結果、決定 keep 或 discard,你早上醒來看 100 個實驗的 log。如果你想把「一個個手動跑實驗」這件事交給 Agent,這篇說明核心設計與思維轉變。 - [🚀 從 PR Review 中學習:用 LLM分析PR | 2025](https://warmwater.dev/blog/pr-review-llmpr-2025): Code Review 意見散落在 PR 上,沒有系統整理就很難從中學習。LLM PR Review Analyzer 能自動分析 GitHub PR 的審查意見,用 AI 萃取技術洞察與最佳實踐,適合想從資深工程師評論中建立結構化學習路徑的開發者。 ## Viewpoint - [AI 時代的 PM / HR / Sales:你才是讓 AI 落地的那個人](https://warmwater.dev/blog/ai-for-non-engineer-workplace): 公司導入AI失敗,通常不是技術問題。PM、HR、Sales、Manager各自有最直接能用AI加速的場景,這篇整理四個角色的具體切入點,以及如何從個人用起,帶動整個組織。 - [AI 時代的非工程師:從今天開始,不需要準備好](https://warmwater.dev/blog/ai-mindset-non-engineer): 很多人沒有開始用AI,不是因為不懂技術,而是覺得還沒準備好。這篇說清楚AI思維是什麼、跟工具思維有什麼差別,以及三個能讓你今天就開始的具體習慣。不需要學程式,只需要改變開口的時機。 - [AI 時代的 Backend Engineer:從會用到能建的完整路線](https://warmwater.dev/blog/backend-to-ai-engineer-roadmap): 熟悉 API 設計的 Backend Engineer,轉 AI 工程師沒有標準路線。這篇整理三個 Phase:LLM Integration 基本功、Agentic System 架構設計(含 RAG、memory、安全層與 eval),以及 Fine-tuning 與 Local Inference 的 Hybrid 策略,還有為什麼要先把工作方式升級成 Agentic Coding。 - [你在比的是模型,但決定 Claude Code 效果的是 Harness](https://warmwater.dev/blog/claude-code-harness-over-model): 大部分人評估 AI coding 工具的第一個動作是比 benchmark,但規模化部署的觀察說的是另一件事:決定 Claude Code 效果的不是模型選擇,是圍繞它建立的 Harness——CLAUDE.md、Hooks、Skills、Plugins、MCP 構成的執行生態。這篇說清楚為什麼。 - [Agent Memory 策略選型:三個決策,一個框架](https://warmwater.dev/blog/agent-memory-strategy-selection): 選 Agent Memory 框架時,你問的是「哪個 recall 最準」,但這個問題問的是框架,不是決策。Write、Search、Storage 三個決策鎖在一起,改其中一個另外兩個都要跟著換。如果你不知道從哪裡開始選,這篇提供一個具體的決策框架,從資料性質的第一個問題切入。 - [你能把問題量化成什麼,AI 就能優化什麼](https://warmwater.dev/blog/self-improve-eval-function-design): AutoResearch、並行 Agent、SFT Flywheel、合成資料——這四個看起來不同的方法,為什麼都卡在同一個問題:你怎麼知道改進了?如果你想理解為什麼 eval function 的清晰度決定系統能走多遠,以及設計一個可驅動 Agent 自我改進的 eval 需要什麼條件,這篇是四篇系列的概念收尾。 - [Python AI 工程師為什麼要學 TypeScript?](https://warmwater.dev/blog/why-python-ai-engineers-learn-typescript): FastAPI 跑得好好的,LangChain 熟到閉眼寫,為什麼要花時間學 TypeScript?如果你是 Python AI 工程師,不確定 TypeScript 能補上什麼、兩個語言的分工邊界在哪裡,這篇用光譜圖說明為什麼越靠近 User 的那層 TypeScript 優勢越大,以及 Vibe Coding 時代讓進入成本降到最低的四個原因。 - [AI Native 從 25% 到 40%:YC 兩年告訴我們的幾件事](https://warmwater.dev/blog/ai-native-25-40yc): AI Native 公司佔比從 7% 漲到 40%,但這個數字背後發生了什麼順序?這篇追蹤 YC W24 到 S25 四個 batch 的數據:哪類行業先被 AI 打入、平均團隊規模為何從 6.7 人縮到 3.6 人、Agent-First 浪潮如何從 25% 逐步確立,以及這些趨勢對工程師定位的實際意義。 - [在 Claude Code 的年代,我為什麼還要學 C++?](https://warmwater.dev/blog/claude-code-c): vLLM、llama.cpp、Flash Attention 底層幾乎全是 C++,但 Python 套件看起來已經夠用了——這個矛盾讓人困惑。如果你想搞清楚 C++ 在現代 AI 推論工程裡的真實位置、Python wrapper 慢在哪裡,這篇是 C++ AI 推論系列的起點,從問題出發而非語法出發。 - [你的 Prompt 為什麼有效:從 Transformer 機制看 AI 系統設計](https://warmwater.dev/blog/prompt-transformer-ai): 同樣的 prompt,關鍵資訊放前段和後段,輸出品質差很多——這不是措辭問題,是 Transformer 注意力機制決定的。如果你想搞清楚為什麼重要資訊的位置比你想的更重要、為什麼 agent 跑幾十輪後開始亂、為什麼 context window 是零和競爭,這篇從機制角度解釋這些工程決策背後的「為什麼」。 - [機器學習的本質思考:Vibe Coding 時代工程師的關鍵決策指南](https://warmwater.dev/blog/vibe-coding): AI 可以幫你寫訓練程式碼,但「這個問題該用 Accuracy 還是 F1?」、「模型在測試集好、部署後崩潰是為什麼?」這類決策沒辦法外包。如果你覺得 ML 工程師在 Vibe Coding 時代的判斷力越來越難說清楚,這篇整理了 7 個最容易踩坑的決策點,幫你建立可以說清楚的思考框架。 - [✨ 如何用一段 Prompt 讓 Copilot 更了解你的專案?](https://warmwater.dev/blog/prompt-copilot): GitHub Copilot 一直補出舊版語法或不符合團隊風格的程式碼,根本原因是它不知道你的專案背景。透過 .github/copilot-instructions.md 加上一段 Prompt,可以讓 Copilot 自動掃描整個 codebase 並產生結構化的專案指引,讓後續補全與 Chat 回覆都更貼近你的實際需求。 ## LLMOps - [LoRA 這件事你只需要搞清楚一次](https://warmwater.dev/blog/lora-map): LoRA 不是省記憶體的訓練技巧,背後是一個關於「fine-tuning 的 weight 更新本質上是低維的」的假設。這篇涵蓋 LoRA 核心機制、r 與 alpha 的物理意義、target_modules 的選擇邏輯、QLoRA 的設計,以及何時該用 LoRA、何時該用 RAG,一次建立完整判斷框架。 - [你怎麼知道 AI 答對了?建立 LLM 評估的思考框架](https://warmwater.dev/blog/llm-eval-foundations): 改了 prompt、換了模型版本,系統輸出開始變奇怪,但你說不清楚哪裡不對,也沒辦法系統性地量——傳統 assert == expected 在 LLM 這裡直接失效。如果你想建立一套能回答「這個 AI 夠不夠好」的思考框架,這篇解析評估的三個層次、LLM-as-Judge 的運作原理,以及 Evaluation 與 Observability 的分工。 - [選對指標,不要選多:LLM 評估的決策框架](https://warmwater.dev/blog/llm-eval-metrics-decision): 全選 DeepEval 的 40 幾個指標,只會拿到一張不知道怎麼用的報表。如果你搞不清楚 Faithfulness 和 Hallucination 的差別、RAG 和 Agent 各自該量什麼,這篇按系統架構給出決策框架:找到你的架構類型,直接看你需要的指標,以及怎麼避免「指標全過但系統還是爛」。 - [Langfuse](https://warmwater.dev/blog/langfuse): LLM 應用上線後,你不知道每次呼叫花了多少 token、哪個步驟最慢、哪個 prompt 版本效果更好。Langfuse 提供 trace 追蹤、成本分析與實驗管理,這篇說明如何整合 DeepEval 建立一套完整的 LLMOps 評估流程。 - [AI Agent 大語言模型輸出評估:如何選擇最佳評估框架?](https://warmwater.dev/blog/ai-agent): AI Agent 的輸出涉及多步驟推理,傳統評估指標難以衡量推理品質與可解釋性。如果你不確定 DeepEval、Promptfoo、LangChain AgentEvals 該選哪個,這篇比較三個框架的核心差異,並說明為什麼 G-Eval 是評估 Agent 推理能力的最佳起點。 ## Skill - [GSD、gstack、Matt Pocock、Superpowers 都在解什麼問題](https://warmwater.dev/blog/gsd-gstack-mattpocock-superpowers-comparison): GSD、gstack、Matt Pocock、Superpowers 四套 AI Coding Agent 工具,到底選哪個?這個問題本身有問題——它們診斷的根本失敗模式不同,解法不重疊。如果你搞不清楚該用哪套,這篇從 Context 策略、工作流擁有權、行為約束三個維度拆解差異,讓你知道什麼情境用什麼。 - [Superpowers:AI Coding Agent 系統性失敗模式的設計答案](https://warmwater.dev/blog/superpowers-plan-mode-ai-agent): Plan Mode 之後,AI coding agent 還是會在某個節點走歪——猜 bug 原因、宣稱完成但沒驗證、長 session 開始遺忘早期決策。如果你想知道這四個系統性失敗模式的共同根因,以及 Superpowers 的 Skill 懶載入注入架構如何系統性覆蓋整個 coding lifecycle,這篇做設計分析。 - [Claude Skills 完全解析:Agent 時代的能力模組化設計](https://warmwater.dev/blog/claude-skills-agent): 當你想讓 Agent 支援幾十個不同任務,把所有指令塞進 prompt 很快就會讓 context 爆炸。這篇解析 Claude Skills 的模組化設計——如何把能力切分成可按需載入的單元,以及它和工具呼叫的本質差異。 ## RAG - [RAG 典範轉移:從向量檢索到結構化檢索](https://warmwater.dev/blog/rag): 向量檢索的 RAG 系統在語意相似搜尋上表現不錯,但當問題需要完整文件結構或精確程式碼時就會失效。這篇以 LangChain 重建自家 Chatbot 的真實案例,說明為何要從向量檢索轉向結構化檢索,以及兩者的差異。 ## Stock & Finance - [打造台股交易模擬訓練平台:從構想到實作的技術分享](https://warmwater.dev/blog/post): 模擬盤沒有真實感,真金白銀又有風險——這篇說明如何用 FastAPI、React、yfinance 與 Tavily API 打造台股歷史回放交易平台,讓你在歷史 K 線與當天真實新聞的情境下練習交易決策。 - [🤖 LLM Agent Trader: 當ChatGPT遇上股票交易,我打造了一個會思考的交易機器人 (Part3)](https://warmwater.dev/blog/llm-agent-trader-chatgpt-3): LLM 交易 Agent 的每日判斷是獨立的,缺乏跨日決策的連貫性,也無法從對話中學習。Part 3 開源完整程式碼,並說明如何加入決策記憶池、多輪對話機制與更多資料源,讓系統逐步成為真正的交易夥伴而非一次性工具。 - [🤖 LLM Agent Trader: 當ChatGPT遇上股票交易,我打造了一個會思考的交易機器人 (Part2)](https://warmwater.dev/blog/llm-agent-trader-chatgpt-2): 跑完回測後看到一個不合理的賣出點,卻不知道 LLM 當天為什麼這樣決策?Part 2 新增策略討論室,可以用自然語言向 AI 詢問任意交易日的決策動機,並讓它給出策略調整建議,把黑盒子變成可對話的夥伴。 - [🤖 LLM Agent Trader: 當ChatGPT遇上股票交易,我打造了一個會思考的交易機器人](https://warmwater.dev/blog/llm-agent-trader-chatgpt): 傳統程式交易只能執行固定規則,無法理解市場語境。LLM Agent Trader 把技術指標整合成市場報告餵給 GPT-4,讓 AI 像真人交易員一樣綜合判斷進出場時機,並透過回測平台可視化每一筆決策的推理過程。 - [打造智能股票分析團隊:LLM Stock Team Analyzer](https://warmwater.dev/blog/llm-stock-team-analyzer): 想用 LangGraph 實作一個多 Agent 股票分析系統,但不確定怎麼設計角色分工、資料流與 RAG 整合?LLM Stock Team Analyzer 是一個可直接執行的開源實作,涵蓋技術分析、新聞情緒與多空辯論流程,可作為 Multi-Agent 金融系統的起點範本。 - [TradingAgents: Multi-Agents LLM Financial TradingFramework](https://warmwater.dev/blog/tradingagents-multi-agents-llm-financial-tradingframework): 多 Agent 系統在多輪對話中容易發生語意失真與上下文遺失,導致決策品質下降。TradingAgents 論文提出結構化通訊協議與角色分工設計,讓每個 Agent 只處理自己職責範圍內的資訊,是解決 Multi-Agent 協作中上下文管理問題的具體參考架構。 ## Paper Notes - [Agentic Context Engineering:讓 AI 代理人自我改進的關鍵技術](https://warmwater.dev/blog/agentic-context-engineering-ai): Agent 在多輪互動後容易發生 context 污染、資訊遺失或注意力分散,導致推理品質下降。ACE 框架透過動態備忘錄、反思器與策展器三個組件的閉環設計,讓 Agent 能夠在不依賴 LLM 重寫的情況下持續累積精煉知識,避免 context collapse。 - [Dynamic Cheatsheet Paper 筆記](https://warmwater.dev/blog/dynamic-cheatsheet-paper): 模型訓練完成後就固定不變,但實際推理時能不能持續從經驗中學習?Dynamic Cheatsheet 論文發現直接保留所有歷史記錄反而有害,真正有效的方式是透過智能檢索加上策展,把原始經驗提煉成可重用的知識片段,讓 Agent 表現隨推理次數持續提升。 - [ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory](https://warmwater.dev/blog/reasoningbank-scaling-agent-self-evolving-with-reasoning-memory): Agent 在不同任務之間無法共享過往的推理經驗,每次遇到新環境都要從零開始探索。ReasoningBank 論文提出把歷史推理過程結構化為可轉移的記憶單元,讓 Agent 在跨任務、跨領域場景下能動態檢索相關經驗,減少冗餘探索並提升泛化能力。 ## 關於作者 - [作品集](https://warmwater.dev/projects) - [聯絡](https://warmwater.dev/contact) - [JSON Feed](https://warmwater.dev/feed.json) - [RSS](https://warmwater.dev/rss.xml)