LLM 工程 · Agentic System · Harness Engineering

Articles

Implement 用 RPG 架構評估 SRE Agent:Kube Arena 設計紀錄 評估 SRE agent 靠 pass/fail 不夠——你需要知道它在哪裡浪費步驟、有沒有形成假設。Kube Arena 用三組件架構在真實 k3d cluster 上測試任何 OpenAI-compatible agent,輸出 efficiency score 和 wasted steps 分析。
14 分 2026-05-28
Harness Engineering Self Escalate Agent:刻意設計成不完整的 AI Agent 遇到能力缺口時有兩個壞選擇:靜默失敗或亂猜答案。如果你在設計 Agent 系統時想知道怎麼讓 Agent 誠實說出「這件事我現在做不到」、用 GitHub Issue 把能力缺口轉成精確改進訊號、以及 SOUL.md 怎麼把行為準則從程式碼裡分離,這篇說明一個刻意設計成不完整的 Agent 原型。
8 分 2026-05-09
Implement 不靠直覺,靠實驗:用 AutoResearch 找到 C++ 的 33x 優化空間 沒寫過 C++ 卻要做效能優化,靠直覺猜槓桿在哪沒有意義。用 AutoResearch 框架讓 Agent 系統化跑實驗,結果找到 33x 的優化空間——光是調整 loop 順序就帶來 15.8x。如果你想用「設計實驗」取代「靠經驗猜測」,這篇說明整個流程與關鍵發現。
15 分 2026-04-17
Implement 把 ML 工程師的直覺,打包進 Agent 讀完 Kaggle top solution 的 insight 很快就忘掉,每場比賽又從零開始——這個問題能不能用 Agent 系統解決?這篇說明如何讓 Agent 分析競賽、蒸餾可複用的 ML 判斷力存進知識庫,把「花在 research 的時間」轉換成一個可以持續對話的 ML 專家系統。
14 分 2026-04-04
Harness Engineering 用 LangChain + LangGraph 實作 Harness Engineering:從 deepagents 學到的設計模式 知道 Harness Engineering 的概念之後,要怎麼實作?如果你想看 Memory 持久化、Context 壓縮、HITL 審批、Middleware 攔截在一個真實 POC 裡怎麼用 LangChain + LangGraph 落地,這篇從 deepagents 的原始碼出發,逐一對應 Harness 的五個維度。
19 分 2026-04-02
Implement AI 自主研究實驗:讓 Agent 在你睡覺時跑 100 個實驗 ML 實驗流程能不能自動化到讓 Agent 自己跑?Karpathy 的 autoresearch 框架給了一個具體答案:AI 改 code、訓練、看結果、決定 keep 或 discard,你早上醒來看 100 個實驗的 log。如果你想把「一個個手動跑實驗」這件事交給 Agent,這篇說明核心設計與思維轉變。
26 分 2026-03-27
Stock & Finance 打造台股交易模擬訓練平台:從構想到實作的技術分享 模擬盤沒有真實感,真金白銀又有風險——這篇說明如何用 FastAPI、React、yfinance 與 Tavily API 打造台股歷史回放交易平台,讓你在歷史 K 線與當天真實新聞的情境下練習交易決策。
9 分 2025-11-27
Stock & Finance 🤖 LLM Agent Trader: 當ChatGPT遇上股票交易,我打造了一個會思考的交易機器人 (Part2) 跑完回測後看到一個不合理的賣出點,卻不知道 LLM 當天為什麼這樣決策?Part 2 新增策略討論室,可以用自然語言向 AI 詢問任意交易日的決策動機,並讓它給出策略調整建議,把黑盒子變成可對話的夥伴。
3 分 2025-08-19
Stock & Finance 🤖 LLM Agent Trader: 當ChatGPT遇上股票交易,我打造了一個會思考的交易機器人 傳統程式交易只能執行固定規則,無法理解市場語境。LLM Agent Trader 把技術指標整合成市場報告餵給 GPT-4,讓 AI 像真人交易員一樣綜合判斷進出場時機,並透過回測平台可視化每一筆決策的推理過程。
9 分 2025-08-12
Implement 🚀 從 PR Review 中學習:用 LLM分析PR | 2025 Code Review 意見散落在 PR 上,沒有系統整理就很難從中學習。LLM PR Review Analyzer 能自動分析 GitHub PR 的審查意見,用 AI 萃取技術洞察與最佳實踐,適合想從資深工程師評論中建立結構化學習路徑的開發者。
19 分 2025-07-23
Stock & Finance 打造智能股票分析團隊:LLM Stock Team Analyzer 想用 LangGraph 實作一個多 Agent 股票分析系統,但不確定怎麼設計角色分工、資料流與 RAG 整合?LLM Stock Team Analyzer 是一個可直接執行的開源實作,涵蓋技術分析、新聞情緒與多空辯論流程,可作為 Multi-Agent 金融系統的起點範本。
15 分 2025-07-15