LLM 工程 · Agentic System · Harness Engineering

Articles

系列:AutoResearch 設計哲學系列,共 6 篇,依順序排列。看全部文章
Source Code 你去睡覺,它在做研究:讀 Karpathy 的 AutoResearch 想讓 AI Agent 在你睡覺時自主跑 ML 實驗,但不知道怎麼設計才能讓不同實驗結果直接可比、不被 Agent 作弊?這篇拆解 Karpathy autoresearch 的三個核心決策:固定時間預算如何讓實驗可比、Git 如何被當成實驗狀態機、以及 program.md 如何把研究判斷提前編碼成 Agent 工作協議。
11 分 2026-05-12
Source Code 1,039 個策略,一個晚上:當計算量打敗 Domain Knowledge 一個人幾乎沒讀題,用 1,039 個 AI 生成策略在 Hackathon 拿了第一。如果你想知道為什麼平行跑 20 個 Agent 和一個 Agent 跑 20 次根本上不同、from-scratch reset 怎麼打破增量改進的天花板、以及計算量打敗 domain knowledge 的前提條件是什麼,這篇拆解這個系統的設計哲學。
10 分 2026-05-12
Source Code 資料也可以 Autoresearch:Meta AutoData 的三層 Agent 迴圈 合成訓練資料的根本問題是沒有品質回饋:生出一百道題不知道哪道有用,只能事後 filtering,但 filtering 無法告訴你怎麼生出更好的題。如果你想知道 Meta AutoData 如何把資料品質轉化為可優化的 evaluation function,以及三層 Agent 迴圈如何把 weak/strong solver 差距從 1.9pp 擴大到 34pp,這篇拆解它的架構設計。
10 分 2026-05-12
Source Code 不訓練神經網路也能打出理論最高分:Heuristic Learning 的設計邏輯 Jiayi Weng 用純程式碼打出 Atari Breakout 理論最高分 864,完全沒有神經網路。這篇拆解 Heuristic Learning 的核心機制:程式碼作為 policy、coding agent 持續維護替代梯度下降,以及為什麼 coding agent 讓啟發式系統重新值得長期維護。
16 分 2026-05-29
Source Code Skill Library 的技術債:SkillOps 原始碼解析 Skill Library 會累積技術債:重複 skill 污染搜尋、缺少驗證器讓錯誤靜默傳播、型別 drift 讓計畫在 runtime 才爆。SkillOps 用 Typed Contract + HSEG 四種邊 + 雙迴圈維護,maintenance pass <1 秒 CPU。
30 分 2026-05-29
Source Code 把 Skill 文件當成可訓練參數:SkillOpt 的文字空間優化 SkillOpt 把 skill 文件當成可訓練參數,用類深度學習的優化循環自動改善 Agent 任務表現。本文解析五個核心組件如何對應 forward pass、gradient、learning rate、validation 與 momentum,以及 52/52 benchmark 組合下,validation gate 為何只接受少數 edit 反而讓增益更可靠。
16 分 2026-05-29