LLM 工程 · Agentic System · Harness Engineering

Articles

系列:LLM 評估與可觀測性系列,共 3 篇,依順序排列。看全部文章
LLMOps 你怎麼知道 AI 答對了?建立 LLM 評估的思考框架 改了 prompt、換了模型版本,系統輸出開始變奇怪,但你說不清楚哪裡不對,也沒辦法系統性地量——傳統 assert == expected 在 LLM 這裡直接失效。如果你想建立一套能回答「這個 AI 夠不夠好」的思考框架,這篇解析評估的三個層次、LLM-as-Judge 的運作原理,以及 Evaluation 與 Observability 的分工。
7 分 2026-05-12
LLMOps 選對指標,不要選多:LLM 評估的決策框架 全選 DeepEval 的 40 幾個指標,只會拿到一張不知道怎麼用的報表。如果你搞不清楚 Faithfulness 和 Hallucination 的差別、RAG 和 Agent 各自該量什麼,這篇按系統架構給出決策框架:找到你的架構類型,直接看你需要的指標,以及怎麼避免「指標全過但系統還是爛」。
10 分 2026-05-12
Harness Engineering 你的 Agent 跑歪了你知道嗎?LLM Agentic System 可觀測性設計 LLM 系統不會拋 exception,它只會靜靜地漂移——prompt 一個字的修改、provider 靜默升版、tool API schema 改動,任何一個都不觸發 alert。如果你不知道 Agent 在哪一層失敗、怎麼在 Cost 飆升之前偵測異常,這篇說明 Tracing、三層 Evaluation 與行為異常偵測的設計原則。
9 分 2026-05-07