一定要配温開水
⌕ 搜尋
/
Articles
Stock
Projects
Profile
Contact
LLM 工程 · Agentic System · Harness Engineering
Articles
系列:
LLM 評估與可觀測性系列
,共 3 篇,依順序排列。
看全部文章
LLMOps
你怎麼知道 AI 答對了?建立 LLM 評估的思考框架
改了 prompt、換了模型版本,系統輸出開始變奇怪,但你說不清楚哪裡不對,也沒辦法系統性地量——傳統 assert == expected 在 LLM 這裡直接失效。如果你想建立一套能回答「這個 AI 夠不夠好」的思考框架,這篇解析評估的三個層次、LLM-as-Judge 的運作原理,以及 Evaluation 與 Observability 的分工。
7 分
2026-05-12
LLMOps
選對指標,不要選多:LLM 評估的決策框架
全選 DeepEval 的 40 幾個指標,只會拿到一張不知道怎麼用的報表。如果你搞不清楚 Faithfulness 和 Hallucination 的差別、RAG 和 Agent 各自該量什麼,這篇按系統架構給出決策框架:找到你的架構類型,直接看你需要的指標,以及怎麼避免「指標全過但系統還是爛」。
10 分
2026-05-12
Harness Engineering
你的 Agent 跑歪了你知道嗎?LLM Agentic System 可觀測性設計
LLM 系統不會拋 exception,它只會靜靜地漂移——prompt 一個字的修改、provider 靜默升版、tool API schema 改動,任何一個都不觸發 alert。如果你不知道 Agent 在哪一層失敗、怎麼在 Cost 飆升之前偵測異常,這篇說明 Tracing、三層 Evaluation 與行為異常偵測的設計原則。
9 分
2026-05-07