~/writingseries
Agent
-
AI 明明答错了,系统为什么还显示一切正常?
接口成功不代表 AI 任务正确。本文讲清日志、Trace、监控与评估的边…
-
企业知识库怎么建:从资料盘点到持续运营
从一次过期制度回答出发,系统拆解企业知识的盘点、分层、摄取、检索、评测、…
-
CLI能否来赚钱
CLI 从内部工具走向规模化后,如何处理身份权限、Agent Eval、…
-
如何做好CLI的需求
从飞书 CLI 拆解 Agent CLI 的命令粒度、机器契约与 Ski…
-
CLI兴起,MCP和CLI是否要既生瑜何生亮
Agent 为什么重新需要 CLI,以及 CLI、MCP、开放平台和 S…
-
【Eval】离线全通过,上线仍会失败的原因到底是啥
将发布门槛、线上监控、坏例审核、回归集和版本复测连接起来,让 Agent…
-
【Eval】规则、AI裁判和人工怎么成为铁三角
从规则检查、AI 裁判和人工复核的分工出发,理解 Promptfoo、D…
-
【Eval】分数变高,不代表版本真的变好
通过固定基线、同案例成对比较、多次运行、分组分析和跨模型矩阵,区分真实改…
-
【Eval】测Skill,不只是盯结果
Skill 的质量不止是最终回答,还包括是否正确触发、是否选对工具和步骤…
-
【Eval】第一次Eval,先从小事情干起
不搭平台、不先学复杂统计,用一个明确任务、约 20 个真实案例、分层评分…