BLOG
知识分享
技术文章、实战教程、经验心得
共找到 2 篇文章
AI 评测DeepEvalRAGAS
AI 评测系列(06):DeepEval 实战——企业级 Agent 评测套件
用 DeepEval 对同一个客服 Agent 运行三个指标:AnswerRelevancy(均值 0.767,60% 通过)、Faithfulness(均值 0.600,40% 通过)、ToolCorrectness(20% 通过——Agent 大量不调工具是根因)。重点讲 DeepEval 与 RAGAS 的范式差异:RAGAS 是批量分析工具,DeepEval 是 CI 质量门控工具,两者解决不同问题。同时演示如何把 glm-4-flash 接入 DeepEval 作为 Judge LLM。
·约 6 分钟阅读
AI 评测Agent 评测工具调用
AI 评测系列(05):Agent 评测——工具调用准确率与轨迹质量
对一个客服 Agent(3 个工具,15 个测试用例)进行系统性评测。结果:工具名准确率 73%、参数准确率 100%、步骤效率 0.73x。4 个失败案例全是'应该调工具却没调'而不是'调错了工具',说明 Agent 的工具触发逻辑是瓶颈,不是工具执行逻辑。轨迹质量 LLM-as-Judge 均分 3.73/5,多步骤任务和边界情况表现略差。
·约 8 分钟阅读