BLOG

知识分享

技术文章、实战教程、经验心得

共找到 4 篇文章
AI 评测LLM-as-Judge评测方法

AI 评测系列(01):为什么 AI 评测难——不确定性、主观性与多维度

AI 评测和传统软件测试有三个本质区别:输出不确定(同输入多次运行结果不同)、质量主观(没有唯一正确答案)、维度复杂(准确、相关、有帮助是三件不同的事)。四种评测方法各有代价,没有万能方案。本文建立评测的认知框架,为后续系列打基础。

·约 6 分钟阅读
AI 评测LLM-as-Judge偏见

AI 评测系列(03):LLM-as-Judge——让 LLM 评价 LLM 的正确姿势

用真实实验量化三种 LLM-as-Judge 偏见。位置偏见:第一位置胜率 67%,远高于 50% 基线,同一对答案换顺序有 33% 概率得到相反判断。冗长偏见:相同内容的啰嗦版比简洁版多得 0.5 分。框架偏见:严格专家 prompt 与标准 prompt 得分无差异,说明 glm-4-flash 对 prompt 强度不敏感。三种缓解方案及适用场景。

·约 7 分钟阅读
Skill指标体系监控

Skill 系列(04):Skill 指标体系——L1/L2/L3 三层监控,让质量下降有据可查

对 rnd-technical-writer 跑 6 次调用,采集真实 L3 数据(时延、Token),L2 格式检查 + LLM-as-Judge 质量评分,加入模拟 L1 用户反馈,输出完整健康看板。3 条告警真实触发:P90 时延 50.6s(阈值 30s)、格式合规率 66.7%(阈值 95%)、用户评分 3.5/5(阈值 4.0)。

·约 7 分钟阅读
Skill评测体系LLM-as-Judge

Skill 系列(01):Skill 评测体系——如何量化一个 AI Skill 的质量

用 20 个测试用例跑 Trigger 评测(F1=0.96),再用 LLM-as-Judge 对两个任务打分,最后做 A/B Prompt 对比。数据揭示三个工程发现:1个 FP 暴露 Skill 描述的边界模糊、中文字数检查的隐蔽 Bug、LLM 评委在细粒度差异上的局限。

·约 7 分钟阅读