BLOG

知识分享

技术文章、实战教程、经验心得

共找到 539 篇文章 · 第 1 页/45
LLMAutomated TestingSelf-Healing

LLM 驱动的自动化测试系列(10):自愈定位——当启发式打分撞上语义理解的天花板

Healenium 是自愈定位领域最老牌的开源项目,README 宣称'leverages machine learning',但直接读代码发现核心机制是一套基于 DOM 树相似度的加权打分公式,权重和阈值都是硬编码常量,跟机器学习没有关系;更值得注意的是它 2026 年新增了一个 AI 生成 XPath 的接口,但代码里直接写着'必须是付费的 hlm-ai 服务'。这篇先拆穿 Healenium 的打分公式到底怎么算,再看 MarketSquare/robotframework-selfhealing-agents 这个真正基于 LLM 的自愈项目怎么设计多智能体架构,最后回答规划里提的问题:自愈成功率和误判率的权衡,到底卡在哪。

·约 14 分钟阅读
LLMAutomated TestingMetaGPT

LLM 驱动的自动化测试系列(09):移动端自动化(五)——当通用 Agent 框架下沉到测试场景

MetaGPT 是一个'多智能体软件公司'框架,主打需求分析、代码生成这类通用软件工程场景,但它内置了一个 Android 测试 demo。直接读代码会发现规划文档里的一个预设是错的:这个 demo 没有复用 MetaGPT 通常宣传的产品经理/工程师/QA 角色分工,而是只有一个自定义 Role,复用的是 Team/Environment/Role/Action 这套更底层的调度骨架;更关键的是,README 里明确写着它'借鉴了 AppAgent 的思路和代码'——这篇拆解这个通用框架到底继承了 AppAgent 的哪些设计、复用通用骨架换来了什么、又付出了什么代价。

·约 16 分钟阅读
LLMAutomated TestingAppAgent

LLM 驱动的自动化测试系列(08):移动端自动化(四)——AppAgent:解析树与视觉特征的结合

AppAgent 是腾讯开源的 CHI 2025 论文项目,跟前几篇纯视觉(ARTEMIS/Mobilerun)或纯坐标(Mobile-Agent-v3)的方案不同:它用无障碍树给截图上的元素画数字标签,模型只需要挑一个数字——'解析树'和'视觉'其实不是两个独立感知通道,而是结构信息负责标注位置,视觉模型负责决策。这篇拆解它自主探索阶段怎么靠反思四分类(BACK/INEFFECTIVE/CONTINUE/SUCCESS)自己攒文档,网格兜底机制在解析树失效时怎么退化,也如实指出网格兜底路径里一个真实存在的坐标换算 bug。

·约 19 分钟阅读
LLMAutomated TestingMobile-Agent-v3

LLM 驱动的自动化测试系列(07):移动端自动化(三)——Mobile-Agent-v3 与自研 GUI-Owl 模型路线

Mobile-Agent-v3 是阿里通义实验室(Tongyi Lab)基于自研 GUI-Owl 模型打造的多智能体框架,跟前两篇依赖通用 VLM(Gemini/GPT/Claude)做感知的 ARTEMIS、Mobilerun 走的是完全不同的路:自己训练一个专门做 GUI grounding 的模型,让它输出'绝对像素坐标'而不用再猜。这篇拆解它 Manager/Executor/ActionReflector/Notetaker 四角色的具体分工、'连续两次失败才升级给 Manager'的容错阈值设计,也如实指出代码里一个真实存在的 HarmonyOS 输入 bug。

·约 20 分钟阅读
LLMAutomated TestingDroidRun

LLM 驱动的自动化测试系列(06):移动端自动化(二)——DroidRun/Mobilerun 的角色级模型拆分

DroidRun(现更名为 Mobilerun)用统一的设备驱动抽象把 Android 和 iOS 塞进同一套工具接口,但它跟上一篇的 ARTEMIS 走的是完全不同的路:不是'任务级'选择 Flash 还是 Pro,而是'角色级'——Manager、Executor、FastAgent 三个角色分别配模型、配温度。这篇拆解它的多智能体工作流、Portal 无障碍服务、App Card 机制,也如实指出它那块'91.4%'的 benchmark 徽章在仓库里其实找不到任何本地可考证的说明。

·约 21 分钟阅读
LLM自动化测试ARTEMIS

LLM 自动化测试系列(05):移动端自动化(一)——ARTEMIS 的双模式架构拆解

Google 开源的 ARTEMIS 让 AI 助手和测试套件像人一样操作真机。这篇先讲清楚它是什么、特色在哪,再深挖 Flash/Pro 双模式的图结构、'verify vs assert'的语法级区分、两层预执行安全网,以及最容易被忽略的一点——它给'元素定位'单独配了一个 Google 自研的具身推理模型 Gemini Robotics-ER,而不是让通用 VLM 顺手做定位。这些技术点跟它宣称的 AndroidWorld 99%+ 到底是什么因果关系,这篇尽量说清楚。

·约 24 分钟阅读
LLM自动化测试Midscene

LLM 自动化测试系列(04):Web UI 自动化——Midscene 的视觉驱动脚本化

字节跳动开源的 Midscene 走的是纯视觉定位路线:不写 selector,直接把截图交给视觉模型,用自然语言描述'点击提交按钮'。这篇拆解它的三种模型角色分工(Default/Planning/Insight)、aiAct 的重规划循环、规划缓存与定位缓存各自的失效判定逻辑,以及跟 Stagehand 这类基于 DOM/无障碍树的方案比,鲁棒性和成本的权衡到底在哪。

·约 15 分钟阅读
LLM自动化测试单元测试

LLM 自动化测试系列(03):单元测试生成——TestGen-LLM 与 Qodo Cover

让 LLM '随便写点测试',产出的往往是编译不过、断言写死 true、或者根本不提升覆盖率的垃圾测试。Meta 的 TestGen-LLM 论文给出的解法不是让模型变聪明,而是用一套机械化的过滤器把不合格的产出全部筛掉。这篇拆解这套过滤器的具体设计,以及它的开源实现 Qodo Cover 怎么把这套思路落地成可跑的 CLI 工具。

·约 10 分钟阅读
LLM自动化测试GUI Agent

LLM 自动化测试系列(02):统一技术底座——视觉定位 / DOM 语义化 / Computer Use

同一个'找到提交按钮'的任务,不同的开源项目给出了三种完全不同的技术路线:专用视觉定位模型、DOM/无障碍树结构化理解、纯坐标点击的 Computer Use。这篇建立全系列复用的概念词汇表,讲清楚三条路线各自的原理、取舍,以及 ScreenSpot / ScreenSpot-Pro / OSWorld 这些 benchmark 到底在测什么。

·约 10 分钟阅读
LLM自动化测试Agent

LLM 自动化测试系列(01):为什么测试是 LLM 落地的新战场

传统自动化测试有三个老问题:脆弱定位、oracle 问题、维护成本,而且这三者会互相加剧。这篇是系列开篇,讲清楚这三个问题的本质,以及为什么测试恰好是 LLM Agent 落地里少见的'有明确对错标准'的场景。后续 13 篇会逐一拆解代表性开源项目的具体解法。

·约 7 分钟阅读
开源项目TeamAI-CLI腾讯

一天一个开源项目(第223篇):TeamAI-CLI —— 腾讯开源的团队级 AI Agent 中间层,让每个人的 AI 能力变成团队共享能力

TeamAI-CLI 是腾讯开源的团队协作中间层工具,不是又一个 AI 编程助手,而是让 Claude Code、Codex、Cursor 等已安装的 AI 工具共享技能、规则、知识库的元管理系统。通过 push/pull 流程同步团队规范,配合代码知识图谱和"摩擦度"驱动的经验沉淀机制,把个人的 AI 使用经验转化为团队共享资产。4.8k Stars,MIT 协议。

·约 11 分钟阅读
开源项目ARTEMISGoogle

一天一个开源项目(第224篇):ARTEMIS —— 谷歌开源的移动端 AI 自动化框架,让 AI 助手像人一样操作手机

ARTEMIS 是 Google 开源的 Android 自动化框架,把自然语言指令转化为可靠的移动端自动化操作。提供 Flash(快速反应式)和 Pro(多智能体规划验证)两种执行模式,通过 MCP 协议与 Claude Code、Antigravity、Codex 等 AI IDE 原生集成,在 AndroidWorld 基准测试中达到 99%+ 任务完成率。8.1k Stars,Apache-2.0。

·约 12 分钟阅读