<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>冬奇实验室 | Wonder Lab</title>
    <link>https://home.wonlab.top</link>
    <description>探索AI应用、Android车机、工程实践的技术博客</description>
    <language>zh-CN</language>
    <atom:link href="https://home.wonlab.top/rss.xml" rel="self" type="application/rss+xml"/>
    
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（14）：落地与工程化——为什么测试场景的 Token 账单,反而是这个系列里最便宜的]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-14-production-engineering</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-14-production-engineering</guid>
      <pubDate>Sat, 21 Nov 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[同一个作者的企业级 Bug 修复流程,调试阶段烧掉了数千美金 Token；这个系列里验证过的测试场景——AutoRestTest 测一个 15 个接口的 API 只要一毛钱,pytest-triage 默认每次运行最多花 10 次模型调用——差了几个数量级。这篇把 13 篇文章积累的证据摆在一起,回答规划里剩下的三个问题：测试场景的成本量级为什么比代码生成低,人工确认门该放在流程的哪个节点,以及到底有哪些场景明确不该用 LLM。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（13）：Flaky Test 不是重跑几次就能解决的分类问题]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-13-flaky-test-triage</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-13-flaky-test-triage</guid>
      <pubDate>Sat, 14 Nov 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[477 star 的 pytest-rerunfailures 和 397 star 的 flaky，处理不稳定测试的手段永远是同一句话：失败了就重跑几次。这解决不了规划里提出的问题——一次失败到底是真 bug、环境抖动，还是测试本身写得有问题。真正尝试用 LLM 做这个根因分类的，是一个只有 2 star、上线不到两个月的项目 pytest-triage，而它最值得学习的地方，反而是它给 AI 判断加的四条安全约束——AI 从头到尾不允许影响测试的通过/失败结果。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（12）：像素 diff 之外，谁真的在让 LLM「看懂」UI 变化]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-12-visual-regression</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-12-visual-regression</guid>
      <pubDate>Sat, 07 Nov 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[7.2k star 的 BackstopJS 处理噪声的全部手段就是四个数字配置项：misMatchThreshold、requireSameDimensions、ignoreAntialiasing、usePreciseMatching——本质上还是在跟字体渲染抖动死磕像素级容差。真正把 VLM/LLM 接进视觉回归判断链路的，是一个只有 23 star 的项目 vlmkit，而且它自己的内部评测数据直接写着某个模型会把红改成红——把这两个项目摆在一起，视觉语义回归到底解决了什么、又引入了什么新问题，答案比想象中更具体。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（11）：API 测试为什么反而是 LLM 最保守的战场]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-11-api-testing</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-11-api-testing</guid>
      <pubDate>Sat, 31 Oct 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[18.5k star 的 Keploy 首页写着'Expand API Coverage using AI'，但把整个开源 Go 代码库翻遍，找不到一行调用大模型的代码——那个 AI 功能只存在于闭源的云端 SaaS。3.6k star 的 Schemathesis 则完全不用 LLM，靠 Hypothesis 这套纯粹的基于属性测试（property-based testing）的模糊测试引擎就能找到真实的服务端 500 错误。反倒是两个不到 100 star 的小项目——AutoRestTest 和 api-automation-agent——才是真正调用大模型 API 的实现。这篇要说清楚：结构化的 API 输入输出天然更适合传统 fuzzing，那 LLM 到底能在这个赛道里做什么传统工具做不到的事，为什么它目前只敢做，不敢像 UI 自动化那样 all-in。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（10）：自愈定位——当启发式打分撞上语义理解的天花板]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-10-self-healing-locators</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-10-self-healing-locators</guid>
      <pubDate>Sat, 24 Oct 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[Healenium 是自愈定位领域最老牌的开源项目，README 宣称'leverages machine learning'，但直接读代码发现核心机制是一套基于 DOM 树相似度的加权打分公式，权重和阈值都是硬编码常量，跟机器学习没有关系；更值得注意的是它 2026 年新增了一个 AI 生成 XPath 的接口，但代码里直接写着'必须是付费的 hlm-ai 服务'。这篇先拆穿 Healenium 的打分公式到底怎么算，再看 MarketSquare/robotframework-selfhealing-agents 这个真正基于 LLM 的自愈项目怎么设计多智能体架构，最后回答规划里提的问题：自愈成功率和误判率的权衡，到底卡在哪。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（09）：移动端自动化（五）——当通用 Agent 框架下沉到测试场景]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-09-mobile-metagpt</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-09-mobile-metagpt</guid>
      <pubDate>Sat, 17 Oct 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[MetaGPT 是一个'多智能体软件公司'框架，主打需求分析、代码生成这类通用软件工程场景，但它内置了一个 Android 测试 demo。直接读代码会发现规划文档里的一个预设是错的：这个 demo 没有复用 MetaGPT 通常宣传的产品经理/工程师/QA 角色分工，而是只有一个自定义 Role，复用的是 Team/Environment/Role/Action 这套更底层的调度骨架；更关键的是，README 里明确写着它'借鉴了 AppAgent 的思路和代码'——这篇拆解这个通用框架到底继承了 AppAgent 的哪些设计、复用通用骨架换来了什么、又付出了什么代价。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（08）：移动端自动化（四）——AppAgent：解析树与视觉特征的结合]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-08-mobile-appagent</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-08-mobile-appagent</guid>
      <pubDate>Sat, 10 Oct 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[AppAgent 是腾讯开源的 CHI 2025 论文项目，跟前几篇纯视觉（ARTEMIS/Mobilerun）或纯坐标（Mobile-Agent-v3）的方案不同：它用无障碍树给截图上的元素画数字标签，模型只需要挑一个数字——'解析树'和'视觉'其实不是两个独立感知通道，而是结构信息负责标注位置，视觉模型负责决策。这篇拆解它自主探索阶段怎么靠反思四分类（BACK/INEFFECTIVE/CONTINUE/SUCCESS）自己攒文档，网格兜底机制在解析树失效时怎么退化，也如实指出网格兜底路径里一个真实存在的坐标换算 bug。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（07）：移动端自动化（三）——Mobile-Agent-v3 与自研 GUI-Owl 模型路线]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-07-mobile-agent-v3</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-07-mobile-agent-v3</guid>
      <pubDate>Sat, 03 Oct 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[Mobile-Agent-v3 是阿里通义实验室（Tongyi Lab）基于自研 GUI-Owl 模型打造的多智能体框架，跟前两篇依赖通用 VLM（Gemini/GPT/Claude）做感知的 ARTEMIS、Mobilerun 走的是完全不同的路：自己训练一个专门做 GUI grounding 的模型，让它输出'绝对像素坐标'而不用再猜。这篇拆解它 Manager/Executor/ActionReflector/Notetaker 四角色的具体分工、'连续两次失败才升级给 Manager'的容错阈值设计，也如实指出代码里一个真实存在的 HarmonyOS 输入 bug。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 驱动的自动化测试系列（06）：移动端自动化（二）——DroidRun/Mobilerun 的角色级模型拆分]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-06-mobile-mobilerun</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-06-mobile-mobilerun</guid>
      <pubDate>Sat, 26 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[DroidRun（现更名为 Mobilerun）用统一的设备驱动抽象把 Android 和 iOS 塞进同一套工具接口，但它跟上一篇的 ARTEMIS 走的是完全不同的路：不是'任务级'选择 Flash 还是 Pro，而是'角色级'——Manager、Executor、FastAgent 三个角色分别配模型、配温度。这篇拆解它的多智能体工作流、Portal 无障碍服务、App Card 机制，也如实指出它那块'91.4%'的 benchmark 徽章在仓库里其实找不到任何本地可考证的说明。]]></description>
    </item>
    <item>
      <title><![CDATA[一天一个开源项目（第228篇）：AX —— Google 开源的「Kubernetes for Agents」，用声明式 YAML 编排十亿级 Agent 任务]]></title>
      <link>https://home.wonlab.top/blog/open-source-projects/228-google-ax</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/open-source-projects/228-google-ax</guid>
      <pubDate>Sat, 26 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[AX（google/ax）是 Google 开源的高吞吐声明式 Agent 编排运行时，目标是在单个集群里调度十亿级的自主 Agent 工作负载。它借鉴 Kubernetes 的心智模型，用 Task、Workspace、Model 三个核心原语描述 Agent 任务，底层跑在 Agent Substrate 沙箱之上，提供 kubectl 风格的 CLI（apply/get/watch/ssh/suspend/resume）。11,600+ Stars，Apache-2.0 协议，仍处于 Alpha 阶段。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 自动化测试系列（05）：移动端自动化（一）——ARTEMIS 的双模式架构拆解]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-05-mobile-artemis</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-05-mobile-artemis</guid>
      <pubDate>Fri, 25 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[Google 开源的 ARTEMIS 让 AI 助手和测试套件像人一样操作真机。这篇先讲清楚它是什么、特色在哪，再深挖 Flash/Pro 双模式的图结构、'verify vs assert'的语法级区分、两层预执行安全网，以及最容易被忽略的一点——它给'元素定位'单独配了一个 Google 自研的具身推理模型 Gemini Robotics-ER，而不是让通用 VLM 顺手做定位。这些技术点跟它宣称的 AndroidWorld 99%+ 到底是什么因果关系，这篇尽量说清楚。]]></description>
    </item>
    <item>
      <title><![CDATA[一天一个开源项目（第227篇）：Strands Agents Harness SDK —— 从「手写 Agent 循环」到「一行代码拿到生产级 Agent」]]></title>
      <link>https://home.wonlab.top/blog/open-source-projects/227-harness-sdk</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/open-source-projects/227-harness-sdk</guid>
      <pubDate>Fri, 25 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[Strands Agents（strands-agents/harness-sdk）是 AWS 团队开源的 Agent 开发 SDK，提供 Python/TypeScript 双语言实现。核心亮点是 Strands Harness——一个通过 create_harness() 单次调用即可组装出的"全副武装"生产级 Agent，内置上下文管理、会话持久化、长期记忆、技能加载与多模型支持，且返回的仍是一个完全可定制的原生 Agent 对象。8,300+ Stars，Apache-2.0 协议。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 自动化测试系列（04）：Web UI 自动化——Midscene 的视觉驱动脚本化]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-04-web-ui-midscene</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-04-web-ui-midscene</guid>
      <pubDate>Thu, 24 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[字节跳动开源的 Midscene 走的是纯视觉定位路线：不写 selector，直接把截图交给视觉模型，用自然语言描述'点击提交按钮'。这篇拆解它的三种模型角色分工（Default/Planning/Insight）、aiAct 的重规划循环、规划缓存与定位缓存各自的失效判定逻辑，以及跟 Stagehand 这类基于 DOM/无障碍树的方案比，鲁棒性和成本的权衡到底在哪。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 自动化测试系列（03）：单元测试生成——TestGen-LLM 与 Qodo Cover]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-03-unit-test-generation</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-03-unit-test-generation</guid>
      <pubDate>Wed, 23 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[让 LLM '随便写点测试'，产出的往往是编译不过、断言写死 true、或者根本不提升覆盖率的垃圾测试。Meta 的 TestGen-LLM 论文给出的解法不是让模型变聪明，而是用一套机械化的过滤器把不合格的产出全部筛掉。这篇拆解这套过滤器的具体设计，以及它的开源实现 Qodo Cover 怎么把这套思路落地成可跑的 CLI 工具。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 自动化测试系列（02）：统一技术底座——视觉定位 / DOM 语义化 / Computer Use]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-02-technical-foundation</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-02-technical-foundation</guid>
      <pubDate>Tue, 22 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[同一个'找到提交按钮'的任务，不同的开源项目给出了三种完全不同的技术路线：专用视觉定位模型、DOM/无障碍树结构化理解、纯坐标点击的 Computer Use。这篇建立全系列复用的概念词汇表，讲清楚三条路线各自的原理、取舍，以及 ScreenSpot / ScreenSpot-Pro / OSWorld 这些 benchmark 到底在测什么。]]></description>
    </item>
    <item>
      <title><![CDATA[LLM 自动化测试系列（01）：为什么测试是 LLM 落地的新战场]]></title>
      <link>https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-01-why-battlefield</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/llm-practice/llm-autotest/llm-autotest-series-01-why-battlefield</guid>
      <pubDate>Mon, 21 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[传统自动化测试有三个老问题：脆弱定位、oracle 问题、维护成本，而且这三者会互相加剧。这篇是系列开篇，讲清楚这三个问题的本质，以及为什么测试恰好是 LLM Agent 落地里少见的'有明确对错标准'的场景。后续 13 篇会逐一拆解代表性开源项目的具体解法。]]></description>
    </item>
    <item>
      <title><![CDATA[一天一个开源项目（第223篇）：TeamAI-CLI —— 腾讯开源的团队级 AI Agent 中间层，让每个人的 AI 能力变成团队共享能力]]></title>
      <link>https://home.wonlab.top/blog/open-source-projects/223-teamai-cli</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/open-source-projects/223-teamai-cli</guid>
      <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[TeamAI-CLI 是腾讯开源的团队协作中间层工具，不是又一个 AI 编程助手，而是让 Claude Code、Codex、Cursor 等已安装的 AI 工具共享技能、规则、知识库的元管理系统。通过 push/pull 流程同步团队规范，配合代码知识图谱和"摩擦度"驱动的经验沉淀机制，把个人的 AI 使用经验转化为团队共享资产。4.8k Stars，MIT 协议。]]></description>
    </item>
    <item>
      <title><![CDATA[一天一个开源项目（第224篇）：ARTEMIS —— 谷歌开源的移动端 AI 自动化框架，让 AI 助手像人一样操作手机]]></title>
      <link>https://home.wonlab.top/blog/open-source-projects/224-artemis</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/open-source-projects/224-artemis</guid>
      <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[ARTEMIS 是 Google 开源的 Android 自动化框架，把自然语言指令转化为可靠的移动端自动化操作。提供 Flash（快速反应式）和 Pro（多智能体规划验证）两种执行模式，通过 MCP 协议与 Claude Code、Antigravity、Codex 等 AI IDE 原生集成，在 AndroidWorld 基准测试中达到 99%+ 任务完成率。8.1k Stars，Apache-2.0。]]></description>
    </item>
    <item>
      <title><![CDATA[一天一个开源项目（第225篇）：NanoJev —— 一个 0.6B 的并行决策模型，让 LLM 直接输出概率分布而不是生成 Token]]></title>
      <link>https://home.wonlab.top/blog/open-source-projects/225-nanojev</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/open-source-projects/225-nanojev</guid>
      <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[NanoJev 是 Jev 并行决策模型系统的轻量复刻版，基于 Qwen3-0.6B 骨干网络附加决策头，输入状态和问题，直接输出完整概率分布，零输出 Token 解码。支持动态选择、布尔判断、有序评分三种决策类型，在迷宫导航和 Snake 游戏基准上验证了效果。954 Stars，MIT 协议。]]></description>
    </item>
    <item>
      <title><![CDATA[一天一个开源项目（第226篇）：AIO Sandbox —— 把浏览器、Shell、文件、MCP、VSCode 塞进同一个容器的 Agent 沙箱]]></title>
      <link>https://home.wonlab.top/blog/open-source-projects/226-aio-sandbox</link>
      <guid isPermaLink="true">https://home.wonlab.top/blog/open-source-projects/226-aio-sandbox</guid>
      <pubDate>Sun, 20 Sep 2026 00:00:00 GMT</pubDate>
      <description><![CDATA[AIO Sandbox（agent-infra/sandbox）是一个"全能型" AI Agent 沙箱环境，用一个 Docker 容器统一了浏览器自动化、Shell 终端、文件操作、MCP 服务和 VSCode Server，核心是一套跨工具共享的统一文件系统。提供 Python/TypeScript/Go 官方 SDK，内置四组开箱即用的 MCP Server，并已验证与 Browser Use、LangChain、OpenAI Assistants 等框架的集成。6.0k Stars，Apache-2.0 协议。]]></description>
    </item>
  </channel>
</rss>