LLM自动化测试Midscene
LLM 自动化测试系列(04):Web UI 自动化——Midscene 的视觉驱动脚本化
字节跳动开源的 Midscene 走的是纯视觉定位路线:不写 selector,直接把截图交给视觉模型,用自然语言描述'点击提交按钮'。这篇拆解它的三种模型角色分工(Default/Planning/Insight)、aiAct 的重规划循环、规划缓存与定位缓存各自的失效判定逻辑,以及跟 Stagehand 这类基于 DOM/无障碍树的方案比,鲁棒性和成本的权衡到底在哪。
·约 15 分钟阅读