🎉 PrimeSkills 已上线访问产品
一人企业 · 独立创作者

Hi,我是陈东棋
在这里构建有趣的东西

10年车载系统老兵,AI 应用探索者,独立开发者。 分享车机开发、AI 工程化、团队管理的实战经验, 也在这里孵化一些小而美的产品。

CarOSAI/LLMIndie Hacker
BLOG

最新文章

技术文章、实战教程、经验心得,覆盖车机开发、AI 应用、团队管理等领域

LLM自动化测试Midscene

LLM 自动化测试系列(04):Web UI 自动化——Midscene 的视觉驱动脚本化

字节跳动开源的 Midscene 走的是纯视觉定位路线:不写 selector,直接把截图交给视觉模型,用自然语言描述'点击提交按钮'。这篇拆解它的三种模型角色分工(Default/Planning/Insight)、aiAct 的重规划循环、规划缓存与定位缓存各自的失效判定逻辑,以及跟 Stagehand 这类基于 DOM/无障碍树的方案比,鲁棒性和成本的权衡到底在哪。

·15 min
LLM自动化测试单元测试

LLM 自动化测试系列(03):单元测试生成——TestGen-LLM 与 Qodo Cover

让 LLM '随便写点测试',产出的往往是编译不过、断言写死 true、或者根本不提升覆盖率的垃圾测试。Meta 的 TestGen-LLM 论文给出的解法不是让模型变聪明,而是用一套机械化的过滤器把不合格的产出全部筛掉。这篇拆解这套过滤器的具体设计,以及它的开源实现 Qodo Cover 怎么把这套思路落地成可跑的 CLI 工具。

·10 min
LLM自动化测试GUI Agent

LLM 自动化测试系列(02):统一技术底座——视觉定位 / DOM 语义化 / Computer Use

同一个'找到提交按钮'的任务,不同的开源项目给出了三种完全不同的技术路线:专用视觉定位模型、DOM/无障碍树结构化理解、纯坐标点击的 Computer Use。这篇建立全系列复用的概念词汇表,讲清楚三条路线各自的原理、取舍,以及 ScreenSpot / ScreenSpot-Pro / OSWorld 这些 benchmark 到底在测什么。

·10 min
LLM自动化测试Agent

LLM 自动化测试系列(01):为什么测试是 LLM 落地的新战场

传统自动化测试有三个老问题:脆弱定位、oracle 问题、维护成本,而且这三者会互相加剧。这篇是系列开篇,讲清楚这三个问题的本质,以及为什么测试恰好是 LLM Agent 落地里少见的'有明确对错标准'的场景。后续 13 篇会逐一拆解代表性开源项目的具体解法。

·7 min
开源项目TeamAI-CLI腾讯

一天一个开源项目(第223篇):TeamAI-CLI —— 腾讯开源的团队级 AI Agent 中间层,让每个人的 AI 能力变成团队共享能力

TeamAI-CLI 是腾讯开源的团队协作中间层工具,不是又一个 AI 编程助手,而是让 Claude Code、Codex、Cursor 等已安装的 AI 工具共享技能、规则、知识库的元管理系统。通过 push/pull 流程同步团队规范,配合代码知识图谱和"摩擦度"驱动的经验沉淀机制,把个人的 AI 使用经验转化为团队共享资产。4.8k Stars,MIT 协议。

·11 min
开源项目ARTEMISGoogle

一天一个开源项目(第224篇):ARTEMIS —— 谷歌开源的移动端 AI 自动化框架,让 AI 助手像人一样操作手机

ARTEMIS 是 Google 开源的 Android 自动化框架,把自然语言指令转化为可靠的移动端自动化操作。提供 Flash(快速反应式)和 Pro(多智能体规划验证)两种执行模式,通过 MCP 协议与 Claude Code、Antigravity、Codex 等 AI IDE 原生集成,在 AndroidWorld 基准测试中达到 99%+ 任务完成率。8.1k Stars,Apache-2.0。

·12 min
PRODUCTS

我造的东西

独立开发的产品,从想法到上线全程自己搞定

PODCAST

听我聊聊

在播客中分享科技见解、生活思考

CONNECT

找到我

在各个平台关注我,获取最新动态

✉️

订阅 Newsletter

每周精选内容直达邮箱,包括技术干货、产品更新、行业洞察。不 spam,随时退订。

我们仅收集您的邮箱地址用于发送 Newsletter,不会与第三方共享。您可以随时退订。

已有 1,024 位订阅者 · 隐私优先,绝不泄露