BLOG

知识分享

技术文章、实战教程、经验心得

共找到 533 篇文章 · 第 1 页/45
LLM自动化测试Midscene

LLM 自动化测试系列(04):Web UI 自动化——Midscene 的视觉驱动脚本化

字节跳动开源的 Midscene 走的是纯视觉定位路线:不写 selector,直接把截图交给视觉模型,用自然语言描述'点击提交按钮'。这篇拆解它的三种模型角色分工(Default/Planning/Insight)、aiAct 的重规划循环、规划缓存与定位缓存各自的失效判定逻辑,以及跟 Stagehand 这类基于 DOM/无障碍树的方案比,鲁棒性和成本的权衡到底在哪。

·约 15 分钟阅读
LLM自动化测试单元测试

LLM 自动化测试系列(03):单元测试生成——TestGen-LLM 与 Qodo Cover

让 LLM '随便写点测试',产出的往往是编译不过、断言写死 true、或者根本不提升覆盖率的垃圾测试。Meta 的 TestGen-LLM 论文给出的解法不是让模型变聪明,而是用一套机械化的过滤器把不合格的产出全部筛掉。这篇拆解这套过滤器的具体设计,以及它的开源实现 Qodo Cover 怎么把这套思路落地成可跑的 CLI 工具。

·约 10 分钟阅读
LLM自动化测试GUI Agent

LLM 自动化测试系列(02):统一技术底座——视觉定位 / DOM 语义化 / Computer Use

同一个'找到提交按钮'的任务,不同的开源项目给出了三种完全不同的技术路线:专用视觉定位模型、DOM/无障碍树结构化理解、纯坐标点击的 Computer Use。这篇建立全系列复用的概念词汇表,讲清楚三条路线各自的原理、取舍,以及 ScreenSpot / ScreenSpot-Pro / OSWorld 这些 benchmark 到底在测什么。

·约 10 分钟阅读
LLM自动化测试Agent

LLM 自动化测试系列(01):为什么测试是 LLM 落地的新战场

传统自动化测试有三个老问题:脆弱定位、oracle 问题、维护成本,而且这三者会互相加剧。这篇是系列开篇,讲清楚这三个问题的本质,以及为什么测试恰好是 LLM Agent 落地里少见的'有明确对错标准'的场景。后续 13 篇会逐一拆解代表性开源项目的具体解法。

·约 7 分钟阅读
开源项目TeamAI-CLI腾讯

一天一个开源项目(第223篇):TeamAI-CLI —— 腾讯开源的团队级 AI Agent 中间层,让每个人的 AI 能力变成团队共享能力

TeamAI-CLI 是腾讯开源的团队协作中间层工具,不是又一个 AI 编程助手,而是让 Claude Code、Codex、Cursor 等已安装的 AI 工具共享技能、规则、知识库的元管理系统。通过 push/pull 流程同步团队规范,配合代码知识图谱和"摩擦度"驱动的经验沉淀机制,把个人的 AI 使用经验转化为团队共享资产。4.8k Stars,MIT 协议。

·约 11 分钟阅读
开源项目ARTEMISGoogle

一天一个开源项目(第224篇):ARTEMIS —— 谷歌开源的移动端 AI 自动化框架,让 AI 助手像人一样操作手机

ARTEMIS 是 Google 开源的 Android 自动化框架,把自然语言指令转化为可靠的移动端自动化操作。提供 Flash(快速反应式)和 Pro(多智能体规划验证)两种执行模式,通过 MCP 协议与 Claude Code、Antigravity、Codex 等 AI IDE 原生集成,在 AndroidWorld 基准测试中达到 99%+ 任务完成率。8.1k Stars,Apache-2.0。

·约 12 分钟阅读
开源项目NanoJevLLM

一天一个开源项目(第225篇):NanoJev —— 一个 0.6B 的并行决策模型,让 LLM 直接输出概率分布而不是生成 Token

NanoJev 是 Jev 并行决策模型系统的轻量复刻版,基于 Qwen3-0.6B 骨干网络附加决策头,输入状态和问题,直接输出完整概率分布,零输出 Token 解码。支持动态选择、布尔判断、有序评分三种决策类型,在迷宫导航和 Snake 游戏基准上验证了效果。954 Stars,MIT 协议。

·约 11 分钟阅读
开源项目AIO Sandboxagent-infra

一天一个开源项目(第226篇):AIO Sandbox —— 把浏览器、Shell、文件、MCP、VSCode 塞进同一个容器的 Agent 沙箱

AIO Sandbox(agent-infra/sandbox)是一个"全能型" AI Agent 沙箱环境,用一个 Docker 容器统一了浏览器自动化、Shell 终端、文件操作、MCP 服务和 VSCode Server,核心是一套跨工具共享的统一文件系统。提供 Python/TypeScript/Go 官方 SDK,内置四组开箱即用的 MCP Server,并已验证与 Browser Use、LangChain、OpenAI Assistants 等框架的集成。6.0k Stars,Apache-2.0 协议。

·约 11 分钟阅读
open-sourcesecurityskill

开源项目第222期:security-audit — Cloudflare 的安全审计 Skill,把 Coding Agent 变成六阶段安全审计器,13k Stars

Cloudflare 出品的 coding-agent skill,把编程 Agent 变成安全审计器。六阶段流程:侦察、覆盖率导向的漏洞狩猎、候选独立验证、结构化输出、记录独立核实、目标中立报告。核心设计:对抗性验证(检查者≠发现者)、机器可读的 findings.json + 零依赖校验器、多轮运行覆盖率递增。JavaScript,MIT,13k Stars。

·约 9 分钟阅读
开源项目Coder云开发环境

一天一个开源项目(第221篇):Coder —— 自托管云开发环境,也是给 AI Agent 一间安全的工作室

Coder 是自托管的云开发环境平台,用 Terraform 定义工作区,支持 AWS/Kubernetes/Docker 等后端,把开发者上手时间从数天缩短到数秒。近年新增 AI Agent 委托能力——Agent 循环运行在控制平面而非工作区内,配合 AI Gateway 实现集中化模型治理、成本追踪和审计。14.9k Stars,AGPL-3.0。

·约 11 分钟阅读
开源项目WeKnora腾讯

一天一个开源项目(第220篇):WeKnora —— 腾讯开源的企业级知识框架,从 RAG 问答到 Wiki 自进化

WeKnora 是腾讯开源的 LLM 知识框架,融合 RAG 快速问答、ReAct 智能体多步推理和 Wiki 模式自动生成互联知识库三大能力,支持 20+ LLM 提供商、10+ 文档格式、企业级多工作区 RBAC,是微信对话开放平台的核心技术底座。25.4k Stars,MIT 协议。

·约 11 分钟阅读
开源项目开发者工具免费服务

一天一个开源项目(第217篇):free-for-dev —— 137k Star 的开发者免费服务终极宝库

free-for-dev 是 GitHub 上排名最靠前的资源类仓库之一,收录了 60+ 大类、数百项提供真正免费层级的 SaaS/PaaS/IaaS 服务,从主流云平台到 CI/CD、数据库、AI 工具、认证服务一网打尽。137k Stars,由 1600+ 贡献者持续维护,是每个开发者都该收藏的"白嫖手册"。

·约 11 分钟阅读