BLOG

知识分享

技术文章、实战教程、经验心得

共找到 24 篇文章 · 第 1 页/2
WorkflowLangGraphTemporal

Workflow 系列(09):主流框架对比——Prompt-based、LangGraph、Temporal、n8n 如何选

四种工作流方案的本质差异:Prompt-based(Markdown + JSON 状态文件)、LangGraph(Python 图结构状态机)、Temporal(企业级 Durable Execution)、n8n(可视化低代码)。不是哪个更好,而是不同场景下的最优解不同。LangGraph 的 State/Node/Edge 概念与 Prompt-based 方案一一对应。

·约 8 分钟阅读
Skill工作流LangGraph

Skill 系列(05):Skill 工作流串联——4 种模式实测,并发加速 1.5x

实现并测量 4 种 Skill 串联模式:顺序链(35.1s)、并发 fan-out(加速 1.5x,不是理论的 3x)、条件路由(3/3 正确分类)、反馈循环(首轮得 8/10 直接通过)。并发加速比低于预期的原因是 Amdahl 定律——顺序的 merge 步骤限制了整体加速效果。

·约 7 分钟阅读
AgentContext EngineeringLangGraph

Agent 系列(22):Context Engineering 深度——三种上下文管理策略的量化对比

用 30 轮合成对话 + 4 个早期决策召回测试,量化对比三种上下文管理策略:Naive(全量历史)/ Sliding Window(截断)/ Rolling Summary(滚动摘要)。数据揭示三个反直觉发现:截断的代价远超预期、摘要偶尔比原始更准、压缩损失是真实 bug 而非统计误差。

·约 8 分钟阅读
AgentWeb AgentLangGraph

Agent 系列(23):Web Agent——让 Agent 真正浏览网页

从零搭建一个能真正浏览网页的 Web Agent:DuckDuckGo 搜索 + 页面抓取 + LangGraph 执行图。重点讲三个工程 Guard:Token Budget 截断、Step Limit 防死循环、URL 错误处理——数据来自真实运行输出。

·约 10 分钟阅读
AgentHarness EngineeringPython Package

Agent 系列(20):Harness 实战——从单文件到生产级模块包

把 Article 19 的单文件 Harness 拆成可复用的 Python 包:registry / budget / sandbox / audit / rollback / harness 六个模块。重点介绍三个 API 设计决策:execute() 统一入口、IRREVERSIBLE 拦截时退还预算、approve_and_execute() 人工审批通道。配合 LangGraph 集成示例和 45 个测试全覆盖验证。

·约 8 分钟阅读
AgentHarness EngineeringLangGraph

Agent 系列(19):Harness 完整体系——8 层防护框架全景

从入门的五要素到完整的 8 层框架:最小权限、动作注册表、权限预算、执行沙箱、人工检查点、不可篡改审计日志、回滚协调器、威胁模型。四个对抗场景揭示三个反直觉结论:工具范围限制是软防御、预算在审批前扣除是设计陷阱、注入检测不等于注入阻止。

·约 11 分钟阅读
AgentHarness EngineeringLangGraph

Agent 系列(17):Harness Engineering——给自主 Agent 装上安全护栏

Agent 越自主,越需要可控执行框架。本文用实验覆盖 Harness Engineering 五要素:Action Space(动作空间注册表)、Human Checkpoint(LangGraph interrupt 人工检查点)、Execution Boundary(执行边界)、Audit Log(审计日志)、Rollback(回滚)。包含三个反直觉结论:Harness 阻止的是动作,不是模型的谎言;执行边界必须在图级实现而非 wrapper;模型能力仍是可靠性的底层决定因素。

·约 10 分钟阅读
Agent记忆MemorySaver

Agent 系列(15):Agent 记忆系统进阶——短期、长期、压缩,三层记忆架构

Agent 的记忆不只是"存对话历史"。本文拆解三层记忆架构:短期记忆(MemorySaver 保持会话内上下文)、长期记忆(跨会话用户事实存储与注入)、历史压缩(token 守卫)。附真实跑分,包括一个反直觉的发现:MemorySaver 基础设施正常,但模型能力决定能否真正利用上下文。

·约 8 分钟阅读
Agent工具设计LangGraph

Agent 系列(16):工具链设计——让 LLM 用对工具的五个原则

工具设计不是给人看的,是给 LLM 看的。本文用三个对比实验覆盖工具设计的核心原则:描述质量影响工具选择(但有反直觉的前提条件)、raise 异常 vs 返回错误字符串的实测差异、以及粗粒度 omnibus 工具 vs 细粒度专用工具的对比。附五条设计黄金规则。

·约 8 分钟阅读
Agent评估工具调用

Agent 系列(12):Agent 评估框架——怎么知道你的 Agent 到底好不好

Agent 不是普通函数,传统软件测试不够用。本文拆解 Agent 评估的三个维度:能力(工具调用准确率 + 任务完成率)、效率(步骤数 + Token 消耗 + 延迟)、鲁棒性(边缘用例 + 对抗输入)。附 13 个可运行测试用例和真实跑分结果,包括两个反直觉的 failure 分析。

·约 9 分钟阅读
Agent安全提示词注入

Agent 系列(13):Agent 安全与防护——提示词注入、工具滥用、数据泄露怎么防

Agent 的攻击面比普通 LLM 大得多:提示词注入可以绕过角色限制,工具参数可以注入代码,输出可以意外泄露敏感数据。本文用三个可运行 Demo 覆盖三条攻击链,并实测 Naive vs Hardened Agent 的回答差异、工具字符白名单的拦截效果、以及三层防护管道的联合工作方式。

·约 9 分钟阅读
Agent可观测性Callback

Agent 系列(14):Agent 可观测性——追踪每一步决策,让黑盒变透明

Agent 的决策过程天然不透明:为什么它调了三次工具?延迟来自哪里?生产环境里它出错了怎么复现?本文用 LangChain BaseCallbackHandler 实现三种可观测性模式:实时 Trace 打印、延迟分解时间线、结构化 JSON 审计日志。附真实跑分——LLM 占 99.9% 延迟,工具调用仅 2ms。

·约 8 分钟阅读