Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

140 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

awesome-ai-agent

ai-agent-arch

概念篇

Agent 框架

  • 📖 框架深度评测与对比分析
    简介:全面评测主流 Agent 框架,覆盖六大类别:通用开发(LangChain/LangGraph/OpenAI Agents SDK)、多Agent协作(AutoGen/CrewAI/MetaGPT/AgentScope/Camel-Owl)、自主Agent(AutoGPT/BabyAGI/gpt-engineer)、数据与RAG(LlamaIndex/MemGPT)、平台级工具(Dify/Flowise/Spring AI Alibaba)、领域专用(TradingAgents/GPT-Researcher)。从架构设计、核心能力、适用场景等维度深度对比,提供选型决策矩阵,助你快速定位最佳技术方案。

  • 📖 LangGraph 官方文档 简介:LangChain 团队推出的状态图式 Agent 编排框架,支持循环、分支、持久化与人工干预,提供细粒度控制流与记忆管理,适合构建复杂多步骤 Agent 工作流。

  • 📄 AutoGen: Enabling Next-Gen LLM Application via Multi-Agent Conversation 简介:微软研究院提出的多 Agent 对话框架,支持 Agent 间自主对话协作、人机协同、代码执行与工具调用,可构建研究助手、编码团队等复杂应用场景。

  • 📖 如何设计一个AI Agent系统
    简介:大淘宝 SRE 团队出品,从工程实践出发,系统讲解如何以LLM为认知核心,围绕规划、记忆、工具与执行框架构建可控可用的Agent系统,并结合研发流程、设计范式、知识管理与资损分析案例,给出工业落地方法论与实践体会。

Harness 实践

  • 📖 Effective harnesses for long-running agents
    简介:Harness 设计是 Agentic Coding 前沿性能的关键。本文介绍 Anthropic 如何在前端设计与长时自主软件工程任务中进一步释放 Claude 的能力。

  • 📖 Harness design for long-running application development
    简介:Harness 设计是 Agentic Coding 前沿性能的关键。本文分享 Anthropic 如何在前端设计与长时自主软件工程任务中进一步推动 Claude 的能力边界。

  • 📖 Effective context engineering for AI agents
    简介:Context 是 AI Agent 的关键且有限资源。本文系统讨论如何高效策划、组织与管理上下文,以提升智能体在复杂任务中的稳定性与产出质量。

  • 📖 OpenAI — Harness Engineering: Harnessing Codex in an Agent-First World
    简介:OpenAI 分享在 Agent-First 时代如何通过 Harness Engineering 驱动 Codex 的稳定产出,重点覆盖上下文组织、工具调用编排、执行反馈闭环与工程可控性。

  • 📖 Agent Harness 解析:智能体架构深度拆解
    简介:系统拆解 Agent Harness 的核心定义与工程边界,覆盖编排循环、工具调用、记忆体系、上下文管理、状态持久化、错误恢复与安全护栏等关键组件,并对 Anthropic、OpenAI、LangChain 等主流框架的落地模式进行对比,帮助从“模型能力”转向“基础设施能力”理解生产级智能体。

  • 📖 用第一性原理拆解 Agentic Coding:从理论到实操
    简介:从第一性原理出发,系统拆解 Agentic Coding 的底层机制与工程实践:涵盖 LLM 自回归与 Attention 约束、Agent Loop 与工具调用原理、上下文管理与短对话策略、项目规则与复利工程(Compounding Engineering)等关键方法,帮助开发者从“会用 AI”走向“驾驭 AI 协作”的实战能力升级。

  • 📖 逆向深扒Claude Code源码,我发现了什么!?
    简介:基于 Claude Code v2.1.88 泄露源码的逆向工程分析,系统拆解其最小 Agent Loop 如何通过 12 层渐进式 Harness 升级为工业级编码代理,重点覆盖工具系统、权限与安全、上下文压缩、子代理协同、Skills 按需注入、会话持久化与编译时特性门控等核心设计。

  • 📖 深度解析 Hermes Agent 如何实现“自进化”及其 Prompt / Context / Harness 的设计实践
    简介:聚焦 Hermes 从“自主执行”迈向“自进化”的关键机制,系统拆解动态 Skill 沉淀与 RL 训练闭环两条演进路径,并从 Prompt、Context、Harness 三个工程维度分析其在异构模型兼容、长上下文压缩、记忆管理、错误自愈与安全约束上的设计取舍与落地实践。

  • 📖 拆完Hermes源码,我发现Agent的"自我进化"根本不需要训练模型
    简介:基于 Hermes Agent 源码逆向分析,重点拆解其通过“四维记忆 + 技能自动生成 + 后台审查(KEPA)”实现的自进化机制,说明 Agent 能力提升可通过 Prompt Engineering 与文件持久化闭环达成,而不必依赖模型微调,并与 OpenClaw 的学习范式做了工程化对比。

  • 📖 QQ音乐Harness Engineering实践
    简介:结合 QQ 音乐在 Monorepo Microservices 场景的落地案例,系统阐述如何以“代码产出 = AI 能力 × 上下文质量”为核心,通过五阶段四门禁、三层知识体系、三仓联动、Skill/Agent/Command 协同与 Self-Refinement 闭环,将 AI 协作从对话式编码升级为可控、可审计、可复用的工程流程。

  • 📖 Claude Code Harness 工程:数仓侧落地方案|得物技术
    简介:围绕数仓场景中 AI Coding 的上下文失忆、规范不稳与 context 膨胀问题,提出以 CLAUDE.md 持久化、Auto Memory、hooks 强校验、subagents 隔离与 SKILL 改造为核心的五层 Harness 防御体系,并给出可直接落地的 8 步工作流与工程化实施路径。

  • 📖 横向拆解Claude Code、Codex等六大Agent上下文压缩策略后,我们做了第 7 个
    简介:横向对比 Claude Code、Codex、OpenCode、Cline、Cursor、Amp 与 MemGPT/Letta 的上下文压缩策略,提炼分层渐进、成本递增、增量摘要、用户消息保护与单调边界等共识,并面向云端多用户 Agent 落地四级水位线(Snip / Prune / Summarize)方案,补充存储分离、跨轮缓存与多用户隔离等工程实践。

感知记忆

  • 📖 从架构到代码:深入理解 OpenClaw 的双源记忆系统
    简介:围绕 OpenClaw 的“动态会话日志(JSONL)+ 静态长期记忆(Markdown)”双源记忆架构,深入拆解记忆生成、分块索引、向量与关键词混合检索(sqlite-vec + FTS5)以及 Agent 调用链路,并分析其在上下文容量、信息保真与 token 成本之间的工程权衡。

  • 📖 深度拆解 Hermes Agent 记忆系统:它修正了 OpenClaw 的哪层误区?
    简介:从运行时分层视角解析 Hermes 的记忆设计:通过 MEMORY/USER 热记忆、session_search 历史检索、skills 程序性记忆与可选 Honcho 外部建模,将“常驻事实、历史档案与流程经验”分层治理,并结合压缩前 memory flush 与 prompt cache 稳定前缀策略,展示其对长期 Agent 连续性与成本控制的工程取舍。

  • 📄 MemGPT: Towards LLMs as Operating Systems 简介:借鉴操作系统内存分页机制,将有限上下文窗口视为"主存",外部存储视为"磁盘",通过自主管理的内存分页与检索策略突破上下文瓶颈,支持长期对话与多会话持久化。

  • 📄 Let All Context Be Memorized: A Memory Bank Design for LLMs 简介:提出记忆银行架构,将历史信息按重要性分层存储,通过计算记忆的"存取频率"与"时间衰减"实现动态召回,有效缓解长对话中的信息遗忘问题。

RAG 实践

评估观测

  • 📊 Bringing Observability to Claude Code: OpenTelemetry in Action 简介:SigNoz 官方出品的深度实践指南,从零搭建 OpenTelemetry 监控体系。深入剖析 Token 用量分析、成本核算、响应延迟控制等生产级场景,适合需要完整可观测性方案的团队落地实施。

  • 🔧 @devtheops/opencode-plugin-otel · npm 简介:功能完善的开源 OTel 插件,完整呈现 Claude Code 到 OpenTelemetry 的数据链路。通过研读源码可深入理解如何为 AI 应用构建生产级可观测性数据模型,是学习和定制监控方案的绝佳参考实现。

  • 📖 Agent Tracing 技术方案对比:LangSmith vs Langfuse vs Phoenix
    简介:横向对比 LangSmith、Langfuse、Phoenix 三款 Agent Tracing 方案,覆盖产品定位、追踪/评测/数据集/监控、框架集成、部署方式与定价,并指出 LangSmith 不支持私有化部署,补充 Langfuse 与 Phoenix 作为可自部署替代选型。

  • 📊 agenttrace
    简介:本地优先的AI编码智能体会话观测工具,可读取Claude Code、Codex CLI、Gemini CLI、Qwen Code、Aider、Cursor、OpenCode、OpenClaw等日志,帮助开发者查看成本、Token、耗时、工具失败和慢任务原因。

  • 🚀 NVIDIA AgentIQ
    简介:企业级智能体观测与优化工具包,提供运行时性能分析、执行流程追踪、超参数/提示词优化器,支持 MCP/A2A 协议。

工具生态

  • 📖 如何让你的 Agent 更准确:MCP 工具设计技巧
    简介:围绕“工具是 Agent 的用户界面”这一核心理念,系统讲解 MCP 工具在命名、描述、参数 schema、输出与错误处理上的设计方法,结合工具粒度控制、上下文与 token 成本、Skills 与 MCP 互补等实践,帮助提升 Agent 的工具选择准确率与调用稳定性。

  • 📖 一文读懂 Agent Tools,拒绝复杂化、碎片化、黑盒化
    简介:从 Agent 工具全生命周期出发,系统梳理类型安全、LLM 友好接口、自我修复与人机确认等关键设计原则,并结合 AgentKit Gateway 在工具转化、调用治理、技能化管理与身份鉴权上的企业级实践,给出破解 Tools 碎片化、复杂化、黑盒化的落地路径。

  • 📖 Code execution with MCP: Building more efficient agents
    简介:传统直接工具调用会为每个定义与中间结果持续消耗上下文。本文说明为何让 Agent 通过编写代码来调用工具更易扩展,并详细介绍在 MCP 中的实现方式。

  • 📖 Writing effective tools for agents — with agents
    简介:Agent 的效果高度依赖可用工具质量。本文分享如何编写高质量工具与评测流程,并说明如何借助 Claude 反向优化其自身工具以进一步提升性能。

    评测基准

  • 📊 AI Agent评测基准大揭秘:智能体的「体检标准」
    简介:深度解析主流Agent评估体系,系统性梳理 GAIA、AgentBench、PaperBench、WAA等七大主流评测基准,覆盖通用能力、安全鲁棒性、中文场景及科研复现等多维度评估体系。

  • 📊 XBench
    简介:红杉中国推出的双轨测评体系:AGI Tracking测试技术上限,Profession-Aligned量化商业场景效用价值(如招聘/营销)。

  • 🔍 ClawBench
    简介:面向真实生产网页的AI浏览器Agent评测基准,153个日常任务、144个真实网站、15个类别;通过提交拦截层(Chrome扩展+CDP)保证真实环境下的端到端评测不产生副作用。评测了7个前沿模 型,最佳通过率33.3%。[paper]

自我进化

  • 📄 翁荔博客-通过Harness工程实现AI自我提升 简介:翁荔在文中系统梳理了从 ACE、Meta Context Engineering 到 Self-Harness、Darwin Gödel Machine 等一系列围绕「Harness 自我优化」展开的研究工作,并试图回答:递归式自我提升(RSI)究竟会先发生在模型权重层面,还是先发生在这层「脚手架」上

  • 📄 翁荔长文谈Harness自进化:Agent越用越强,评测难点怎么破? 简介:现有 Agent benchmark 大多仍然面向静态系统无法回答 harness evolution 中更关键的问题:一次更新到底改进了什么?提升是否能迁移到未见任务?是否只是过拟合近期反馈?是否遗忘了旧能力?是否引入了更高成本或运行时不稳定?

  • 📄 Self-Refine: Iterative Refinement with Self-Feedback 简介:Aman Madaan et al. (CMU, Google, Allen AI),单一 LLM 同时作为生成器、反馈提供者和优化者,通过迭代式自我反馈改进输出,无需额外训练数据或强化学习。在 7 个任务上平均提升 20%。

  • 📄 OPRO: Large Language Models as Optimizers 简介:Chengrun Yang et al. (Google DeepMind) 提出的方法,将 LLM 作为通用优化器,用自然语言描述优化任务,以历史解和评分为上下文迭代生成新候选解。GSM8K 提升 8%,Big-Bench Hard 提升 50%。

  • 📄 TextGrad: Automatic Differentiation via Text 简介:Mert Yuksekgonul et al. (Stanford) 提出的框架,借鉴神经网络反向传播思想,通过 LLM 提供的文本反馈"反向传播"优化复合 AI 系统各组件。采用 PyTorch 风格 API,GPT-4o 准确率从 51% 提升至 55%。[GitHub]

  • 📄 DSPy: Compiling Declarative Language Model Calls *简介:Omar Khattab et al. (Stanford) 提出的声明式 LM 编程框架,将 LM 管道抽象为计算图,编译器自动优化提示词、微调策略与推理流程。GPT-3.5 提升 >25%,llama2-13b-chat 提升

65%。[文档]*

  • 📄 ADAS: Automated Design of Agentic Systems 简介: Shengran Hu, Cong Lu, Jeff Clune 提出"元智能体搜索"(Meta Agent Search)框架,让智能体通过编程自动发现新智能体架构,构建不断增长的发现档案。发明的智能体超越手工设计 SOTA,且跨领域迁移鲁棒。

  • 📄 STOP: Self-Teaching Optimization Program 简介:递归自改进框架,LLM 通过生成自教学样本、反思自身解法、蒸馏推理能力来实现无外部数据的持续优化。核心是代码层面的递归改进循环。

安全实践

开源项目

  • 📈 openclaw
    简介:OpenClaw开源项目。

  • 🤖 Claude Code
    简介:Anthropic官方泄露版本的Claude Code源码。

  • 🤖 OpenAI Codex
    简介:OpenAI出品,专精于理解自然语言并生成对应代码。核心特点:自然语言转代码、多语言支持、GitHub Copilot核心引擎。

  • 🦌 DeerFlow
    简介:字节跳动推出的深度研究框架,集成多智能体协作与端到端研究自动化。核心特点:多智能体分工(基于LangGraph实现模块化架构)、工具深度集成(支持Tavily/DuckDuckGo搜索、Python代 码执行、学术资源抓取)、人机协同创作(提供类Notion的交互式编辑界面)、MCP无缝扩展。

  • 🦌 HKUDS-VideoAgent
    简介:VideoAgent: 一站式智能体框架,用于视频理解、编辑与再创作

  • 🦌 HKUDS-DeepTutor
    简介:DeepTutor 是一个智能体原生的学习工作区,在一个可扩展的系统中集成了辅导、解题、出题、研究、可视化及掌握度练习等多种功能。

  • 🌐 Suna
    简介:Kortix AI推出的通用型智能体,专注于跨平台任务自动化执行。核心特点:浏览器自动化引擎(基于Playwright实现网页导航、数据抓取及表单操作)、安全沙箱环境(通过Docker容器隔离 任务执行)、多工具链协同、企业级部署。

  • 🛠️ NotFair
    简介:面向营销场景的开源 Claude Code Skills 套件(约2.9k stars,MIT开源)。覆盖 SEO 站点分析、关键词研究、内容写作、Google Ads 审计与出价管理、Meta Ads(Facebook + Instagram)广告效果分析,通过 Google Ads MCP、Meta Ads MCP、Google Search Console MCP 和 Google Analytics(GA4)MCP 接入实时数据,是目前开源生态中覆盖付费广告+自然搜索最完整的 Agent Skills 实现。

  • 🖥️ Orkas
    简介:开源、本地优先的多智能体桌面客户端,由 Commander 协调专业智能体并行或串行完成复杂任务,支持 macOS、Windows 与 Linux。

  • 🌳 fractal
    简介:层级式编码智能体编排运行时。每个节点都在独立的 Git worktree 中通过自主循环推进任务,并可将可分离的子任务递归委派给子节点;支持深度、子节点数、成本和时间限制,使用本地 SQLite 数据库记录运行状态,并提供实时终端监控与干预。

资源中心

About

AI Agent 资源汇总,不限于基础概念、Harness 实践、RAG、测评基准、感知记忆、开源项目推荐、核心论文、开源项目等

Resources

Stars

244 stars

Watchers

4 watching

Forks

Releases

Packages

Contributors