开源项目与工具集
Awesome Lists(入口导航)
Section titled “Awesome Lists(入口导航)”先收藏这些,它们持续追踪领域最新进展:
| 仓库 | 维护方 | 说明 |
|---|---|---|
| Awesome-Self-Improving-Agents | 清华 C3I | 自改进 Agent 综述配套,覆盖 harness/skills/memory/meta-evolution |
| Awesome-Self-Evolving-Agents | 厦大 DeepLIT | 配套 Survey 论文,按 What/When/How/Where 分类 |
| awesome-agent-evolution | EvoMap | Agent 进化、记忆系统、多智能体架构合集 |
| Awesome-Self-Improving-Agents | FrontisAI | ”Agents in the Era of Experience” 配套 |
评估层工具(方案 A 相关)
Section titled “评估层工具(方案 A 相关)”| 项目 | Stars | 语言 | 核心能力 | 链接 |
|---|---|---|---|---|
| Promptfoo | 5k+ | TypeScript | Prompt/Agent 对比测试、红队扫描、CI 集成 | GitHub |
| DeepEval | 4k+ | Python | 14+ 内置指标、pytest 集成、Confident AI 平台 | GitHub |
| RAGAS | 7k+ | Python | RAG 专项评估(faithfulness/relevance/context) | GitHub |
| AgentEval | 新 | Python | Agent 专项评估框架 | GitHub |
| agent-eval-framework | 新 | Python | 生产级 Agent 评估+持续改进 | GitHub |
Observability(可观测性 + 评分)
Section titled “Observability(可观测性 + 评分)”| 项目 | 定位 | 自部署 | 核心能力 | 链接 |
|---|---|---|---|---|
| Langfuse | 开源 Observability | ✅ Docker | Trace、Scoring、Prompt 管理、数据集 | GitHub |
| Arize Phoenix | 开源 Observability | ✅ | Trace、LLM Eval、Embedding 分析 | GitHub |
| OpenLIT | OpenTelemetry for LLM | ✅ | 标准化 trace 采集、Grafana 集成 | GitHub |
| Latitude | Agent Observability | 部分 | 多 Agent trace、评估、prompt 版本 | GitHub |
Benchmark 数据集
Section titled “Benchmark 数据集”| 项目 | 评估对象 | 说明 | 链接 |
|---|---|---|---|
| AgentBench | Agent 综合能力 | 8 种环境(OS/DB/Web/Game…) | GitHub |
| SWE-bench | 代码 Agent | 真实 GitHub issue 修复 | GitHub |
| GAIA | 通用 Agent | 多步推理 + 工具使用 | HuggingFace |
| ToolBench | 工具使用 | 16000+ 真实 API | GitHub |
| τ-bench | 对话式 Agent | 模拟用户多轮交互 | GitHub |
优化层工具(方案 B 相关)
Section titled “优化层工具(方案 B 相关)”Prompt 自动优化
Section titled “Prompt 自动优化”| 项目 | 核心思想 | 适用场景 | 链接 |
|---|---|---|---|
| DSPy | 声明式 Prompt 编程 + 自动编译 | Pipeline 级优化,few-shot 自动选择 | GitHub |
| TextGrad | 文本梯度反向传播 | 单 prompt 深度优化 | GitHub |
| OPRO | LLM 搜索最优 prompt | 目标明确的 prompt 搜索 | Paper |
| EvoPrompt | 遗传算法 prompt 进化 | 大规模 prompt 变体搜索 | Paper |
| PromptBreeder | 自引用 prompt 进化 | Prompt + 变异策略协同进化 | Paper |
经验记忆与反思
Section titled “经验记忆与反思”| 项目 | 核心思想 | 链接 |
|---|---|---|
| Reflexion | 语言强化学习,经验存文字记忆 | GitHub |
| LATS | 树搜索 + 反思,探索多条推理路径 | GitHub |
| Memento-II | 有状态反思记忆 | Paper |
| MARS | 记忆增强 + 反思自改进 | Paper |
| MemoryBank | 长期记忆管理与遗忘机制 | GitHub |
DSPy 生态
Section titled “DSPy 生态”| 项目 | 说明 | 链接 |
|---|---|---|
| DSPy 主仓库 | Stanford NLP 维护,核心框架 | GitHub |
| dspy-0to1-guide | 从零到一实战教程 | GitHub |
| dspy-agent-forge | DSPy + Agent 结合示例 | GitHub |
| AutoDSPy | 用 RL 自动化 DSPy 模块设计 | Paper (EMNLP 2025) |
进化层框架(方案 C 相关)
Section titled “进化层框架(方案 C 相关)”自进化 Agent 框架
Section titled “自进化 Agent 框架”| 项目 | 出处 | 进化目标 | 成熟度 | 链接 |
|---|---|---|---|---|
| EvoAgentX | 开源社区 | 完整自进化生态系统 | 活跃开发中 | GitHub |
| AgentEvolver | 阿里 ModelScope | Agent 工作流自进化 | 论文配套 | GitHub |
| EvolveR | ICML 2026 | 经验驱动全生命周期 | 论文配套 | GitHub |
| EvoMaster | 上海交大 | 科研级大规模进化 | 学术 | GitHub |
| AHE | arXiv 2604.25850 | Agent Harness 自进化 | 论文配套 | GitHub |
架构搜索与 Meta-Agent
Section titled “架构搜索与 Meta-Agent”| 项目 | 核心思想 | 链接 |
|---|---|---|
| ADAS | 用代码搜索自动设计 Agent 系统 | Paper (ICLR 2025) |
| MetaAgent-X | 端到端 RL 突破多智能体设计上限 | Paper |
| Meta-Agent (FSM) | 基于有限状态机自动构建多 Agent 系统 | Paper |
| High-Order ADAS | 高阶自动 Agent 系统设计 | IEEE |
技能库与自动发现
Section titled “技能库与自动发现”| 项目 | 思路 | 链接 |
|---|---|---|
| Voyager | Minecraft Agent 自动发现技能 + 技能库 | GitHub |
| Claude Code Skills | 文件系统承载的技能定义与自动触发 | Docs |
| code-voyager | Voyager 思路用于代码 Agent | GitHub |
| Anthropic Agent Skills | SDK 级别的技能系统 | Blog |
综合平台(商业/混合)
Section titled “综合平台(商业/混合)”供参考架构设计思路,不一定需要直接使用:
| 平台 | 定位 | 开源程度 | 特点 |
|---|---|---|---|
| Braintrust | Eval + 数据集 + 优化 | 部分开源 | 完整的 eval pipeline |
| LangSmith | Trace + Eval + 标注 | 闭源 | LangChain 深度集成 |
| HoneyHive | Eval + Observability | 闭源 | 企业级评估平台 |
| AgentOps | Agent 可观测性 | 开源 SDK | 专注 Agent trace |
| Weights & Biases Weave | LLM 实验追踪 | 部分 | ML 实验管理背景 |
快速上手推荐
Section titled “快速上手推荐”如果你只想今天就开始
Section titled “如果你只想今天就开始”# 1. 用 Promptfoo 跑你的第一个 evalnpx promptfoo@latest initnpx promptfoo@latest eval
# 2. 或用 DeepEval (Python)pip install deepevaldeepeval test generate # 自动生成测试用例如果你有 1 周时间搭 MVP
Section titled “如果你有 1 周时间搭 MVP”- Langfuse — 部署 trace 收集 (
docker compose up) - DeepEval — 编写评估脚本
- DSPy — 跑通一次 prompt 自动优化
如果你在做深度研究
Section titled “如果你在做深度研究”- 读完 Awesome-Self-Improving-Agents (清华) 的分类
- 跑通 EvoAgentX 的 examples
- 复现 EvolveR 的实验
本文会持续收录新的开源项目。最后更新时间见页面顶部。
如果你发现了好的开源项目,欢迎通过 GitHub Issue 提交。