← 返回作品集

AegisEvo

让 Agent Harness、Skill、代码和评测器的改进经过可重放搜索、统计门禁和人的批准。

角色
系统设计 / 核心工程
核心
Governed co-evolution
技术
Rust / Axum / PostgreSQL
许可
Apache-2.0

它不再造一个 Agent,
它治理 Agent 如何变好。

AegisEvo 通过版本化、内容寻址的目标包驱动固定的 RepoAegis 运行时。候选使用同样预算执行,结果经过安全否决、统计比较和人工批准后,才能从 challenger 走向 canary 与 active。

01冻结基线目标提交、工具、策略与数据版本
02生成候选结构化变异与交叉
03等预算评测同一 Harness 与案例
04双重门禁质量统计 + 零安全回退
05受控晋级Challenger → Canary → Active

先证明机制可重放,
再谈模型有没有变好。

以下数字来自仓库提交的确定性演示,不是实时模型质量,也不代表生产基准。

12候选方案
8开发案例
4病理生态位
10,000Bootstrap 重采样

候选不会覆盖过去,
晋级也不是改一个状态值。

BaselineMutation AMutation BUnsafe / vetoActiveRollback

高分不够,安全回退直接否决。

绝对质量达标配对统计显著预算没有超限零安全回退人工批准

当前边界

  • Phase 1B 不声称生产就绪,也不声称已测得真实模型质量提升。
  • 仓库没有提交真实 benchmark 分数,因为缺少完整清单与匹配的固定源码检出。
  • 评测器群体演进、模型权重修改和 Agentic RL 属于后续阶段。

下一项:用户侧产品

WriteMelo →