Raven 开源:给每个模型自动演化专用 harness,「通用多智能体框架」正在被自己的产物替代

结论
EverMind AI 发布开源多智能体系统 Raven。它的机制不是「一个框架打天下」,而是为每个模型和领域单独构建 harness:从失败中演化、经统计检验后替换,再由 host agent 把目标拆成任务图,分派给各个「模型 + harness」组合。这代表一种路线转向 —— 框架本身不再被当作固定代码,而是被当作可进化的产物。
三个要点
- 它针对的是真实痛点。 同一条指令,不同模型的失败模式完全不同。用一套固定的提示与工具编排去适配所有模型,等于在平均水平上妥协。为每个模型单独演化 harness,是把这个差异正面处理掉。
- 「统计检验后替换」是最容易被忽略、也最关键的一步。 没有这一步,演化会过拟合到偶然的成功样本上,看起来在进步,换一批输入就崩。抄机制的时候可以省别处,这一步不能省。
- 它有明确前提。 需要可重复的失败信号与足够的调用量,否则演化没有梯度。小规模使用场景下,手工调好的 harness 往往比自动演化更稳。
对你意味着什么
哪怕不用 Raven,也值得借鉴它的证据纪律。 「每次失败都留下结构化记录:输入、输出、期望、判定」—— 这一条可以独立于任何框架落地,而且立刻能提升你现有 Agent 的可调试性。
先评估自己的调用量。 日均调用在数百次以下,优先把评测集和失败归档做扎实,别急着引入自动演化。
把它当作方法论而非现成答案。 开源项目的价值往往在思路:模型与编排应当解耦、失败应当被量化、替换应当有门槛。
把「可替换」当作设计目标。 如果哪一天你想换模型,成本主要来自当初把编排逻辑写死在了哪里。留一层薄接口,比追求某一次演化的峰值收益重要得多。
一句话:下一代 Agent 框架的竞争点,可能不是谁的设计更好,而是谁能把自己的设计淘汰得更快。
参考来源
- DAIR.AI(X):EverMind AI 开源多智能体系统 Raven
延伸阅读:100 次调用换一个证明:Cogentic 说明多智能体真正的价值在「审查」 · OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜