Prime Agent проверяет, может ли улучшение Harness резко изменить результаты модели
Prime Agent — открытый Harness для самоулучшающихся агентов от Prime Intellect. Согласно сообщениям, при использовании Opus 5 он повысил результат на ARC-AGI-3 с 30,2% до 95,5%, однако представленные материалы не содержат независимого подтверждения этого показателя.
Prime Agent, судя по описанию, не изменяет веса базовой модели. Вместо этого он дает модели программный доступ к контексту и истории, постоянным файлам, инструментам, навыкам, памяти и дочерним агентам. Часть состояния Harness может изменяться во время работы, благодаря чему система сохраняет результаты прошлых попыток и корректирует способ выполнения задач.
Этот пример показывает, что слой оркестрации способен заметно влиять на результат конкретного бенчмарка. Но показатель 95,5% подтверждается главным образом публикациями в социальных сетях и вторичными пересказами. В предоставленных источниках нет воспроизводимой конфигурации теста, подробностей набора задач или независимой записи в рейтинге.
Оптимизация под оценщик может привести к переобучению или использованию лазеек, не повышая надежность в реальных сценариях. Поэтому утверждение, что Prime Agent способен заменить Claude Code или Codex, пока не следует из имеющихся данных. Более осторожный вывод состоит в том, что дизайн Harness может существенно менять измеряемые результаты на отдельных задачах.
Источники
AI 自我进化,先改的可能不是模型,而是 Harness-腾讯云开发者社区-腾讯云developer.cloud.tencent.com · supporting### 3. 自我改进,不是把同一道题再答一遍 Lilian Weng 在文章里给出一条很有意思的演进路径:Prompt,结构化上下文,工作流,Harness 代码,最后到优化器代码。 越往后,系统改的越不是某个答案,而是“以后怎么产生答案”。 唐斩角色用保留集和未见集校验 Harness 修改 唐斩角色用保留集和未见集校验 Harness 修改 用保留集和未见集校验 Harness 修改 Self-Harness 的做法很典型。它先从失败轨迹里找反复出现的问题,再提出范围受限的修改,最后用测试决定接不接受。 这里有两个细节很重要。 一是修改面要有限。系统不能想改哪里就改哪里。 二是既要看这次暴露出来的问题有没有解决,也要看没参与修改的任务有没有退步。通过了,修改才进入下一版;没通过,记录下来并回退。 这才像工程。一个“会自我改进”的 Agent,首先应该会承认这次修改没用。 唐斩角色把评估、权限、回归测试和人工复核固定在自改进循环之外 唐斩角色把评估、权限、回归测试和人工复核固定在自改进循环之外 把评估、权限、回归测试和人工复核固定在自改进循环之外 ### 4. 最危险的做法,是让它连裁判一起改 自改进听起来很兴奋,落到工程里却有一个朴素问题:谁来判断它真的变好了? 如果答案是“它自己”,麻烦就来了。 测试可能太窄,Judge 模型可能有偏好,Benchmark 也可能被钻空子。系统会优化你给它的信号,但不保证那个信号等于你真正想要的结果。 原文把评估器和权限控制放在自改进循环之外,我赞同这个边界。保留集、未见集、轨迹审计和关键节点的人工复核,都不该被改进器随手重写。 [...] 当这套系统能被观察、测试和回退之后,自我改进才不是一句口号。 如果你现在正用 Codex、Claude Code 或其他 Coding Agent,下一步可以先做一件小事:选一个每周都会重复的任务,把它改造成有文件状态、有验证器、有停止条件的循环。 先让 Harness 能稳定变好。模型的下一次升级来了,你也接得住。 原文:Harness Engineering for Self-Improvement 本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。 原始发表:2026-07-14,如有侵权请联系 cloudcommunity@ten
翁荔再发万字长文:AI自进化,从Harness开始 - 智源社区hub.baai.ac.cn · supporting学习如何读、写和编辑文件系统,通常通过 bash 命令,是 LLM 的基础能力。因此,用文件这种简单形式管理持久记忆,自然能够受益于核心模型能力的提升。 ### 3.模式三:子Agent和后台任务 Harness 可以启动多个子 Agent 并行执行,也可以监控后台任务。当主 Agent 需要搜索多个假设、并发运行实验,或者把隔离子任务委托出去而不污染主上下文时,这很有用。此时父 Agent 需要一个小型进程管理器:启动任务、检查日志、取消失败运行,并把结果合并回主 Agent 线程。 关键设计选择是让并行性显式且可检查。如果子 Agent 的输出只存在于临时聊天上下文中,它们很快会过时并被隐藏。如果这些输出被存储为文件、日志和状态记录,模型就可以在中断后恢复,并根据自己的执行历史进行推理。 ### 4.案例研究:编程Agent Harness 主流编程 Agent 的核心接口在 Claude Code、Codex、OpenCode 和 Cursor 风格 Agent 中已经逐渐稳定。它们通常使用如下循环: 在获得一组工具后,编程 Agent 能够在给定代码仓库中开发和调试问题,类似人类开发者配备 IDE 后的工作方式。 ### 5.Harness层与核心智能? 很难预测 RSI 的未来会在多大程度上依赖 harness 工程,但 RSI 的近期开端不太可能是模型直接重写自己的权重。我对近期实践路径的判断是: 1.Harness 工程将朝着元方法论方向演化,也就是改进“得到更好答案的机器”,而不仅仅是改进答案本身。Harness 系统自身会成为优化目标,其中启发式规则会减少,更通用的机制会增多。 2.反过来,成熟的 harness 会支持面向模型自我改进循环的自动化研究;而更聪明的模型会避免 harness 被过度工程化,使系统保持可持续。 [...] 面向完整 RSI,研究者已经取得了真实进展,但几个瓶颈仍然存在。 1.弱且模糊的评估器。许多研究声明没有快速、精确的 verifier,许多现实任务也是如此。当前自我改进循环最适合那些评估指标可测、客观的任务,类似 RL 能发挥作用的场景。 研究品味、新颖性和长期科学价值要难衡量得多。例如,研究品味常常混合了问题框定、实验设计,以及判断哪些意外结果值得追、哪些失败案例值得重试的能力。 2.上
翁荔最新万字长文:AI 的自进化,可能不在模型,在 Harness - 智源社区hub.baai.ac.cn · supporting如果你正在做 AI 相关的事,欢迎和我们聊聊。 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965 年),他将"超级智能机器"定义为一种能够在所有智力活动上超越人类、并能设计出更好的机器来改进自身的系统。Yudkowsky(2008 年)将"递归自我改进"用于描述一个具体的反馈回路:AI 利用其当前的智能来改进产生该智能的认知机制。 这一反馈回路在现代 AI 中,可能意味着模型直接重写自身的权重,或者更广泛地,模型改进训练流水线和部署系统,进而催生出在经济价值任务上表现更好的下一代模型。AI 研究的发展速度已在前沿实验室中(如 Anthropic、OpenAI)被证明正在大幅加速。 我之所以特别提到"部署系统",是因为原始模型与真实世界情境之间的那一层,其重要性似乎不亚于模型本身的原始智能(即预训练后直接评测的结果)。Harness 是 AI 部署的重要组成部分,Claude Code 和 Codex 等成功的编程 Agent 产品即是佐证。所谓 harness,是围绕基础模型构建的系统,它编排执行流程,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储产出物,以及评估结果。 本文专注于 harness 工程的相关研究,以及它如何推动 RSI 的实现。近期大量关于自动科研、自我改进 Agent 和进化程序搜索的工作,都可以围绕这一问题加以组织。关于模型自我博弈、合成数据、测试时训练以及持续学习这一更宏观主题的其他工作,同样契合 RSI 的愿景(如 Yuan et al. 2024、Chen et al. 2024、Zhao et al. 2025、Choi et al. 2026),但它们不是本文的重点。 ## 01 ## Harness 如何设计: ## 循环、记忆、并行 [...] 1. 从池中的一个编程 Agent 开始。 2. 在每次迭代中,以与其性能成正比、与其子代数量成反比的概率选择一个父代,对其进行修改并分支产生新 Agent。 3. 被选中的父代 Agent 审查自身的基准评估日志,然后提议对自身 harness 代码库的改进,以生成编程 Agent 的新版本。代码编辑通过两个基本工具实现:(1)bash(参数:);(2)editor(参数:view/create/edit <文件路径>)。 4. 新编程
全新 AI 技术栈:模型、Harness、Loop 与自我进化的智能体 | Tony Baitonybai.com · supportingWeb Analytics # 全新 AI 技术栈:模型、Harness、Loop 与自我进化的智能体 题图 题图 本文永久链接 – 大家好,我是Tony Bai。 在过去的 AI 浪潮中,所有人的目光都死死盯着基础模型(Foundation Models): 从 GPT-5.x 到 Claude Sonnet 5/Fable 5,再到各种开源大模型。整个行业似乎形成了一种思维定势——“只要模型更聪明,应用就会更好。” 但这其实是整个 AI 行业最大的谎言。 为什么手握同样的基础模型,顶尖大厂做出的 Claude Code 和 Codex等能够实现丝滑的工程自动化,而你熬夜写出的 Agent 却在跑了 20 步之后就因为上下文暴涨而当场崩溃? AI 圈技术专家 Rahul (@sairahul1) 在一篇名为“The New AI Stack: Models, Harnesses, Loops, and Self-Improving Agents”的技术长文中给出了答案:基础模型只是 passive(被动)的 CPU。真正决定一个 AI 产品是“玩具”还是“生产级工具”的,是包裹在模型之外的“驾驭框架(Harness)”。 更让人感到兴奋(甚至一丝敬畏)的是,在最新的 AI 工程实践中,这套驾驭框架已经开始由 AI 自行重写和优化,实现了真正的“自我进化”。 本文将和你一起来看看这个由Rahul提出来的“模型、Harness、循环、自优化智能体”构成的全新 AI 技术栈。看完这篇文章,你将彻底明白为什么各大前沿实验室的 Agent 能力正在呈指数级无声进化。 以下为译文全文: 所有人都在谈论 AI 模型。 但根本没有人关注那个真正让模型变得实用的底层逻辑。 Claude Code、Codex、Cursor…… [...] 但根本没有人关注那个真正让模型变得实用的底层逻辑。 Claude Code、Codex、Cursor…… 这些绝不仅仅是简单的“大模型”。 它们是被包裹在一整套工程系统之中的模型。 这套系统,被称为 “驾驭框架(Harness)”。 而如今,最顶尖的驾驭框架,已经学会了自我进化(Improve themselves)。 以下,是关于全新 AI 技术栈你所需要了解的一切。 整个 AI 产品圈深信不疑的谎
Harness要不要做?斯坦福的回答是:让AI自己做-品玩pingwest.com · supporting黄小艺 发布于 4月1日 同一个模型,换一套Harness,编程基准分就翻倍了,行业为此吵了两个月,现在斯坦福说:不用吵了。 ## Harness火了,但也吵起来了 2026年开年最热的AI工程概念,就是Harness。 它指的是模型之外的一切——prompt模板、上下文管理、检索策略、多步推理编排、工具调用逻辑。一句话概括:你怎么调用模型,和模型本身同样重要,甚至更重要。 OpenAI Codex团队5个月写了100万行Agent代码后,得出的最大教训是“Agent不难,Harness才难”;SWE-Bench Mobile论文中,同一个Claude Opus 4.5在不同Harness下成功率2%对12%,差了6倍;LangChain 的编码 Agent 在 Terminal Bench 2.0 上,通过仅优化 Harness 而不修改底层模型,得分从 52.8% 提升至 66.5%,排名从第 30 跃升至第 5。 数据足够有说服力。Harness这个概念迅速从学术圈破圈,成了产业界的高频词。 但一个概念一旦火了,争议就跟着来了。给这股Harness热泼冷水的,比如OpenAI的Noam Brown,说Harness本质是拐杖,模型终将超越它——推理模型出来后,大量精心设计的Agentic系统一夜淘汰就是明证;Claude Code团队也说,“所有秘密武器在模型本身,追求最薄的包装”。 Anthropic的实践还提供了一个微妙的视角。他们先为Opus 4.5做了一套相当厚重的Harness方案——GAN式对抗架构、三Agent分工、sprint合约;但Opus 4.6出来后,Harness直接做了减法:去掉sprint分解、整体简化,从6小时$200降到3.8小时$125。性能更好,成本更低。 [...] 战场三:编程Agent——超越人类Harness方案 在 Claude Haiku 4.5组别中,Meta-Harness 确实以 37.6% 拿到了组别第一,超越了所有已知的手工 Harness(如 Goose 和官方的 Claude Code);在 Claude Opus 4.6组别中,Meta-Harness 以 76.4% 拿到组别第二。 Meta-Harness在这个任务上还自主发现了一个关键trick——“Environmen
Gorden Sun on X: "Prime Agent:Prime Intellect开源的可自我改进Agent框架 使用Opus5模型,在ARC-AGI 3上得分95.5%,核心设计理念: 递归语言模型 (RLM):将上下文视为变量,支持LLM通过编写程序来操作自身上下文与管理历史。 持续化 Harness :将" / Xx.com · supportingLog inSign up ## Post user avatar Gorden Sun @Gorden\_Sun Prime Agent:Prime Intellect开源的可自我改进Agent框架 使用Opus5模型,在ARC-AGI 3上得分95.5%,核心设计理念: 递归语言模型 (RLM):将上下文视为变量,支持LLM通过编写程序来操作自身上下文与管理历史。 持续化 Harness :将 Prompt、技能、记忆和子Agent抽象为可动态增删改查的状态,根据运行轨迹自动更新,实现自我改进。 没有看到明显的创新点和特色,帖子这么火全是靠推广。之前的OpenClaw虽然质量不佳,但具有开源首创性,所以火了;后来的Hermes是靠框架自我改进能力,也火了一阵。 我不试了,我现在Agent就搭配订阅使用,也不折腾API,Codex、Claude Code、Cursor、Grok Build,主要就用这些。 Github:github.com/PrimeIntellect… user avatar Prime Intellect @PrimeIntellect Aug 5 Introducing Prime Agent: A self-improving RLM harness for coding and long-running autonomous tasks. Designed to be both token-efficient and expressive through programmatic tool calling, context as a variable, multi-agent messaging, and a self-modifiable harness state. [...] 00:00 10:58 AM · Aug 6, 20262.7KViews