Prime Agent Tests Whether Harness Improvements Can Transform Benchmark Performance
Prime Agent is an open-source self-improving agent harness from Prime Intellect. Reports claim that pairing it with Opus 5 raised an ARC-AGI-3 score from 30.2% to 95.5%, but the result has not been independently documented in the supplied evidence.
Prime Agent does not appear to modify the underlying model weights. Instead, it gives the model programmatic control over context and history, persistent files, tools, skills, memories, and sub-agents. The harness can also change parts of its own state, allowing repeated runs to preserve lessons and revise the way tasks are executed.
The example highlights how much orchestration can affect a model on a particular benchmark. However, the 95.5% ARC-AGI-3 figure is supported mainly by social posts and secondary write-ups. The supplied material does not include a reproducible evaluation setup, task distribution, or an independent leaderboard record.
Benchmark-directed self-modification can also overfit to the evaluator or exploit loopholes without improving real-world reliability. Claims that Prime Agent could replace products such as Claude Code or Codex therefore go beyond the available evidence. The safer conclusion is that harness design may materially change measured performance on selected tasks.
Source evidence
AI 自我进化,先改的可能不是模型,而是 Harness-腾讯云开发者社区-腾讯云developer.cloud.tencent.com · supporting### 3. 自我改进,不是把同一道题再答一遍 Lilian Weng 在文章里给出一条很有意思的演进路径:Prompt,结构化上下文,工作流,Harness 代码,最后到优化器代码。 越往后,系统改的越不是某个答案,而是“以后怎么产生答案”。 唐斩角色用保留集和未见集校验 Harness 修改 唐斩角色用保留集和未见集校验 Harness 修改 用保留集和未见集校验 Harness 修改 Self-Harness 的做法很典型。它先从失败轨迹里找反复出现的问题,再提出范围受限的修改,最后用测试决定接不接受。 这里有两个细节很重要。 一是修改面要有限。系统不能想改哪里就改哪里。 二是既要看这次暴露出来的问题有没有解决,也要看没参与修改的任务有没有退步。通过了,修改才进入下一版;没通过,记录下来并回退。 这才像工程。一个“会自我改进”的 Agent,首先应该会承认这次修改没用。 唐斩角色把评估、权限、回归测试和人工复核固定在自改进循环之外 唐斩角色把评估、权限、回归测试和人工复核固定在自改进循环之外 把评估、权限、回归测试和人工复核固定在自改进循环之外 ### 4. 最危险的做法,是让它连裁判一起改 自改进听起来很兴奋,落到工程里却有一个朴素问题:谁来判断它真的变好了? 如果答案是“它自己”,麻烦就来了。 测试可能太窄,Judge 模型可能有偏好,Benchmark 也可能被钻空子。系统会优化你给它的信号,但不保证那个信号等于你真正想要的结果。 原文把评估器和权限控制放在自改进循环之外,我赞同这个边界。保留集、未见集、轨迹审计和关键节点的人工复核,都不该被改进器随手重写。 [...] 当这套系统能被观察、测试和回退之后,自我改进才不是一句口号。 如果你现在正用 Codex、Claude Code 或其他 Coding Agent,下一步可以先做一件小事:选一个每周都会重复的任务,把它改造成有文件状态、有验证器、有停止条件的循环。 先让 Harness 能稳定变好。模型的下一次升级来了,你也接得住。 原文:Harness Engineering for Self-Improvement 本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。 原始发表:2026-07-14,如有侵权请联系 cloudcommunity@ten
翁荔再发万字长文:AI自进化,从Harness开始 - 智源社区hub.baai.ac.cn · supporting学习如何读、写和编辑文件系统,通常通过 bash 命令,是 LLM 的基础能力。因此,用文件这种简单形式管理持久记忆,自然能够受益于核心模型能力的提升。 ### 3.模式三:子Agent和后台任务 Harness 可以启动多个子 Agent 并行执行,也可以监控后台任务。当主 Agent 需要搜索多个假设、并发运行实验,或者把隔离子任务委托出去而不污染主上下文时,这很有用。此时父 Agent 需要一个小型进程管理器:启动任务、检查日志、取消失败运行,并把结果合并回主 Agent 线程。 关键设计选择是让并行性显式且可检查。如果子 Agent 的输出只存在于临时聊天上下文中,它们很快会过时并被隐藏。如果这些输出被存储为文件、日志和状态记录,模型就可以在中断后恢复,并根据自己的执行历史进行推理。 ### 4.案例研究:编程Agent Harness 主流编程 Agent 的核心接口在 Claude Code、Codex、OpenCode 和 Cursor 风格 Agent 中已经逐渐稳定。它们通常使用如下循环: 在获得一组工具后,编程 Agent 能够在给定代码仓库中开发和调试问题,类似人类开发者配备 IDE 后的工作方式。 ### 5.Harness层与核心智能? 很难预测 RSI 的未来会在多大程度上依赖 harness 工程,但 RSI 的近期开端不太可能是模型直接重写自己的权重。我对近期实践路径的判断是: 1.Harness 工程将朝着元方法论方向演化,也就是改进“得到更好答案的机器”,而不仅仅是改进答案本身。Harness 系统自身会成为优化目标,其中启发式规则会减少,更通用的机制会增多。 2.反过来,成熟的 harness 会支持面向模型自我改进循环的自动化研究;而更聪明的模型会避免 harness 被过度工程化,使系统保持可持续。 [...] 面向完整 RSI,研究者已经取得了真实进展,但几个瓶颈仍然存在。 1.弱且模糊的评估器。许多研究声明没有快速、精确的 verifier,许多现实任务也是如此。当前自我改进循环最适合那些评估指标可测、客观的任务,类似 RL 能发挥作用的场景。 研究品味、新颖性和长期科学价值要难衡量得多。例如,研究品味常常混合了问题框定、实验设计,以及判断哪些意外结果值得追、哪些失败案例值得重试的能力。 2.上
翁荔最新万字长文:AI 的自进化,可能不在模型,在 Harness - 智源社区hub.baai.ac.cn · supporting如果你正在做 AI 相关的事,欢迎和我们聊聊。 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965 年),他将"超级智能机器"定义为一种能够在所有智力活动上超越人类、并能设计出更好的机器来改进自身的系统。Yudkowsky(2008 年)将"递归自我改进"用于描述一个具体的反馈回路:AI 利用其当前的智能来改进产生该智能的认知机制。 这一反馈回路在现代 AI 中,可能意味着模型直接重写自身的权重,或者更广泛地,模型改进训练流水线和部署系统,进而催生出在经济价值任务上表现更好的下一代模型。AI 研究的发展速度已在前沿实验室中(如 Anthropic、OpenAI)被证明正在大幅加速。 我之所以特别提到"部署系统",是因为原始模型与真实世界情境之间的那一层,其重要性似乎不亚于模型本身的原始智能(即预训练后直接评测的结果)。Harness 是 AI 部署的重要组成部分,Claude Code 和 Codex 等成功的编程 Agent 产品即是佐证。所谓 harness,是围绕基础模型构建的系统,它编排执行流程,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储产出物,以及评估结果。 本文专注于 harness 工程的相关研究,以及它如何推动 RSI 的实现。近期大量关于自动科研、自我改进 Agent 和进化程序搜索的工作,都可以围绕这一问题加以组织。关于模型自我博弈、合成数据、测试时训练以及持续学习这一更宏观主题的其他工作,同样契合 RSI 的愿景(如 Yuan et al. 2024、Chen et al. 2024、Zhao et al. 2025、Choi et al. 2026),但它们不是本文的重点。 ## 01 ## Harness 如何设计: ## 循环、记忆、并行 [...] 1. 从池中的一个编程 Agent 开始。 2. 在每次迭代中,以与其性能成正比、与其子代数量成反比的概率选择一个父代,对其进行修改并分支产生新 Agent。 3. 被选中的父代 Agent 审查自身的基准评估日志,然后提议对自身 harness 代码库的改进,以生成编程 Agent 的新版本。代码编辑通过两个基本工具实现:(1)bash(参数:);(2)editor(参数:view/create/edit <文件路径>)。 4. 新编程
全新 AI 技术栈:模型、Harness、Loop 与自我进化的智能体 | Tony Baitonybai.com · supportingWeb Analytics # 全新 AI 技术栈:模型、Harness、Loop 与自我进化的智能体 题图 题图 本文永久链接 – 大家好,我是Tony Bai。 在过去的 AI 浪潮中,所有人的目光都死死盯着基础模型(Foundation Models): 从 GPT-5.x 到 Claude Sonnet 5/Fable 5,再到各种开源大模型。整个行业似乎形成了一种思维定势——“只要模型更聪明,应用就会更好。” 但这其实是整个 AI 行业最大的谎言。 为什么手握同样的基础模型,顶尖大厂做出的 Claude Code 和 Codex等能够实现丝滑的工程自动化,而你熬夜写出的 Agent 却在跑了 20 步之后就因为上下文暴涨而当场崩溃? AI 圈技术专家 Rahul (@sairahul1) 在一篇名为“The New AI Stack: Models, Harnesses, Loops, and Self-Improving Agents”的技术长文中给出了答案:基础模型只是 passive(被动)的 CPU。真正决定一个 AI 产品是“玩具”还是“生产级工具”的,是包裹在模型之外的“驾驭框架(Harness)”。 更让人感到兴奋(甚至一丝敬畏)的是,在最新的 AI 工程实践中,这套驾驭框架已经开始由 AI 自行重写和优化,实现了真正的“自我进化”。 本文将和你一起来看看这个由Rahul提出来的“模型、Harness、循环、自优化智能体”构成的全新 AI 技术栈。看完这篇文章,你将彻底明白为什么各大前沿实验室的 Agent 能力正在呈指数级无声进化。 以下为译文全文: 所有人都在谈论 AI 模型。 但根本没有人关注那个真正让模型变得实用的底层逻辑。 Claude Code、Codex、Cursor…… [...] 但根本没有人关注那个真正让模型变得实用的底层逻辑。 Claude Code、Codex、Cursor…… 这些绝不仅仅是简单的“大模型”。 它们是被包裹在一整套工程系统之中的模型。 这套系统,被称为 “驾驭框架(Harness)”。 而如今,最顶尖的驾驭框架,已经学会了自我进化(Improve themselves)。 以下,是关于全新 AI 技术栈你所需要了解的一切。 整个 AI 产品圈深信不疑的谎
Harness要不要做?斯坦福的回答是:让AI自己做-品玩pingwest.com · supporting黄小艺 发布于 4月1日 同一个模型,换一套Harness,编程基准分就翻倍了,行业为此吵了两个月,现在斯坦福说:不用吵了。 ## Harness火了,但也吵起来了 2026年开年最热的AI工程概念,就是Harness。 它指的是模型之外的一切——prompt模板、上下文管理、检索策略、多步推理编排、工具调用逻辑。一句话概括:你怎么调用模型,和模型本身同样重要,甚至更重要。 OpenAI Codex团队5个月写了100万行Agent代码后,得出的最大教训是“Agent不难,Harness才难”;SWE-Bench Mobile论文中,同一个Claude Opus 4.5在不同Harness下成功率2%对12%,差了6倍;LangChain 的编码 Agent 在 Terminal Bench 2.0 上,通过仅优化 Harness 而不修改底层模型,得分从 52.8% 提升至 66.5%,排名从第 30 跃升至第 5。 数据足够有说服力。Harness这个概念迅速从学术圈破圈,成了产业界的高频词。 但一个概念一旦火了,争议就跟着来了。给这股Harness热泼冷水的,比如OpenAI的Noam Brown,说Harness本质是拐杖,模型终将超越它——推理模型出来后,大量精心设计的Agentic系统一夜淘汰就是明证;Claude Code团队也说,“所有秘密武器在模型本身,追求最薄的包装”。 Anthropic的实践还提供了一个微妙的视角。他们先为Opus 4.5做了一套相当厚重的Harness方案——GAN式对抗架构、三Agent分工、sprint合约;但Opus 4.6出来后,Harness直接做了减法:去掉sprint分解、整体简化,从6小时$200降到3.8小时$125。性能更好,成本更低。 [...] 战场三:编程Agent——超越人类Harness方案 在 Claude Haiku 4.5组别中,Meta-Harness 确实以 37.6% 拿到了组别第一,超越了所有已知的手工 Harness(如 Goose 和官方的 Claude Code);在 Claude Opus 4.6组别中,Meta-Harness 以 76.4% 拿到组别第二。 Meta-Harness在这个任务上还自主发现了一个关键trick——“Environmen
Gorden Sun on X: "Prime Agent:Prime Intellect开源的可自我改进Agent框架 使用Opus5模型,在ARC-AGI 3上得分95.5%,核心设计理念: 递归语言模型 (RLM):将上下文视为变量,支持LLM通过编写程序来操作自身上下文与管理历史。 持续化 Harness :将" / Xx.com · supportingLog inSign up ## Post user avatar Gorden Sun @Gorden\_Sun Prime Agent:Prime Intellect开源的可自我改进Agent框架 使用Opus5模型,在ARC-AGI 3上得分95.5%,核心设计理念: 递归语言模型 (RLM):将上下文视为变量,支持LLM通过编写程序来操作自身上下文与管理历史。 持续化 Harness :将 Prompt、技能、记忆和子Agent抽象为可动态增删改查的状态,根据运行轨迹自动更新,实现自我改进。 没有看到明显的创新点和特色,帖子这么火全是靠推广。之前的OpenClaw虽然质量不佳,但具有开源首创性,所以火了;后来的Hermes是靠框架自我改进能力,也火了一阵。 我不试了,我现在Agent就搭配订阅使用,也不折腾API,Codex、Claude Code、Cursor、Grok Build,主要就用这些。 Github:github.com/PrimeIntellect… user avatar Prime Intellect @PrimeIntellect Aug 5 Introducing Prime Agent: A self-improving RLM harness for coding and long-running autonomous tasks. Designed to be both token-efficient and expressive through programmatic tool calling, context as a variable, multi-agent messaging, and a self-modifiable harness state. [...] 00:00 10:58 AM · Aug 6, 20262.7KViews