
Self-Harness团队 投稿
量子位 | 公众号 QbitAI
让AI我方改我方的Agent Harness,这事还是被顶级Agent社区堤防到了。
上海东说念主工智能践诺室团队冷落的Self-Harness,近期被LangChain CEO、长入首创东说念主Harrison Chase转发,也被前OpenAI副总裁Lilian Weng收进自进化Agent关联博客。
它盯上的不是换模子,而是Agent外层那套Harness。
作念法很班师。模子先查验我方的运行轨迹,从失败里挖出神情,再冷落有规模的Harness修改,临了交给回想测试决定要不要收受。
践诺收尾骄横,在Terminal-Bench-2.0上,底层模子、器用环境和评测契约皆保抓不变,只改Harness,三个模子后端皆拿到了held-out援手。
其中Qwen3.5-35B-A3B总援手达到104%,MiniMax M2.5和GLM-5辩认援手28%和24%。
论文和样式还是公开,文末附贯穿。

△LangChain CEO/co-founder Harrison Chase转发Self-Harness让Harness我方进化
Agent Harness不错贯通为包在模子外层的一套运行装配,笼罩系统辅导词、器用使用规则、考据器、运行时赶走战略和轻量middleware。
在多轮器用任务里,它决定Agent怎么调用器用,什么期间停,失败后怎么复原,居品又该怎么考据。
往常,这套东西主要靠工程师手调。要读大批奉行轨迹,找失败原因,改辅导词或器用规则,再反复跑benchmark。
模子越多、任务越杂,Harness就越难继续按“一模子一套东说念主工调参”的样式推广。
△三种Harness纠正范式:东说念主工改、强模子外助改,以及Self-Harness让模子基于自身轨迹改Self-Harness怎么职责
换到Self-Harness,经由被压成三步。先挖缺点,再提改法,临了跑回想。
Weakness Mining:从失败轨迹挖缺点系统先让现时Harness驱动固定模子完成一批任务,记载齐全奉行轨迹、器用调用和评测收尾。
失败样本不会被当成孤例处理。Self-Harness会勾通考据器反映、Agent行为和失败之间的因果关连,把可复用的失败机制聚起来。
这么,“某个任务没过”会变成“这一类失败可能来自归拢种Harness颓势”。比如穷乏最终居品、近似奉行无效敕令、器用报错后不复原,能够探索太久却迟迟不参加完了。
Harness Proposal:提有规模的改法拿到结构化失败根据后,归拢个模子会切换成proposer,针对已挖出的失败机制冷落候选Harness edit。
这些edit只可落在事前声明的可裁剪名义上,不行把通盘这个词Agent赶走架构推倒重来。
每个提案皆要说明念念改变哪种行为,可能带来什么回想风险,以及为什么可能修好现时失败神情。
Proposal Validation:用回想测试拍板候选Harness会在归拢评测契约下重跑,并和现时Harness对比。
接受规则很保守。held-in或held-out至少一个split要援手,另一个split不行退化,才会参加下一代Harness。
这亦然它和平方“自动改prompt”的离别。Self-Harness不让模子凭嗅觉拍板,而是把每一次调动皆放进可记载、可复现、可回退的评测闭环里。
△Self-Harness自纠正闭环,包括缺点挖掘、修改提案和回想考据不换模子,只改外层也能涨
论文在Terminal-Bench-2.0上作念了系统评测。
Terminal-Bench-2.0是一个多轮智能体benchmark,任务运行在容器化结尾环境中,笼罩文献责罚、敕令奉行、作假复原、居品考据等真实器用使用智力。
在固定模子、器用集、任务环境和评测竖立的前提下,Self-Harness只改Harness。收尾三个模子皆出现援手。
MiniMax M2.5总援手28%,Qwen3.5-35B-A3B总援手104%,GLM-5总援手24%。
这组收尾的要点不是又换了一个更强模子,而是在归拢个模子外面,Harness本人也不错被搜索、考据和迭代。
△Terminal-Bench-2.0收尾,三个模子后端在Self-Harness后均赢得held-out援手
更艰巨的是,每个候选修改皆经过held-in和held-out回想测试。
换句话说,Self-Harness不是堆更长的辅导词,而是在一次次考据门控后,只留住确凿带来收益、又莫得昭彰回退的Harness edits。
△Qwen3.5 Self-Harness进化路子,通过多轮考据门控保留灵验edits不同模子暴深化不同缺点
Self-Harness的另一个不雅察更像工程现场。不同模子不是归拢种失败。
MiniMax M2.5:找到陈迹后迟迟不录用在启动Harness下,MiniMax M2.5偶而会抓续探索数据集。即使还是找到要道元信息,也迟迟不创建评测所需的谜底文献,临了因为穷乏居品或超时失败。
Self-Harness保留的修改会荧惑Agent更早识别必需输出,先创建启动居品,并在器用调用过永劫转向具体完了和考据。
Qwen3.5-35B-A3B:器用失败后容易堕入轮回Qwen3.5-35B-A3B的常见问题,是器用失败后参加近似裁剪、近似笼罩或近似敕令轮回,甚而在罢手前删除评测必需文献。
Self-Harness为它引入依赖预查验、失败后居品复原、幸免总计谈判敕令重试,以及由器用作假触发的artifact-focused提醒。
△Qwen3.5保留住来的code-level Harness edits,长入在依赖预查验、居品复原和重试拘谨。GLM-5:更需要管住shell气象和节律
GLM-5暴深化的缺点更长入在shell会话气象,以及从探索切到完了的时机。
纠正后的Harness会提醒Agent在修改环境变量、安装器用或调养旅途后,阐述这些变化能跨敕令抓续可用。当永劫辰探索还莫得变成居品时,系统也会鼓动它转向完了与测试。
这说明Self-Harness不仅仅给通盘模子加一段通用辅导。它会根据每个模子在真实轨迹中暴深化的缺点,生成并筛选稳健它的Harness调动。
为什么会引起珍重Agent越来越像跑在器用环境里的系统,而不是只回话单轮问题的模子。
在这种设定里,模子智力仅仅一部分。外层Harness决定它是否知说念何时调用器用,怎么从作假中复原,是否保留正确居品,退出前有莫得作念考据。
往常,Harness工程更像造就活。Self-Harness给出的倡导是,让模子我方参与这套造就的挖掘和改写,但最终仍由评测而不是自评来拍板。
它莫得讲解“Agent不错总计我方进化”,也莫得绕过benchmark限度。论文里的收尾主要来自Terminal-Bench-2.0和固定模子后端。
但看成一个自进化Agent的组件,它给出了相比知道的规模:改什么,怎么改,怎么验,什么期间拒却。
酌量团队该职责来自上海东说念主工智能践诺室团队,论文题为Self-Harness: Harnesses That Improve Themselves。
从现存文档看,团队公开了论文和样式地址,读者不错检察具体践诺缔造、Harness edits和代码。
论文:https://arxiv.org/abs/2606.09498
样式地址:https://github.com/qzzqzzb/Self-Harness— 完 —
量子位 QbitAI · 头条号
珍重咱们开yun体育网,第一时辰获知前沿科技动态
