
让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为:
递归自我改进(Recursive Self-Improvement,RSI)。
但几乎所有 RSI 系统都是同一套结构:一个固定不变的改进程序,反复作用于模型。并往往只从 Harness、Data 或 Model RSI 的单一视角切入。
为了回应这一难题,CosmosMind 联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校发布 MetaRSI-v1。
这是全球首个统一 Model-RSI、RSI、Harness-RSI 的元递归架构,能够改进"自我改进的过程"。
RSI 由此进入"平方时代"。

△论文首页
在没有任何外部教师模型参与下,MetaRSI-v1 使得一个仅 30 亿激活参数的小模型,在四项基准上平均自我提升 10.9 分;并且让 GPT-5.6、Claude Opus 5 等六款前沿旗舰模型,平均提升 7.3 分。

更重要的是数字背后, MetaRSI-v1 是一套试图统一整个 RSI 领域的架构语言:包括一个内核、两条编排轴、三个算子、整个元 RSI 层,以及五大定律。

△MetaRSI-v1 概览首次被统一的 Loop Kernel 范式
Loop Kernel 是 MetaRSI-v1 首次提出的自我改进统一形式。
它第一次把"进步如何发生"抽象成一条与对象无关的闭环:消费反馈得到的学习信号,在 Data、Harness、Model 上提出改动,交由验证器裁决,并将结果回流为下一轮信号。
Data、Harness、Model 从此开始能够被统一成同一 Kernel 的不同实例化算子,可组合、可统一调度,自我改进由此第一次拥有了统一、可复用的底层骨架。

△Loop Kernel 范式改进空间:RSI、Harness-RSI、Model-RSI
沿用同一个 Loop Kernel,自我改进在三个空间上展开,分别由 RSI、Harness-RSI、Model-RSI 三个算子承担并协同完成。
RSI:从自身运行轨迹提取学习信号,经校验用于合成数据交由下游消费,标定并放大模型正向能力与负向能力边界。
Harness-RSI:利用学习反馈信号,在 Harness 拆分出的 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位上生成改进,做加法与减法。
Model-RSI:更新模型自身的参数与结构,把反复验证有效的行为内化进模型。
纵横之间:让改进自己找到最优路径
横轴(horizontal orchestration)编排算子的应用顺序:RSI ² Agent 在每个决策点根据信号反馈选定下一个算子,再把该算子有机衔接编排送入 RSI Loop Kernel 执行。
纵轴(vertical optimization)优化算子的内部策略:RSI ² Agent 向目标算子专属的 RSI ² Sub-Agent 下发指令,后者根据学习信号与环境反馈等改写算子本身的 RSI 规则,优化 RSI 系统本身。
递归之上的递归:三层改进与"元层"的诞生
整套架构由四个 Agent 协调运作,并且均能被人类专家局部替换形成 human-in-the-loop 系统。
MetaRSI ² Agent:学习如何进行合适的纵横优化,优化RSI ² Agent的策略学习。
RSI ² Agent:在每个决策点选择进行横轴(指定下一个算子)或纵轴(向 Sub-Agent 下发策略改写指令)优化。
RSI ² Sub-Agent:在纵向优化中,接受来自RSI ² Agent的执行指令,对算子内部的 RSI 策略进行调整。
Transition Agent:负责衔接横向编排中上游算子的产物与下一个算子对产物的消费。
四个 Agent 对应形成三个 RSI 优化 Level:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略本身。
实验:小模型与前沿模型均实现自我进化
实验沿两条路线展开:
小模型路线使用可训练的开源模型,Data、Harness、Model 三个算子全部启用;
前沿模型路线面向 Claude Opus 5,GPT-5.6 sol,Kimi K3 等顶级模型,这类模型参数巨大或为闭源模型,仅启用 Data 与 Harness 算子。
路线一:小模型的自我改进
元股证券:ygzq.hk目标模型为 Qwen3.5-35B-A3B(35B 总参、3B 激活),在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond 高难度子集、AIME 四项基准上评测。

△MetaRSI 让 Qwen3.5-35B-A3B 实现自进化
MetaRSI-v1 平均提升 10.9 分,SWE-bench Pro解决率接近翻倍,Meta 层为 RSI 带来更高的天花板,连续自进化的累计增益提升显著。

△"改进改进者",MetaRSI 让小模型累计自进化增益扩大路线二:前沿模型的自我改进
多款前沿模型在 Terminal-Bench 2.1 上平均提升 7.3 分,说明 MetaRSI 范式对前沿模型同样成立,旗舰模型同样留有可观的自我改进空间。

△六款前沿模型的自我改进五条定律:为"机器如何进步"立法
MetaRSI 梳理出两条互补的改进路线:Harness-RSI 保持权重不变,让自我改进覆盖任何可通过接口调用的模型;Model-RSI 通过训练把能力内化进模型。
且 MetaRSI 首次重新定义了 RSI,作为模型的能力边界探测与放大器,通过对执行轨迹与外界反馈 learning-signal 的联合分析得到经过验证的经验并 scale 为可复用的数据,并标定这些经验能够支撑到哪里,框定模型能力的正、负边界。
RSI 的产物同时供给 Harness-RSI 与 Model-RSI 消费,两条路线的改动结果又能够流回 RSI,重新标定能力边界、驱动下一轮,能力由此逐轮披露、累积。
在这一过程中,Harness 不仅能做加法还能做减法:RSI 放大暴露的问题经 Model-RSI 内化之后,原本吸纳在 Harness 中的知识会变成冗余,Harness-RSI 系统在回放校验下将其删除,能力留下,成本退场。
在此之上,MetaRSI 提炼出五条定律。
定律一:验证决定自我改进的前沿。
一个领域能不能形成自改进闭环,取决于该领域任务能否被检验,是否有合适的 verifier。
定律二:自我认知会过期,重新发现能力边界是速率瓶颈,RSI 改变 agent 能力,其原本旧的系统描述随即失效。
定律三:能力与载体无关但成本与载体有关。
例如同一项能力放在 Harness 里每次推理都要重付成本,内化进 Model 只需付一次,成熟循环能够持续把能力迁移到更便宜的载体。
定律四:可信度由不可写面度量。
在闭环内部,真正能力变强和放宽成功标准会得到完全相同的分数,而且这种偏差从内部无法察觉、也无法靠统计纠正。
定律五:循环不凭空创造能力,一切增益本质上都是外部信息熵的输入或能力的激发。
自改进只能重新组织、放大并固化模型已经具备的潜力。因此每次提升都要分清两部分:哪些是把已有能力放大出来的,哪些是真正从外部新引入的。
环环相扣,终成文明:让每个科学领域都拥有进化闭环
人类历史每一次的跃迁,都源于"生产答案的方式被重新发明"。
MetaRSI 要在 AI 时代把这件事再做一遍。
它背后的 CosmosMind 团队,是一支由清华 / 北大 / 斯坦福等海内外名校硕博、头部大厂基模核心组研究员、著名产业方领军人物组成的小而精的团队,长期从事大规模模型训练 /RSI/ 智能体 / 科学计算等工作,在顶会顶刊上发表过诸多有影响力的论文。
这一次,他们没有选择再做一个更大的模型,而是把全部精力押在了"改进改进本身"这件事上。
团队同步了开源 RSI-Harness,这是一个能自我学习、自我迭代的 Harness,并可以在使用中为不同科学领域与工程实践沉淀出可移植的Harness Genome。
Cosmosmind 已经把目光投向了闭环触碰物理世界:可编程仪器、自动化实验室成为执行器和验证器,仿真、台架实验、真实仪器可以像三级火箭一样逐级推进,把不可逆的昂贵操作放到最后——第一个在物理世界关上的进化循环,很可能不会出现在开放环境里,而会出现在自动化实验室中。
研究者面对的不再是一堆待验证的猜测。人类只需负责定义问题与价值判断,而机器负责让"从假设到验证"的循环,以过去无法想象的速度开始转动。
相信在 MetaRSI 的后时代,AI 将会从解题工具走向文明级的进化引擎。
Cosmomind 官网:https://cosmosmind.ai/

项目主页:https://github.com/CosmosMind-ai/RSI-Harness
配资界官网论文:https://www.cosmosmind.ai/research/metarsi-v1
arxiv:https://arxiv.org/abs/2609.06396
HuggingFace:https://huggingface.co/CosmosMind/RSI-Harness
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见上海股票配资平台可靠吗
融资融券网提示:本文来自互联网,不代表本网站观点。