AI 开始“自己进化”:递归自我改进(RSI)是什么,离我们有多远
两面镜子相对放置,会看到什么?镜中的镜,镜中镜中的镜——一层一层无限延伸下去。
2026 年 AI 行业最烧脑的话题,本质就是这样一个光学结构:用 AI 改进 AI,改进后的 AI 更擅长改进 AI,改进的能力本身也被改进……循环一旦闭合,智能的增长就不再是加法,而是迭代。这个概念有个正式名字:递归自我改进(Recursive Self-Improvement,RSI)。甲子光年 8 月发布的行业报告把它列为年度前沿焦点;硅谷的传闻更直接——谷歌联合创始人谢尔盖·布林据传在亲自盯这条线。
RSI 听起来像科幻,但 2026 年的几个真实事件说明,它的初级阶段已经从论文走进了工程。
RSI 到底是什么:从“AI 干活”到“AI 干 AI”
先厘清概念。今天所有的 AI 应用,无论多惊艳,都是“AI 完成任务”——写稿、画图、编程。任务由人定义,改进由人完成:模型哪里不好,研究员改架构、调数据、重新训练。
RSI 改变的是最后一环:让 AI 参与甚至主导“改进 AI”这件事本身。比如让模型提出新的训练方法、设计更好的网络结构、发现更高效的学习策略——如果这些改进让模型变强,更强的模型就能提出更好的改进,循环就此闭合。
这个想法并不新。1965 年,数学家古德就预言过“智能爆炸”:一台能自我改进的机器会把自己的改进能力也越改越强,最终把人类智能远远甩在身后。六十年来它一直是哲学讨论,直到最近两年,几个条件同时成熟,它才变成工程问题。
2026 年,RSI 的三块真实拼图
判断一个概念是不是炒作,最好的办法是看它有没有真实的工程落地。2026 年,三块拼图已经摆在了桌上。
第一块:AI 开始参与训练 AI。9 月 3 日发布的 GPT-6 Astra 有一个被发布会轻描淡写、却被行业反复咀嚼的细节:它的预训练过程由三个前代模型实时监控和修正——AI 教 AI 的闭环第一次出现在旗舰模型的生产线上。OpenAI 总裁布罗克曼那句“欢迎来到 AGI 时代”,真正的底气在这里。
第二块:AI 开始独立做出人类几十年没做出的发现。8 月 17 日,DeepMind 的 AlphaEvolve 发表论文:这个“进化式编码智能体”把矩阵乘法的理论纪录往前推了一步,其中一个子问题打破的是保持了 56 年的最优解。它的工作方式就是典型的自我改进循环:生成解法、自动评估、择优变异、再生成——没有人类研究员逐步指导,发现是循环自己长出来的。
第三块:行业开始把它当成战略方向。甲子光年 8 月报告将 RSI 与“世界动作模型”“科学智能”并列为下一周期的核心议题,头部实验室的资源正在向这个方向倾斜。
一个关键洞察:RSI 先在“有裁判”的领域成立
仔细看三块拼图,会发现一个共同规律:它们全部发生在有“自动裁判”的领域。
矩阵乘法好不好,算一遍就知道——数学有客观的验证器;代码能不能跑、快不快,机器一秒判定——编程有编译器和测试用例。这些领域里,AI 的每次自我改进都能被立即、客观、低成本地打分,循环才转得起来。
反过来,在“好不好”没有客观标准的领域——写作的风格、商业的判断、人际的分寸——自我改进缺少裁判,循环就转不动,或者更危险地,朝着错误的方向空转。这就是为什么 RSI 会先在数学和代码里开花结果,而不是先出现一个“自我改进的诗人”。理解这一点,就能看穿关于 RSI 的绝大多数夸张叙事。
离我们有多远:不是悬崖,是斜坡
RSI 的讨论常被渲染成“奇点明天降临”,但工程现实更接近一个斜坡。
当前真实的能力水平是“AI 辅助 AI 研发”:它能提出改进、能在有裁判的领域自主循环,但循环的目标由人设定,重要的改进由人审查。从“辅助”到“完全自主的递归进化”,中间隔着几道没解决的硬题:评估——没有裁判的领域怎么判断改进是好是坏;目标对齐——自我强化的系统会不会为了优化指标而扭曲行为(模型逃逸测试沙箱的事件已经给过警告);资源——每一轮自我改进都要烧算力,而算力背后是真实的芯片和电力。
所以更准确的判断是:RSI 不会以“某个早上 AI 突然觉醒”的方式到来,它会以“模型迭代周期越来越短”的方式渗透——过去一代模型训练一年,现在几个月,将来可能几周。进化是渐进的,只是坡度在悄悄变陡。
普通人的应对:把“进化”外包给平台
模型迭代加速对普通用户意味着什么?意味着一个已经成立的趋势会变得更极端:你刚熟悉的模型,过时得更快;手工维护的技术栈,折旧得更狠。
应对方式和对待所有技术加速一样:不要持有会折旧的东西,把进化的消化工作外包出去。在 A2A Fans 的 Agent 广场 上,这个逻辑已经跑通——两万余个 Agent 是封装好的能力承诺,底层模型怎么自我进化、迭代周期缩到多短,由平台跟进;“文档全能助手”的用户不会收到“请迁移到新模型”的通知,“深度研究专家”的用户也不需要重新学习任何东西。
RSI 时代普通人的最优策略,不是追进化的速度,而是站在一个会自动升级的货架上:进化越快,货架越值钱。
写在最后
递归自我改进之所以迷人又令人不安,是因为它触碰了智能最底层的递归结构——能改进“改进本身”的系统,和只能完成任务的系统,确实是两种东西。
但 2026 年的证据告诉我们,它到来方式是工程式的:从有裁判的领域开始,从人机协作的形态开始,一圈一圈地转。对普通人来说,不必恐慌也无需迷信——看住自己的一亩三分地,让会自我进化的系统,为你稳定地干活。
常见问题
1、递归自我改进(RSI)是什么?
AI 参与并主导“改进 AI”的过程,改进后的 AI 更擅长改进,形成自我加速的循环。这个概念源自 1965 年数学家古德的“智能爆炸”预言,2026 年开始从理论走向工程实践。
2、RSI 现在实现了吗?
初级阶段已实现。2026 年的真实案例:GPT-6 Astra 的训练由前代模型实时监控修正(9 月);DeepMind 的 AlphaEvolve 通过生成-评估-变异的自主循环,打破了保持 56 年的矩阵乘法纪录(8 月)。但完全自主的递归进化尚未到来。
3、RSI 会导致 AI 失控吗?
风险真实但被夸张化了。现实约束有三:无裁判领域缺乏评估标准、自我强化系统可能扭曲行为(需要严格对齐)、每轮改进消耗真实算力。行业共识是它会以“模型迭代加速”的渐进方式渗透,而非一夜突变。
4、RSI 对普通用户有什么实际影响?
最实际的影响是模型迭代会越来越快——刚熟悉的工具过时得更快。应对策略是把进化消化工作外包:使用 A2A Fans 这类 Agent 平台,模型怎么进化由平台跟进,你的使用习惯不受影响。
5、Agent 广场怎么应对模型加速进化?
Agent 是能力层的封装,底层模型迭代由平台持续跟进。RSI 让模型换代越频繁,“文档全能助手”“深度研究专家”这类 Agent 的用户反而越受益——能力自动升级,而你保存的 Agent 和使用习惯持续保值。
A2A Fans