查看作品文字内容

解析 · 人工智能 AI 开始造 AI: 把 RSI 这个词讲清楚 如果一台机器能设计出比自己更好的机器,那它会设计出什么?这个问题今年不再是哲学讨论——它已经开始出现在模型训练日志里。 主题 递归式自我改进(RSI) 解析来源 视频号 · 远哥带你看 核对时间 2026-09-24 原文出处 本文解析自视频号短内容 《AI已经开始参与研发下一代AI了》 (2026 年 9 月 23 日发布)。视频里的核心说法是: “如果把传统大模型训练比作让 AI 进大学学知识,RSI 更像把它送进‘社会大学’——走进真实任务,从结果中不断调整自己。”视频点名上海 AI 公司 StartLux 正在做这件事,并在结尾抛出问题:AI 连“如何让自己变强”都越做越好,会不会最终走向智能爆炸? 下面按科普方式把这套说法展开:哪些已经被公开事实印证,哪些还只是单方描述。 01 先把词拆开:RSI 到底是什么 RSI,全称 Recursive Self-Improvement,中文通常译作“递归式自我改进”。它的意思是: AI 参与到对自身的改进中去,形成“能力提升 → 研发能力增强 → 能力再提升”的正反馈 。 放到日常语言里,可以这样理解:普通 AI 帮你写代码,是因为你要它写;RSI 里的 AI 写代码,是为了让下一代 AI 更强,然后再用更强的下一代去设计再下一代。链条一旦转起来,改进的推力就不再只来自人。 这里最容易搞混的一点是: RSI 不是“有”或“没有”的开关,而是一个连续谱 。真正有价值的提问不是“AI 会不会自我改进”,而是——这个闭环,已经闭合了多少? 02 这个念头其实很老 RSI 不是 2026 年的新发明,它最早来自一位数学家在半个多世纪前的一句话。 1965 “最后一项发明” 英国数学家 I. J. Good 提出:如果一台机器能在各种智力活动上超过人类,而设计机器本身也是一种智力活动,那么它原则上就能设计出更好的机器。第一台超智能机器,可能是人类需要完成的最后一项发明。(不同资料记为 1965 或 1966 年) 2008 这个词被正式命名 Eliezer Yudkowsky 在直接以该概念为题的文章中给出定义:AI 重写自己的认知算法,让原本作用于外部对象的智能开发能力反过来作用于自身,由此“闭合循环”。 2014 给“爆炸”装上刹车片 哲学家尼克·波斯特洛姆在《超级智能》里提出一个关键比值:智能演进速度 = 优化能力 ÷ 改进阻力。RSI 会放大优化能力,但最易得的改进会被用尽,数据、算力、电力都会变成阻力——所以 RSI 并不自动等于智能爆炸。 之后 一个形象的阶段划分 研究者图尔钦与邓肯伯格把 AI 分为“狭义 AI”(人的工具)与“青年 AI”(开始自我提升、自我进化)。从工具变成“青年”,才是 RSI 真正改变的东西。 03 为什么偏偏是 2026 年被翻出来 因为过去一年多,一批可以查证的具体事件,把这个概念从论文推到了工程现场。 2025 年 5 月 ,Google DeepMind 公布 AlphaEvolve:用大模型生成候选算法,靠自动评估和演化搜索保留更优方案,已被用于优化数据中心调度、芯片设计和 AI 训练流程。 2026 年 2 月 ,OpenAI 称 GPT-5.3-Codex 在“创建自身”的过程中发挥了重要作用——早期版本被用于监控和调试训练、管理部署、分析评测结果。同期,Meta 研究者发布 HyperAgents:它能修改那个“负责修改任务智能体的元智能体”本身。 真正让公众开始讨论的是 2026 年 6 月 16 日 Anthropic 发布的报告《当 AI 开始建造自身》。报告披露:截至 2026 年 5 月,Anthropic 代码库中 超过 80% 的合入代码由 Claude 编写 ;Claude 智能体已经可以自主提出并检验假设,累计执行约 800 小时 的开放式 AI 安全研究实验。 OpenAI 也披露了自己的口径:截至 2026 年 8 月,其研究组织中 每 1 个人类研究日,对应约 3.1 个 AI Agent 工作日 ;但也坦承,在 4 到 8 小时的复杂任务里,超过一半的成功案例仍需要人工救场。 80 % Anthropic 代码库中由 Claude 编写并合入的代码占比 Anthropic 报告,截至 2026-05 800 小时 Claude 智能体自主执行的开放式安全研究实验时长 同上 3.1 :1 OpenAI 研究组织中 AI Agent 与人类的工作日之比 OpenAI 披露,截至 2026-08 46.5 亿美元 RSI 方向公司 Recursive Superintelligence 的投后估值(2026 年 5 月融资 6.5 亿美元) 公开报道 钱和人也在往同一个方向挤。由多位 AI 研究者创办的 Recursive Superintelligence 完成 6.5 亿美元融资;前 Anthropic Discovery 团队负责人创办的 Mirendil 以 RSI 为核心方向拿到 2 亿美元种子轮;在谷歌工作 27 年的 Jeff Dean 离职创办的 Discovery Loop,方向同样是把完整的实验循环交给 AI;Andrej Karpathy 则开源了 autoresearch,让 Agent 在真实的小模型训练环境里自己改代码、跑训练、看结果。 国内的时间点也很有意思:就在视频发布当天(9 月 23 日),机器之心联合张江 AI 创新小镇在上海办了一场名为「AI²:当 AI 学会自我超越」的技术沙龙,主题正是“今天的 AI 究竟进入了 AI 研发循环的哪些环节”。 04 视频里那家公司,具体在做什么 视频点名的 StartLux,是上海的 AI 公司,注册主体为上海原点星辉科学技术有限公司,方向是本地 Agent 模型。它的模型 StartLux-V1.0-27B-Preview 以 Qwen3.6-27B 为基座做后训练,可以在消费级个人电脑上跑。 成绩单来自中国信通院人工智能研究所的“可信 AI 大模型基准测试——MCP 专项测试”:综合性能排名第二,综合得分 39.25,超过 284B 参数的 DeepSeek-V4-Flash-0731 与 198B 的 Step-3.7-Flash,同等参数规模下比 Qwen-3.6-27B 高 5.34 个百分点,仅次于 1.6T 参数的 DeepSeek-V4-Pro;在位置导航任务上排名第一,浏览器自动化、金融分析等单项与 DeepSeek-V4-Pro 并列或独占第一。 但真正和 RSI 相关的是训练方法。团队称,在这版模型的后训练中, 约 70% 的实验研发工作由 AI 独立完成 ——包括提出实验假设、生成或筛选数据、启动训练和评测、分析失败轨迹,再决定下一轮试什么;人类研究员负责的是研究方向和关键取舍。 “如果只是批量生成合成数据,或者自动搜一组超参数,我会把它叫自动化,而不是 Research。真正的 Auto Research 应该形成‘假设—实验—验证—新假设’的闭环。” —— StartLux 联合创始人兼 CTO 郭权玮 …