MIT Alex Zhang:RLM、智能体集群与下一代模型形态
核心看点
这期访谈聚焦 MIT 博士生 Alex Zhang 的研究脉络:从 GPU kernels、KernelBench,到 Recursive Language Models(RLMs)、harness 设计和大规模多智能体系统。讨论的主线是:当模型本身越来越强时,真正限制能力释放的,可能不只是模型参数,而是包裹模型的系统设计。
从 GPU 内核到 AI 写代码
Alex Zhang 参与了 GPU Mode 社区,也关注 AI 生成 GPU kernels 的能力边界。访谈中提到,AI 写内核虽然进展很快,但仍然留给人类专家大量空间。
一个重要观点是:在某些场景下,单个专家洞察可能替代大量暴力 token 搜索。也就是说,模型可以生成许多候选解,但真正高效的性能优化往往依赖对硬件、编译器、内存访问和任务结构的深刻理解。
相关讨论包括:
- GPU Mode 与 KernelBench
- AI-written kernels 的现状
- 人类专家经验与暴力搜索之间的关系
- 为什么某些“微小”的工程洞察会带来巨大性能差异
研究品味:PhD 应该押注什么问题
访谈强调了研究品味的重要性。Alex Zhang 认为,博士生应该敢于押注那些一开始看起来很普通、奇怪,甚至像是“没什么意义”的方向。
讨论中提到的例子包括:
- SWE-bench
- RLMs
- ReAct
- Quiet-STaR
这些方向在早期可能并不显得显而易见,但后来都在不同程度上揭示了模型能力、推理方式或系统组织形式中的关键问题。
重新理解“语言模型”
访谈中讨论了 GEV,以及为什么“语言模型”不一定必须等同于标准的自回归 text-to-text decoder。
这引出一个更大的问题:未来用户调用的“模型”,表面上可能仍是一个简单接口,但底层实际运行的可能是更复杂的 scaffold、harness,甚至是一整组智能体。
换句话说,未来的“语言模型”可能不再只是单次前向生成文本,而是包含:
- 多轮上下文管理
- 工具调用
- 子任务拆解
- 多智能体协作
- 共享记忆
- 自我修改的执行框架
RLM:递归语言模型的关键思想
Recursive Language Models(RLMs)是访谈重点之一。其核心思路是让模型不仅生成答案,还能把自己的 prompt、上下文和执行流程作为外部环境中的对象来操作。
访谈中提到的 RLM 相关机制包括:
- context offloading:将上下文卸载到外部结构中管理
- code execution:通过代码执行扩展模型能力
- recursive subagents:递归调用子智能体处理子问题
- shared memory:在多个执行单元之间共享状态
- programmatic tool calling:用程序化方式调用工具,而不是仅靠自然语言提示
一个相关案例是 Prime Agent,被描述为面向编码和长时间自主任务的 self-improving RLM harness。它强调 token 效率、程序化工具调用、将 context 视为变量、多智能体消息传递,以及可自我修改的 harness state。
Harness 作为组合泛化器
访谈提出了一个重要判断:harness 设计本身可能改善模型在任务和领域之间的组合泛化能力。
这里的 harness 可以理解为模型外部的执行框架。它负责组织上下文、调用工具、拆分任务、协调子智能体,并维护运行状态。
访谈中还提到,Claude Code、Codex 和 Pi 在表面体验上差异很大,但结构上可能比看起来更相似:它们都不是单纯的“模型直接回答”,而是模型与外部系统协同工作的结果。
多智能体系统与未来模型接口
访谈进一步讨论了智能体集群。一个引人注意的观点是:未来用户查询的模型,背后可能实际上是一整个 swarm 或 scaffold。
涉及的话题包括:
- OpenAI 的大规模智能体实验
- 10,000-agent experiment
- 130B output tokens
- 约 4000 万美元等价的问题求解成本
- Kimi 与 OpenAI 在多智能体系统上的不同路径
- Sakana AI 的开放式研究方法
不过,访谈也指出,多智能体 swarm 中可能存在大量浪费性搜索;即便如此,如何让这些系统真正收敛,仍然是困难问题。
能力悬置与工具调用
Alex Zhang 还讨论了 capability overhang:当前前沿模型可能已经具备很多尚未被充分释放的能力,瓶颈可能在于系统如何组织这些能力。
其中一个方向是 speculative programmatic tool calling,即在生成过程中与工具执行重叠,让模型不只是“想完再调用工具”,而是在推理和执行之间形成更紧密的流水线。
这类机制可能改变模型完成复杂任务的方式,尤其是在编码、科学研究、长期任务和多步骤规划场景中。
Neuralese:模型是否受语言形式限制?
访谈还讨论了一个更开放的问题:模型推理是否被英语、代码或其他表达形式限制?
所谓 “Neuralese” 指的是一种可能不同于自然语言和传统代码的内部表达方式。问题在于,如果模型必须通过英语或代码进行推理,它的思考方式是否被这些媒介约束?未来是否会出现更适合模型自身的推理语言或中间表示?
访谈时间线
- 00:00:00:开场介绍
- 00:00:49:GPU Mode、KernelBench 与 AI-written kernels
- 00:07:38:人类专家经验与暴力 AI 搜索
- 00:13:20:研究品味与大胆押注
- 00:19:28:GEV 与重新理解语言模型
- 00:29:03:电子游戏智能体与 harness 问题
- 00:31:01:Claude Code、Codex 和 Pi 的结构相似性
- 00:36:42:harness 作为组合泛化器
- 00:44:24:RLMs 解释
- 00:52:01:Prime Agent 与持久子智能体
- 00:57:41:RLMs 的实际应用
- 01:00:30:OpenAI swarms 与语言模型未来
- 01:07:26:开放式研究与 Sakana AI
- 01:15:52:Kimi 与 OpenAI 的智能体集群路径
- 01:20:06:能力悬置与 speculative tool calling
- 01:28:19:Neuralese、未来研究与 AI for Science
小结
这次访谈的核心并不是某一个模型架构,而是一个更系统性的问题:当基础模型能力持续提升时,如何通过 harness、上下文管理、工具调用和多智能体协作,把潜在能力真正转化为可用能力。
RLM、Prime Agent、智能体集群和 Neuralese 都指向同一个方向:未来的“模型”可能不再只是一个生成文本的网络,而是一个由模型、工具、记忆、执行环境和智能体协作组成的复杂系统。
