MIT Alex Zhang:RLM、智能体集群与下一代模型形态

Latent Space1 天前

核心看点

这期访谈聚焦 MIT 博士生 Alex Zhang 的研究脉络:从 GPU kernels、KernelBench,到 Recursive Language Models(RLMs)、harness 设计和大规模多智能体系统。讨论的主线是:当模型本身越来越强时,真正限制能力释放的,可能不只是模型参数,而是包裹模型的系统设计。

从 GPU 内核到 AI 写代码

Alex Zhang 参与了 GPU Mode 社区,也关注 AI 生成 GPU kernels 的能力边界。访谈中提到,AI 写内核虽然进展很快,但仍然留给人类专家大量空间。

一个重要观点是:在某些场景下,单个专家洞察可能替代大量暴力 token 搜索。也就是说,模型可以生成许多候选解,但真正高效的性能优化往往依赖对硬件、编译器、内存访问和任务结构的深刻理解。

相关讨论包括:

  • GPU Mode 与 KernelBench
  • AI-written kernels 的现状
  • 人类专家经验与暴力搜索之间的关系
  • 为什么某些“微小”的工程洞察会带来巨大性能差异

研究品味:PhD 应该押注什么问题

访谈强调了研究品味的重要性。Alex Zhang 认为,博士生应该敢于押注那些一开始看起来很普通、奇怪,甚至像是“没什么意义”的方向。

讨论中提到的例子包括:

  • SWE-bench
  • RLMs
  • ReAct
  • Quiet-STaR

这些方向在早期可能并不显得显而易见,但后来都在不同程度上揭示了模型能力、推理方式或系统组织形式中的关键问题。

重新理解“语言模型”

访谈中讨论了 GEV,以及为什么“语言模型”不一定必须等同于标准的自回归 text-to-text decoder。

这引出一个更大的问题:未来用户调用的“模型”,表面上可能仍是一个简单接口,但底层实际运行的可能是更复杂的 scaffold、harness,甚至是一整组智能体。

换句话说,未来的“语言模型”可能不再只是单次前向生成文本,而是包含:

  • 多轮上下文管理
  • 工具调用
  • 子任务拆解
  • 多智能体协作
  • 共享记忆
  • 自我修改的执行框架

RLM:递归语言模型的关键思想

Recursive Language Models(RLMs)是访谈重点之一。其核心思路是让模型不仅生成答案,还能把自己的 prompt、上下文和执行流程作为外部环境中的对象来操作。

访谈中提到的 RLM 相关机制包括:

  • context offloading:将上下文卸载到外部结构中管理
  • code execution:通过代码执行扩展模型能力
  • recursive subagents:递归调用子智能体处理子问题
  • shared memory:在多个执行单元之间共享状态
  • programmatic tool calling:用程序化方式调用工具,而不是仅靠自然语言提示

一个相关案例是 Prime Agent,被描述为面向编码和长时间自主任务的 self-improving RLM harness。它强调 token 效率、程序化工具调用、将 context 视为变量、多智能体消息传递,以及可自我修改的 harness state。

Harness 作为组合泛化器

访谈提出了一个重要判断:harness 设计本身可能改善模型在任务和领域之间的组合泛化能力。

这里的 harness 可以理解为模型外部的执行框架。它负责组织上下文、调用工具、拆分任务、协调子智能体,并维护运行状态。

访谈中还提到,Claude Code、Codex 和 Pi 在表面体验上差异很大,但结构上可能比看起来更相似:它们都不是单纯的“模型直接回答”,而是模型与外部系统协同工作的结果。

多智能体系统与未来模型接口

访谈进一步讨论了智能体集群。一个引人注意的观点是:未来用户查询的模型,背后可能实际上是一整个 swarm 或 scaffold。

涉及的话题包括:

  • OpenAI 的大规模智能体实验
  • 10,000-agent experiment
  • 130B output tokens
  • 约 4000 万美元等价的问题求解成本
  • Kimi 与 OpenAI 在多智能体系统上的不同路径
  • Sakana AI 的开放式研究方法

不过,访谈也指出,多智能体 swarm 中可能存在大量浪费性搜索;即便如此,如何让这些系统真正收敛,仍然是困难问题。

能力悬置与工具调用

Alex Zhang 还讨论了 capability overhang:当前前沿模型可能已经具备很多尚未被充分释放的能力,瓶颈可能在于系统如何组织这些能力。

其中一个方向是 speculative programmatic tool calling,即在生成过程中与工具执行重叠,让模型不只是“想完再调用工具”,而是在推理和执行之间形成更紧密的流水线。

这类机制可能改变模型完成复杂任务的方式,尤其是在编码、科学研究、长期任务和多步骤规划场景中。

Neuralese:模型是否受语言形式限制?

访谈还讨论了一个更开放的问题:模型推理是否被英语、代码或其他表达形式限制?

所谓 “Neuralese” 指的是一种可能不同于自然语言和传统代码的内部表达方式。问题在于,如果模型必须通过英语或代码进行推理,它的思考方式是否被这些媒介约束?未来是否会出现更适合模型自身的推理语言或中间表示?

访谈时间线

  • 00:00:00:开场介绍
  • 00:00:49:GPU Mode、KernelBench 与 AI-written kernels
  • 00:07:38:人类专家经验与暴力 AI 搜索
  • 00:13:20:研究品味与大胆押注
  • 00:19:28:GEV 与重新理解语言模型
  • 00:29:03:电子游戏智能体与 harness 问题
  • 00:31:01:Claude Code、Codex 和 Pi 的结构相似性
  • 00:36:42:harness 作为组合泛化器
  • 00:44:24:RLMs 解释
  • 00:52:01:Prime Agent 与持久子智能体
  • 00:57:41:RLMs 的实际应用
  • 01:00:30:OpenAI swarms 与语言模型未来
  • 01:07:26:开放式研究与 Sakana AI
  • 01:15:52:Kimi 与 OpenAI 的智能体集群路径
  • 01:20:06:能力悬置与 speculative tool calling
  • 01:28:19:Neuralese、未来研究与 AI for Science

小结

这次访谈的核心并不是某一个模型架构,而是一个更系统性的问题:当基础模型能力持续提升时,如何通过 harness、上下文管理、工具调用和多智能体协作,把潜在能力真正转化为可用能力。

RLM、Prime Agent、智能体集群和 Neuralese 都指向同一个方向:未来的“模型”可能不再只是一个生成文本的网络,而是一个由模型、工具、记忆、执行环境和智能体协作组成的复杂系统。

评论

请登录后发表观点

暂无数据