AI 日报:GPT-6.1 Sol、Sonnet 5.5 与智能体工具链更新

Latent Space1 天前

概览

10 月 1—2 日,AI 社区整体较为平静,但仍有几条值得关注的技术动态:新模型继续围绕成本与性能展开竞争,智能体工具链持续扩展,决策模型和本地推理生态出现新进展,研究侧则聚焦多工具环境下的智能体训练与强化学习效率。

模型:GPT-6.1 Sol 与 Sonnet 5.5 的成本—性能竞争

GPT-6.1 Sol 定价与定位

OpenAI 的 GPT-6.1 Sol 被定位为更便宜、更快的模型。其价格为:

  • 输入:每百万 token 2 美元
  • 输出:每百万 token 10 美元

相比之下,GPT-6 Astra 的价格为每百万输入 / 输出 token 10 / 50 美元。

社区转述的评测结果显示,Sol 在部分基准中表现较强:

  • 在 DeepSWE v1.1 上,据称比 GPT-6 Sol 高 6.4 分;
  • 在 AutomationBench 上,据称比 Opus 5.5 高 2.2 分;
  • OpenAI 员工将其描述为“好、便宜且快”。

另有开发者反馈称,Sol 很偏好使用 codemode,这与 GPT 系列模型接受相关训练的说法相吻合。

Agent Arena 排名

在 Agent Arena 中:

  • Sol [Max] 进入第 5 名,成绩为 +11.23%;
  • 每个任务的中位成本为 0.56 美元;
  • 相比 GPT-6 Sol,成本低 39%,分数高 1.52;
  • 相比 GPT-6 Astra,成本低 81%,分数差距在 1.04 分以内。

Sonnet 5.5 [Max] 则以 +12.5% 的成绩进入第 3 名,并在 Chat 类别排名第 1。不过其每任务成本为 2.74 美元,高于排名第 2 的 Opus 5.5 的 1.58 美元,因此未进入帕累托前沿。

目前 Anthropic 模型占据 Agent Arena 前三名。

Code Arena 与 Text Arena

在 WebDev 排名中,Sol 曾短暂进入第 3 名,随后被 Sonnet 5.5 挤到第 4 名。

其他变化包括:

  • Sonnet 在 WebDev 中距离 GPT-6 Astra [Max] 约 2 分,但成本低约 80%;
  • Gemini 4 Argon [High] 在 Text Arena 中排名第 1;
  • 开源模型 MiMo-V2.6-Pro 与 Flash 分别进入 Agent Arena 开源模型第 5 和第 9 名。

其他独立评测

WeirdML v3 的不完整评测显示:

  • Sol token 使用效率较高,接近 Astra,但峰值能力较低;
  • Sonnet 5.5 超过 Opus 5;
  • Grok 4.7 超过 Kimi-K3。

Design Arena 分析了 324 份模型“思考摘要”,发现:

  • Astra 的模糊表述频率约为 Opus 5.5 的 20 倍;
  • Opus 在约五分之四的摘要中较早给出明确判断。

StepFun 的 Step 5 Preview 在 Vals 中位列开源权重模型第 7,每任务成本为 2.54 美元,平均每个任务耗时接近两小时,支持 100 万 token 上下文窗口。

未确认传闻

社区中还出现两条未确认消息:

  • Claude Fable 5.5 可能在下周发布,并据称超过因安全问题推迟的 “Astra 6.1”;发布者明确表示无法验证这些说法;
  • 有人发现 “GPT-6 Astra Lite” 条目,并猜测其可能与 Sol 是同一模型。

决策模型与本地推理生态

llama.cpp 新增 /v1/systemone 端点,用于本地运行类似 Jev 的决策模型推理。

相关进展包括:

  • 本地运行方式示例:llama serve -hf ggml-org/Kev-4B-GGUF;
  • Kev 1.0 的工作机制已有介绍文章发布;
  • Perplexity 称 pplx-decider-v1-27b 在 11 个基准上的平均分为 85.7%,高于 Jev;
  • Clef 决策模型已上线 Ollama;
  • 有研究者认为,所谓决策模型本质上是零样本分类器的重新包装;
  • 另有分析将 Jev 风格的校准与价值函数、Q 函数预测联系起来。

此外,webAI 发布 TwIL-LM3-Pro:

  • 参数量为 3.66B;
  • 基于 Granite 4.2 后训练;
  • 在 webAI 测试中,形式逻辑能力大致接近 Qwen3-8B;
  • Q4 GGUF 文件大小为 2.09 GiB;
  • 采用非商业许可。

Reka 则发布了 RIDM 逆动力学模型,许可证为 Apache 2.0。该模型在游戏数据上训练,可泛化到真实视频,并提取运动与摄像机动作。

智能体、助手与开发者工具

OpenAI dot

Sam Altman 表示,dot 是他最喜欢的 OpenAI 产品,并称它会随着学习个人工作流而持续改进。

dot 的能力包括:

  • 跨应用保留上下文;
  • 协调 Codex 任务;
  • 标记需要用户关注的事项。

社区中也有人将其与 Grokbot 的多智能体“幕僚长”模式比较,还有开发者用树莓派、Telegram 网关和任意模型自制类似方案。

Meta Muse 硬件生态

Meta 开源了用于 Muse 硬件的 ESP32 固件和 Linux SDK,方便开发者构建兼容 Muse 的设备。

Meta 还制作了 5,000 台 Muse Home Link 智能家居桥接设备,面向订阅用户限量免费提供。

智能体运行框架扩展

DeepSeek Harness 发布了 macOS 与 Windows 桌面版本,Linux 用户可通过 npm 安装 @deepseek-ai/dsh。

Claude Code 生态中,Mods 被定义为带有中间件式钩子的插件。新的 “You should know” 插件会启动一个侧边智能体,提醒用户可能错过的重要输出。

Pi 方面,其运行能力扩展到 Cloudflare Durable Objects,并通过 agents SDK v0.26.0 支持相关部署,同时 Pi v1.0 也已发布。

T3 Code 重写

T3 Code 用户数已超过 40 万。其历时 4 个月的重写 PR 已合并,包含:

  • 823 次提交;
  • 涉及 1,912 个文件。

新版本加入的能力包括:

  • Pi 支持;
  • 跨提供商 delegate_task;
  • ACP 注册表;
  • 线程分叉;
  • 对话中途切换模型;
  • 子智能体 lineage 视图;
  • 定时任务。

平台更新

OpenAI Agents API 新增:

  • 一次调用即可使用浏览器计算机;
  • Bedrock Managed Agents;
  • 可移植环境。

同时官方声称:

  • turn reliability 达到 99.97%;
  • 工具调用速度提升 20%。

Cursor Rollouts 的新能力是:当发现回归问题时,它可以定位引入问题的 PR,创建 issue,并提供一键云端智能体修复。

Cloudflare 方面:

  • Sandbox SDK 1.0 允许 Durable Objects 直接控制沙箱容器;
  • 同时推出了请求 Traces 功能。

研究:智能体训练、长程控制与强化学习效率

Hugging Face 的多 harness 强化学习研究显示,同一组模型权重在不同运行框架中的表现差异可能很大:一个 harness 得分为 62%,另一个只有 33%。

研究方法是使用代理层兼容 OpenAI、Anthropic 和 Gemini API 格式,并记录采样 token ID 与 logprobs,用于训练,同时无需修改现有 harness。

结果包括:

  • LFM2.5-2.6B 在四个 harness 上从 42% 提升到 54%;
  • 工具调用次数减少 31%;
  • 基于 3,189 条 Qwen3.8-27B rollout 的监督微调在 47.5% 附近进入平台期;
  • 训练器、数据与 7 个训练后模型均已开放。

另一项与 credit assignment 相关的工作 ProVer 使用 judge 定位轨迹中的关键片段,再通过片段前后的 rollout 估计该片段优势。其报告称,相比 GRPO:

  • Qwen3.5-2B 相对提升 9.91%;
  • Qwen3.5-4B 相对提升 7.12%。

小结

当天没有单一爆炸性新闻,但可以看到几条持续趋势:模型竞争继续向“性价比”维度倾斜,智能体工具链从封闭产品走向可扩展框架,本地决策模型生态开始成形,而研究侧正在更认真地处理多工具环境、credit assignment 和长程任务训练问题。

评论

请登录后发表观点

暂无数据