AI 日报:GPT-6.1 Sol、Sonnet 5.5 与智能体工具链更新
概览
10 月 1—2 日,AI 社区整体较为平静,但仍有几条值得关注的技术动态:新模型继续围绕成本与性能展开竞争,智能体工具链持续扩展,决策模型和本地推理生态出现新进展,研究侧则聚焦多工具环境下的智能体训练与强化学习效率。
模型:GPT-6.1 Sol 与 Sonnet 5.5 的成本—性能竞争
GPT-6.1 Sol 定价与定位
OpenAI 的 GPT-6.1 Sol 被定位为更便宜、更快的模型。其价格为:
- 输入:每百万 token 2 美元
- 输出:每百万 token 10 美元
相比之下,GPT-6 Astra 的价格为每百万输入 / 输出 token 10 / 50 美元。
社区转述的评测结果显示,Sol 在部分基准中表现较强:
- 在 DeepSWE v1.1 上,据称比 GPT-6 Sol 高 6.4 分;
- 在 AutomationBench 上,据称比 Opus 5.5 高 2.2 分;
- OpenAI 员工将其描述为“好、便宜且快”。
另有开发者反馈称,Sol 很偏好使用 codemode,这与 GPT 系列模型接受相关训练的说法相吻合。
Agent Arena 排名
在 Agent Arena 中:
- Sol [Max] 进入第 5 名,成绩为 +11.23%;
- 每个任务的中位成本为 0.56 美元;
- 相比 GPT-6 Sol,成本低 39%,分数高 1.52;
- 相比 GPT-6 Astra,成本低 81%,分数差距在 1.04 分以内。
Sonnet 5.5 [Max] 则以 +12.5% 的成绩进入第 3 名,并在 Chat 类别排名第 1。不过其每任务成本为 2.74 美元,高于排名第 2 的 Opus 5.5 的 1.58 美元,因此未进入帕累托前沿。
目前 Anthropic 模型占据 Agent Arena 前三名。
Code Arena 与 Text Arena
在 WebDev 排名中,Sol 曾短暂进入第 3 名,随后被 Sonnet 5.5 挤到第 4 名。
其他变化包括:
- Sonnet 在 WebDev 中距离 GPT-6 Astra [Max] 约 2 分,但成本低约 80%;
- Gemini 4 Argon [High] 在 Text Arena 中排名第 1;
- 开源模型 MiMo-V2.6-Pro 与 Flash 分别进入 Agent Arena 开源模型第 5 和第 9 名。
其他独立评测
WeirdML v3 的不完整评测显示:
- Sol token 使用效率较高,接近 Astra,但峰值能力较低;
- Sonnet 5.5 超过 Opus 5;
- Grok 4.7 超过 Kimi-K3。
Design Arena 分析了 324 份模型“思考摘要”,发现:
- Astra 的模糊表述频率约为 Opus 5.5 的 20 倍;
- Opus 在约五分之四的摘要中较早给出明确判断。
StepFun 的 Step 5 Preview 在 Vals 中位列开源权重模型第 7,每任务成本为 2.54 美元,平均每个任务耗时接近两小时,支持 100 万 token 上下文窗口。
未确认传闻
社区中还出现两条未确认消息:
- Claude Fable 5.5 可能在下周发布,并据称超过因安全问题推迟的 “Astra 6.1”;发布者明确表示无法验证这些说法;
- 有人发现 “GPT-6 Astra Lite” 条目,并猜测其可能与 Sol 是同一模型。
决策模型与本地推理生态
llama.cpp 新增 /v1/systemone 端点,用于本地运行类似 Jev 的决策模型推理。
相关进展包括:
- 本地运行方式示例:
llama serve -hf ggml-org/Kev-4B-GGUF; - Kev 1.0 的工作机制已有介绍文章发布;
- Perplexity 称 pplx-decider-v1-27b 在 11 个基准上的平均分为 85.7%,高于 Jev;
- Clef 决策模型已上线 Ollama;
- 有研究者认为,所谓决策模型本质上是零样本分类器的重新包装;
- 另有分析将 Jev 风格的校准与价值函数、Q 函数预测联系起来。
此外,webAI 发布 TwIL-LM3-Pro:
- 参数量为 3.66B;
- 基于 Granite 4.2 后训练;
- 在 webAI 测试中,形式逻辑能力大致接近 Qwen3-8B;
- Q4 GGUF 文件大小为 2.09 GiB;
- 采用非商业许可。
Reka 则发布了 RIDM 逆动力学模型,许可证为 Apache 2.0。该模型在游戏数据上训练,可泛化到真实视频,并提取运动与摄像机动作。
智能体、助手与开发者工具
OpenAI dot
Sam Altman 表示,dot 是他最喜欢的 OpenAI 产品,并称它会随着学习个人工作流而持续改进。
dot 的能力包括:
- 跨应用保留上下文;
- 协调 Codex 任务;
- 标记需要用户关注的事项。
社区中也有人将其与 Grokbot 的多智能体“幕僚长”模式比较,还有开发者用树莓派、Telegram 网关和任意模型自制类似方案。
Meta Muse 硬件生态
Meta 开源了用于 Muse 硬件的 ESP32 固件和 Linux SDK,方便开发者构建兼容 Muse 的设备。
Meta 还制作了 5,000 台 Muse Home Link 智能家居桥接设备,面向订阅用户限量免费提供。
智能体运行框架扩展
DeepSeek Harness 发布了 macOS 与 Windows 桌面版本,Linux 用户可通过 npm 安装 @deepseek-ai/dsh。
Claude Code 生态中,Mods 被定义为带有中间件式钩子的插件。新的 “You should know” 插件会启动一个侧边智能体,提醒用户可能错过的重要输出。
Pi 方面,其运行能力扩展到 Cloudflare Durable Objects,并通过 agents SDK v0.26.0 支持相关部署,同时 Pi v1.0 也已发布。
T3 Code 重写
T3 Code 用户数已超过 40 万。其历时 4 个月的重写 PR 已合并,包含:
- 823 次提交;
- 涉及 1,912 个文件。
新版本加入的能力包括:
- Pi 支持;
- 跨提供商
delegate_task; - ACP 注册表;
- 线程分叉;
- 对话中途切换模型;
- 子智能体 lineage 视图;
- 定时任务。
平台更新
OpenAI Agents API 新增:
- 一次调用即可使用浏览器计算机;
- Bedrock Managed Agents;
- 可移植环境。
同时官方声称:
- turn reliability 达到 99.97%;
- 工具调用速度提升 20%。
Cursor Rollouts 的新能力是:当发现回归问题时,它可以定位引入问题的 PR,创建 issue,并提供一键云端智能体修复。
Cloudflare 方面:
- Sandbox SDK 1.0 允许 Durable Objects 直接控制沙箱容器;
- 同时推出了请求 Traces 功能。
研究:智能体训练、长程控制与强化学习效率
Hugging Face 的多 harness 强化学习研究显示,同一组模型权重在不同运行框架中的表现差异可能很大:一个 harness 得分为 62%,另一个只有 33%。
研究方法是使用代理层兼容 OpenAI、Anthropic 和 Gemini API 格式,并记录采样 token ID 与 logprobs,用于训练,同时无需修改现有 harness。
结果包括:
- LFM2.5-2.6B 在四个 harness 上从 42% 提升到 54%;
- 工具调用次数减少 31%;
- 基于 3,189 条 Qwen3.8-27B rollout 的监督微调在 47.5% 附近进入平台期;
- 训练器、数据与 7 个训练后模型均已开放。
另一项与 credit assignment 相关的工作 ProVer 使用 judge 定位轨迹中的关键片段,再通过片段前后的 rollout 估计该片段优势。其报告称,相比 GRPO:
- Qwen3.5-2B 相对提升 9.91%;
- Qwen3.5-4B 相对提升 7.12%。
小结
当天没有单一爆炸性新闻,但可以看到几条持续趋势:模型竞争继续向“性价比”维度倾斜,智能体工具链从封闭产品走向可扩展框架,本地决策模型生态开始成形,而研究侧正在更认真地处理多工具环境、credit assignment 和长程任务训练问题。
