Grok 4.6 与 Grok Bot:AI 协作工具的新尝试
Grok 4.6 与 Grok Bot:AI 协作工具的新尝试
xAI 发布了 Grok 4.6,同时推出处于早期测试阶段的 Grok Bot。两者共同指向一个正在形成的方向:让 AI 从回答问题的助手,进一步成为能够操作工具、执行任务并交付结果的协作成员。
Grok Bot:能够操作工具的 AI 协作成员
Grok Bot 被描述为一种 AI teammate。它可以登录用户使用的工具,以类似用户的方式完成操作,并返回已经完成的工作。
这一设计将 AI 应用从单人对话界面延伸到多人协作和多智能体工作流。此前,Claude Tag 和 Block 的 Buzz 已经尝试进入这一领域,但产品定位和使用门槛各不相同。Grok Bot 的出现,为 AI 团队协作工具带来了新的竞争者。
目前 Grok Bot 仍处于早期测试阶段,实际可用范围、权限控制、数据隔离和长期稳定性仍有待进一步验证。
Grok 4.6:重点强化长任务与知识工作
Grok 4.6 建立在 Grok 4.5 之上,重点面向以下场景:
- 长时间运行的智能体任务
- 软件开发与通用编码
- 知识工作
- STEM 任务
- 网页开发
- 计算机辅助设计
- 内核优化
- 更复杂的交互式和视觉任务
Grok 4.6 的训练说明显示,xAI 延长了补充训练过程,加入了用于推理和高级技术概念的模型生成数据、高质量工程数据,并改进了优化器与训练方案。
随后,xAI 使用 Grok 4.5 重新生成不同推理强度、智能体框架和领域中的监督微调轨迹,覆盖推理、软件工程和知识工作等任务,并通过模型检查过滤存在问题的轨迹。之后,模型还接受了覆盖多类智能体环境的强化学习训练。
评测与价格表现
已有评测将 Grok 4.6 的 Intelligence Index 记为 61,整体接近 GPT-5.6 Sol Max,但仍落后于 Claude Opus 和 Fable 等模型。其他披露的结果包括:
- Terminal-Bench v2.1:88.4%
- GDPval-AA v2:1753 Elo
- API 价格:每百万输入 token 2 美元、每百万输出 token 6 美元
这些结果显示,Grok 4.6 的主要卖点不仅是能力提升,也包括价格与性能之间的平衡。在网页开发、编码和缺陷定位等任务中,早期使用反馈对其评价较为积极。不过,部分结论来自早期评测和使用体验,不能直接等同于所有场景下的稳定优势。
同期模型动态
这段时间,多个模型产品也在能力、开放程度和价格方面出现变化:
- Qwen3.8-Max:以开放权重形式发布,总参数量为 2.4T,激活参数量为 95B,并获得 vLLM、Together AI 和 Baseten 等平台的支持。初始开放权重版本被指出仅支持文本输入,不包含视觉输入。
- DeepSeek V4 Pro GA:正式版本的价格约为每百万输入 token 0.435 美元、每百万输出 token 0.87 美元。Cline 称其相较预览版在 Terminal Bench 上提升了 15.8%,但早期反馈并未显示其在所有任务上都明显领先于其他模型。
- MAI-Thinking-1:微软发布的首个从头构建的推理模型,已在 Foundry 提供。团队特别寻求关于工具调用能力的反馈。
- Solar Pro 4:在 Intelligence Index 上从 14 分提升至 42 分,智能体任务和长上下文任务的进步较为明显,但与当前领先的前沿模型和开放模型相比仍有差距。
- LTX-2.5:继续完善本地开放视频生成工作流,支持视频与 48 kHz 音频联合生成、可控制片段长度、双阶段质量模式和分块渲染等功能。
仍需观察的问题
Grok 4.6 和 Grok Bot 展示了 AI 从模型能力竞争走向工作流和协作方式竞争的趋势,但仍有几个问题需要进一步观察:
- Grok Bot 能否在真实工作中稳定完成跨工具、长链路任务。
- 工具授权、隐私保护和操作审计机制是否足够完善。
- Grok 4.6 的评测成绩能否在不同任务、不同用户和长期使用中保持。
- 较低的调用价格是否会带来足够的实际成本优势。
现阶段,更准确的判断是:Grok 4.6 在长任务、编码和知识工作方向展现出较强竞争力,Grok Bot 则代表了一种让 AI 直接参与工具操作和团队协作的产品形态。其长期影响仍取决于可靠性、权限治理和真实工作流中的完成质量。
