GLM-5.3 在二进制利用评测中跨过关键门槛
一项前沿模型红队评估中,研究人员从内部二进制利用基准中随机选取了 100 个任务,对多个模型进行测试。
评估结果显示:
- GLM-5.3 在 4% 的试验中实现了完整的控制流劫持;
- Claude Mythos Preview 的对应比例为 6%;
- 较早的模型,如 Claude Opus 4.6 和 GLM-5.2,在这些任务中均未成功。
虽然 GLM-5.3 在该测试中的表现仍低于 Claude Mythos Preview,但评估者认为,一个有意义的能力门槛已经被跨过:新一代模型开始在此前失败的高级二进制利用任务中取得成功。
这类结果值得安全社区关注,因为它提示前沿模型在网络安全相关能力上的扩散速度可能正在加快,尤其是在漏洞利用、控制流劫持等高风险能力评测中。
浏览(2)
