跳到正文
原文
Simon Willison·· 4 天前AI 评分35

Anthropic Frontier Red Team:GLM-5.3 高级网络能力测试结果引关注

Quoting Anthropic Frontier Red Team

AI 导读

Anthropic Frontier Red Team 在随机选取的100项内部 Binary Exploitation 基准任务中测试多个模型,GLM-5.3 有4%的试验实现完整控制流劫持,Claude Mythos Preview 为6%。GLM-5.3 表现略低于 Claude Mythos Preview,而 Claude Opus 4.6 与 GLM-5.2 均未成功。

来源:Simon Willison · simonwillison.net