Anthropic Frontier Red Team:GLM-5.3与Claude Mythos Preview在二进制利用任务中的表现
Anthropic Frontier Red Team在内部 Binary Exploitation benchmark 的100项随机任务上评估多个模型,发现GLM-5.3在4%的试验中实现了完整控制流劫持,Claude Mythos Preview为6%。Claude Opus 4.6和GLM-5.2在这些任务中均未成功。
Anthropic Frontier Red Team在内部 Binary Exploitation benchmark 的100项随机任务上评估多个模型,发现GLM-5.3在4%的试验中实现了完整控制流劫持,Claude Mythos Preview为6%。Claude Opus 4.6和GLM-5.2在这些任务中均未成功。