claude - 超腾开源标签
Anthropic公司最新推出的AI编程模型Claude Mythos Preview在SWE-Bench Verified和SWE-Bench Pro两大权威编程基准测试中均位列第一,展现出卓越性能。在SWE-Bench Verified榜单中,它以0.939分领先于第二名Claude Opus 4.7的0.876分;在更复杂的SWE-Bench Pro榜单中,也以0.778分大幅领先。文章同时列举了包括MiniMax、Kimi、Qwen、小米、智谱AI等在内的多个国内主流模型的表现及排名。值得注意的是,Claude Mythos Preview在全部16个涵盖数学、科学、网络安全等多领域的基准测试中均排名第一,但其价格极为昂贵,输出成本是其他领先模型的数十倍。作者指出,虽然榜单成绩不能完全代表实际项目表现,但此类模型的强大能力也同时意味着网络安全风险的门槛可能随之降低。
645
2026-04-21