GLM-5.3 在 DeepSWE 上击败 Claude Fable 5,成本降低 5.4 倍
在 DeepSWE 基准测试中的正面对比中,GLM-5.3 展现了其对 Claude Fable 5 的优势,在首次尝试的准确性上表现相当,但每次生成仅需 $3.99,而 Fable 为 $21.63。DeepSWE 是一个严格的编码基准测试,于 2026 年 5 月推出,评估 AI 模型在 113 项原创软件工程任务中的表现,重点关注长期问题解决能力,而非短期的 GitHub 修复。
两种模型在 pass@1(首次尝试解决任务的指标)上的表现相似,Fable 略微领先,为 69.7%,而 GLM-5.3 为 69.0%。然而,在 pass@2 和 pass@4 指标上,GLM-5.3 表现更佳,分别达到了 81.1% 和 87.6%的成功率,而 Fable 分别为 77.1% 和 84.1%。更重要的是,每次生成仅需 $3.99,GLM-5.3 每 $100 可解决 17 项任务,而 Fable 仅为 3 项——使其成本高出 5.4 倍。
DeepSWE 的结构化任务涵盖五种编程语言和八个领域,测试模型在从并发性到协议一致性等多方面的表现。GLM-5.3 在五个领域中占据优势,包括并发性和持久性(62% 对比 Fable 的 45%)以及程序分析。Fable 在三个领域表现出色,尤其是在 Rust 编程(85% 对比 GLM 的 70%)和数据序列化任务(88% 对比 79%)。尽管 Fable 在 Rust 方面表现突出,但整体结果显示 GLM 是更通用且成本更高效的选择。
GLM-5.3 的成本效率不仅体现在任务准确性上。Fable 的较高冗长度(114k 输出 token 对比 GLM 的 80k)和较少的步骤(85 对比 GLM 的 124)并未转化为显著的速度优势。两种模型的平均生成时间均为大约 34-35 分钟,但 GLM 更低的 token 使用量显著降低了成本。此外,GLM 的开源权重允许自托管,与仅通过 Anthropic 封闭生态系统提供的 Fable 相比,提供了更大的操作灵活性。
从故障分析的角度来看,两种模型的行为相似,Fable 在可靠性上略胜一筹(82% 对比 GLM 的 78.8%)。然而,GLM 的更广覆盖率(87.6% 对比 84.1%)为需要更广泛编码覆盖的团队提供了明显优势。两种模型在错误处理方面表现严谨,但 Fable 更高的“重大失误”率(18% 对比 GLM 的 16%)表明当出现问题时,其风险略高。
有趣的是,将两种模型组合为级联系统——先运行 GLM,仅在必要时升级到 Fable——可以实现 81.1% 的准确性,每项任务成本为 $10.74。这种策略相比单独使用 Fable 提升了效率,但由于两种模型的高相关性(0.65),组合效益有限。对于大多数团队来说,默认使用 GLM-5.3,并在 Rust 密集型或序列化关键任务中保留 Fable,是更优的选择。
DeepSWE 的严格方法强调原创、长期任务,并具有最小的污染风险,这一点在 2026 年 7 月的 arXiv 论文中得到了强调。该基准测试旨在测量 AI 编码代理在真实世界条件下的表现,使这些结果对于评估 AI 模型在软件工程应用中的使用价值的开发者和组织尤为重要。
总体而言,GLM-5.3 在 DeepSWE 上成为实用的赢家,提供了卓越的成本效率、更广泛的任务覆盖范围以及开源权重的灵活性。Fable 在某些特定领域的优势可能吸引专业用户,但对于大多数应用场景而言,GLM-5.3 提供了性能与价值的最佳平衡。