Copied


GLM-5.3 在成本上超过 GPT-5.6 Sol,并在多次尝试的 DeepSWE 任务中略胜一筹

realtime news   Aug 22, 2026 06:22 1 Min Read


对 GLM-5.3 和 GPT-5.6 Sol 在 DeepSWE 软件工程测试套件上的对比基准测试揭示了精确度与成本之间的显著权衡。虽然 GPT-5.6 Sol 在单次尝试的准确性上仍然占据优势(pass@1: 72.7%),但开源权重的 GLM-5.3 缩小了差距,凭借 pass@4 的高分(87.6% 对 85.8%)领先,并且每次运行的成本仅为一半($3.99 对 $8.37)。这使得 GLM-5.3 成为预算敏感或可容忍重试使用场景的一个具有吸引力的选择。

DeepSWE 于 2026 年 7 月推出,对 113 项长周期编程任务进行测试,涵盖多种语言和领域。这些任务专门设计避免 AI 基准测试中常见的污染问题,确保其对真实世界工程部署的高度相关性。

性能指标:精确度与覆盖范围

GPT-5.6 Sol 仍然是精确度的领导者,其单次尝试的可靠性表现出色,能够完美解决更多任务(61 项任务四次尝试全通过,而 GLM-5.3 为 48 项)。然而,GLM-5.3 更广的覆盖范围(87.6%)和更低的失败回归率(11% 对 Sol 的 20%)突显出其在迭代或最佳 k 尝试场景中的适用性。对于运行批量部署或在运行后验证输出的团队,GLM-5.3 提供了一个更安全且更经济的选择。

成本效率:GLM-5.3 的关键优势

每次运行成本仅为 $3.99,GLM-5.3 每 $100 可完成 17 次解决,而 Sol 为 9 次。尽管 Sol 的运行速度更快(19 分钟 对 35 分钟)且输出更简洁,使其更适合对延迟敏感的任务,但 GLM-5.3 的成本结构在高批量或非紧急应用中凸显优势。对于在精确度和预算之间寻求平衡的开发者来说,权衡非常清晰:Sol 更快但更昂贵;GLM-5.3 更慢但显著更便宜。

任务与语言表现分析

两种模型在不同领域各有所长。Sol 在数据建模(92%)和协议一致性(59%)等精确度要求高的领域表现卓越,而 GLM-5.3 则在结构化、解释器风格的任务中表现最佳,如查询语言(88%)和运行时内部(83%)。按编程语言划分,GLM-5.3 在 JavaScript(90% 对 75%)和 Rust 中领先,而 Sol 在 Python、Go 和 TypeScript 中表现更优。

最佳部署:级联策略

两种模型的差异使得组合方法成为可能。将 GLM-5.3 作为前线模型运行,并将未解决的任务交给 Sol 处理,可以实现 85.9% 的解决率,每项任务成本为 $6.61——优于 Sol 的单独表现(72.7%,成本为 $8.37)。这种方法在精确度和成本之间实现了优化,使其成为拥有验证器支持工作流的团队的首选策略。

对更广泛 AI 采用的影响

GLM-5.3 的强劲表现突显了开源权重模型的日益竞争力。其以低成本交付可比结果的能力,可能加速在资源受限环境中的采用,尤其适用于评估 AI 辅助编码解决方案的工程团队。同时,Sol 的速度和首次尝试的可靠性巩固了其作为时间敏感、精确度要求高应用的高端选择角色。

对于关注 Solana(SOL)的交易者来说,这些发现值得在更广泛的市场活动中进行背景化分析。截至 2026 年 8 月 22 日,Solana 的代币当前价格为 $77.97,并因 ETF 流入和代币化项目的推动而吸引了更多机构兴趣。虽然 DeepSWE 基准测试不会直接影响 Solana 的区块链性能,但 GPT-5.6 Sol 模型受益于更广泛 GPT 生态系统的声誉——可能进一步加强投资者对 Solana 在 AI 集成基础设施中作用的信心。

最终,GLM-5.3 和 GPT-5.6 Sol 之间的选择将取决于具体的运营优先事项。对于大规模部署或需要高重试容忍度的团队,GLM-5.3 是明确的价值领导者。而对于优先速度和精确度的团队,Sol 继续证明其高价标签的合理性。


Read More