智谱发布GLM 5.3:称“编程能力最强的开源模型”,接近Fable 5

  8月14日,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但...

智谱发布GLM 5.3:称“编程能力最强的开源模型	”,接近Fable 5-第1张图片

  8月14日 ,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变 ,但通过极致的后训练Scaling大大提高了模型的智能上界:数十倍的长程任务环境 、更丰富多样的环境类型、超长的后训练时间。智谱表示 ,在多项主流基准测试中GLM-5.3是当前排名比较高 的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型 。

智谱发布GLM 5.3:称“编程能力最强的开源模型”	,接近Fable 5-第2张图片

  智谱称,相比前代,GLM-5.3的新能力包括:更强的编程能力、网络安全能力 、后训练Scaling以及开源。

  根据智谱介绍 ,在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景 、强调跨工具协作与长程任务的Agents' Last Exam上 ,得分从23.8提升至28.5。在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力 。

  在白盒代码审查与漏洞发现等安全任务中,GLM-5.3的表现持平Mythos 5 。“从任务链条看 ,网络安全能力大致包括代码审查、漏洞验证 、漏洞利用以及真实环境中的攻防闭环。我们选取了覆盖漏洞分析、验证和利用不同阶段的三个基准,对GLM-5.3的网络安全能力进行了全面评估,GLM-5.3当前优势主要集中在前半段。”智谱表示 ,在CyberGym测试中 ,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞 。GLM-5.3得分为84.5%,高于GLM-5.2的77.2% ,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

  近期,大模型领域频频上新。

  8月13日凌晨,DeepSeek V4 Pro正式推出 ,并已更新至API,模型版本为DeepSeek-V4-Pro-0813,新版本增强了Agent能力 。根据DeepSeek给出的模式测试对比成绩 ,与此前V4-Pro-Preview版本相比,V4-Pro-0813已经全面提升,例如在AI编程智能体基准测试DeepSWE中 ,得分从Preview的7.3,大幅提升至62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试AutomationBench中甚至超越近来 公认最强大的Claude Fable 5。

  随后 ,DeepSeek首款智能体也开放测试 ,13日晚间,DeepSeek宣布,DeepSeek Harness的开发者预览版(v0.1 版本)面向全球 Harness开发者开放测试 ,并同步以 MIT 协议开放源代码 。DeepSeek Harness 采取“一切皆插件 ”的设计思路。我们采用插件式开放架构来构建 Agent Harness:模型 、工具、技能、会话 、沙箱、存储、循环 、调度、UI 等所有 Agent 能力均由插件组合而成,可自由替换、灵活重组。

  与此同时,SpaceXAI发布Grok 4.6 。SpaceXAI表示 ,新模型是在Grok 4.5基础上进一步升级,重点提升长流程任务中的表现,以及处理更复杂的交互式 、视觉和知识工作任务的能力。

  截至发稿时 ,智谱跌超4%。

(文章来源:澎湃新闻)

本文来自作者[北极]投稿,不代表成都团团转立场,如若转载,请注明出处:https://m.cdttzh.com/tuantuan/1085.html

(1)

文章推荐

发表回复

本站作者才能评论

评论列表(4条)

  • 北极
    北极 2026-08-14

    我是成都团团转的签约作者“北极”!

  • 北极
    北极 2026-08-14

    希望本篇文章《智谱发布GLM 5.3:称“编程能力最强的开源模型”,接近Fable 5》能对你有所帮助!

  • 北极
    北极 2026-08-14

    本站[成都团团转]内容主要涵盖:成都团团转,温柔资讯,日常随想,生活片段,城市记录,慢节奏,小温暖,街边故事,时节感悟,轻阅读,安静陪伴,好物分享,点滴美好

  • 北极
    北极 2026-08-14

    本文概览:  8月14日,智谱(2513.HK)发布GLM-5.3,与GLM-5.2相比,基座模型没变,但...

    联系我们

    邮件:成都团团转@sina.com

    工作时间:周一至周五,9:30-18:30,节假日休息

    关注我们