GLM 5.3 更强却更难用了?我们让它和 5.2 做了同一个北京城市驾驶游戏
📌 概要
官方强调 GLM 5.3 安全能力大幅提升,实测却发现这套安全机制在自动化工具链中频繁触发拒绝,导致开发流程中断。 作者丨吴海明 编辑丨李 娜 大家还记得《极限竞速:地平线
⚡ 关键要点
- ▸官方强调 GLM 5.3 安全能力大幅提升,实测却发现这套安全机制在自动化工具链中频繁触发拒绝,导致开发流程中断。
官方强调 GLM 5.3 安全能力大幅提升,实测却发现这套安全机制在自动化工具链中频繁触发拒绝,导致开发流程中断。 作者丨吴海明
编辑丨李 娜
大家还记得《极限竞速:地平线》里那种在开放世界中自由驾驶、穿梭城市与道路的体验吗?

地平线游戏图
这次,我们用一个类似思路、但更贴近真实工程开发的题目来考一考 GLM 5.3:从零开发一款基于 OpenStreetMap 真实数据的「北京国贸 → 望京」区域 3D 开放世界驾驶游戏,5.3 需要在浏览器中单机运行,不依赖任何在线服务,并且最终交付一个可启动、可验证、可断网运行的完整项目。
GLM 5.3 是智谱在 2026 年 8 月 13 日发布的最新旗舰模型,对比上一代旗舰 GLM 5.2,GLM 5.3 使用同一个底座,主要通过更大规模、更贴近真实工程场景的后训练,增强复杂编程、长程任务、工具调用和项目交付能力。同时,GLM 5.3 还有一个值得关注的变化:官方强调其网络安全能力明显增强,模型在风险识别、安全判断和复杂系统分析上更强。

网络社区对于GLM5.3安全能力的评价
能力增强之后,也带来了新的使用感受,最近有小红书用户吐槽,GLM 5.3 似乎出现了“过度防御”:也有人反馈 5.3 写出的文案越来越难懂,“全是黑话”,即使反复修改提示词也没有明显改善。这些反馈指向同一个问题:GLM 5.3 变强之后,是否也变得更谨慎、更难驾驭?

网络社区网友反馈截图
对此,我们设计了一次更贴近真实工程场景的对照测试。为了更直观地观察模型迭代效果,我们选取 GLM 5.2 作为对照组,在同一题目、同一需求下比较两者的真实世界还原度、项目完成度、工程交付能力和最终运行效果。
先说结论,最终,GLM 5.3 和 GLM 5.2 都能端到端完成项目,GLM 5.3 不仅完成速度更快,也更懂得把光影、路灯、HUD、导航和速度反馈等细节组织成更真实的驾驶体验。不过测试也印证了前面的用户反馈:GLM 5.3 更强的安全能力确实带来了新的适配问题,模型因为安全判断增强而变得更谨慎,在自动化编程交互中更容易触发拒绝判断;当它接入自动化开发工具链时,这种“谨慎”甚至可能让原本正常的开发流程被意外卡住。

01
实测 GLM 5.3:
从零开发「北京国贸到望京」的
3D 开放世界驾驶游戏
在这次实测中,我们选择智谱官方发布的 ZCode 作为开发环境,让 GLM 5.3 面向真实开发场景展开实测:从零开发一款基于 OpenStreetMap 真实数据的「北京国贸→望京」区域 3D 开放世界驾驶游戏。为更直观观察模型迭代效果,本次测试同时选取 GLM 5.2 作为对照组,在相同需求下比较两者的真实世界还原度、项目完成度、工程交付能力与最终运行效果。
具体题目如下:
以 OpenStreetMap 真实数据为基础,从零开发一个"北京国贸→望京"区域的 3D 开放世界驾驶游戏,单机浏览器运行,不依赖任何在线服务。要求:1. 用脚本从 Overpass API 拉取该区域路网与建筑数据,先勘查数据完整性再动工;2. 车辆有基础物理(加速/转向/碰撞);3. 昼夜循环,且【工作日早 7:00-9:00 主干道车流密度翻倍】;4. 地图边缘用【软性阻挡】处理(车辆被自然减速推回,不允许报错或瞬移);5. 含导航、音效、存档系统;6. 交付可运行项目+README(含一条命令启动方法);README 中说明如何验证第 3、4 条特性;7. 完成前自行做启动冒烟验证(如 node --check / 本地起服务确认无报错),再把启动方法写入 README;8. 交付后【运行时零网络请求】:开发期联网拉取的数据与所有第三方库/资源(含 CDN 引用)必须本地打包, 断网状态下游戏可完整加载与运行;9. README 注明运行环境要求(如 Node/Python 版本、推荐浏览器)。技术栈与项目结构(单文件 HTML 还是多文件工程、用什么渲染方案)不做限制,由你自行决策,并在 README 中用一段说明选型理由。从测试题目可以看到,这是一次覆盖数据获取、工程搭建、三维渲染、交互控制、交通规则、离线交付和项目文档的综合性开发测试。模型需要理解北京国贸到望京这一真实地理场景,并将开放地图数据转化为可运行的 3D 驾驶空间,并围绕车辆控制、NPC 车流、昼夜变化、导航系统和存档机制搭建完整玩法闭环。
如下面 2 张图所示,GLM 5.3 与 GLM 5.2 均能端到端一次性完成项目开发,并完成冒烟测试和自动化部署。两个模型最终开发的项目都支持一键启动,且完成全部任务要求,实现了从自然语言需求出发,完成项目规划、代码实现、资源组织、运行验证和文档交付的完整链路。

GLM 5.3 开发的「北京国贸→望京」 3D 开放世界驾驶游戏截图,更多真实世界的元素:路灯、夸张的路标等

GLM 5.2 开发的「北京国贸→望京」 3D 开放世界驾驶游戏截图
为了更好理解两个模型在这个小型系统级别开发任务的表现,我们通过完整测试与体验后整理了如下判分表格:

具体来说:
GLM 5.3 首先编写了获取数据的脚本,从 OpenStreetMap 拉取北京国贸至望京区域的真实路网与建筑数据,并在开发前生成勘查报告,统计出路网 4,671 条、约 1,091 公里,建筑 7,103 栋,同时检查高度标签比例和异常几何情况。
后续构建中,GLM 5.3 将真实经纬度投影为米制平面坐标,并生成包含 6,541 个节点、13,513 条有向边的路网图。在游戏设计上,设计了车辆加速、转向和碰撞三项基础物理特性,其中转向采用自行车运动学模型,碰撞则覆盖建筑和交通车,并通过 2,300 多帧自检验证稳定性。
此外,GLM 5.3 在工作日的 7:00-9:00 实现了主干道车流翻倍,从数据能查到主干道车流从 44 辆爬升至 70 辆、再到 80 辆的记录,不过支路车流保持不变;地图边缘软阻挡也完整实现,车辆顶着油门撞向边界时越界深度稳定在 0.7 米,松油门后可缓慢回推。
最后,GLM 5.3 还实现了自动化导航、12.62 公里国贸至望京 SOHO 路线规划、92 段路径、偏航重算、小地图设点、手动与自动存档,以及包含启动方法、验证说明和技术选型的 README,整体更接近一个可直接体验的浏览器端 3D 驾驶游戏原型。
GLM 5.2 也完成了端到端项目开发,并展现出较强的工程稳健性。5.2 先进行数据勘查,再进入游戏开发流程,独立勘查脚本会按道路等级统计长度、检查几何损坏比例,并在数据不达标时直接报错退出,最后 GLM 5.2 获取到路网约 1,243 公里、建筑 8,417 栋,几何损坏为零,并进入游戏实现阶段。
在地图还原方面,GLM 5.2 基于真实 OSM 经纬度坐标进行换算,截图核验显示道路和建筑位置能够与真实城市空间对应;车辆系统方面,它完成了加速、转向和碰撞,并加入空间网格加速碰撞查询。早高峰规则经过脚本实测:工作日 7 点半主干道车辆达到 169 辆,高峰前后为 85 辆,约为翻倍,周末同时段不触发;地图边缘软阻挡也通过高强度测试,车辆以 108 km/h 全速冲向边界后,车速被压低至约 5 km/h,始终无法出界,松油门后约 13 秒缓慢回推,且每帧位移不超过 0.5 米,无瞬移和报错。
导航方面,它规划出国贸至望京 SOHO 约 14.4 公里的路线,支持转向箭头、剩余距离、小地图路线显示和偏航重算;存档系统支持每 5 秒自动保存和关闭页面前保存,刷新后可恢复位置、时间、里程和导航目的地;README 也较完整,配有白天、夜晚截图及多轮启动验证记录。
先说结论。整体来看,两个模型都能端到端完成项目开发,但在效率和技术取向上有所不同。GLM 5.3 更像面向产品体验的快速原型开发搭档,而 GLM 5.2 则更像强调可验证、可兼容、可离线运行的工程执行者。
1.从时间上来说,GLM 5.3 用时 50 分 47 秒,较 GLM 5.2 的 66 分 1 秒快了约 15 分钟。
2.在代码规模接近的情况下,GLM 5.3 产出 3,104 行代码、14 个文件,GLM 5.2 产出 3,063 行代码、20 个文件,前者结构更集中,后者拆分更细;
3.运行交付方面,两者均实现一键启动,且都通过断网可玩验证,GLM 5.3 把游戏运行所需的核心程序文件都打包到本地,而 GLM 5.2 的离线方案更彻底,不仅不需要联网加载任何资源,甚至不用启动本地服务,直接打开文件也能运行;
4.技术选型上,GLM 5.3 采用 three.js ES M