闲社

标题: 国产大模型实测:DeepSeek-R1推理翻车,智谱GLM-4.5代码反超 [打印本页]

作者: wancuntao    时间: 昨天 09:02
标题: 国产大模型实测:DeepSeek-R1推理翻车,智谱GLM-4.5代码反超
兄弟们,今天不整虚的,直接上硬核实测。我们把市面上三款主流国产模型——DeepSeek-R1、智谱GLM-4.5、通义千问2.5-Max——拉到同一批高难度任务上“烤”了一下午,结论挺有意思。

**先说推理逻辑题。** 之前吹爆的DeepSeek-R1在“多步因果推断”上明显退步,连续三道题出现“看似严谨但结论错误”的情况,尤其在引入干扰条件后,其“深度思考”模式反而陷入自我纠缠,响应速度慢了一倍,准确率仅62%。相比之下,GLM-4.5在同样的题目上稳得一批,准确率冲到81%,而且给出的步骤解析干净利落,没有废话。

**重点说代码能力。** 这轮最大的黑马是GLM-4.5,在复杂工程任务(比如要求生成一个带状态管理的React组件,并附带单元测试)中,其生成代码的一次性通过率高达74%,比DeepSeek-R1高出近20个百分点。更关键的是,GLM-4.5生成的代码风格更接近资深工程师,变量命名和注释质量明显优于另外两家。

**千问2.5-Max则表现中规中矩**,在中文长文本理解上有微弱优势,但在多模态融合任务上明显落后,上下文窗口超长后性能衰减严重。

**结论:** 如果搞科研推理,千问可以凑合;写业务代码,GLM-4.5目前是国产首选;DeepSeek-R1需要再等等,别被“深度思考”的名头唬住。具体跑分数据我整理成表格了,评论区自取。欢迎理性讨论,别上来就扣帽子。




欢迎光临 闲社 (https://21112.xianshe.com/) Powered by Discuz! X5.0