闲社
标题:
实测豆包、文心、DeepSeek三大模型,中文推理差距比想象大
[打印本页]
作者:
可笑
时间:
昨天 21:02
标题:
实测豆包、文心、DeepSeek三大模型,中文推理差距比想象大
兄弟们,今天上午刚跑完一轮国产主流大模型的横向实测,结论挺意外的。采用同一批中文逻辑推理题、代码生成和长文本阅读理解,共30条测试用例,参数统一temperature=0.3,max_tokens=2048。
先看结果:豆包(Doubao-pro-32k)在中文常识问答上表现最稳,正确率86.7%,但面对复杂多跳推理时,模型容易“自说自话”,回答里出现与事实相悖的细节。文心一言4.0在代码生成上明显领先,特别是Python和SQL场景,可执行率83%,但长文本总结时偶发指令偏离,比如让提取“原因”却输出“对策”。最意外的是DeepSeek-V3,在逻辑推理和数学题上正确率88.3%,且推理步骤清晰,速度也快,但多模态和上下文记忆稍弱,5000字以上文档中会丢失部分关键实体。
个人建议:日常办公首选豆包,写代码上文心,强推理场景(数据分析、数学建模)直接上DeepSeek。另外,三个模型在“反事实提问”和“具身常识”上普遍拉胯,说明国产模型在因果推理上仍有明显短板。详细评测数据和Prompt样例我整理在附件了,有跑过其他模型的兄弟欢迎来对线。
欢迎光临 闲社 (https://21112.xianshe.com/)
Powered by Discuz! X5.0