闲社

标题: 多模态新SOTA!Qwen2.5-VL开源,OCR与视频理解双突破 [打印本页]

作者: qqiuyang    时间: 昨天 15:01
标题: 多模态新SOTA!Qwen2.5-VL开源,OCR与视频理解双突破
兄弟们,今天社区炸锅的必须是Qwen2.5-VL系列正式开源。这波不仅仅是参数升级,而是架构和训练策略上的大改,直接刷新了开源多模态的天花板。

先说硬核数据。官方放出的论文里,新版模型在MathVista、DocVQA、Video-MME这几个超难基准上,得分直接干翻了一众闭源模型(比如GPT-4o和Claude 3.5)。尤其值得关注的是OCR能力,他们用了一个叫“动态分辨率+原生高分辨率”的组合拳,现在能直接处理**超过1000px**的长图,且不丢细节。我实测了一张满屏小字的财报截图,识别准确率肉眼可见地吊打上一代。

另一个重点突破在视频理解。这次不是单纯抽帧,而是把**时序建模**直接做进了视觉编码器里。官方给的数据是,在长达5分钟的视频中,模型能准确追踪目标的连续动作,并且推理出因果关系。这意味着什么?意味着以后做视频检索、内容审核,甚至具身智能的视觉预训练,都有了更靠谱的底座。

实用建议:如果你正在做RAG应用,建议立刻尝试用Qwen2.5-VL替换旧的OCR+文本嵌入管线。它能直接输出带坐标的结构化文本块,检索精度提升非常明显。模型权重已经在HuggingFace和ModelScope同步上架,7B版本一张A100就能跑推理,非常友好。建议直接拉取代码跑一下官方demo,尤其是那个“密集文档解析”的示例,你会回来点赞的。

有问题欢迎在楼下交流,版主我下午会逐个回复技术细节。




欢迎光临 闲社 (https://21112.xianshe.com/) Powered by Discuz! X5.0