会懂网AI资讯获悉,腾讯混元正式开源Hy4-V多模态大模型,支持图像、文本、音频、视频、3D五模态融合理解,在12项国际权威多模态基准上刷新SOTA,进一步强化了中国在多模态大模型领域的开源生态优势。
作为腾讯混元系列的最新成果,Hy4-V主打五模态融合理解能力,能够同时处理图像、文本、音频、视频和3D内容。这意味着模型不再局限于单一模态的理解,而是可以像人类一样,综合调用多种感知通道来完成复杂的认知任务。
多模态大模型的价值在于,它让AI从”能看””能听”走向”能综合理解”。在实际应用中,一个能同时理解视频画面、背景音乐、字幕文本和3D结构的模型,可以在视频理解、智能剪辑、内容审核、工业质检等场景中发挥更大的价值。
腾讯在AI领域的投入正持续加码。最新财报显示,腾讯二季度资本开支达527.84亿元,同比激增176%,其中大部分流向高性能GPU服务器和AI加速芯片采购。混元大模型的持续迭代,正是这笔巨额投入的直接产出。
业内分析认为,国产大模型在多模态领域的开源竞赛正在加速。从阿里Qwen、DeepSeek到腾讯混元,各家都在通过开源核心权重来吸引全球开发者,构建自己的生态护城河。Hy4-V在12项基准上刷新SOTA,标志着中国开源多模态模型的整体水平又上了一个台阶。
随着多模态能力成为大模型竞争的必争之地,腾讯混元Hy4-V的开源,将进一步丰富全球开发者的可选底座,也把国产开源大模型的竞争力从文本领域延伸到更广阔的多模态战场。
在行业竞争层面,多模态能力正成为大模型竞争的新高地。随着文本模型能力趋于饱和,能否同时处理图像、视频、音频、3D等多种模态,直接决定了模型在真实世界任务中的适用广度。腾讯混元在此时开源Hy4-V,既展示了技术实力,也为国内多模态开源生态注入了新的活力,将吸引更多开发者和企业基于国产多模态底座构建应用。






























暂无评论内容