会懂网AI资讯,9月6日,据9月6日早报梳理,谷歌DeepMind发布开源模型Gemma 4 12B。该模型采用无编码器(encoder-free)的统一多模态架构,参数量约120亿,可在16GB内存的笔记本电脑上运行,支持原生音频理解,并以Apache 2.0协议开放,已在Hugging Face与Kaggle平台提供下载。

无编码器统一架构是Gemma 4的一大技术看点。传统多模态模型往往依赖独立的视觉编码器把图像转成特征再喂给语言模型,而Gemma 4把文本、图像与音频统一在同一框架内处理,简化了结构,也有望提升跨模态对齐的连贯性与效率。
12B的体量让”本地可跑”成为可能。官方称其可在16GB内存的消费级笔记本上运行,意味着开发者无需昂贵显卡即可在本地部署多模态能力,带来数据不出本机、低时延与零调用成本等优势,特别适合隐私敏感与离线场景。
原生音频支持拓展了交互维度。相比仅支持图文的多模态模型,Gemma 4能直接理解音频输入,为语音助手、会议摘要与多媒体分析等应用提供轻量底座,也降低了开发者构建端侧语音智能的门槛。
采用Apache 2.0开源协议,是谷歌”开放普惠”策略的延续。宽松许可让企业与个人可自由商用与修改,配合Hugging Face、Kaggle的便捷获取,Gemma 4有望在端侧与边缘场景快速积累生态,与云端大模型形成互补。
端侧多模态的轻量化趋势,正与近年来大模型下沉相互呼应。当”看得懂图、听得懂话”的模型能装进笔记本,完整的本地AI工作流就有机会摆脱对数据中心的依赖,为离线优先、隐私优先的应用打开想象空间。
会懂网观察,Gemma 4 12B代表了”小而全”的端侧路线:统一多模态、原生音频、可本地运行且完全开源。当强能力模型变得轻巧可得,AI的下一波普及,很可能发生在每个人的笔记本与手机里,而非远端的机房。




















暂无评论内容