近日
全球科技公司“你追我赶”
这些模型
或具备更快速的回答能力
或有更强的多模态能力
或增强了推理与生成能力
持续带来更加智能的使用体验
并为各行各业注入新动能
一起来回顾
↓↓↓
![图片[1]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网](https://www.huidong.net//wp-content/uploads/2025/05/01/2e1af0862da0620fa50ffb12c9e668b6.webp)
当地时间4月23日
OpenAI发布了全新图像模型
GPT-image-1
并通过API向开发者开放使用
该模型可以控制生成图像的
敏感度、生成效率、背景
输出格式、渲染质量、压缩质量等
OpenAI于4月16日发布的
新款AI模型o3和o4-mini
则能够处理、裁剪和转换图像
例如o3可以分析用户上传的
草图、图表以及其他图像
并生成答案
o4-mini作为o3的轻量级版本
适用于需要快速响应的场景
此前一天
OpenAI还推出了
GPT-4.1系列模型
在多模态处理、代码能力
指令遵循和成本方面实现提升
其最大亮点是
支持100万token的
上下文处理能力
能够处理超长文本
适用于法律、金融
编程等领域的复杂任务
![图片[2]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网](https://www.huidong.net//wp-content/uploads/2025/05/01/b7e7cc6294e2fa10692ea56a43ae5213.webp)
4月21日
生数科技视频大模型
Vidu Q1上线
目前支持生成5秒、1080P
高质量视频
运用其首尾帧功能
仅需两张图就能生成
流畅自然的中间镜头
还可实现一系列
衔接自然的镜头运动
同时上线的AI音效功能
通过录入一句话
就能生成精准专属音效
还可实现多种音效叠加
![图片[3]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网](https://www.huidong.net//wp-content/uploads/2025/05/01/5725a5e58f8c153ccd864f234c677c1d.webp)
谷歌公司4月17日宣布推出
Gemini 2.5 Flash Preview
预览AI模型
它是一个混合推理模型
具备“动态且可控”的计算能力
开发者能够
根据查询请求的复杂程度
灵活调整处理时间
谷歌在其博客文章中提到
“这款工作型模型
针对低延迟和降低成本进行了优化
是响应式虚拟助手
和实时总结工具的理想引擎”
![图片[4]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网](https://www.huidong.net//wp-content/uploads/2025/05/01/31716ede16de9a83636cd4aafb51f1c7.webp)
与谷歌同日
字节跳动发布了
豆包1.5深度思考模型
该模型采用MoE架构
总参数200B、激活参数20B
低于同类模型参数规模的50%
具备显著的推理成本优势
该模型还能结合视觉理解技术
提供更多功能
如根据照片分析地貌
或完成项目管理流程图等
此外,豆包文生图模型
Seedream3.0也已开放
支持2K分辨率直出
在生图结构准确性方面
具有优势
![图片[5]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网](https://www.huidong.net//wp-content/uploads/2025/05/01/43e1d6cb7f82191714dd7423128aa33f.webp)
4月15日,快手旗下
可灵2.0视频生成模型
及可图2.0图像生成模型发布
一般情况下
AI视频制作者往往
通过文字生成图片
再用图片生成视频
而可灵2.0
可将文字、图片、视频等
不同格式的文件
结合起来编辑生成视频的
多模态视频编辑功能
![图片[6]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网](https://www.huidong.net//wp-content/uploads/2025/05/01/acfc96e1b3cf95ea93c4cdefebe5b462.webp)
值得一提的是
在近期召开的
2025年世界互联网大会亚太峰会
人工智能大模型论坛上
来自全球的专家学者、企业代表
围绕“共促大模型
高水平开发与应用”这一主题
展开深入探讨
与会嘉宾认为
人工智能正深度融入
经济社会发展各领域
释放出普惠性价值
同时也面临
技术、伦理与协作等多重挑战
要以开放促合作,以创新谋突破
让人工智能大模型
为人类社会发展注入更强动能





















暂无评论内容