全球科技公司竞发AI大模型新版本,赋能多领域智能体验

近日

全球科技公司“你追我赶”

竞相发布了新版本人工智能(AI大模型

这些模型

或具备更快速的回答能力

或有更强的多模态能力

或增强了推理与生成能力

持续带来更加智能的使用体验

并为各行各业注入新动能

一起来回顾

↓↓↓

图片[1]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网

当地时间4月23日

OpenAI发布了全新图像模型

GPT-image-1

并通过API向开发者开放使用

该模型可以控制生成图像的

敏感度、生成效率、背景

输出格式、渲染质量、压缩质量等

OpenAI于4月16日发布的

新款AI模型o3o4-mini

则能够处理、裁剪和转换图像

例如o3可以分析用户上传的

草图、图表以及其他图像

并生成答案

o4-mini作为o3的轻量级版本

适用于需要快速响应的场景

此前一天

OpenAI还推出了

GPT-4.1系列模型

在多模态处理、代码能力

指令遵循和成本方面实现提升

其最大亮点是

支持100万token的

上下文处理能力

能够处理超长文本

适用于法律、金融

编程等领域的复杂任务

图片[2]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网

4月21日

生数科技视频大模型

Vidu Q1上线

目前支持生成5秒、1080P

高质量视频

运用其首尾帧功能

仅需两张图就能生成

流畅自然的中间镜头

还可实现一系列

衔接自然的镜头运动

同时上线的AI音效功能

通过录入一句话

就能生成精准专属音效

还可实现多种音效叠加

图片[3]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网

谷歌公司4月17日宣布推出

Gemini 2.5 Flash Preview

预览AI模型

它是一个混合推理模型

具备“动态且可控”的计算能力

开发者能够

根据查询请求的复杂程度

灵活调整处理时间

谷歌在其博客文章中提到

“这款工作型模型

针对低延迟和降低成本进行了优化

是响应式虚拟助手

和实时总结工具的理想引擎”

图片[4]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网

与谷歌同日

字节跳动发布了

豆包1.5深度思考模型

该模型采用MoE架构

总参数200B、激活参数20B

低于同类模型参数规模的50%

具备显著的推理成本优势

该模型还能结合视觉理解技术

提供更多功能

如根据照片分析地貌

或完成项目管理流程图等

此外,豆包文生图模型

Seedream3.0也已开放

支持2K分辨率直出

在生图结构准确性方面

具有优势

图片[5]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网

4月15日,快手旗下

可灵2.0视频生成模型

可图2.0图像生成模型发布

一般情况下

AI视频制作者往往

通过文字生成图片

再用图片生成视频

而可灵2.0

可将文字、图片、视频等

不同格式的文件

结合起来编辑生成视频的

多模态视频编辑功能

图片[6]-全球科技公司竞发AI大模型新版本,赋能多领域智能体验-会懂网

值得一提的是

在近期召开的

2025年世界互联网大会亚太峰会

人工智能大模型论坛

来自全球的专家学者、企业代表

围绕“共促大模型

高水平开发与应用”这一主题

展开深入探讨

与会嘉宾认为

人工智能正深度融入

经济社会发展各领域

释放出普惠性价值

同时也面临

技术、伦理与协作等多重挑战

要以开放促合作,以创新谋突破

让人工智能大模型

为人类社会发展注入更强动能

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容