阿里巴巴发布Qwen3.8-Omni-Flash 多项表现逼近Gemini 3.8 Flash

📅 2026-09-18

摘要:

阿里巴巴旗下Qwen团队近日发布新一代原生全模态模型Qwen3.8-Omni-Flash,进一步将音频、视频理解与AI智能体能力结合起来。

该模型支持文本、图像、音频和视频四种输入形式,并提供100万Token上下文窗口。与上一代Qwen3.5-Omni-Plus相比,Qwen官方称其在29项基准测试中的平均成绩提升超过25%,同时大幅降低了音频和音视频处理成本。

1789705181_banner-latest.en.webp

Qwen3.8-Omni-Flash最大的变化之一,是其并非简单地将语音识别、图像识别等能力拼接在一起,而是从模型层面原生处理不同类型的信息。阿里巴巴希望借此让模型不只是“看懂”或“听懂”音视频内容,而是能够在理解这些信息之后进一步规划任务、调用工具并完成实际工作。

在音频能力方面,Qwen3.8-Omni-Flash的表现尤其突出。按照Qwen公布的数据,该模型在部分音频基准测试中已经超过Gemini 3.8 Flash。例如在WildClawBench-MM多模态工具调用测试中,Qwen3.8-Omni-Flash获得71.0分,而Gemini 3.8 Flash为58.9分;在DailyOmni测试中,Qwen为85.1分,Gemini为84.0分;在SpotSoundBench中,两者分别为67.2分和39.7分;MMAU测试中则为81.8分和76.9分。

多说话人会议语音识别同样是此次升级的重点。Qwen公布的AliMeeting测试数据显示,Qwen3.8-Omni-Flash的说话人错误率DER为3.35,带说话人归属的词错误率cpWER为17.18,而上一代Qwen3.5-Omni-Plus分别为88.11和89.61。这意味着新模型在这一测试中的变化幅度非常明显。

不过,Qwen3.8-Omni-Flash并不是在所有项目上都领先Gemini 3.8 Flash。例如在AgenticVBench测试中,Gemini 3.8 Flash获得45.0分,Qwen为36.8分;OmniGAIA中则分别为78.6分和74.0分。在部分视频理解测试中,Gemini同样保持优势。因此,Qwen所强调的“逼近Gemini”更多体现在整体音频和音视频能力,而并非意味着在所有多模态项目中全面领先。

Qwen3.8-Omni-Flash的另一项重要变化是价格。Qwen表示,与此前的模型相比,其音频输入的估算成本每小时下降超过98%,音频加视频输入的成本每小时下降超过93%。按照官方计算方式,所谓“每小时”成本是以两分钟素材的处理价格乘以30计算,其中视频采用720p、每秒1帧的输入条件。

目前阿里云公布的国际区域价格为每百万Token输入0.15美元,命中缓存的输入Token为0.016美元,每百万输出Token为0.47美元。中国大陆以及部分其他区域的价格还会有所不同。由于音频和视频可以直接作为模型输入,这种定价结构尤其适合会议记录、长音频分析、视频审核、字幕生成以及大量媒体内容处理等场景。

100万Token上下文窗口则进一步放大了这一优势。Qwen3.8-Omni-Flash最大输入长度接近99.2万Token,在思考模式下最大输入长度约为98.4万Token,最大输出长度达到13.1万Token。这意味着开发者可以将规模非常大的音频或视频内容直接交给模型处理,而不必像过去一样频繁切片、抽帧,再通过多个模型分别完成语音识别、视觉理解和文本推理。

阿里云的官方资料显示,Qwen3.8-Omni-Flash能够处理113种语言和方言的音频输入,并支持空间音频分析。通过相关参数,模型可以处理双声道立体声以及四声道空间音频。同时,该模型支持函数调用、联网搜索、上下文缓存等能力,可以被直接用于更加复杂的智能体工作流。

从应用方向来看,Qwen团队此次重点强调的是“智能体交付”。例如,模型可以分析长视频、定位其中的关键内容,并进一步调用工具完成视频编辑、内容整理、会议总结、字幕生成等任务。Qwen还公布了面向多模态智能体开发的Qwen-MM-Plugins,并计划推出Qwen-Live-Harness,以帮助开发者进一步构建基于音视频输入的智能体应用。

与上一代Qwen3.5-Omni相比,这次升级的重点因此并不只是提高传统意义上的识别准确率,而是试图改变音视频AI的使用方式。过去的多模态应用通常需要先把视频抽帧、音频转写,再把不同结果交给语言模型处理;Qwen3.8-Omni-Flash则试图将这些环节尽可能统一到一个原生全模态模型中,并利用100万Token上下文直接处理更长的原始内容。

Qwen3.8-Omni-Flash目前通过阿里云百炼提供服务,支持北京、新加坡、中国香港、日本东京、德国法兰克福和美国弗吉尼亚等区域。该模型本身并未像部分Qwen此前的模型那样直接开放权重,阿里巴巴此次主要开放的是配套的多模态插件和相关开发工具。

整体来看,Qwen3.8-Omni-Flash此次更新的核心并不只是模型跑分提升,而是同时压低音视频处理成本、扩大上下文规模,并将音视频理解与工具调用结合起来。尤其是超过98%的音频输入成本降幅,如果实际使用成本能够达到官方测算水平,将使长时间会议录音、播客、直播和视频素材的大规模自动分析变得更加容易,也进一步加剧了Qwen与Google Gemini等多模态模型之间的竞争。

关联标签

相似文章

评论

0/500
验证码(点击图片刷新)
暂无评论