Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

2026-09-18

Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

Qwen 推出下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入与 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%,并同步开放 API、开源插件与运行时。

这是什么信号

Qwen 把 Qwen3.8-Omni-Flash 定位成“下一代原生全模态模型”,输入侧直接覆盖文本、图像、音频、视频,上下文窗口给到 1M token。这不是单点能力升级,而是一次面向“音视频智能体”的定价与工程能力同时下探:官方口径下,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%,同时开放 API,并附上开源插件与运行时。能力提升叠加价格骤降,通常意味着模型从“能演示”进入“能算账”的阶段。

为什么重要

音视频类任务长期被两件事卡住:一是长内容装不进上下文,二是按小时计费的推理成本压不住。1M token 上下文让长会议、长视频、连续多模态会话不必频繁切段丢失上下文;音频与音视频输入价格下降超过九成,则直接改变单位经济模型——过去做不了或只能抽样做的场景,可能变成全量处理。再叠加插件与运行时的开源,说明它不只是给一个接口,而是给一套可以自己搭起来的执行路径,音视频智能体从“调 API 拼流程”向“带运行时交付任务”推进。

对谁有价值

最直接受益的是做音视频工作流的团队:会议记录与会议智能体、视频剪辑与打标、直播或实时交互、多模态内容审核、客服语音分析。其次是做 AI 应用中间层的产品团队,输入成本骤降意味着可以把原本“只处理摘要”的流程升级为“全量转写+理解+动作”。对自建倾向强的团队,开源插件与运行时降低了被单一 API 绑定的顾虑,可先在本地或自有环境验证链路。

可以怎么行动

第一步做对照实验:挑一条真实音视频流程,用 Qwen3.8-Omni-Flash 与现有方案(含 Qwen3.5-Omni-Plus)跑同批样本,重点看长视频下的上下文保持、音频理解准确度和端到端时延,而不是只看评测分数。第二步做成本重估:以“每小时音频/音视频输入”为单位重新测算,把此前因成本被砍掉的全量处理环节加回流程。第三步做落地试点:选一个闭环短、可量化的场景(如会议纪要生成、剪辑素材打标)先上线,验证效果后再扩到实时交互类高要求场景。第四步评估自建路径:如果数据合规或成本敏感,先读开源插件与运行时的能力边界,再决定是纯 API 还是混合部署。

风险与限制

25% 是官方 29 项评测的平均提升,属于厂商自测口径,真实业务分布上的收益需要自己验证;98% 和 93% 是下降比例,未给出绝对价格,实际账单还取决于输入时长、并发与重试带来的 token 消耗。1M 上下文不等于无限吞入,长音视频的推理时延、显存/算力占用和长上下文下的注意力衰减仍需实测。此外原生全模态在高噪声音频、多说话人重叠、复杂画面上的鲁棒性,以及实时交互场景的延迟表现,都不能由发布信息直接推出。

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 qwen.ai 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。