新模型 2026-09-17

阿里发布 Qwen3.8-Omni-Flash:看得懂音视频的国产全模态模型

阿里发布 Qwen3.8-Omni-Flash:看得懂音视频的国产全模态模型

一句话说清:阿里千问出了个新模型,能同时看懂文字、图片、声音和视频,音频处理成本砍了 98%,做会议纪要和视频分析便宜多了。

发生了什么

9 月 17 日,阿里千问团队发布 Qwen3.8-Omni-Flash,这是千问 3.8 系列里第一个原生全模态模型——也就是同一个模型能直接吃进四种输入:文字、图片、声音、视频,然后输出文字。

几个普通人能感知的点:

  • 100 万词元(token)超长上下文,官方说能连续处理约一小时的音视频。
  • 音频输入成本比上一代降了 98% 以上,音视频整体成本降了 93% 以上——意味着以前“跑一遍比人工还贵”的音视频分析,现在可以放心全量跑了。
  • 支持“边看边干活的智能体”用法:不仅能看懂会议录音、产品视频,还能顺手调用搜索、写代码把结果交出来。
  • 已经在阿里云百炼、通义千问、Hugging Face、ModelScope 上线。

对我有什么用

  • 打工人:丢一段一小时会议录音进去,它能直接出结构化的会议纪要,不用再人工听写。
  • 做短视频 / 自媒体:一条长视频丢进去,让它做切片、写解说、出摘要,成本大幅降低。
  • 开发者:它开放了兼容其它厂商的接口和插件,可以接到你常用的编程工具里,给 AI 智能体加上“看视频、听语音”的能力。

我可以怎么做

  1. 打开通义千问网页版(tongyi.com)或阿里云百炼(bailian.console.aliyun.com),登录账号。
  2. 在模型列表里找到 qwen3.8-omni-flash,直接用网页对话框上传一段音频或视频提问,例如:“总结这段会议的核心结论,列出 3 个关键时间点。”
  3. 开发者想接 API:在百炼控制台创建密钥,用兼容 OpenAI 格式的接口调用,模型名填 qwen3.8-omni-flash。
  4. 想做实时会议助手,可以搜官方开源的 Qwen-Live Harness 和 Qwen-MM-Plugins 插件库。

温馨提醒

  • 目前公布的性能数字都来自阿里官方自报,独立复测和实际生产环境的稳定性还要再观察。
  • 模型权重是否开源还没完全确认,要做私有化部署先看清授权说明,别踩合规坑。
  • 长视频建议用百炼的异步接口或分片上传,一次性塞太大文件容易超时。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发