新模型
2026-09-17
阿里发布 Qwen3.8-Omni-Flash:看得懂音视频的国产全模态模型
阿里发布 Qwen3.8-Omni-Flash:看得懂音视频的国产全模态模型
一句话说清:阿里千问出了个新模型,能同时看懂文字、图片、声音和视频,音频处理成本砍了 98%,做会议纪要和视频分析便宜多了。
发生了什么
9 月 17 日,阿里千问团队发布 Qwen3.8-Omni-Flash,这是千问 3.8 系列里第一个原生全模态模型——也就是同一个模型能直接吃进四种输入:文字、图片、声音、视频,然后输出文字。
几个普通人能感知的点:
- 100 万词元(token)超长上下文,官方说能连续处理约一小时的音视频。
- 音频输入成本比上一代降了 98% 以上,音视频整体成本降了 93% 以上——意味着以前“跑一遍比人工还贵”的音视频分析,现在可以放心全量跑了。
- 支持“边看边干活的智能体”用法:不仅能看懂会议录音、产品视频,还能顺手调用搜索、写代码把结果交出来。
- 已经在阿里云百炼、通义千问、Hugging Face、ModelScope 上线。
对我有什么用
- 打工人:丢一段一小时会议录音进去,它能直接出结构化的会议纪要,不用再人工听写。
- 做短视频 / 自媒体:一条长视频丢进去,让它做切片、写解说、出摘要,成本大幅降低。
- 开发者:它开放了兼容其它厂商的接口和插件,可以接到你常用的编程工具里,给 AI 智能体加上“看视频、听语音”的能力。
我可以怎么做
- 打开通义千问网页版(tongyi.com)或阿里云百炼(bailian.console.aliyun.com),登录账号。
- 在模型列表里找到 qwen3.8-omni-flash,直接用网页对话框上传一段音频或视频提问,例如:“总结这段会议的核心结论,列出 3 个关键时间点。”
- 开发者想接 API:在百炼控制台创建密钥,用兼容 OpenAI 格式的接口调用,模型名填
qwen3.8-omni-flash。 - 想做实时会议助手,可以搜官方开源的 Qwen-Live Harness 和 Qwen-MM-Plugins 插件库。
温馨提醒
- 目前公布的性能数字都来自阿里官方自报,独立复测和实际生产环境的稳定性还要再观察。
- 模型权重是否开源还没完全确认,要做私有化部署先看清授权说明,别踩合规坑。
- 长视频建议用百炼的异步接口或分片上传,一次性塞太大文件容易超时。
📤 一键转发小助手
帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发
💬 说说你的看法