阿里自研AI模型有哪些?文本、图像视频、视觉理解多模态、语音、向量等模型大全
阿里云自研AI模型有哪些?最知名的就是通义千问Qwen系列大模型,阿里云是通过百炼AI模型平台对外提供API调用服务,阿里自研模型涉及文本、图像、视频、语音及全模态等多种类型。以下是阿小云axiaoyun.com根据现有资料整理的阿里云自研模型清单大全,在阿里云CLUB中心:aliyun.club 免费领取优惠券。
文本生成与理解
- Qwen3.8-Max:旗舰文本模型,适用于智能体及复杂推理任务。
- Qwen3.8-Flash:支持百万级上下文窗口,适用于超长文档和代码仓库处理。
- Qwen3.7-Plus:通用文本生成模型。
- Qwen-Long:专为超长文档或多文档的阅读理解、总结与信息提取设计。
- 通义法睿:专注法律领域的行业模型,适用于法律咨询、案例分析及合同审查。
视觉理解与多模态
- Qwen3-VL-Plus:视觉语言模型,支持视觉 Coding、空间感知及多模态思考。
- Qwen3.8-Omni-Flash / Realtime:全模态模型,融合文本、图像、音频、视频的理解与生成能力,支持实时音视频对话。
- Qwen-VL / QVQ / Qwen-OCR:适用于 OCR、图像内容描述、图像问答及视觉推理场景。
图像与视频生成
- Qwen-Image-3.0-Pro:图像生成模型,注重细节真实性与知识准确性。
- Wan3.0-Video / Wan2.7-Image-Pro:视频与图像生成模型,支持四模态全能参考及多种创作模式。
- 通义万相:支持文生图、图生图、涂鸦作画、图像背景生成及AI试穿等功能。
- HappyHorse 系列:包含 HappyHorse-1.1-T2V/I2V/R2V 及 1.0-Video-Edit,适用于文字生成视频、图生视频及视频编辑。
- 悦动人像 EMO / 舞动人像 AnimateAnyone:分别用于基于肖像生成数字人视频和基于图像生成舞蹈视频。
语音与音频
- Qwen3-TTS-Flash / Qwen-Audio-3.0-TTS-Plus:语音合成模型,支持多语言方言自适应及低延迟输出。
- CosyVoice-V3-Flash:高表现力语音合成模型,支持语音克隆。
- Fun-ASR / Qwen-Audio-3.1-ASR-Flash:语音识别模型,支持中英文自由切换及流式/文件转写。
- Fun-Music-v1:根据提示词或歌词生成音乐。
- Qwen-Audio-3.1-Realtime-Plus / Qwen3.5-Omni-Plus:端到端语音对话模型,无需分别调用 ASR 和 TTS。
向量、重排序与决策
- Qwen3.7-Text-Embedding / Flash / VL-Embedding:文本及图文向量化模型。
- Qwen3.7-Text-Rerank:文本重排序模型,配合向量检索提升精度。
- Decision-Model-Preview:面向高频业务判断的结构化决策模型。
随着时间推移,以上模型会持续更新也可能会新增模型,请以阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 为准,目前在百炼官网还可以领取超7000万的Tokens免费额度,更多可用模型及最新版本请以百炼控制台模型广场实时显示为准。
阿里云官方活动 https://t.aliyun.com/U/bLynLC 新老用户同享99元一年,4核16G10M带宽70元/月起
阿里云代金券领取入口 aly.wiki 免费领取12张代金券,2088元优惠券

