1. 首页
  2. 阿里云百炼AI大模型服务平台

阿里自研AI模型有哪些?文本、图像视频、视觉理解多模态、语音、向量等模型大全

阿里云自研AI模型有哪些?最知名的就是通义千问Qwen系列大模型,阿里云是通过百炼AI模型平台对外提供API调用服务,阿里自研模型涉及文本、图像、视频、语音及全模态等多种类型。以下是阿小云axiaoyun.com根据现有资料整理的阿里云自研模型清单大全,在阿里云CLUB中心:aliyun.club 免费领取优惠券。

阿里云百炼AI模型广场
阿里云百炼AI模型广场

文本生成与理解

  • Qwen3.8-Max:旗舰文本模型,适用于智能体及复杂推理任务。
  • Qwen3.8-Flash:支持百万级上下文窗口,适用于超长文档和代码仓库处理。
  • Qwen3.7-Plus:通用文本生成模型。
  • Qwen-Long:专为超长文档或多文档的阅读理解、总结与信息提取设计。
  • 通义法睿:专注法律领域的行业模型,适用于法律咨询、案例分析及合同审查。

视觉理解与多模态

  • Qwen3-VL-Plus:视觉语言模型,支持视觉 Coding、空间感知及多模态思考。
  • Qwen3.8-Omni-Flash / Realtime:全模态模型,融合文本、图像、音频、视频的理解与生成能力,支持实时音视频对话。
  • Qwen-VL / QVQ / Qwen-OCR:适用于 OCR、图像内容描述、图像问答及视觉推理场景。

图像与视频生成

  • Qwen-Image-3.0-Pro:图像生成模型,注重细节真实性与知识准确性。
  • Wan3.0-Video / Wan2.7-Image-Pro:视频与图像生成模型,支持四模态全能参考及多种创作模式。
  • 通义万相:支持文生图、图生图、涂鸦作画、图像背景生成及AI试穿等功能。
  • HappyHorse 系列:包含 HappyHorse-1.1-T2V/I2V/R2V 及 1.0-Video-Edit,适用于文字生成视频、图生视频及视频编辑。
  • 悦动人像 EMO / 舞动人像 AnimateAnyone:分别用于基于肖像生成数字人视频和基于图像生成舞蹈视频。

语音与音频

  • Qwen3-TTS-Flash / Qwen-Audio-3.0-TTS-Plus:语音合成模型,支持多语言方言自适应及低延迟输出。
  • CosyVoice-V3-Flash:高表现力语音合成模型,支持语音克隆。
  • Fun-ASR / Qwen-Audio-3.1-ASR-Flash:语音识别模型,支持中英文自由切换及流式/文件转写。
  • Fun-Music-v1:根据提示词或歌词生成音乐。
  • Qwen-Audio-3.1-Realtime-Plus / Qwen3.5-Omni-Plus:端到端语音对话模型,无需分别调用 ASR 和 TTS。

向量、重排序与决策

  • Qwen3.7-Text-Embedding / Flash / VL-Embedding:文本及图文向量化模型。
  • Qwen3.7-Text-Rerank:文本重排序模型,配合向量检索提升精度。
  • Decision-Model-Preview:面向高频业务判断的结构化决策模型。

随着时间推移,以上模型会持续更新也可能会新增模型,请以阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 为准,目前在百炼官网还可以领取超7000万的Tokens免费额度,更多可用模型及最新版本请以百炼控制台模型广场实时显示为准。

阿里云官方活动 https://t.aliyun.com/U/bLynLC 新老用户同享99元一年,4核16G10M带宽70元/月起

阿里云代金券领取入口 aly.wiki 免费领取12张代金券,2088元优惠券