语音与音频·EASYHUB 选读
Qwen2.5-Omni 开放多模态输入与流式语音响应

这次有什么变化
模型采用 Thinker-Talker 结构,在统一流程中理解文本、图像、音频和视频,并输出文本与语音。音视频实时体验仍依赖采集、传输和推理端的完整实现。
- 原文标题
- 阿里云通义千问发布新一代端到端多模态旗舰模型 Qwen2.5-Omni 并开源,看听说写样样精通
- 来源
- IT之家 · www.ithome.com
- 主题
- 语音与音频
- 原文月份
- 2025-03
本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。
本站摘要页面发布 · 更新 · 内容说明