EASYHUB JOURNAL / 2025-03
2025年3月 AI 资讯
10 篇选读,按原文日期从新到旧。点击标题查看摘要、配图及原文链接。
- IT之家
AutoGLM 沉思发布预览,结合研究与实际操作
智谱通过官方公众号介绍 AutoGLM 沉思,重点是研究、规划和工具执行的衔接。报道明确为预览版本,后续执行能力扩展和开源计划应与当前功能分开。
- IT之家
Qwen2.5-Omni 开放多模态输入与流式语音响应
模型采用 Thinker-Talker 结构,在统一流程中理解文本、图像、音频和视频,并输出文本与语音。音视频实时体验仍依赖采集、传输和推理端的完整实现。
- IT之家
混元 T1 正式版上线,强化数学、代码与长文本推理
混元 T1 正式版通过强化学习针对数学、逻辑、科学和代码任务优化,并沿用 Turbo S 的 Mamba-Transformer 混合架构降低长文本推理开销。发布时网页体验和腾讯云 API 已上线,可用于长文分析及需要多步推理的问答。
- IT之家
Llama Nemotron 按边缘、单卡和服务器场景分层
英伟达介绍不同规模的推理模型与视觉语言方向,面向智能体和多种部署环境。系列发布涵盖不同阶段的能力,应逐个检查具体检查点及服务是否已经开放。
- IT之家
Mistral Small 3.1 面向低延迟多模态和本地部署
报道介绍 Mistral Small 3.1 的本地部署、长上下文和工具调用方向。显卡与内存示例需要结合量化方式及上下文长度理解,不能据型号名称保证性能。
- The Verge
Gemini Canvas 提供文稿、代码实时编辑与预览
Google 将可编辑工作区和音频概览加入 Gemini,支持边修改边预览代码成果。音频概览在发布时仅支持英语,后续语言计划与当前能力保持区分。
- 量子位
OpenManus 用模块化智能体连接浏览器、代码和文件
量子位介绍 OpenManus 的规划、浏览器操作和文件处理模块,以及与既有开源工具的关系。这是可修改的原型路线,不是已经复现商业产品全部可靠性的证明。
- IT之家
混元开源 13B 图生视频模型,并提供 LoRA 训练代码
混元将视频生成扩展到图片输入,结合动作和镜头描述生成短视频,并公开 13B 模型权重、推理及 LoRA 训练代码。同期在线平台展示对口型、动作驱动和配音玩法;这些产品能力不应全部等同于单个开源图生视频权重的能力。