EASYHUB JOURNAL / 2025-02
2025年2月 AI 资讯
12 篇选读,按原文日期从新到旧。点击标题查看摘要、配图及原文链接。
- IT之家
混元 Turbo S 发布,采用混合架构改善响应速度
腾讯发布快思考模型 Turbo S,结合 Mamba 与 Transformer,重点降低长文本处理的计算和缓存开销。发布时腾讯云 API 已开放,元宝计划逐步接入;它也被用作推理、长文和代码等混元衍生模型的基础,而不是仅面向聊天的新入口。
- IT之家
万相 2.1 开放视频模型,提供 1.3B 与 14B 选择
阿里开放万相视频模型权重和推理代码,覆盖较小尺寸与高质量生成路线。消费级显卡的演示对应特定分辨率和配置,不意味着所有版本都只需同样显存。
- IT之家
Moonlight 与分布式 Muon 实现开放,研究训练效率
月之暗面公布在 Muon 上训练的 MoE 模型、优化器实现和中间检查点。重点是训练方法和可复查资源,模型总参数与每次激活参数应分别记录。
- IT之家
SkyReels-V1 与 A1 开放人物视频和表情驱动研究
昆仑万维开放面向人物视频生成的模型和表情动作控制方法,覆盖文字、图片及驱动视频等创作输入。演示是工作流起点,成片仍需检查动作、身份与镜头一致性。
- IT之家
阶跃与吉利开放视频生成和语音交互模型
双方公布 Step-Video-T2V 与 Step-Audio,分别面向视频生成和可控制表达的语音交互。两种任务属于不同模型与部署链路,不能把一个版本的硬件需求套用到另一个。
- Dify
Dify 1.0 以插件与 Agent 节点扩展应用工作流
Dify 1.0 将模型和工具等能力拆成可扩展插件,并在工作流中引入 Agent 节点,方便组合决策逻辑与外部服务。开发者可通过生态市场或自有插件扩展应用,但插件会接触实际工具和数据,安装来源与调用权限仍需逐项审查。
- IT之家
OmniParser V2 解析屏幕元素,配合 OmniTool 研究电脑操作
OmniParser V2 将截图中的按钮、图标等内容转成大模型可定位的结构化元素,改进小目标识别。配套 OmniTool 提供 Docker 化 Windows 实验环境,将界面理解、动作规划和执行连接起来;解析器本身不是完整智能体,实际操作仍需权限边界与人工监督。
- 新智元
OpenThinker-32B 开放推理模型及配套训练数据
OpenThoughts 团队公开推理训练数据、生成流程和模型,研究数据筛选对推理质量的影响。报道中的成绩来自指定基准,开放资料的价值在于便于复查和继续实验。
- IT之家
VideoWorld 探索从视频中学习知识与动作
字节与高校团队开放 VideoWorld,研究不以语言模型为中心的视频学习路线。围棋和机器人实验展示了特定任务的潜力,不应将这些实验概括为已经理解整个物理世界。
- 机器之心
FireRedASR 开放两种识别架构,覆盖精度与效率需求
小红书 FireRed 团队开放 FireRedASR 模型与推理代码,提供编码器—解码器和大语言模型结合两种路线,服务中文语音转文字。前者侧重较轻量推理,后者借助语言模型提升识别表现;这是语音识别而非语音合成,榜单结果仍依赖具体测试集。