EASYHUB JOURNAL / 2025-01
2025年1月 AI 资讯
10 篇选读,按原文日期从新到旧。点击标题查看摘要、配图及原文链接。
- IT之家
Janus-Pro 用解耦视觉编码统一图像理解与生成
DeepSeek 开放 Janus-Pro,通过分离理解与生成的视觉编码路径,在统一框架中处理两类任务。系列适合研究多模态设计,基准排名不代表所有画面或提示都优于其他模型。
- IT之家
Open-R1 发起开放训练复现,补充推理模型的数据与代码
Hugging Face 发起 Open-R1,希望补足只有权重而缺少完整训练数据、代码的研究环节。报道时这是社区复现计划,不能将其当成已经完成、与原模型完全等价的替代品。
- IT之家
Qwen2.5-VL 开放三种尺寸,扩展文档和视频理解
Qwen2.5-VL 提供 3B、7B 与更大版本,增强空间时间感知、文档图表理解和视觉智能体能力。开发者可按设备与任务选择尺寸,小模型与大版本的表现需分别评估。
- IT之家
百川 Omni-1.5 开放全模态理解与文本语音输出
百川开放 Omni-1.5,整合文本、图像、音频和视频理解,并采用文本与音频交错输出。报道中的医疗领域表现仅是模型比较,不能据此作为临床可靠性的证明。
- IT之家
SmolVLM 新增 256M 与 500M,进一步压低视觉模型门槛
Hugging Face 为 SmolVLM 增加 256M 与 500M 两种尺寸,面向资源受限设备的图像描述、视觉问答与文档图表理解。它们扩展了较早的 2B 版本,但小参数量不等于固定内存占用,实际需求仍随图像分辨率、上下文和推理后端变化。
- IT之家
有道子曰-o1 开源 14B 模型,强调分步骤讲解
有道将分步骤解题作为子曰-o1 的重点,提供可供部署的轻量级模型。推理过程有助于观察解题方式,但展示步骤不保证推导正确,更不应替代学生自己的核算。
- Tencent
混元 3D 2.0 将几何生成与纹理绘制拆成两段工作流
Hunyuan3D 2.0 先从参考图片生成网格,再为网格合成纹理;纹理模块也可用于已有手工模型。腾讯同时开放推理代码、预训练权重和在线制作入口,生成的资产可以导出为常见三维格式,继续进入模型编辑、渲染与内容制作流程。
- IT之家
DeepSeek-R1 发布,同时提供多尺寸蒸馏模型
DeepSeek 开放推理模型与多个蒸馏版本,让开发者在模型规模和资源需求之间选择。报道中的与 o1 对比属于厂商任务评测,不能把旗舰结果直接看作每个小模型的能力。
- IT之家
MiniCPM-o 2.6 用 8B 参数探索端侧全模态交互
面壁智能公众号宣布 MiniCPM-o 2.6,支持文本、图像、音频和视频输入,以及文本与语音输出。报道展示端侧实时交互方向,但设备需求和体验仍受模型精度及运行方案影响。
- IT之家
天工 4.0 推出推理与多模态入口,配套 Skyo 语音助手
昆仑万维将推理与多模态版本上线网页和 App,并介绍具备情感表达的 Skyo 实时语音助手。报道所述免费使用是当时的产品状态,历史资讯不作为当前套餐承诺。