EASYHUB JOURNAL / 2025-09
2025年9月 AI 资讯
15 篇选读,按原文日期从新到旧。点击标题查看摘要、配图及原文链接。
- IT之家
混元图像 3.0 开源,增加长指令理解与文字生成能力
腾讯开放 80B 参数的原生多模态图像生成模型 HunyuanImage 3.0,重点提升利用知识理解复杂长描述的能力,并支持在画面内生成较长文字。它把多主体语义、构图要求和文字内容放在同一生成任务中,服务更细致的图像创作。
- IT之家
混元 3D-Omni 与 3D-Part 开源,补充几何控制和部件拆分
腾讯同批推出两项 3D 工具:3D-Omni 用多种条件约束几何结构与姿态;3D-Part 结合 P3-SAM 分割和 X-Part 生成,把整体模型拆为可单独处理的部件。两者开放权重与推理代码,部件能力也进入混元 3D Studio,方便资产编辑与 3D 打印准备。
- IT之家
Kimi OK Computer 开始灰度测试,在虚拟电脑里完成网站与文档任务
Kimi 推出基于 K2 的 OK Computer 模式,让智能体操作自己的虚拟电脑,执行网站开发、数据分析、图片视频和 PPT 制作。用户提交目标后由系统拆解任务、调用工具并生成产物;发布时属于灰度测试,首批向此前支持过 Kimi 的用户开放。
- 新智元
Code World Model 研究通过预测执行结果辅助编码
Meta 的 CWM 把程序执行轨迹纳入训练,探索在生成代码时预测状态变化。报道将其作为研究验证,模型模拟的执行不能代替真正运行测试和检查补丁。
- ComfyOrg
ComfyUI 原生接入 Wan 动作迁移与 Qwen 多图编辑
ComfyUI 为 Wan2.2 Animate 与 Qwen-Image-Edit-2509 提供原生工作流,前者用参考视频驱动角色动作或替换角色,后者支持 1–3 张图片组合编辑并增强主体一致性。公告要求更新到 0.3.60 并下载相应模型,桌面安装包的支持当时仍待跟进。
- IT之家
MobileLLM-R1 将小参数模型聚焦数学、代码与科学题
Meta 提供多个小尺寸推理版本,重点是数学、代码和科学问题而非通用闲聊。它为资源受限设备提供研究选项,任务专长不能直接推广为综合助手能力。
- IT之家
Granite-Docling-258M 以结构标记保留文档的阅读顺序
IBM 发布 258M 参数的 Granite-Docling,将页面内容与表格、公式、列表等结构表示为 DocTags,再衔接 Markdown、JSON、HTML 等处理流程。它适合文档转换与知识整理;中文等多语言能力在当时仍有成熟度限制,不应替代业务文档的人工抽查。
- IT之家
MiMo-Audio 开放端到端语音预训练研究
小米公开语音模型与相关编码组件,探索从大规模语音中获得少样本任务泛化。Tokenizer、语言骨干和整体模型属于不同组件,参数量应按各自定义记录。
- The Verge
Notion Agent 将页面、数据库与外部检索连成任务流程
Notion 3.0 引入可规划并修改页面和数据库的智能体,支持跨连接工具检索与可编辑偏好。完全自动运行的定制智能体仍属后续安排,执行也受工作区权限限制。
- Replit
Replit Agent 3 加入浏览器自测,并能搭建定时工作流
Replit Agent 3 可在开发过程中打开浏览器检查页面、发现问题后继续修改,也能生成连接外部服务的智能体和定时工作流。用户可查看执行进度并调整任务;长时间自主运行属于可选择的测试能力,生成结果仍需实际验收。
- IT之家
腾讯发布 CodeBuddy Code 命令行工具,国际版 IDE 同步公测
CodeBuddy Code 将自然语言开发任务带入终端,可生成和重构代码、处理依赖并执行测试。腾讯同时开放 CodeBuddy IDE 国际版公测,形成插件、IDE 与 CLI 三种入口;国际版 IDE 和 CLI 共用模型额度,不应把测试赠送额度写成永久免费。
- IT之家
InternVL3.5 扩展界面、空间和矢量图形任务
上海 AI 实验室更新多尺寸视觉语言模型,强化 GUI 交互、空间推理和矢量图形处理。公开评测反映特定能力,自动化实际文件操作仍应在授权范围内验证。