跳到正文

值得读的 7

2025 年 9 月 23 日 · 周二 · 第 150 期 · 约 2 分钟

本期头条

刘聪 NLP:美团龙猫再开源 LongCat-Flash-Thinking 模型,细节满满!

LongCat-Flash-Thinking 采用长 CoT 冷启动加强化学习两阶段训练,RL 阶段用 DORA 系统并多领域并行训练后融合;实测速度快,指令遵循与数学代码表现不错,但老鹰飞行题答错。

领域大模型

阿真:把舒适区干成统治区,这个 AI 真能 3D 建模直出手办!

混元 3D 3.0 建模精度提升 3 倍,支持 36 亿体素;每天 20 次免费生成,邀请好友可额外获得 30 次机会。

领域图像生成

南川:谷歌万字长文解密:从原型到生产,构建可靠 AI Agents 的全栈技术指南

谷歌云发布 60 余页《初创公司技术指南:AI Agents》,提出以 ADK 为核心的全栈技术体系;指南涵盖三大路径、五大核心组件及 MCP 与 A2A 两大开放协议。

领域Agent

近 7 天另有 3 条提到「MCP」,最近的 09-2109-18

署名南川同学

歸藏:可灵 2.5Turbo 实测|顶尖 AI 视频模型,真能打平 CG 吗?

可灵 2.5 Turbo 高品质模式 5 秒视频从 35 积分降至 25 积分;实测复杂时序提示词理解与风格一致性显著提升,部分场景可与世界渲染大赛 Top 100 作品掰手腕。

领域视频生成

近 7 天另有 2 条提到「Gemini 2.5 Pro」,最近的 09-22

署名歸藏

组织能力才是 AI 公司真正的壁垒 | 对谈 Palona AI 联创任川

Palona AI 90% 代码由 AI 编写,20 人团队无全职 PM;任川从工作流、人才、组织三维度总结 AI Native 团队实操经验。

领域行业动态形态观点

Qwen-Image-Edit 全新升级版本: 多图编辑支持,单图一致性提升

新增多图编辑,支持人物 + 人物、人物 + 商品、人物 + 场景等玩法;单图一致性增强,覆盖人物、商品、文字编辑,并原生支持 ControlNet。

领域图像生成形态新品

Qwen3-TTS-Flash:多音色 & 多语言 & 多方言的语音合成

中英稳定性在 seed-tts-eval 上取得 SOTA,超越 SeedTTS、MiniMax、GPT-4o-Audio-Preview;提供 17 种音色、每种支持 10 种语言,并支持 9 种方言。

领域音频形态新品

这一期的 7 条,到这儿全了

更新的一期在 09-24