基于 MiniMax H3 Max 的 24 小时 AI 直播网站上线了
H3 Max 生成 5 秒 768p 音视频不到 3 秒,吞吐量约为 H3 的 35 倍;H3 开源三周下载量超 2400 万次,产生超 300 个衍生模型。
H3 Max 生成 5 秒 768p 音视频不到 3 秒,吞吐量约为 H3 的 35 倍;H3 开源三周下载量超 2400 万次,产生超 300 个衍生模型。
320B 总参数、AA 综合智能指数 57 分,与 Claude Opus 4.8 持平;定价为 GLM-5.3 的 1/10,限时折扣内为 1/20。
行业首个实况级多人多 Agent 并行协作空间,端云两栖且支持持久化工作现场;冲突处理收敛在系统层,为文件系统设计底层协同引擎。
多模态 Agent 能力接近 Opus-4.8,纯文本能力与 V4-Flash 持平;API 按 token 计费,单图最多 384 tokens,Files API 免费开放。
围绕原生多模态视频模型 H3 构建,支持语义级创作与编辑;提供 3D 导演台等能力,覆盖从分镜到成片的完整商业内容生产流程。
Agent 能力大幅提升,Code Agent 任务在 DeepSeek Harness 极简模式下测试;API 原生支持 Responses API 并适配 Codex,思考模式新增 low/high/max 三档。
开发者预览版上线并开源,基于 Cordis 插件系统构建,一切皆插件;随附标准、PTC、极简、创造四种模式,Code Mode 将工具生成为 TypeScript SDK 减少上下文消耗。
deepseek-v4-pro 支持 1M 上下文、384K 最大输出,缓存未命中输入 3 元 / 百万 Token、输出 6 元;并发限制 500,价格与并发均为 Flash 的 3 倍。
前身是 2025 年 10 月发布的 Aardvark,今年 3 月更名并整合进 Codex;以 npm 包形式开源,支持 OpenRouter、Fireworks 和 Amazon Bedrock 接入第三方模型。
托管式智能体把运行壳与基础设施打包,开发者只需提供业务逻辑;Managed Deep Agents 构建于 Deep Agents 之上,集成 LangSmith 全家桶。
全模态生成系统,支持最高 2K 分辨率、15 秒带原生立体声的视频;H3-Context-IR 不包含在开源发布中,仅提供 API 与提示词指南。
YC 开源内部多 Agent 协作框架 QM,支持 Slack 与 Web 双端;核心在 Node 上运行,可切换 Pi、OpenCode、Codex 与 Claude Code 等运行框架。
单段视频生成从 15 秒提升至 30 秒,支持最长 3 分钟超长视频与多轮延长;单次最多支持 50 个多模态参考素材(30 张图片、10 条视频、10 条音频)。
全模态生成模型,支持文本、图像、视频、声音统一理解,输出原生双声道音视频,最高 15s 2K;2K 分辨率下每秒价格不到主流模型的 1/3,计划未来几天开放模型权重。
九项 Agent 测试全部超过 V4 Pro Preview,DeepSWE 得分提升 7.5 倍;原生支持 Responses API,并针对 Codex 做了适配优化。
基于 React、Three.js、Vite 与 Electron 构建的 AI 原生 3D 导演工作台;支持游戏、FPV 无人机运镜和手机虚拟拍摄三种导演模式。
Kimi K3 为 2.8 万亿参数 MoE 模型,支持原生视觉与 100 万 token 上下文;同步开源 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
白皮书于 2026 年 7 月 18 日发布,串联算力、Token、出海三大核心要素;中国日均 Token 调用量突破 140 万亿,两年增长超 1000 倍。
以 Opus 4.8 相同的价格提供更强性能,Frontier-Bench 与 GDPval-AA 达业界最佳;网络安全任务上仍落后于 Mythos 5。
该 Skill 通过访谈式流程分析代码仓库与智能体轨迹,产出 Harbor 格式的可执行评测;已在 chat-langchain 上测试,代码位于 langchain-ai/langchain-skills 仓库。
单次生成最长 20 秒带音频视频,对比偏好率最高 69%;图像与动作预测能力将分阶段开放早期访问。
开源小红书写作 Skill,含 SKILL.md、素材表、校验脚本等,MIT 许可;支持 Codex 与 Claude Code 两种安装方式,生图依赖 Codex 原生 Image2。
面壁智能发布并开源 MiniCPM-Robot 系列,含 1.5B 的 RobotManip 与 0.9B 的 RobotTrack;RobotManip 流式推理将 60 帧历史观测下每决策步计算量从 125 TFLOPs 降至 3.3 TFLOPs。
LangChain 开源了 dcode、OpenSWE、OpenSWE Review、OpenWiki 四件套;OpenSWE Review 在 Offline Code Review Benchmark 上得分 47%,排名开源代码审查智能体第 1。
Skill Engineering 1.0 开源,覆盖 Skill 全生命周期管理;用 4 个 Use Case 验证,从会议纪要扩展到 GitHub Issue 与多文件研究证据包。
2.8 万亿参数、100 万 token 上下文,基于 KDA 与 Attention Residuals 架构;整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但超过其他所有模型。
蒸馏 5 位作者 645 篇公众号文章,按 AI 硬件、论文解读等维度总结标题句式;每次从稳健准确、网感点击等方向生成并选出前 5 名,标注标题党风险与关键词过期。
提供 CLI 配合 Skill 实现转录、Speaker 识别、润色与剪辑,并实时同步进度到 GUI;仅支持 Mac,翻译速度略慢但质量不错。
WorkBuddy 实战蓝皮书以 MIT 协议开源,含使用手册、实战案例、进阶方法与岗位落地四部分;提供 GitHub 仓库与在线阅读网站,支持提交 Issue 或 Pull Request 共创。
WaytoAGI 孵化新项目 WaytoGrowth,为 AI 品牌提供 GTM 增长系统;服务涵盖叙事定位、搜索可见度、付费广告与全球发布四类。
GPT-5.6 系列包含旗舰 Sol、均衡 Terra 与高效 Luna 三档;Sol 在 Agents' Last Exam 达 53.6 分,比 Claude Fable 5 高 13.1 分。
全双工架构实现边听边说,可实时打断与追问;日常对话自接,难题实时委托后台 GPT-5.5 处理,对话不中断。
Seedream 5.0 Pro 上线火山方舟、豆包与即梦;支持复杂信息可视化、交互式精准编辑、图层分离与多图融合。
Sol 在 Terminal-Bench 2.1 上达 88.8%,Ultra 模式 91.9%;METR 评测检出其作弊率高于任何公开模型,50% time horizon 约 11.3 小时。
新增 PPT 动画能力,借助 Fable 5 解决 PptxGenJS 不支持动画的局限;baoyu-design 将 Claude Design 打包为可移植 Agent Skill,支持 70+ 个 Agent。
Meta 开源内部使用 8 年的设计系统 Astryx,已支撑超 1.3 万个应用;提供 150+ 无障碍组件、CLI 工具并集成 MCP 服务器。
项目为单 HTML 文件、约 250KB,支持拖拽导入与多格式导出;开发过程消耗约 10 亿 Token,使用 glm-5.2、DeepSeek-v4-pro 和 k2.7 三个模型协作完成。
豆包大模型升级至 Doubao-Seed-2.1 Pro,百万 tokens 输入 6 元、输出 30 元;Seedance 2.5 支持 30 秒长叙事与 50 个全模态参考,原生 4K 已在即梦上线。
v0.2.0 新增命令行工具 bcc 与 HTML 导出,支持剧本、分镜、风格研究;v0.1.4 修复免安装版数据丢失问题并新增 Gemini 3.1 Flash-Lite。
744B MoE、40B 激活、1M 上下文,MIT 协议开源;Coding 榜单 1595 分排第二,FrontierSWE 74.4% 逼近 Opus 4.8。
Kimi K2.7 Code 在 Kimi Code Bench v2 上提升 21.8%,MLS Bench Lite 提升 31.5%;API 价格与 K2.6 持平,缓存命中输入降至 1.3 元 /1M token。
支持 70 多种语言边听边译,保留说话人语调节奏音高;已登陆 Gemini Live API、Google Translate App 和 Google Meet,Meet 语言组合扩至 2000 多种。
Anthropic 于 2026-06-09 发布 Claude Fable 5 与受限版 Mythos 5,API 价格 $10/MTok input、$50/MTok output;高风险请求会回退 Opus 4.8 或拒答,Mythos-class 数据留存 30 天。
苹果在 WWDC 2026 发布第三代 Apple Foundation Models,共五个模型;最强端侧模型 AFM 3 Core Advanced 为 200 亿参数 MoE,每次仅激活 10 到 40 亿参数。
即览是一款 iPhone/iPad 上的本地 Markdown/HTML 阅读器,支持 .md、.html、.txt 及 ZIP 打包网页;作者认为 Markdown 正成为 AI 数据层、HTML 成为展示层,即览补上手机端打开文件的最后一公里。
周活跃用户突破 500 万,较 2 月桌面版上线增长 6 倍;非开发者用户占 20%,增速为开发者的 3 倍以上。
WeSight 开源桌面 AI Agent 控制台,可统一管理 Claude Code、Codex 等本地 Agent;支持 Agent Team 协作、飞书绑定与运行监控。
开源隐私协议 MVP 生成器 Skill,面向 OPC 与早期团队;流程分产品事实采集、合规校验、协议生成与复查三步,后续规划 v2.0 深度版与 v3.0 持续扩充版。
Opus 4.8 跑分平稳上行、Agent 能力加强,价格与 4.7 一致;dynamic workflows 以研究预览上线,可并行拉起数百个子 Agent。
CodexGuide 已在 GitHub 开源,按“认识入口、跑通任务、建立方法、团队沉淀”四层组织;收录 13 个实战案例,覆盖桌面端、CLI、手机端远程执行等入口。
Gemini 3.5 Flash 已开放,输出速度比同行顶尖模型快 4 倍;Gemini Omni 支持边聊边改视频,基础版已全线接入谷歌产品。
Gemini app 月活突破 9 亿,token 处理量同比增 7 倍达 3200 万亿;发布 Gemini Omni Flash,支持任意输入输出模态,即日起上线。
Gemini 3.5 Flash 在 Terminal Bench 2.1 达 76.2%,速度是其他前沿模型的 4 倍、价格约一半;Gemini Spark 为 24/7 云端个人 Agent,与 Workspace 深度集成。
Managed Agents 新增自托管沙箱与 MCP 隧道,沙箱可部署到 Cloudflare、Daytona、Modal、Vercel 四家托管商;MCP 隧道为 research preview,需申请。
GPT-Realtime-2 首次将 GPT-5 级推理接入语音,上下文从 32K 扩至 128K;Big Bench Audio 跑分 96.6%,较上代提升 15.2 个百分点。
开源 Agent 网盘 neuDrive,支持 Claude、Codex、Cursor 等工具的 Skill 与记忆跨设备同步;免费版够用,Pro 版 10 美元 / 月,输入 VIVO50 可领 3 个月免费版。
幻觉率在高危场景降 52.5%,AIME 2025 从 65.4 升至 81.2;API 代号 chat-latest,定价 $5/$30 每百万 token,GPT-5.3 保留三个月后退役。
Meta_Kim 2.0.19 已支持 Claude Code、Codex、OpenClaw、Cursor 四个平台,以 canonical/ 为统一主源;配套论文在 Zenodo 已有 500+ 阅读、400+ 下载。
Anthropic 一次放出 9 个创作连接器,覆盖 Blender、Adobe、Ableton 等 3D、设计、音乐、VJ 四类软件;同时推出由 Claude Opus 4.7 驱动的 Claude Design 产品。
总参数 1.6T、激活 49B,Flash 版 284B/13B;1M 上下文下推理算力需求降至 V3.2 的 27%,KV Cache 降至 10%。
GDPval 84.9%、OSWorld-Verified 78.7%,均高于 GPT-5.4;已向 ChatGPT Plus/Pro/Business/Enterprise 用户滚动开放,并推出 GPT-5.5 Bio Bug Bounty。
面向 ChatGPT Business、Enterprise、Edu、Teachers 四套餐开放,定位为 GPTs 的进化形态;底层跑 Codex,可在 ChatGPT 与 Slack 中部署。
可灵视频 3.0 系列新增原生 4K 直出选项,每秒消耗 30 灵感值;即日起至 6 月 30 日会员享 4K 生成限时优惠,铂金及以上 8 折、黄金 9 折。
项目已开源,基于 Novel 编辑器开发,支持 AI 改写、生图、摘要与标签生成;配套 Chrome 插件、Obsidian 插件和 Skill 技能,可用 Cloudflare 免费部署。
K2.6 代码能力较 K2.5 提升近 20%,任务步骤数平均减少 35%;AgentSwarm 一次可拉起 100 个不同专长的分身,Claw 群组单群最多 50 个成员。
由 Claude Opus 4.7 驱动,输出可运行 React 代码而非静态稿;支持组织级设计系统与代码库理解,Brilliant 反馈复杂交互从 20 多轮提示降到 2 轮。
阿里发布世界模型 HappyOyster,支持一句话或一张图生成可 WASD 漫游的 3D 空间;Direct 导演模式可在生成中持续插入指令实时改剧情,当前处于 Beta 内测阶段。
Claude Design 由 Claude Opus 4.7 驱动,向 Pro/Max/Team/Enterprise 用户开放研究预览;设计稿可打包交接给 Claude Code 实现。
BixBench 通过率 0.751,序列生成排名超人类专家第 84 百分位;仅限美国 Enterprise 客户走 trusted access,同步开源 Life Sciences 研究插件。
输入 $5/1M tokens、输出 $25/1M tokens,价格不变;GitHub 93 项编码基准较 Opus 4.6 提升 13%,CursorBench 达 70%。
Claude Managed Agents 在云端托管智能体基础设施,按用量收费,Sentry 几周上线自动修 bug 流程;Anthropic 年经常性收入突破 300 亿美元,是去年 12 月的三倍。
预构建可配置的 agent harness,运行在托管基础设施上;支持 Python、TypeScript、Java、Go、Ruby、PHP 六种 SDK。
一条命令 `deepagents deploy` 即可完成生产级部署,自带 30+ endpoints 的 LangSmith Deployment server;基于 MIT 许可证的开源 harness,支持任意模型与 sandbox provider,无 Anthropic lock-in。
SWE-bench Verified 93.9%,较 Opus 4.6 提升 13 个百分点;仅向 12 家核心合作方和 40 余家关键基础设施组织开放,不公开发布。
Meta_Kim 是一套跑在 Claude Code、Codex CLI、OpenClaw 上的治理框架,核心 skill meta-theory 标到 v1.5.0;复杂任务走八阶段流程,Execution 前需齐备十个协议包。
ColaOS 定位为有灵魂的 Agent OS,以大模型为 CPU、Agent 为内核,可直接操控电脑并具备长期记忆;项目开放内测,官网可申请 waitlist,并建立共创文档征集用户案例。
支持文本、图像、视频、音频全模态输入,覆盖生成、编辑、复刻、重塑、驱动、续写、参考全链路;最多支持 5 个视频主体参考,实现外观和音色锁定。
标准版支持 1K/2K 分辨率,PRO 版支持 4K 并自带全通道透明底;配套「万相妙思 +」快闪赛总奖池约 5 万元。
31B 在 AIME 2026 拿到 89.2%、Codeforces ELO 2150;许可证从自有协议换成 Apache 2.0,支持 140 多种语言。
开源一套企业 AI 场景诊断 Skill,输入公司名自动生成 15-30 页场景地图报告;内置 8 大行业场景库,MIT 协议免费商用。
手册共 10 章,覆盖从安装到独立做产品的全过程;信息更新至 2026 年 3 月底,基于 Anthropic 官方文档与 Boris Cherny 分享等来源。
Stitch 从 Labs 实验项目升级为 AI 原生设计平台,推出 Vibe Design 方向;Figma 股价当天跌 8.8%。
飞书 2026 春季发布会全程纯 Demo,发布 8 款产品,核心是让每个人在飞书里拥有智能伙伴;aily 1 分钟激活,能读取飞书内文档、日历、聊天记录等上下文,支持后台任务与主动触发。
M2.7 在 SWE-Pro 得分 56.22%,追平 GPT-5.3-Codex;MLE Bench Lite 三次平均得牌率 66.6%,与 Gemini-3.1 持平。
Rubin GPU 推理性能较 Blackwell 提升 5 倍、单 token 成本降 10 倍;英伟达 200 亿美元收购 Groq,token/watt 提升 35 倍。
文档完全免费开源,覆盖部署、Skills 与实战案例;Windows 本地部署含 WSL 配置等避坑步骤,并附一键部署方案。
首个原生全模态 embedding 模型,文本 / 图片 / 视频 / 音频 /PDF 编码进同一向量空间;默认 3072 维,MTEB 68.17,文本定价 $0.20/ 百万 tokens。
GPT-5.4 与 5.4 Pro 同步发布,标准版 API 定价 $2.50/M 输入、$15/M 输出,Pro 版为 $30/M 输入、$180/M 输出;首次在通用模型中内置 Computer Use,OSWorld-Verified 得分 75.0% 超过人类基准 72.4%。
代码能力与 GPT-5.3-Codex 持平,世界知识强于 GPT-5.2;上下文窗口升级至 100 万 token,并内置原生计算机使用能力。
Google Workspace CLI 上线 GitHub,数小时 Star 从 2700 涨到 3700;输出均为 JSON,内置 100 多个 SKILL.md 文件。
作者用 16 天发布 40 个版本、220 次提交,开发出 Codepilot 桌面端;拆出 Claude-to-IM 与 Claude-to-IM-skill 两个开源项目,支持飞书、Discord、Telegram 远程控制 Claude Code。
通义语音发布 Fun-CosyVoice3.5 与 Fun-AudioGen-VD 双模型,支持自然语言指令控制语音生成;新增泰语、印尼语、葡萄牙语、越南语四种语言,生僻字读错率从 15.2% 降至 5.3%。
Anthropic 上线 Memory Import 工具,支持从 ChatGPT、Gemini 一键导入记忆到 Claude,三步完成;免费版不支持,Pro 计划 20 美元 / 月起,记忆更新最长 24 小时生效。
ARC-AGI-2 得分 77.1%,较前代 31.1% 翻倍并超过 Claude Opus 4.6 的 68.8%;16 项基准中 13 项第一,价格不到 Claude Opus 4.6 一半。
30 秒音轨、自动歌词与封面图,支持文字 / 图片 / 视频生成;嵌入 SynthID 水印并新增音频验证,API 版本为 lyria-002。
SWE-bench Verified 80.2%、ARC-AGI-2 60.4%,价格不变;支持 100 万 token 上下文窗口,Computer Use 接近人类水平。
总参数量 3970 亿、激活 170 亿参数,解码吞吐量最高达 Qwen3-Max 的 19 倍;语言支持从 119 种扩展至 201 种,并开放 Qwen3.5-397B-A17B 权重。
相比 4.0 版本在理解、推理和生成方面全面提升,首次引入实时检索增强能力;已上线即梦 AI、火山方舟体验中心,并在豆包开启内测。
参数规模从 355B 扩展至 744B,预训练数据提升至 28.5T;在 SWE-bench-Verified 和 Terminal Bench 2.0 分别获得 77.8 和 56.2 的开源 SOTA 分数。
支持 1k token 指令与 2k 分辨率,生图编辑二合一;已在阿里云百炼开放 API 邀测,Qwen Chat 可免费体验。
5.0-preview 支持联网实时检索、编辑精准可控与智能逻辑推理,2k/4k 清晰度即梦首发限免;4.5 定位深度编辑,4.0 主打高效低耗。
Terminal-Bench 2.0 得分 77.3%,比 GPT-5.2-Codex 高 13.3 个百分点;速度比 5.2-Codex 快 25%,并首次被标为网络安全 High capability 模型。
GDPval-AA 上赢 GPT-5.2 约 144 Elo,MRCR v2 八针 1M 测试拿 76%;首次支持 1M token 上下文,输出上限 128K,API 新增 adaptive thinking 与 context compaction。
Vidu Q2 参考生 Pro 支持 2 视频 +4 图片同时创作;Vidu Q3 为全球首个支持 16s 声画同出的模型,在 Artificial Analysis 榜单中国第一、全球第二。
视频 3.0 支持智能分镜、图生视频加主体参考、多语种口型配音与 15 秒超长生成;视频 3.0 Omni 新增全能参考与主体 3.0,支持上传角色视频提取特征与原声音色。
基于 Qwen3-Next-80B-A3B-Base 构建,激活参数仅 3B;SWE-Bench Verified 超 70%,SWE-Bench-Pro 表现与激活参数高 10 到 20 倍的模型相当。
Vidu Q3 于 1 月 30 日发布,全球首个支持 16 秒音视频直出;在 Artificial Analysis 榜单中排名中国第一、全球第二。
官方插件市场新增 Playground,两行命令即可安装;可生成可交互 HTML 界面,支持拖拽调参并自动生成配置更新 prompt。
DeepPlanning 基准聚焦全局最优解,要求多日旅行精确到分钟级排期并守住时间预算上限;实测 GPT-5.2、Claude 4.5、Gemini 及 Qwen3 在全局优化与长周期一致性上仍有短板。
Qwen3-ASR 系列开源,含 1.7B/0.6B 识别模型与 0.6B 强制对齐模型;1.7B 在中文、英文、方言与歌唱识别上达 SOTA,0.6B 支持 128 并发 2000 倍吞吐。
Chrome 内置 Gemini 3 侧边栏,可读当前页面并调用 Gmail 等全家桶;新增 Auto Browse 自动浏览,能像人一样打开网页、点击、填表完成任务。
每月 7.9 美元,含 Gemini 3 Pro、Nano Banana Pro、Veo 3.1 与 NotebookLM;新用户前两月 3.99 美元,可共享给 5 位家庭成员。
桌面端支持本地文件处理与浏览器托管,可在安全本地环境处理敏感数据;专家 Agent 支持自定义指令、子代理、工具、Skill、环境变量与 MCP 工具。
19 项基准测试中性能媲美 GPT-5.2-Thinking、Claude-Opus-4.5 和 Gemini 3 Pro;引入自适应工具调用与测试时扩展技术,API 模型名 qwen3-max-2026-01-23 已开放。
Tasks 取代 Todos,支持跨 session、跨 subagent 协作与依赖关系;任务存储在 ~/.claude/tasks,可设置 CLAUDE_CODE_TASK_LIST_ID 环境变量。
Tool Search 在工具说明书超过上下文 10% 时自动启用懒加载,官方示例中工具定义占用从 15 万 token 降至 2000 token,节省 98.7%;Anthropic 还提出用写代码方式调用工具的 Code Mode,可绕过模型上下文。
支持最高 1080P 分辨率,延迟从秒级降至即时响应;基于 Omni 原生多模态基础模型、自回归流式生成机制和瞬时响应引擎三大技术。
Engram-27B 在等参数、等算力下全面超越纯 MoE baseline,MMLU 提升 3.0、BBH 提升 5.0;100B 参数 Engram 表放主机内存,吞吐量下降不到 3%。
Skill 热重载与 Bash 通配符权限落地;新增 language 配置项,可让 Claude 用中文回复。
抖音科技内容全年播放量超 1.4 万亿次,30 分钟以上中长视频播放量增长 298%;AI 内容兴趣用户数同比激增 105%,1748 万用户发布近 5000 万篇 AI 相关内容。
SWE-bench Verified 得分 74.0,多语言场景超越 Claude Sonnet 4.5;模型权重与 API 均已开放,支持本地部署。
MinT 用 CPU 机器即可训练万亿参数模型,成本优化十倍;比 Thinking Machines 更早实现 1T LoRA-RL,方案已开源并获 Nvidia 转载。
发行价每股 116.20 港元,募资总额约 43.5 亿港元;2025 年 API 收入增长超十倍,付费 API 收入超过所有国产模型之和。
WaytoAGI 知识库接入飞书知识库问答,覆盖 9000+ 篇教程;支持一键加入后直接提问,并提炼出 6 个高频提问方向。
GLM-4.7 在 SWE-bench-Verified 获 73.8% 开源 SOTA,LiveCodeBench V6 达 84.9%;HLE 基准 42.8% 较 GLM-4.6 提升 41%,超过 GPT-5.1。
VTP 将重建、图文对比与自监督三种目标联合训练,重建权重仅 0.1;算力增 10 倍 gFID 提升 65.8%,收敛比 VA-VAE 快 4.1 倍。
Medeo 内测中,今日邀请码无限畅用;支持聊天式创作、剪辑轨道编辑,覆盖科普、新闻、广告、漫剧等全品类。
GPT-5.2 在 ARC-AGI-2 上得分 52.9%,较 GPT-5.1 的 17.6% 翻三倍;在 GDPval 上赢或打平行业专家的比例达 70.9%(Pro 为 74.1%)。
基于 DeepSeek-V3.2-Exp-Base 开发,在 IMO 2025 和 CMO 2024 上取得金牌级成绩;引入自我验证机制,以证明过程严谨性而非最终答案作为奖励。
FLUX.2 提供 pro、flex、dev、klein 四个版本,dev 为 32B 开源模型,可在单块 RTX 4090 上运行;支持最多 10 张参考图、4MP 图像编辑及中文文本渲染。
SWE-bench Verified 80.9%,定价 5/25 每百万 token,比 4.1 便宜;System Card 承认 AIME 训练数据污染,自治能力接近但未突破 ASL-4。
基于 Gemini 3 Pro 构建,支持最多 14 张图像与 5 位人物一致性、2K/4K 分辨率;免费用户有有限配额,Plus/Pro/Ultra 订阅用户配额更高。
Gemini 3 Pro 在 LMArena 拿到 1501 Elo 断层领先;Deep Think 模式下 Humanity's Last Exam 得分从 37.5% 升至 41.0%。
Atlas 将 Chromium 作为独立进程,通过 OWL 架构与 Swift 主应用经 Mojo IPC 通信;Agent mode 下把弹窗合成回主页面,让 AI 获得完整截图。
首个编码模型 Composer 速度是同等智能模型的 4 倍,多数回合 30 秒内完成;新界面支持并行运行多个代理,底层由 git worktree 或远程机器支撑。
总参数 230B、激活参数 10B,在 Artificial Analysis 榜单上开源全球第一、闭源全球第四;支持免费体验与 API 调用,并已在 HuggingFace 开源。
无需本地部署,浏览器内即可连 GitHub 仓库写代码、并行跑任务并自动建 PR;Pro 和 Max 用户可访问 claude.ai/code,iOS 版同步开启预览。
首发平台为 macOS,面向所有 ChatGPT 用户;内置 Agent Mode 可代表用户在网站上自动执行下单等操作。
用 100 个视觉 token 超过 GOT-OCR2.0 的 256 个 token,800 个 token 超过 MinerU2.0 的 6000+ token;核心架构 DeepEncoder 仅 380M 参数,采用 MoE 架构激活参数仅 570M。
Qwen3-VL 在 Vision Arena 与 Text Arena 均居开源第一,OpenRouter 图像处理市场份额 48% 居首;官方发布 Cookbook,覆盖文档解析、OCR、视频理解、3D 定位等 12 个 Notebook。
Veo 3.1 新增全功能音频、素材生视频、Frames to Video、延长与插入 / 移除编辑能力;提供 Fast 与 Quality 两种模式,每次最长生成 8 秒 1080P 视频。
性能接近五个月前的旗舰 Sonnet 4,成本降至三分之一、速度快一倍多;SWE-bench 73.3%、OSWorld 50.7%,被归类为 ASL-2。
Cursor 1.7 新增浏览器控制、计划模式、Agent 提示词智能补全等多项能力;计划模式可生成可编辑的 plan.md 并严格按计划执行。
Ling-1T 为 1T 参数 MoE 架构,51B 激活,128K 上下文,20T+ token 预训练;AIME 25 准确率 70.42%,推理长度较 Gemini-2.5-Pro 少 40%。
基于 Gemini 2.5 Pro 构建,通过 computer_use 工具实现浏览器与移动端 GUI 直接操作;在 Online-Mind2Web 等基准上以更低延迟领先,已开放公开预览。
发布 App inside ChatGPT、Agent Kit、Codex 正式版及多项 API 更新;Agent Kit 含 Agent Builder、Chat Kit、Evals for Agents 三组件。
OpenAI 开发者日发布 Apps SDK、AgentKit、Codex 全面可用及 Sora 2 API 等四大更新;ChatGPT 周活超 8 亿,API 每分钟处理近 60 亿 token。
开发者社区从 200 万增至 400 万,周活用户突破 8 亿;发布 Apps SDK、AgentKit、GPT-5 Codex 与 Sora 2 API 等多项更新。
ChatGPT 定位转向任务处理平台,引入 Booking、Canva 等第三方应用;GPT-5 Pro 已开放 API,两个 mini 模型降价 70%-80%。
Apps SDK 让开发者在 ChatGPT 内构建可交互应用,AgentKit 提供可视化 Agent 开发画布;Codex 转正并新增 Slack 集成,已处理 40T token。
DevDay 公布 400 万开发者、8 亿周活跃用户、每分钟 60 亿 tokens 调用;发布 Apps SDK 与 AgentKit,ChatGPT 从模型公司转向平台公司。
OpenAI 在 DevDay 上宣布 ChatGPT 可直接调用第三方应用,首批合作包括 Canva、Spotify 等;同时发布 AgentKit 工具包、全面开放 Codex 并升级模型 API。
开发者数两年翻倍至 400 万,ChatGPT 周用户达 8 亿;发布 Apps SDK、AgentKit、Codex 正式版及 GPT-5-Pro 与 Sora 2 API。
拖拽式画布支持逻辑节点、连接器与工具节点编排,内置客户服务、数据扩充等预设模板;通过 MCP 集成 Gmail、Google Calendar 等第三方服务,并含护栏、PII 检测等安全模块。
Sora 2 定位为世界模拟器,能模拟物理因果与失败;配套独立 App 上线,含反成瘾设计与 Cameo 数字分身功能。
代码能力较 GLM-4.5 提升 27%,对齐 Claude Sonnet 4;上下文窗口由 128K 扩至 200K,平均 token 消耗节省 30% 以上。
引入稀疏注意力机制(DSA),表现与 V3.1-Terminus 基本持平;API 成本直降 50%,模型已在 HuggingFace 与 ModelScope 开源。
定价每百万输入 token 3 美元、输出 15 美元;OSWorld 基准得分 61.4%,较 Sonnet 4 提升明显。
Suno 于 9 月 23 日上线 v5 Beta 模型,仅向 Pro 和 Premier 玩家开放;9 月 25 日 Suno Studio 功能上线,目前仅向 Premier 玩家开放测试。
月之暗面今日发布 Agent「OK Computer」,实测可一键建站与生成马里奥游戏;产品定位从长文本处理转向高价值长链条任务的主动执行。
320 亿参数开源权重 LLM,面向基于世界模型的代码生成研究;发布权重、技术报告与推理、评估、演示代码,需 160GB 显存。
云栖大会一口气发布 6 款模型与 1 个新品牌;Qwen3-Max 为万亿参数旗舰,AIME25 达 98%,SWE-Bench Verified 约 70 分。
Qwen3-Max 总参数超 1T,预训练 36T tokens,Instruct 版在 SWE-Bench Verified 得 69.6 分;Qwen3-VL-235B-A22B 开源,原生支持 256K 上下文,可扩展至 1M。
新增多图编辑,支持人物 + 人物、人物 + 商品、人物 + 场景等玩法;单图一致性增强,覆盖人物、商品、文字编辑,并原生支持 ControlNet。
中英稳定性在 seed-tts-eval 上取得 SOTA,超越 SeedTTS、MiniMax、GPT-4o-Audio-Preview;提供 17 种音色、每种支持 10 种语言,并支持 9 种方言。
通过中国 12 门核心学科主任医师笔试评测,为国内首个;技术报告已在 GitHub 和 arXiv 发布,采用 RAG 与两阶段强化学习(GRPO)。
百度蒸汽机 2.0 全系开放,Turbo/Lite/Pro 及有声版均升级,支持 720p/1080p、5s/10s 视频生成;中文语音细节还原度超 98%,支持多人对话音视频一体化生成。
基于 20B 通义图像模型构建,支持中英文双语文字编辑与语义、外观双重编辑;在多个公开基准上达到 SOTA 性能。
GPT-5 在 LMArena 与 Artificial Analysis 均居第一,幻觉率较 o3 降低约 80%;输入价格仅为 GPT-4o 的一半,Plus 订阅降至 10 美元 / 月。
Genie 3 支持 24 FPS 实时互动、720p 画质与数分钟世界记忆;通过 20 万小时无监督视频训练,环境一致性为涌现能力。
Genie 3 支持 720p 分辨率、24 帧每秒实时导航,可维持数分钟一致性;相比 Genie 2 分辨率显著提升,并支持提示词生成世界事件。
六款模型同期开源,含 235B 与 30B 的 Instruct/Thinking 版本及两款 Coder 模型;新版本普遍支持 256K 长上下文,Thinking 版可扩展至 1M tokens。
总参数量 117B/21B,激活参数 5.1B/3.6B,上下文 128k;Apache 2.0 许可,支持商业用途,gpt-oss-20b 可在 16GB 内存设备上运行。
SWE-bench Verified 准确率 74.5%,较 Opus 4 提升 2 个百分点;API 定价每百万输入 token 15 美元、输出 75 美元,提示缓存最高节省 90% 成本。
Genie 3 于 2025 年 8 月 5 日发布,支持实时交互,以每秒 20-24 帧生成 720p 画面;可提示世界事件,用于训练 SIMA 智能体执行复杂任务。
ElevenLabs 于 8 月 5 日推出 AI 音乐生成服务 Eleven Music,估值 33 亿美元;用户可用自然语言描述风格、情绪、用途,数分钟内生成含人声与器乐的完整曲目。
总参数量 321B、激活 38B,采用 MoE 架构;视觉 token 数量降至原来的 1/16,API 每百万 token 输入 1.5 元、输出 4 元。
Eigent 实现多 Agent、多子任务、多工具三层并行,5 分钟可并行生成 200 个可交互 HTML 小游戏;发布 20 小时注册用户超 2000。
Riffusion 更名为 Producer.ai,搭载旗舰模型 FUZZ-2.0,支持对话式音乐创作与音频再创作;目前为邀请制,现有用户可直接访问并获赠 500 点积分。
FLUX.1-Krea [dev] 由 Black Forest Labs 与 Krea 联合开源,主打去除 AI 感;技术报告强调后训练数据质量优于数量,偏好数据需有明确审美观点。
7 月 23 日结束内测全面开放注册,取消邀请码限制;新增 ChatCanvas 功能,支持打点评论、批量执行修改。
扣子开源 Coze Studio 与 Coze Loop,采用 Apache 2.0 许可证支持商用;Coze Studio 提供模型、工作流、插件、知识库等完整开发平台能力。
首次在自回归 TTS 中实现语音持续时间精确控制,支持 0.75x/1.0x/1.25x 三档时长;情感与音色解耦,可用文本描述控制情感,并发布模型权重与推理代码。
新增 Connectors 目录,覆盖 Figma、Notion、Stripe 等主流工具;为 Claude macOS 桌面应用推出专属多功能连接器(MCPs)。
Grok 4 在 HLE 上得分 25.4%,使用工具后提升至 38.6%,Heavy 版本达 44.4%;上下文窗口扩展至 256K tokens,API 定价输入 3 美元 / 百万 tokens,输出 15 美元 / 百万 tokens。
开源微信虚拟人框架,部署成本约 400 元;支持人设、情绪价值、自我意识、多模态理解与输出、主动消息、朋友圈生成等能力。
自动实时保存 ChatGPT、Gemini、DeepSeek、腾讯元宝等平台的对话记录,数据默认存本地;提供对话检索、一键复制与导出功能。
开源免费,预览期每分钟 60 次、每天 1000 次模型请求;支持 MCP、GEMINI.md 配置与 Google Search 检索。
M1 推理模型支持 100 万上下文输入,训练成本 53.47 万美元;Hailuo 02 视频模型支持真 1080P,1 万元可生成 30000 支 720p 视频。
视频模型 V1 以图像转视频形式上线,仅网页端可用,480p 输出,单次生成 4 个 5 秒视频;视频作业收费约为图像作业的 8 倍,Pro 及以上订阅支持放松模式。
红杉中国开源 xbench-ScienceQA 与 xbench-DeepSearch 两个评测集,前者平均正确率仅 32%,后者专测 Agent 深度搜索能力;均采用黑白盒机制防过拟合,每季度更新。
版本号从 0.5x 直接跳到 1.0.0,新增 Bugbot、Background Agent、Memories 等功能;Bugbot 与 Background Agent 需按调用次数计费的 Max 模式,Bugbot 提供 7 天免费试用。
Fellou 2.0 任务执行速度较 1.x 提升 1.2-1.5 倍,成功率从 31% 提升至 80%;支持多任务并行与 7*24 全天候执行,并开源了关键基础设施 Eko 2.0。
平均编辑时间 6-12 秒,支持 Pro/Max/Dev 三个版本;Dev 版开放权重,已接入 Krea.ai、Freepik 等平台。
DGM 在 SWE-bench 上从 20.0% 进化到 50.0%,提升 150%;进化出的能力可跨模型迁移,从 Claude 3.5 Sonnet 应用到 o3-mini 和 Claude 3.7 Sonnet 仍有效。
红杉中国推出双轨评估体系,分 AGI Tracking 与 Profession Aligned 两条主线;首期发布 xbench-ScienceQA 与 xbench-DeepSearch 两个评估集,并给出综合排名。
Claude Opus 4 与 Sonnet 4 发布,上下文 200k,定价与前代一致;Opus 4 在 SWE-bench 得分 72.5%,Sonnet 4 为 72.7%。
Claude 4 新增扩展思考与工具系统,支持网络搜索、代码执行和文件处理;MCP 协议流程简化,客户端工具仍需本地实现。
Claude Opus 4 与 Sonnet 4 为混合模型,支持快速回复与扩展思考模式;SWE-bench Verified 达顶尖水平,Opus 4 可连续工作数小时。
Claude Opus 4 与 Sonnet 4 同步发布,API 上下文 200k,定价与前代一致;Claude Code 推出 VS Code 与 JetBrains 扩展及 GitHub Actions 集成,均处于 Beta 阶段。
Veo 3 首次实现音画同步生成,支持对白、唇动对齐与拟音音效;视频仍只有 8 秒,仅面向美国 Ultra 订阅用户开放,定价 249.99 美元 / 月。
Veo 3 支持 1080p/60fps 视频生成,首次实现原生音效与音画同步;已在 Gemini 应用向 AI Ultra 订阅用户开放,企业用户可通过 Vertex AI 调用。
新增 249.99 美元 / 月的 Google AI Ultra 会员,前三个月半价;Gemini 2.5 Pro 在 LMArena 全部测试项登顶,WebDev 编码测试提升 142 点 Elo。
AI Mode 面向美国用户全面开放,Imagen 4 与 Veo 3 同步更新;Gemini 2.5 Pro 新增增强推理模式,AI Ultra 订阅每月 250 美元。
Codex 基于 codex-1(o3 的软件工程优化版),可在云端沙盒并行处理编程任务;即日起向 ChatGPT Pro、Team、Enterprise 用户开放,Plus 和 Edu 用户稍后上线。
Hunyuan Image2.0 实现毫秒级实时出图,语义响应速度 0.9597 分超过所有生图模型;新增实时绘画板功能,支持参考轮廓与图片强度调节。
AlphaEvolve 用 48 次标量乘法完成 4x4 复数矩阵乘法,改进 1969 年 Strassen 算法;在 11 维空间发现 593 个外球配置,刷新亲吻数问题下限。
在 VBench-1.0 和 VBench-2.0 文生视频榜均登顶,超越 Sora 与 Runway;支持 1080p 与首尾帧百万运镜,1080p 5 秒视频最低 1.34 元。