大聪明:DeepSeek Harness 上线:一切皆为插件,一切皆是可能
开发者预览版上线并开源,基于 Cordis 插件系统构建,一切皆插件;随附标准、PTC、极简、创造四种模式,Code Mode 将工具生成为 TypeScript SDK 减少上下文消耗。
开发者预览版上线并开源,基于 Cordis 插件系统构建,一切皆插件;随附标准、PTC、极简、创造四种模式,Code Mode 将工具生成为 TypeScript SDK 减少上下文消耗。
海淀拿出 43.6 平方公里区域,首次只允许 Agent 参与城市规划,方案通过 GitHub 提交,8 月 31 日截止;入选方案及 Agent 将以碑刻形式永久纪念。
Claude Code 面向 Opus 5 与 Fable 5 删掉 80% 以上系统提示词,编码评测无损失;上下文工程管理推理时进入上下文的 token,context rot 随 token 增多而加剧。
官方文档逐段中英对照翻译,覆盖目标、上下文、输出、边界四要素;含已连接数据源、插件与个性化设置的使用说明。
Loop 是 Claude Code 中自动把提示词反复喂给 Agent 的循环机制,官方定义了回合式、目标式、定时式和主动式四种 Loop;官方给出六条省钱建议,包括选对模型、定清停止标准、先试水、脚本化确定性任务等。
CLAUDE.md 全程占 token,Skills 只在调用时加载完整内容;Hooks 由 harness 在外部执行,完全绕过上下文窗口。
744B MoE、40B 激活、1M 上下文,MIT 协议开源;Coding 榜单 1595 分排第二,FrontierSWE 74.4% 逼近 Opus 4.8。
上海徐汇区红杉加速器一层,6 月 1 日开业,营业时间 15:00-23:00;AGI 基础款 9.9 元 / 杯,大杯 9.11 元,其他酒水均一价 39 元。
Opus 4.8 跑分平稳上行、Agent 能力加强,价格与 4.7 一致;dynamic workflows 以研究预览上线,可并行拉起数百个子 Agent。
Managed Agents 新增自托管沙箱与 MCP 隧道,沙箱可部署到 Cloudflare、Daytona、Modal、Vercel 四家托管商;MCP 隧道为 research preview,需申请。
Anthropic 发布 36 页创始人手册,将创业拆为想法、MVP、上线、规模化四阶段;强调 AI 时代判断力取代执行力,成为创始人核心壁垒。
开源 Agent 网盘 neuDrive,支持 Claude、Codex、Cursor 等工具的 Skill 与记忆跨设备同步;免费版够用,Pro 版 10 美元 / 月,输入 VIVO50 可领 3 个月免费版。
幻觉率在高危场景降 52.5%,AIME 2025 从 65.4 升至 81.2;API 代号 chat-latest,定价 $5/$30 每百万 token,GPT-5.3 保留三个月后退役。
Anthropic PM Jess Yan 用 Claude Code 写原型替代写 spec,并自建三个 agent 处理数据分析、舆情监控和 demo 构建;Claude Managed Agents 公开 beta 已上线,Memory 功能 4 月 23 日开 beta,Rakuten 使用后 first-pass 错误降 97%。
Anthropic 一次放出 9 个创作连接器,覆盖 Blender、Adobe、Ableton 等 3D、设计、音乐、VJ 四类软件;同时推出由 Claude Opus 4.7 驱动的 Claude Design 产品。
OpenChronicle 以 AX Tree 优先、截图兜底实现记忆,8 小时轻度工作约消耗 50 美分 Token;记忆正从产品功能变成 Agent 基建,Calvin 团队主张记忆所有权归用户。
面向 ChatGPT Business、Enterprise、Edu、Teachers 四套餐开放,定位为 GPTs 的进化形态;底层跑 Codex,可在 ChatGPT 与 Slack 中部署。
GPT-Image-2 于 2026 年 4 月 20 日全量上线,中文长图、版式与风格迁移能力跨代升级;实测覆盖攻略长图、老片海报、杂志封面、社交截图等 10 个方向 50 余张图。
K2.6 代码能力较 K2.5 提升近 20%,任务步骤数平均减少 35%;AgentSwarm 一次可拉起 100 个不同专长的分身,Claw 群组单群最多 50 个成员。
阿里发布世界模型 HappyOyster,支持一句话或一张图生成可 WASD 漫游的 3D 空间;Direct 导演模式可在生成中持续插入指令实时改剧情,当前处于 Beta 内测阶段。
BixBench 通过率 0.751,序列生成排名超人类专家第 84 百分位;仅限美国 Enterprise 客户走 trusted access,同步开源 Life Sciences 研究插件。
报告共 423 页、9 个章节,新增 AI 与科学、AI 与医疗两章;中美模型性能差距收窄至 2.7%,美国私人 AI 投资达 2859 亿美元。
OpenAI 发布 13 页政策白皮书,承认经济收益可能集中在少数公司;提出公共财富基金、四天工作制、AI 接入权等具体方案。
Anthropic 官方博客翻译,讲 Claude Code 团队设计工具集的经验;以 AskUserQuestion 工具为例,展示从修改 ExitPlanTool 到改变输出格式的两次失败尝试。
SWE-bench Verified 93.9%,较 Opus 4.6 提升 13 个百分点;仅向 12 家核心合作方和 40 余家关键基础设施组织开放,不公开发布。
原生多模态推理模型,支持工具调用与多 Agent 协同;在图表理解与健康问答上领先,编程与 Agent 任务落后明显。
31B 在 AIME 2026 拿到 89.2%、Codeforces ELO 2150;许可证从自有协议换成 Apache 2.0,支持 140 多种语言。
泄露版本为 @anthropic-ai/claude-code v2.1.88,含 1,900 个 TypeScript 源文件、512,000 行代码;源码暴露了 KAIROS、Coordinator、ULTRAPLAN 等未发布功能。
Taku 提出三层 Harness 架构,让 Agent、工具与脚本共享统一后端通讯协议;演示了将 FlashCut 的 AI 能力拼接到开源剪辑工具 OpenCut。
飞书 2026 春季发布会全程纯 Demo,发布 8 款产品,核心是让每个人在飞书里拥有智能伙伴;aily 1 分钟激活,能读取飞书内文档、日历、聊天记录等上下文,支持后台任务与主动触发。
a16z 认为数据 Agent 表现不佳的关键原因是缺乏正确的数据上下文,而非模型能力不足;提出构建现代上下文层,包含自动化构建、人工精修、自更新等五步架构。
首个原生全模态 embedding 模型,文本 / 图片 / 视频 / 音频 /PDF 编码进同一向量空间;默认 3072 维,MTEB 68.17,文本定价 $0.20/ 百万 tokens。
GPT-5.4 与 5.4 Pro 同步发布,标准版 API 定价 $2.50/M 输入、$15/M 输出,Pro 版为 $30/M 输入、$180/M 输出;首次在通用模型中内置 Computer Use,OSWorld-Verified 得分 75.0% 超过人类基准 72.4%。
Google Workspace CLI 上线 GitHub,数小时 Star 从 2700 涨到 3700;输出均为 JSON,内置 100 多个 SKILL.md 文件。
拒答逻辑、联网搜索与对话语气三处改动,无架构升级;联网模式幻觉率下降 26.8%,图形暴力不合规率从 14.8% 升至 21.9%。
Agent 让执行成本坍缩到个人级,判断力成为唯一稀缺资源;判断可被编码进系统独立运转并产生复利,生态位比奇观本身更值钱。
总参数 744B、激活 40B,在 Artificial Analysis Intelligence Index 上拿到开源模型首个 50 分;DSA 稀疏注意力用 20B token 追平 DeepSeek 943.7B token 的效果。
智能边际生产成本趋近于零,顶级智能消耗成本无上限;Agent 性能约每 7 个月翻一倍,但互联网基建对 Agent 几乎不可用。
GLM-5 连续工作 24 小时、700+ 次工具调用后交付完整 GBA 模拟器;Meta-Prompt 靠文件持久化跨 Session 交接,零参考版本运行超 24 小时完成处理器核心。
Terminal-Bench 2.0 得分 77.3%,比 GPT-5.2-Codex 高 13.3 个百分点;速度比 5.2-Codex 快 25%,并首次被标为网络安全 High capability 模型。
GDPval-AA 上赢 GPT-5.2 约 144 Elo,MRCR v2 八针 1M 测试拿 76%;首次支持 1M token 上下文,输出上限 128K,API 新增 adaptive thinking 与 context compaction。
Vidu Q3 于 1 月 30 日发布,全球首个支持 16 秒音视频直出;在 Artificial Analysis 榜单中排名中国第一、全球第二。
Genie 3 支持 20-24 帧每秒、720p 实时渲染,可保持数分钟世界一致性;目前仅对美国用户开放,需订阅 Google AI Ultra,每月 250 美元。
Claude 已集成进 Excel,Pro/Max/Team/Enterprise 均可用,基于 Opus 4.5;支持联网搜索、透视表、跨表追溯与 Debug,但不支持条件格式、宏和 VBA。
Tasks 取代 Todos,支持跨 session、跨 subagent 协作与依赖关系;任务存储在 ~/.claude/tasks,可设置 CLAUDE_CODE_TASK_LIST_ID 环境变量。
Engram-27B 在等参数、等算力下全面超越纯 MoE baseline,MMLU 提升 3.0、BBH 提升 5.0;100B 参数 Engram 表放主机内存,吞吐量下降不到 3%。
DeepSeek R1 以开源权重发布,训练成本约 500 万美元;2025 年大模型开发重心转向 RLVR 与 GRPO,刷榜现象泛滥。
发行价每股 116.20 港元,募资总额约 43.5 亿港元;2025 年 API 收入增长超十倍,付费 API 收入超过所有国产模型之和。
VTP 将重建、图文对比与自监督三种目标联合训练,重建权重仅 0.1;算力增 10 倍 gFID 提升 65.8%,收敛比 VA-VAE 快 4.1 倍。
OpenAI 内部 Codex 采用率超 92%,使用 Codex 的工程师合并 PR 多 70%;现场演示 12 小时从空目录重写完整项目,7 小时 200 轮迭代产出 500 行 diff。
V3.2 推理 Benchmark 追平 GPT-5、略低于 Gemini-3-Pro,且开源;V3 仅用 500 多万美元训练成本即达到不输 Claude 3.5 的成绩。
DeepSeek V3.2 引入「思考中调用工具」的 Interleaved Thinking,保留推理状态可让长链路 Agent 任务最高提升 35%~40%;MiniMax 正联合 OpenRouter、Ollama、Cline 等推动该能力的跨平台标准化。
推理能力追平 GPT-5-High,Speciale 版在 IMO 和 IOI 拿金牌;DSA 将注意力复杂度从 O(L²) 降到 O(Lk),后训练预算超预训练 10%。
AI 输出不应止步于文本,信息美学把结果加工成结构清晰、带图表的信息产品;品味是生产工具的一部分,呈现是差异化战场。
SWE-bench Verified 80.9%,定价 5/25 每百万 token,比 4.1 便宜;System Card 承认 AIME 训练数据污染,自治能力接近但未突破 ASL-4。
Gemini 3 Pro 在 LMArena 拿到 1501 Elo 断层领先;Deep Think 模式下 Humanity's Last Exam 得分从 37.5% 升至 41.0%。
Atlas 将 Chromium 作为独立进程,通过 OWL 架构与 Swift 主应用经 Mojo IPC 通信;Agent mode 下把弹窗合成回主页面,让 AI 获得完整截图。
a16z 认为视频模型进入专业化阶段,Sora 2 擅长叙事、Veo 3 擅长物理仿真;产品层仍有巨大空白,LiblibAI 完成 1.3 亿美元 B 轮融资。
Atlas 目前仅支持 macOS,含 Chat Anywhere、Browser Memory、Agent Mode 三大能力;Agent Mode 仅对 Plus 和 Pro 用户开放,且为预览版。
无需本地部署,浏览器内即可连 GitHub 仓库写代码、并行跑任务并自动建 PR;Pro 和 Max 用户可访问 claude.ai/code,iOS 版同步开启预览。
用 100 个视觉 token 超过 GOT-OCR2.0 的 256 个 token,800 个 token 超过 MinerU2.0 的 6000+ token;核心架构 DeepEncoder 仅 380M 参数,采用 MoE 架构激活参数仅 570M。
支持 720p/1080p 8 秒视频并自带原生音频;新增视频扩展、首尾帧生成与最多 3 张图片引导三项功能。
性能接近五个月前的旗舰 Sonnet 4,成本降至三分之一、速度快一倍多;SWE-bench 73.3%、OSWorld 50.7%,被归类为 ASL-2。
Ling-1T 为 1T 参数 MoE 架构,51B 激活,128K 上下文,20T+ token 预训练;AIME 25 准确率 70.42%,推理长度较 Gemini-2.5-Pro 少 40%。
发布 App inside ChatGPT、Agent Kit、Codex 正式版及多项 API 更新;Agent Kit 含 Agent Builder、Chat Kit、Evals for Agents 三组件。
Fellou 2.0 支持任务监听无限步长、普通任务上限 1000 步,可 7×24 小时在线运行;成功率从 31% 提升到 80%。
Claude Opus 4 与 Sonnet 4 发布,上下文 200k,定价与前代一致;Opus 4 在 SWE-bench 得分 72.5%,Sonnet 4 为 72.7%。