昨晚,硅谷经历了 AI 诸神之战。
Gemini 3.8 Flash 在 DeepSWE v1.1 上约 74%,单任务成本 2.36 美元;Muse Spark 1.3 达 75.4%,工具调用减少约 20%、token 消耗减少约 25%。
领域
321 条 · 2025 年 5 月 5 日 至 2026 年 9 月 3 日
这个领域还有 夜校 2 讲
这是「AI 开窍计划」系列的第一课。讲师天锦从普通人使用 AI 的真实困惑出发,讲清楚提示词、上下文、模型、智能体这些概念到底是什么,以及它们如何帮你真正把活儿干成。课程还给出了一个写提示词的五步框架、一套让 AI 写稿的完整流程,以及课后作业:找出你所在行业里想用 AI 解决的 5 个问题。
直播回放 · 章节跳转
这节课讲清楚了三件事:提示词分哪几种、系统提示词怎么写、以及如何科学地迭代它。讲师给出了可直接套用的写作模板和迭代方法,也解释了为什么“懂行业 + 会 AI”的人在未来最值钱。听完你能带走一套写提示词的具体步骤,以及一个判断自己是否在进步的标准。
直播回放 · 章节跳转
Gemini 3.8 Flash 在 DeepSWE v1.1 上约 74%,单任务成本 2.36 美元;Muse Spark 1.3 达 75.4%,工具调用减少约 20%、token 消耗减少约 25%。
标准 API 输入 0.75 美元 / 百万 tokens、输出 3.75 美元 / 百万 tokens,2026 年底前有效;Gemini App 仅向 AI Pro 与 Ultra 用户开放,AI Studio 可免费使用。
Fable 5.1 在 Agent 科研上比 Fable 5 提升 27.9 点,缓存读取成本降至每百万 token 0.25 美元;实测其在浏览器自动化和 UI 优化上优于 GPT 5.6。
GLM-5.3-Flash 每百万 Token 输入 0.8 元、输出 2.8 元,与 DeepSeek V4 Flash 对比 14 项 benchmark 赢 11 项;实测可一句话复刻网站、生成 3D 可交互界面。
320B 总参数、AA 综合智能指数 57 分,与 Claude Opus 4.8 持平;定价为 GLM-5.3 的 1/10,限时折扣内为 1/20。
微软提出端点代理方案,用约 3,500 行代码将任意框架接入强化学习,在 SWE-bench Verified 上将 Qwen3.5-9B 从 41.8% 提升到 56.4%;论文指出技能触发瓶颈,56,804 个公共技能争夺不到 100 个触发槽位。
多模态 Agent 能力接近 Opus-4.8,纯文本能力与 V4-Flash 持平;API 按 token 计费,单图最多 384 tokens,Files API 免费开放。
Ling-3.0-flash 总参数 124B、INT4 版约 71.75GB;在 DGX Spark 上实测输出吞吐 84.34 tok/s,MTP 接受率 67.35%。
5 个国产编程模型在相同代码仓库修同一 Bug,各跑 3 次;Kimi K3 首次修改位置中位数 48.5%,Doubao 单条轨迹 293 个动作、切换 184 次。
Skaling 定律用单参数耦合模型规模与数据量,误差降低 1.5-3 倍;窃取推理轨迹攻击覆盖 Anthropic、OpenAI、Google,恢复 315,320 个加密块。
V4 Pro 做樱花城堡耗时 4 分 06 秒、成本 0.055 美元,Grok 4.6 耗时 13 分 42 秒、成本 4.30 美元;API 价格每百万 tokens 输入 3 元、输出 6 元,8 月 17 日起启用峰谷价。
Agent 能力大幅提升,Code Agent 任务在 DeepSeek Harness 极简模式下测试;API 原生支持 Responses API 并适配 Codex,思考模式新增 low/high/max 三档。
deepseek-v4-pro 支持 1M 上下文、384K 最大输出,缓存未命中输入 3 元 / 百万 Token、输出 6 元;并发限制 500,价格与并发均为 Flash 的 3 倍。
将 AI 术语按 7 层架构整理,区分模型、产品与公司品牌;给出可复制的 Prompt 示例与 RAG 分步流程。
H3 稀疏注意力接近 MoBA,默认只对视频 token 做 3D sparsification;Ref2VA 对 reference 质量敏感,长视频续写依赖 reference-conditioning。
H3 权重开源后社区 4 天即出现蒸馏 LoRA,采样步数从约 20 步压到 4~8 步;官方确认 2K 版本将开放,并透露正基于 H3 底座开发统一图像模型。
108 次测试中 7 款模型三次均达 100% 准确率,国产 4 款海外 3 款;DeepSeek-V4-Flash 单次成本仅 0.25 元,为 Claude Opus 5 的不到 3%。
48 次 A/B 实测中,MiniMax-M3 精简版省 Token 20.9% 但简单与模糊任务各降 25 个百分点;GPT-5.6 Sol 质量守住 100% 但 Token 几乎未省。
NOOA 用 Python 对象抽象智能体开发,在 SWE-bench Verified 等基准评测;ReOPD 复用教师轨迹做同策略蒸馏,工具调用次数为零且提速至少 4 倍。
从 RLHF 到 RLVR 再到 RULER,系统提示词正被用作奖励函数;DeepSeek R1-Zero 仅用 GRPO 与可验证奖励,将 AIME 2024 从 15.6% 提升至 77.9%。
OKF 由 Google Cloud 于 2026 年 6 月发布,近期更新至 V0.2 并加入来源、验证、时效性等机制;OKF 将知识定义为 Markdown 文件加 YAML 元数据的可交换产物,并区分生产与消费方。
全模态生成模型,支持文本、图像、视频、声音统一理解,输出原生双声道音视频,最高 15s 2K;2K 分辨率下每秒价格不到主流模型的 1/3,计划未来几天开放模型权重。
九项 Agent 测试全部超过 V4 Pro Preview,DeepSWE 得分提升 7.5 倍;原生支持 Responses API,并针对 Codex 做了适配优化。
7 月开源模型以 Kimi-K3 为焦点,具身相关模型明显增多;腾讯混元 Hy3 正式版总参数 295B、激活 21B、上下文 256K。
以深度学习发展史为线索,从 GPU、AlexNet 讲到 Transformer 与 AlphaGo Zero;作者提出历史、范式变迁、人的视角三个读论文框架。
给出了一段《工作合同》提示词,通过单一职责、终止契约、验收清单与单问分解约束 K3 收敛;实测可降低 K3 的过度思考与工具调用,从而减少 token 消耗。
从 GPT-2 到 Kimi K3 的架构演进路径,参数规模放大 22580 倍;正文含 GPT-2 与线性注意力的完整代码实现。
Kimi K3 为 2.8 万亿参数 MoE 模型,支持原生视觉与 100 万 token 上下文;同步开源 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
覆盖智能体运行框架、记忆与技能、长程任务、可解释性、评测、结构化输出和机器人等方向;GAMUT 基准在 14 个模型上最高分仅 58.7%。
Claude Code 面向 Opus 5 与 Fable 5 删掉 80% 以上系统提示词,编码评测无损失;上下文工程管理推理时进入上下文的 token,context rot 随 token 增多而加剧。
以 Opus 4.8 相同的价格提供更强性能,Frontier-Bench 与 GDPval-AA 达业界最佳;网络安全任务上仍落后于 Mythos 5。
作者对比了 Fable 5、GPT 5.6 Sol、Deepseek V4、Kimi K3、Qwen3.8-Max 五款模型的体感;建议高难任务用 Fable 5,日常开发用 GPT 5.6 Sol,To C 产品选 Deepseek V4。
2.8 万亿参数、100 万 token 上下文,采用 MoE 架构;在 Frontend Code 竞技场盲测中击败 Claude Fable 5 与 GPT-5.6 Sol 拿下第一。
Kimi K3 在 Code Arena 以 1679 分登顶,超过 Claude Fable 5;官方暂停新会员订阅,已订阅用户可正常续费升级,API 输出价 100 元 / 百万 Token。
面壁智能发布并开源 MiniCPM-Robot 系列,含 1.5B 的 RobotManip 与 0.9B 的 RobotTrack;RobotManip 流式推理将 60 帧历史观测下每决策步计算量从 125 TFLOPs 降至 3.3 TFLOPs。
2.8 万亿参数、100 万 token 上下文,基于 KDA 与 Attention Residuals 架构;整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但超过其他所有模型。
验证器从评分 token 的 logit 读取连续分数,在 Terminal-Bench V2 达 86.5%;HOLA 以 340M 参数将 Wikitext 困惑度降至 22.92,低于完整注意力 Transformer++。
GPT-5.6 分 Sol/Terra/Luna 三档,Sol 上下文 372k、定价比 Fable5 便宜 43.5%;OpenAI 将 Codex 并入 ChatGPT,并计划跳过 5.x 直接发布 GPT-6。
GPT-5.6 系列包含旗舰 Sol、均衡 Terra 与高效 Luna 三档;Sol 在 Agents' Last Exam 达 53.6 分,比 Claude Fable 5 高 13.1 分。
Fable 5 于 7 月 1 日全球恢复访问,7 月 7 日后按量计费,输入每百万 token 10 美元、输出 50 美元;正文整理了 Claude Code 核心工程师的实战提示词,覆盖盲区扫描、头脑风暴、访谈、参考材料与实现计划等阶段。
Sol 在 Terminal-Bench 2.1 上达 88.8%,Ultra 模式 91.9%;METR 评测检出其作弊率高于任何公开模型,50% time horizon 约 11.3 小时。
五阶段流水线依次为数据清洗与分词、预训练、监督微调、奖励建模、强化学习;预训练目标仅为预测下一个 token,幻觉由此而来。
Claude 封号风波引发讨论,官方工程师回应称 7 月 2 日新版本将回滚删除检测代码;Fable 5 于 7 月 1 日重新开放,付费计划用户每周额度限 50%。
role:user 协议把数据与指令塞进同一信道,导致销毁式中断与 Prompt 注入防不住;作者尝试从协议层重构,先定义主体身份再谈消息路由。
6 月开源模型密集发布,Anthropic Fable5、智谱 GLM-5.2、MiniMax M3 等相继上线;后训练模型增多,Nex-N2-Pro 与 Macaron-V1-Preview 受关注。
Sakana Fugu 用编排器模型动态构建智能体脚手架,在多个基准上达到 SOTA;Agent-Native Memory 从数据管理视角拆解记忆为四模块,评测 12 个记忆系统。
Seed 2.1 Pro 在 GDPVal 上拿 87.9 分、SWE-Pro 57.5 分,API 兼容 OpenAI 与 Anthropic 格式;实测中自主完成 49 城补贴政策采集、OCR、质检并开源 242 条数据。
Seed2.1 于 2026-06-23 发布,定位生产力模型,强化 Agent 执行、代码工程与多模态理解;Pro 输入 6 元 / 输出 30 元每百万 tokens,Turbo 输入 3 元 / 输出 15 元每百万 tokens。
SpatialClaw 在 20 个空间推理基准上平均准确率 59.9%,比此前空间智能体高 11.2 个百分点;SkillWeaver 的迭代分解使准确率从 51.0% 提升到 67.7%。
智能体无停止条件循环 6 小时,产生 847 次调用、210 万 token,账单 200 美元;修复仅需最大步骤计数器、空结果处理器和低置信度升级路径。
744B MoE、40B 激活、1M 上下文,MIT 协议开源;Coding 榜单 1595 分排第二,FrontierSWE 74.4% 逼近 Opus 4.8。
MSA 在 1M 上下文下将每 token 注意力计算量降低 28.4 倍;Self-Harness 在 Terminal-Bench-2.0 上让 MiniMax M2.5 通过率从 40.5% 提升到 61.9%。
Kimi K2.7 Code 在 Kimi Code Bench v2 上提升 21.8%,MLS Bench Lite 提升 31.5%;API 价格与 K2.6 持平,缓存命中输入降至 1.3 元 /1M token。
架构只是五阶段流程里最不重要的部分,数据、缩放、对齐、评测与系统才是决胜点;Chinchilla 结论为每参数约 20 个训练 token,计入推理成本后升至每参数 150 个以上。
从 Claude Fable 5 系统提示词拆出身份、边界、工具编排、运行时四层结构;提炼 5 条可直接抄写的 Prompt 硬规则,含交付物先行、动词对象标准写死等改法。
Fable 5 在 Agentic coding 跑分 29.3%,约为 GPT 5.5 的 5 倍;Stripe 实测 5000 万行代码迁移一天完成。
Anthropic 于 2026-06-09 发布 Claude Fable 5 与受限版 Mythos 5,API 价格 $10/MTok input、$50/MTok output;高风险请求会回退 Opus 4.8 或拒答,Mythos-class 数据留存 30 天。
苹果在 WWDC 2026 发布第三代 Apple Foundation Models,共五个模型;最强端侧模型 AFM 3 Core Advanced 为 200 亿参数 MoE,每次仅激活 10 到 40 亿参数。
MIT 提出范畴论框架将发现定义为表征体系修订,388 个候选仅 25 个被接受;Google LEAP 在 Putnam 2025 解出全部 12 题,Lean-IMO-Bench 单次形式化解题率从低于 10% 提升到 70%。
四模型横评覆盖 3D、视觉编程、游戏与 Agent 长程任务;3D 与视觉编程两轮 Claude Opus 4.8 与 MiniMax M3 领先,GPT-5.5 审美被评粗糙。
Token、Embedding、Attention、Transformer 等 10 个概念逐一拆解;附 temperature 参数对照表与上下文窗口容量示例。
SkillOpt 在 6 个基准和 7 个模型上全胜,GPT-5.5 直接聊天提升约 +23.5 分;AutoScientists 在 BioML-Bench 达 74.4% 平均排行榜百分位。
5 月开源模型数量明显减少,国内集中在面壁、千问、混元等厂商;MiniMax M3 即将发布,Qwen3.7 的 32B 版本仍在等待开源。
Opus 4.8 跑分平稳上行、Agent 能力加强,价格与 4.7 一致;dynamic workflows 以研究预览上线,可并行拉起数百个子 Agent。
综述提出 code-as-harness 四属性:可执行、可检查、有状态、受治理;OpenAI 模型首次自主解决 Erdős 单位距离猜想,经 9 位数学家验证。
Gemini 3.5 Flash 在 Terminal Bench 2.1 达 76.2%,速度是其他前沿模型的 4 倍、价格约一半;Gemini Spark 为 24/7 云端个人 Agent,与 Workspace 深度集成。
Lighthouse Attention 以训练期 wrapper 实现亚二次长上下文扩展,部署时仍为普通 attention;δ-mem 用 8x8 在线记忆将冻结 backbone 平均分提升至 1.10x。
HeavySkill 让 GPT-OSS-20B 在 LiveCodeBench 上从 69.7% 提升到 85.5%;Conductor 通过编排其他 LLM 在 GPQA-Diamond 和 LiveCodeBench 上取得 SOTA。
8 个支柱覆盖提示工程、RAG、上下文工程、微调、Agent、部署与优化;每个支柱附免费开源课程与仓库,如 vLLM、llama.cpp、Unsloth。
AHE 框架在 Terminal-Bench 2 上 Pass@1 从 69.7% 提升到 77.0%;AgenticQwen-30B-A3B 在 TAU-2 和 BFCL-V4 Multi-Turn 上平均分 50.2。
幻觉率在高危场景降 52.5%,AIME 2025 从 65.4 升至 81.2;API 代号 chat-latest,定价 $5/$30 每百万 token,GPT-5.3 保留三个月后退役。
从 tokenization、embedding、attention 到 prefill/decode 两阶段与 KV caching 的第一性原理梳理;decode 阶段逐 token 生成,瓶颈在内存带宽而非算力。
4 月国内开源模型密集发布,DeepSeek-V4、GLM5.1、Kimi K2.6、Qwen3.6 等相继开源;作者认为国内头部模型与国外御三家仍有差距。
总参数 284B、激活参 13B,视觉 token 压缩率 7056×;预训练数据经两层过滤后超 4000 万条,SFT 覆盖计数、空间推理、迷宫导航与路径追踪四类任务。
DeepSeek 多模态模型灰度上线,视觉能力整体不如 Qwen3.5-Plus;OCR 与文字识别表现不错,但空间推理、表格还原和复杂逻辑推理较弱。
DeepSeek-V4 预览版上线并开源,Pro 为 1.6T 参数稀疏激活 49B,Flash 为 284B 参数稀疏激活 13B,均默认 1M 上下文;架构上引入 mHC 多流约束残差连接,解决超长上下文下标准 Transformer 的容量、路由与深度瓶颈。
DeepSeek V4 系列原生 1M 上下文,Pro 总参数 1.6T;Apple 提出两阶段方案将 Transformer 蒸馏到 Mamba,1B 模型困惑度 14.11。
RLM 将上下文拆成小块,用 Peek、Grep、Partition 和递归调用处理,避免 context rot;论文与 GitHub 代码已公开。
总参数 1.6T、激活 49B,Flash 版 284B/13B;1M 上下文下推理算力需求降至 V3.2 的 27%,KV Cache 降至 10%。
路线图分五个阶段,从标量 / 向量 / 矩阵 / 张量讲到 SVD、Hessian 与矩阵微积分;强调矩阵乘法、特征向量、SVD 是 ML 核心。
GDPval 84.9%、OSWorld-Verified 78.7%,均高于 GPT-5.4;已向 ChatGPT Plus/Pro/Business/Enterprise 用户滚动开放,并推出 GPT-5.5 Bio Bug Bounty。
K2.6 代码能力较 K2.5 提升近 20%,任务步骤数平均减少 35%;AgentSwarm 一次可拉起 100 个不同专长的分身,Claw 群组单群最多 50 个成员。
Anthropic 的 AAR 系统五天将 PGR 拉到 0.97,总成本约 1.8 万美元;NVIDIA 开源 Nemotron 3 Super,120B 参数、12B 激活,支持 1M 上下文。
Claude Code 通过保持 static prefix 不变实现 92% 的 cache hit-rate,30 分钟会话成本从 6 美元降至 1.15 美元;缓存基于 token 序列哈希,任何前缀变化都会导致整段缓存失效。
BixBench 通过率 0.751,序列生成排名超人类专家第 84 百分位;仅限美国 Enterprise 客户走 trusted access,同步开源 Life Sciences 研究插件。
输入 $5/1M tokens、输出 $25/1M tokens,价格不变;GitHub 93 项编码基准较 Opus 4.6 提升 13%,CursorBench 达 70%。
Meta 与 KAUST 提出 Neural Computers 新范式,将计算、记忆与 I/O 统一到学习型运行时;微软 Memento 将推理模型峰值 KV cache 压缩 2-3 倍,吞吐近翻倍。
LLM 本质是逐字预测的接龙模型,Token 是比词更小的计费单位;Harness 是 Prompt 的高阶进化,把身份、规则、工具、格式打包成完整指令体系。
MoE 将 Transformer 每层前馈子层替换为多个 expert,由 router 为每个 token 选出 top-k 个执行;稀疏激活让模型参数巨大但每个 token 只运行一小部分,降低推理成本。
SWE-bench Verified 93.9%,较 Opus 4.6 提升 13 个百分点;仅向 12 家核心合作方和 40 余家关键基础设施组织开放,不公开发布。
逐块拆解 Transformer 的编码器与解码器,覆盖 Tokenization、Embedding、Positional Encoding、Attention 与前馈网络;以 Q、K、V 点积与缩放点积注意力解释注意力机制。
从工程视角拆解 LLM、Token、Context、Prompt、Tool、MCP、Agent 与 Agent Skill 的底层原理;给出 token 与汉字换算经验值及各模型上下文窗口容量。
Anthropic 在 Claude Sonnet 4.5 中识别出 171 个情绪概念向量,可因果影响模型行为;Google DeepMind 提出 AI Agent 陷阱框架,隐藏式 prompt 注入在 86% 场景可部分劫持 agent。
二进制量化将 RAG 内存占用降至 1/32,3600 万向量查询耗时 30 毫秒;技术栈为 Llama Index、Milvus 与 Groq 上的 Kimi-K2。
31B 在 AIME 2026 拿到 89.2%、Codeforces ELO 2150;许可证从自有协议换成 Apache 2.0,支持 140 多种语言。
3 月开源模型以中小尺寸为主,Qwen3.5 小模型、美团 LongCat-Next 全模态等密集发布;Anthropic 的 Claude Code 源码被被动开源。
Claude 自主发现并利用 Ghost CMS 首个关键级 SQL 注入漏洞,读取全部管理员凭证;还发现 Linux 内核 NFS v4 中自 2003 年存在的堆缓冲区溢出。
林俊旸离职后首发长文,判断 AI 下一阶段是智能体式思考;回顾 o1 与 R1 证明推理后训练可规模化,并提及 Qwen3 的混合思考模式。
提出注意力残差机制,将注意力从序列轴转向深度轴,解决标准残差逐层稀释与隐状态爆炸问题;分块注意力残差在块数 N=8 时效果接近全注意力残差且开销可控。
KV 缓存通过存储历史 K/V 向量消除自回归生成中的冗余计算,实践中可实现 5 倍加速;代价是 GPU 内存,Qwen 2.5 72B 单请求缓存可达数 GB,GQA/MQA 与分页注意力用于缓解。
M2.7 在 SWE-Pro 得分 56.22%,追平 GPT-5.3-Codex;MLE Bench Lite 三次平均得牌率 66.6%,与 Gemini-3.1 持平。
Kimi 提出 AttnRes,把注意力机制用于层间连接,每层可动态回看任意前驱层输出;同等算力下性能比标准方法高 25%,GPQA-Diamond 提升 7.5 个点。
OpenDev 采用双智能体架构与四层设计,附 81 页技术报告;AutoHarness 让 Gemini-2.5-Flash 在 16 个游戏中击败更大模型,并消除 145 个游戏中的非法操作。
PaddleOCR-VL-1.5 在表格、扫描件、手写体上表现最佳,逼近商业方案;DeepSeek-OCR-2 整体最弱且部署门槛最高。
首个原生全模态 embedding 模型,文本 / 图片 / 视频 / 音频 /PDF 编码进同一向量空间;默认 3072 维,MTEB 68.17,文本定价 $0.20/ 百万 tokens。
LLM 训练分预训练、指令微调、强化学习三步;Agent 通过工具调用与 ReAct 框架实现任务闭环,Manus 是典型代表。
以斯坦福课程为引,讲解大模型预训练全流程,涵盖数据清洗、Transformer 架构与 tokenization;指出 ChatGPT 回答本质是对人类标注员的统计学模拟。
GPT-5.4 与 5.4 Pro 同步发布,标准版 API 定价 $2.50/M 输入、$15/M 输出,Pro 版为 $30/M 输入、$180/M 输出;首次在通用模型中内置 Computer Use,OSWorld-Verified 得分 75.0% 超过人类基准 72.4%。
代码能力与 GPT-5.3-Codex 持平,世界知识强于 GPT-5.2;上下文窗口升级至 100 万 token,并内置原生计算机使用能力。
用 200 行 Python 从零实现类 ChatGPT 的 MicroGPT,训练数据为 32000 个人名;正文逐层拆解 tokenizer、Softmax、交叉熵、反向传播、注意力机制等原理。
Transformer 用自注意力机制替代 RNN,实现并行计算并解决长距离依赖;核心公式为 Attention(Q,K,V)=softmax(QK^T/√d)V。
2 月国内厂商密集开源,GLM-5、Qwen3.5、MiniMax M2.5 等相继发布;字节 Seedance 2.0 未开源但表现突出。
论文提出双路径加载技术,将智能体推理性能提升 1.87 倍;在 1,152 个 GPU 上验证近线性扩展,在线服务吞吐量提升 22 倍。
2026 年 2 月 5 日 Anthropic 与 OpenAI 同日发布 Claude Opus 4.6 和 GPT-5.3 Codex,编程能力与判断力显著提升;METR 数据显示 AI 能独立完成专家级任务时长约每 4 到 7 个月翻倍。
用 y=kx+b 和老师教学生的比喻,把 SFT、RLHF、PPO 拆给非技术读者;指出 SFT 会让模型交对齐税,冷启动指令微调让续写模型变成问答模型。
XSCT Bench 按应用场景组织评测,用三个多模态模型联合评分并动态加权;测试用例数据集已开源在 GitHub,由 Claude 4.6 Opus 生成。
总参数 744B、激活 40B,在 Artificial Analysis Intelligence Index 上拿到开源模型首个 50 分;DSA 稀疏注意力用 20B token 追平 DeepSeek 943.7B token 的效果。
ARC-AGI-2 得分 77.1%,较前代 31.1% 翻倍并超过 Claude Opus 4.6 的 68.8%;16 项基准中 13 项第一,价格不到 Claude Opus 4.6 一半。
SWE-bench Verified 80.2%、ARC-AGI-2 60.4%,价格不变;支持 100 万 token 上下文窗口,Computer Use 接近人类水平。
总参数量 3970 亿、激活 170 亿参数,解码吞吐量最高达 Qwen3-Max 的 19 倍;语言支持从 119 种扩展至 201 种,并开放 Qwen3.5-397B-A17B 权重。
总参数 397B、激活 17B,上下文 1M,词表扩至 250K;API 价格每百万 Token 低至 0.8 元,为 Gemini 3 Pro 的 1/18。
参数规模从 355B 扩展至 744B,预训练数据提升至 28.5T;在 SWE-bench-Verified 和 Terminal Bench 2.0 分别获得 77.8 和 56.2 的开源 SOTA 分数。
GLM-5 总参数 744B(激活 40B),预训练数据 28.5T;输入 4-6 元 / 百万 tokens,输出 18-22 元 / 百万 tokens,全系开源。
Terminal-Bench 2.0 得分 77.3%,比 GPT-5.2-Codex 高 13.3 个百分点;速度比 5.2-Codex 快 25%,并首次被标为网络安全 High capability 模型。
GDPval-AA 上赢 GPT-5.2 约 144 Elo,MRCR v2 八针 1M 测试拿 76%;首次支持 1M token 上下文,输出上限 128K,API 新增 adaptive thinking 与 context compaction。
CL-bench 基准测试中 GPT-5.1 得分 23.7%,为前沿模型最好成绩,平均分仅 17.2%;测试发现模型更擅长依赖预训练知识而非从上下文中学习新知识。
基于 Qwen3-Next-80B-A3B-Base 构建,激活参数仅 3B;SWE-Bench Verified 超 70%,SWE-Bench-Pro 表现与激活参数高 10 到 20 倍的模型相当。
1 月开源模型密集发布,Kimi K2.5、GLM-4.7-Flash、DeepSeek-OCR 2 等追平闭源;DeepSeek 发布 mHC 和 Engram 论文,基本敲定 V4 架构。
DeepPlanning 基准聚焦全局最优解,要求多日旅行精确到分钟级排期并守住时间预算上限;实测 GPT-5.2、Claude 4.5、Gemini 及 Qwen3 在全局优化与长周期一致性上仍有短板。
K2.5 支持 262K 上下文,输入 4 元 / 百万 tokens、输出 21 元 / 百万 tokens;前端设计横测中设计还原度排第一,设计上限仅次于 Gemini 3 Pro。
核心改动是将视觉编码器从 ViT 换成 prefix LM 结构,引入可学习 query 交互;实测手写体、生僻字、竖版识别有提升,表格结构仍会出错。
总参数量超万亿、预训练数据 36T Tokens;六个测试覆盖创意写作、推理、工具调用、代码、长链条推理与数据分析,免费入口 chat.qwen.ai。
19 项基准测试中性能媲美 GPT-5.2-Thinking、Claude-Opus-4.5 和 Gemini 3 Pro;引入自适应工具调用与测试时扩展技术,API 模型名 qwen3-max-2026-01-23 已开放。
Google 论文发现重复输入提示词可将非推理模型准确率从 21.33% 提升至 97.33%;原理是让模型在第二遍时能回看第一遍的完整信息。
GPT-5.1 首次让聊天中所有模型都成为推理模型,并引入自动切换器与风格特质功能;团队通过改进上下文窗口与指令遵循来提升模型温暖度。
从 UTF-8 字节序列讲起,逐步拆解 BPE 合并 token 的过程;词表大小可达 10 万级,embedding 矩阵行数对应词表、列数对应特征维度。
Engram-27B 在等参数、等算力下全面超越纯 MoE baseline,MMLU 提升 3.0、BBH 提升 5.0;100B 参数 Engram 表放主机内存,吞吐量下降不到 3%。
BabyVision 评测集含 388 道题、22 种子任务,人类基线 94.1%;Gemini3 Pro Preview 得分 49.7%,开源最强 Qwen3-VL-235B 仅 22.2%。
评估的核心是检查结果而非对话记录,区分能力评估与回归评估;pass@k 与 pass^k 两个指标对同一模型给出截然不同的结论。
GRPO 多奖励加总后归一化会导致奖励信号崩塌,GDPO 改为逐奖励归一化再加总;在工具调用、数学推理、代码推理三个任务上 GDPO 均优于 GRPO。
解析层与检索层是决定 RAG 效果的两道坎,解析层是 0 分门槛,检索层是从 60 到 90 分的天花板;解析层因难、脏、贵而容易商业化,检索层因无标准答案而难以收费。
MinT 用 CPU 机器即可训练万亿参数模型,成本优化十倍;比 Thinking Machines 更早实现 1T LoRA-RL,方案已开源并获 Nvidia 转载。
提出流形约束超连接(mHC)架构,将 H_res 限制在双随机矩阵流形上,合成映射增益从 3000 降至 1.6;在 3B、9B、27B 模型上测试,训练开销仅增加 6.7%。
DeepSeek R1 以开源权重发布,训练成本约 500 万美元;2025 年大模型开发重心转向 RLVR 与 GRPO,刷榜现象泛滥。
12 月国内开源模型密集发布,智谱开源周与小米 MiMo-V2-Flash 最受关注;HuggingFace 热力图显示 Qwen 以 382 个模型居首。
GLM-4.7 在 SWE-bench-Verified 获 73.8% 开源 SOTA,LiveCodeBench V6 达 84.9%;HLE 基准 42.8% 较 GLM-4.6 提升 41%,超过 GPT-5.1。
VTP 将重建、图文对比与自监督三种目标联合训练,重建权重仅 0.1;算力增 10 倍 gFID 提升 65.8%,收敛比 VA-VAE 快 4.1 倍。
限制输出时 Qwen3-Max 跌倒检测 10/10 全对,开放解释后 0/10 全错;Gemini 数六指在强制直觉模式下 30 次全对。
上下文工程的核心是在有限窗口内放入最有价值的信息;模型在 8K 到 10K token 范围内性能最佳,超过 1 万 token 性能反而下降。
GPT-5.2 在 AIME 2025 满分、ARC-AGI-2 达 52.9%,API 涨价 40%;实测中 thinking 与 pro 后缀存在降智现象,无后缀版抽卡效果更佳。
GPT-5.2 在 ARC-AGI-2 上得分 52.9%,较 GPT-5.1 的 17.6% 翻三倍;在 GDPval 上赢或打平行业专家的比例达 70.9%(Pro 为 74.1%)。
V3.2 推理 Benchmark 追平 GPT-5、略低于 Gemini-3-Pro,且开源;V3 仅用 500 多万美元训练成本即达到不输 Claude 3.5 的成绩。
面向零基础读者的 LLM 底层技术原理入门指南,覆盖 MLP、CNN、RNN、Transformer、GPT 等;建议从第六章开始阅读,并给出快速入门路径。
开发者花 70 美元 API 费用逆向出 Claude 4.5 Opus 约 1.4 万 token 的官方训练文档;Anthropic 负责人确认文档真实,完整版即将发布。
DeepSeek V3.2 引入「思考中调用工具」的 Interleaved Thinking,保留推理状态可让长链路 Agent 任务最高提升 35%~40%;MiniMax 正联合 OpenRouter、Ollama、Cline 等推动该能力的跨平台标准化。
推理能力追平 GPT-5-High,Speciale 版在 IMO 和 IOI 拿金牌;DSA 将注意力复杂度从 O(L²) 降到 O(Lk),后训练预算超预训练 10%。
11 月开源模型数量明显减少,Gemini3.0 Pro 与 Nano Banana Pro 成为最大亮点;国内字节、千问等发布新模型但未开源。
基于 DeepSeek-V3.2-Exp-Base 开发,在 IMO 2025 和 CMO 2024 上取得金牌级成绩;引入自我验证机制,以证明过程严谨性而非最终答案作为奖励。
SWE-bench Verified 80.9%,定价 5/25 每百万 token,比 4.1 便宜;System Card 承认 AIME 训练数据污染,自治能力接近但未突破 ASL-4。
Gemini 3 在 ARC-AGI-2 上达到 30% 以上,被视为全模态原生模型;实测中真实世界视觉理解性能反降,复杂任务稳定性不如 GPT-5 Pro。
官方 20 项基准测试拿下 19 个第一,唯一输给 Claude 的是 SWE-Bench Verified;MathArena Apex 得分 23.4%,第二名仅 1.6%。
Gemini 3 Pro 在 LMArena 拿到 1501 Elo 断层领先;Deep Think 模式下 Humanity's Last Exam 得分从 37.5% 升至 41.0%。
Gemini 3 在 ARC-AGI v2 上得分超过最强模型两倍以上,除 SWE-Bench 外几乎所有基准达 SOTA;作者实测其可一句话生成设计 Agent、视频 Agent 与互动式游戏,并开放了滚动叙事网页生成提示词。
Gemini 3 Pro 在 AI Studio 上线,社区众测展示了多场景应用;测试覆盖学习工具、ComfyUI 复刻、三体游戏模拟器等。
Nano Banana Pro 可通过 Discord 频道 lyra-chat 免费体验,Gemini 3 Pro 需 Pro 账号并打开 Canvas;Gemini 3 Pro 在 MathArena Apex 从 0.5% 涨至 23.4%,LiveCodeBench Pro Elo 达 2439 超过 GPT-5.1。
GPT-5.1 将 GPT-5 与 GPT-5 Mini 合并,性能与 Token 消耗均介于两者之间;GPT-5.1 Chat 遇复杂问题会直接拒绝回答。
K2-Thinking 采用 fake-quantization+STE 的 W4A16 QAT 方案,post-training 阶段近乎无损;INT4 精度下完整 RL iteration 耗时减少约 10%-20%。
K2 Thinking 原生支持 300 多步工具调用,可边思考边搜索、推理与编程;实测可一键生成带真实数据的 SVG 动画图表,并附完整可复制提示词。
K2T 在长链推理与上下文幻觉上接近 GPT-5 Mini,但指令遵循略逊于 Grok 4;Token 消耗为目前第二高,且输出中混入 NBSP 特殊字符。
Kimi-K2-Thinking 开源,HLE 44.9、IMO 76.8 达 SOTA;Kimi CLI 安装与 KFC 套餐 199 元每周 7168 次调用。
用昆虫幼虫与成虫比喻训练与部署两阶段,引入温度 T 控制软目标平滑度;证明高温下蒸馏退化为直接匹配 logits。
论文提出 CBOW 与 Skip-gram 两种高效词向量模型,可在不到一天内从 16 亿单词数据集学习高质量词向量;向量运算可捕捉语法与语义关系,如 King-Man+Woman 接近 Queen。
10 月国内开源模型共汇总 20 余款,Qwen3-VL 系列尺寸开全;蚂蚁连发 Ling-1T、Ring-1T、Ming-flash-omni 三款模型。
多主题研究任务中模型到第 8-9 个项目时开始编造内容,源于上下文窗口的架构约束;Wide Research 通过并行子代理架构解决,每个子代理拥有独立上下文窗口。
OpenAI 更新了 ChatGPT 在敏感对话中的响应逻辑,按风险等级分四级干预;系统会检测情感依赖信号并主动引导用户转向现实人际支持。
总参数 230B、激活参数 10B,在 Artificial Analysis 榜单上开源全球第一、闭源全球第四;支持免费体验与 API 调用,并已在 HuggingFace 开源。
论文提出基于 CHC 理论的十维 AGI 量化评估框架,GPT-4 得分 27%、GPT-5 得分 57%;长期记忆存储是当前最大瓶颈,两者得分均为 0%。
用 100 个视觉 token 超过 GOT-OCR2.0 的 256 个 token,800 个 token 超过 MinerU2.0 的 6000+ token;核心架构 DeepEncoder 仅 380M 参数,采用 MoE 架构激活参数仅 570M。
Qwen3-VL 在 Vision Arena 与 Text Arena 均居开源第一,OpenRouter 图像处理市场份额 48% 居首;官方发布 Cookbook,覆盖文档解析、OCR、视频理解、3D 定位等 12 个 Notebook。
性能接近五个月前的旗舰 Sonnet 4,成本降至三分之一、速度快一倍多;SWE-bench 73.3%、OSWorld 50.7%,被归类为 ASL-2。
基于 Karpathy 的 nanochat 开源项目,全程约 2 小时、成本约 50 元即可完成从分词器到 RL 的完整训练流程;教程覆盖租用 A100 云服务器、配置环境与执行训练代码。
Ling-1T 为 1T 参数 MoE 架构,51B 激活,128K 上下文,20T+ token 预训练;AIME 25 准确率 70.42%,推理长度较 Gemini-2.5-Pro 少 40%。
基于 Gemini 2.5 Pro 构建,通过 computer_use 工具实现浏览器与移动端 GUI 直接操作;在 Online-Mind2Web 等基准上以更低延迟领先,已开放公开预览。
Qwen3-VL-30B-A3B 开源 Instruct 与 Thinking 两个版本,另有 FP8 版本,两张 4090 即可运行;实测中 Thinking 版在理解计算、图片排序、空间变换上强于 Instruct 版,表格识别与网页复刻表现不佳。
讨论区分了 Lifelong Learning 与 Meta Online Learning 两条路径;Cursor 每两小时用真实用户反馈迭代模型,更接近 off-policy 而非真正的 online learning。
V3.2-Exp 通过 DSA 稀疏注意力将推理成本从平方级降至接近线性,H800 集群测试成本曲线斜率仅为平方级的 1/20;对比 Gemini 2.5 Pro 与 Claude Sonnet 4.5 对超长上下文加价,DeepSeek 实现了顶级模型未做到的线性成本推理。
9 月国内开源大模型密集发布,阿里、腾讯、DeepSeek、智谱等均有新模型;月末 DeepSeek-V3.2 与 GLM-4.6 压哨开源。
原生 VisualCoT 能力可将图像处理融入思维链,支持裁剪、放大、旋转与画辅助线;实测 18 个案例覆盖几何解题、连线画图等场景。
代码能力较 GLM-4.5 提升 27%,对齐 Claude Sonnet 4;上下文窗口由 128K 扩至 200K,平均 token 消耗节省 30% 以上。
引入稀疏注意力机制(DSA),表现与 V3.1-Terminus 基本持平;API 成本直降 50%,模型已在 HuggingFace 与 ModelScope 开源。
定价每百万输入 token 3 美元、输出 15 美元;OSWorld 基准得分 61.4%,较 Sonnet 4 提升明显。
端到端原生全模态,支持 119 种文本语言、19 种语音理解与 10 种语音生成;采用 Thinker-Talker 架构,延迟低于 2 秒,Apache 2.0 协议开源。
核心模型为 Gemini 2.5 Flash-Lite,通过 UI 章程与 UI 交互 JSON 驱动界面即时生成;系统利用流式输出与生成式 UI 图谱实现渐进渲染与状态保持。
云栖大会一口气发布 6 款模型与 1 个新品牌;Qwen3-Max 为万亿参数旗舰,AIME25 达 98%,SWE-Bench Verified 约 70 分。
Qwen3-Max 总参数超 1T,预训练 36T tokens,Instruct 版在 SWE-Bench Verified 得 69.6 分;Qwen3-VL-235B-A22B 开源,原生支持 256K 上下文,可扩展至 1M。
LongCat-Flash-Thinking 采用长 CoT 冷启动加强化学习两阶段训练,RL 阶段用 DORA 系统并多领域并行训练后融合;实测速度快,指令遵循与数学代码表现不错,但老鹰飞行题答错。
豆包、智谱、通义、百度四款视觉模型在发票识别等六大场景实测,智谱与百度输出结构化最好;豆包与通义输入价最低,均为 0.8 元 / 百万 Tokens。
报告 2.0 版发布,梳理记忆系统从 RAG 到智能体化演进;Mem0、Zep、Letta 等第二代系统面临被动性、碎片化、扩展性挑战,MemU、MIRIX、MemOS 等新项目 8 月集中开源。
8 家视觉推理模型参加 6 轮看图猜字谜测试,豆包 Seed 1.6 以 10/12 总分夺冠;Gemini 2.5 Pro、Claude Opus 4.1、Step-3 并列第二。
即使 temperature=0 采用贪婪采样,GPU 并行浮点运算的微小误差仍会导致 LLM 输出不稳定;文章据此给出多次采样投票、CPU 推理、结果后处理等应对策略。
8 月国内开源大模型密集发布,涵盖 Qwen-Image、GLM4.5V、MiniCPM-V 4.5、DeepSeek-V3.1 等;美团压线开源 560B 参数的 LongCat MoE 模型。
通过中国 12 门核心学科主任医师笔试评测,为国内首个;技术报告已在 GitHub 和 arXiv 发布,采用 RAG 与两阶段强化学习(GRPO)。
上下文窗口翻倍至 128K,Aider 编程基准得分 71.6%;实测长文本总结、编程与文本创作能力提升,但整体体感不明显。
百万级上下文窗口存在投毒、干扰、混淆、冲突四类失效模式;伯克利函数调用排行榜显示提供超过一个工具时所有模型表现均变差。
谷歌 2022 年报告显示,三位数加法正确率在参数量突破约 130 亿时从 10% 跃升至 90% 以上;训练 GPT-3 花费约 1200 万美元,GPT-4 估计约 7900 万美元。
正文给出信息处理分析系统 v1.0 的完整提示词,含输入解析、意图识别、知识检索、信息整合四层引擎;提示词以 Markdown 格式输出分析报告,并注明贴合 Claude 执行逻辑时会被拒绝。
好提示可让模型准确率从 0% 升至 90%;少样本、任务分解、自我批评、附加信息、集成五种技术仍有效,角色提示与奖励威胁已失效。
用 XML 提示词复现 LLM 意图识别流程,含意图类型、维度与响应策略池;作者称该提示词贴合 Claude 执行逻辑,发给 Claude 4 会被拒绝执行。
分块是 RAG 索引中最基础也最重要的环节,块大小需权衡语义完整性与检索精度,实验起点约 500 Token;五种分块策略包括固定大小、语义、递归、基于文档结构等。
GPT-5 在 LMArena 与 Artificial Analysis 均居第一,幻觉率较 o3 降低约 80%;输入价格仅为 GPT-4o 的一半,Plus 订阅降至 10 美元 / 月。
官方提示工程指南,覆盖 reasoning_effort、verbosity 等新参数;实测 TauBench-Retail 得分从 73.9% 提升到 78.2%。
GPT-5 前端代码能力与 Claude 4.1 相当,略逊于 Gemini 2.5 Pro;在公众号封面提示词测试中 GPT-5 表现优于其他模型,内容未超出画布。
GPT-5 在 WebDev Arena 等多项测试中位居第一梯队但优势微弱,被网友戏称 GPT4.6;发布会重点转向编程与语音,并大幅下调 API 价格,免费用户也可体验。
LeCun 认为传统 AI 缺乏对物理世界的直观理解,提出世界模型概念;Meta 的 I-JEPA 用 16 个 A100 GPU 在 72 小时内训练出 632M 参数模型,效率提升 2-10 倍。
Claude 4.1 在 UI 设计、卡片生成上明显优于 Claude 4 与 DeepSeek R1,排版更灵活、提示词遵循度更高;网页游戏开发与安卓数据同步修改均一次通过,多文件修改精细。
六款模型同期开源,含 235B 与 30B 的 Instruct/Thinking 版本及两款 Coder 模型;新版本普遍支持 256K 长上下文,Thinking 版可扩展至 1M tokens。
总参数量 117B/21B,激活参数 5.1B/3.6B,上下文 128k;Apache 2.0 许可,支持商业用途,gpt-oss-20b 可在 16GB 内存设备上运行。
SWE-bench Verified 准确率 74.5%,较 Opus 4 提升 2 个百分点;API 定价每百万输入 token 15 美元、输出 75 美元,提示缓存最高节省 90% 成本。
Genie 3 于 2025 年 8 月 5 日发布,支持实时交互,以每秒 20-24 帧生成 720p 画面;可提示世界事件,用于训练 SIMA 智能体执行复杂任务。
总参数量 321B、激活 38B,采用 MoE 架构;视觉 token 数量降至原来的 1/16,API 每百万 token 输入 1.5 元、输出 4 元。
豆包 1.6 系列发布 thinking、flash 与全模态 embedding 三款模型,后者业界首发支持视频向量化;PromptPilot 提供 Prompt 自动生成、评估、迭代与优化的全流程工程化工具。
Anthropic 研究发现模型蒸馏中存在“潜意识学习”,教师模型的隐藏特性会通过无关数据传递给学生模型;当师生模型来自不同架构家族时该效应失效,可作缓解策略。
基于 Wan2.1 与 LoRA 平衡微调,将音频特征注入潜在空间实现全身动作与口型同步;在 HDTF 测试集上 FVD 382、Sync-D 8.14,半身动画任务 FVD 664。
以训马师蒙蒂·罗伯茨的故事类比 AI 对齐,讲解 RLHF 与 DPO 两种偏好学习方法;讨论价值观多元性、对齐陷阱与过度限制的平衡问题。
RAG 通过知识库构建、向量化存储、相关性检索和增强生成四步让大模型从闭卷考试转向开卷考试;嵌入模型与向量数据库(如 Pinecone、Milvus、Faiss)是核心技术支撑。
上下文工程取代提示词工程成为行业共识,核心是为 AI 搭建包含记忆、外部资料与工具的工作环境;上下文窗口从几千词扩展到百万 token,企业可用低成本接入知识库替代微调。
Grok-4 在 ScienceQA 上以 65.0 分登顶,超越 o3;Kimi K2 以 49.6 分成为非思考模型 SOTA,BoN 达 73。
Claude 4 与 Gemini 优化后数据行数错误,DeepSeek 直接报错;Grok 3 将 1039 秒优化至 32.5 秒且行数一致,ChatGPT o3 优化至 7 秒并识别出原表重复值。
用拼图游戏类比解释大模型幻觉的成因,即模型基于知识碎片重组出看似权威的答案;给出三类降低幻觉风险的提问策略,并附可复制的提示词模板。
多模态 AI 训练分三步:单模态预训练、模态对齐(如 CLIP 的 4 亿图文对配对训练)、多任务指令微调;对齐是核心挑战,高质量多模态指令数据稀缺。
总参数 1T、激活参数 32B 的 MoE 模型,主打代码与 Agent 能力;实测在 3D HTML 生成与长文总结任务中表现优于 Claude 4 sonnet 与 Gemini 2.5 Pro。
1T 参数 MoE 模型,代码与 Agent 基准达开源 SOTA;前端实测接近 Claude Sonnet 3.7/4,可替换 Claude Code 默认模型,输出百万 Token 16 元。
Grok4 基础版订阅 215 元 / 月,上下文 130k,Heavy 版 256k;实测代码与多模态能力表现不佳,图像质量倒退。
Grok 4 在 HLE 上得分 25.4%,使用工具后提升至 38.6%,Heavy 版本达 44.4%;上下文窗口扩展至 256K tokens,API 定价输入 3 美元 / 百万 tokens,输出 15 美元 / 百万 tokens。
Gemini 2.5 Pro 成为最常用模型,DeepSeek R1 在创造性任务中表现突出但指令遵循性差;豆包 Seed 1.6、Qwen 3 8B、Claude 4 sonnet 为当下推荐。
M1 推理模型支持 100 万上下文输入,训练成本 53.47 万美元;Hailuo 02 视频模型支持真 1080P,1 万元可生成 30000 支 720p 视频。
AI 幻觉分为信息冲突型与无中生有型两类,根源在训练数据质量与对齐过程;文中给出数据清洗、对齐等应对策略。
红杉中国开源 xbench-ScienceQA 与 xbench-DeepSearch 两个评测集,前者平均正确率仅 32%,后者专测 Agent 深度搜索能力;均采用黑白盒机制防过拟合,每季度更新。
Gemini Diffusion 为谷歌实验性文本扩散模型,生成速度达 1479 tokens/ 秒;AIME 2025 得分 23.3%,HumanEval 通过率 89.6%。
DeepSearch 被定义为智能信息预处理增强技术,核心是迭代式搜索-阅读-推理循环;火山引擎通过 MCP 方式落地并开源 deep_search_mcp 项目。
o3 系统提示词近 3 万字,将工具分为 python 与 python_user_visible 两类通道;提示词强制联网与引用,并设置过度冗长惩罚 3.0。
豆包与元宝以 68 分并列第一,正确率 93%;OpenAI o3 仅得 34 分,正确率 47%,单选题错一半。
DeepSeek R1 0528 版本代码能力大幅提升,部分场景可媲美 Claude 3.7;开启深度思考后生成的课堂游戏、观察表等 HTML 工具界面更精细、功能更完整。
xAI 公开 Grok 3 聊天助手在 grok.com 和 X 上的系统提示词,含中文与英文版本,并计划定期更新;提示词仓库已获 2.5k star。
DGM 在 SWE-bench 上从 20.0% 进化到 50.0%,提升 150%;进化出的能力可跨模型迁移,从 Claude 3.5 Sonnet 应用到 o3-mini 和 Claude 3.7 Sonnet 仍有效。
DeepSeek-R1-0528 在六个前端任务中整体稍逊于 Claude Opus 4,但超过 Sonnet 4 和 Gemini 2.5 Pro;仓库管理系统测试中仅 R1 完整可用,其余模型均出现报错或功能缺失。
DeepSeek R1 节假日前低调发版,版本号未变,OpenRouter 等第三方已同步支持;实测 3D 台球、坦克大战等游戏生成效果惊艳但交互有瑕疵。
新 R1 在代码生成、中文写作、思考时长上明显提升,性能达 Claude3.7 水准;OpenRouter 已上线免费 R1-0528,无需担心服务器繁忙。
红杉中国推出双轨评估体系,分 AGI Tracking 与 Profession Aligned 两条主线;首期发布 xbench-ScienceQA 与 xbench-DeepSearch 两个评估集,并给出综合排名。
Claude Opus 4 与 Sonnet 4 发布,上下文 200k,定价与前代一致;Opus 4 在 SWE-bench 得分 72.5%,Sonnet 4 为 72.7%。
Claude4 发布会实测:Opus4 编程跑分超 o3 与 GPT-4.1,API 价格不变;Claude Code 支持本地命令行与 GitHub 运行,API 提示语缓存延长至 1 小时、成本降 90%。
Claude 4 Opus 与 Sonnet 系统提示词基本一致,全文约万字;提示词策略转向更统括的原则提示,并引导模型在扩展思考中多步推理。
Claude Opus 4 与 Sonnet 4 为混合模型,支持快速回复与扩展思考模式;SWE-bench Verified 达顶尖水平,Opus 4 可连续工作数小时。
Lilian Weng 系统梳理 test-time compute 范式,涵盖思维链、强化学习与外部工具使用;文章末尾提出 reward hacking、CoT 忠实性等开放研究问题。
论文提出 AIGS 概念,以波普尔证伪主义为框架构建 BABY-AIGS 多智能体系统;系统含 PA、EA、RA、FA 四个核心智能体,用 DSL 衔接自然语言与可执行代码。
xAI 于 5 月 16 日开源 Grok 全系系统提示词,涵盖聊天助手、DeepSearch 与 X 平台分析模块;提示词仓库地址为 github.com/xai-org/grok-prompts。
OpenAI 预测 2025-2027 年 AI 将从 Agent 进入 Innovator 阶段,可自主发现新知识;AI 科学家系统每篇论文生成成本不到 15 美元,质量接近顶会水准。
AlphaEvolve 用 48 次标量乘法完成 4x4 复数矩阵乘法,改进 1969 年 Strassen 算法;在 11 维空间发现 593 个外球配置,刷新亲吻数问题下限。
GPT-4o 于 2024-05-13 发布,API 价格比 GPT-4 Turbo 降 50%;2025-03-25 内置原生图像生成,支持精准文本渲染与多轮对话编辑。
Qwen3-235B-A22B 支持 100+ 种语言,提供 0.6B 至 235B-A22B 多种尺寸;在联网搜索、信息总结、结构化输出等任务上较 Qwen2.5 有显著提升。
采用 MoE 架构,激活参数量仅为同类模型的 10%;覆盖 119 种语言和方言,支持思考与非思考双模式。
九类逻辑推理测试全部通过,数字推理给出两种解法互相验证;归纳与类比推理耗时约 1-2 分钟,数学推理仅约 12 秒。
Gemini 2.5 Pro 0506 版在 WebDev Arena 登顶,官方称前端开发超 Claude 3.7 Sonnet;实测 7 段提示词,复杂 3D 网页与高保真原型仍逊于 Claude 3.7。
PB&J 框架通过心理支架为种子判断生成后验合理化解释,在 OpinionQA 上比最佳基线提升 9.7%-10.8%;原始世界信念支架表现最稳定,且无需人口统计学信息也能显著改进。
Gemini 2.5 Pro 05-06 版在 WebDev Arena 登顶,力压 Claude 3.7 Sonnet;支持将 YouTube 视频直接生成可视化网页,目前仅 AI Studio 可用。
Qwen3 原生支持 MCP 协议,工具调用流程与 Function Call 一致;实测使用 Qwen-Agent 框架,通过 uv 创建工程并调用自建 MCP Server 完成时间查询。
o3 在 GeoGuessr 地点辨识中表现超强,能凭模糊照片推理定位;实测中因记忆干扰误判海珠桥为外白渡桥,并附完整 prompt 全文。