跳到正文

值得读的 6

2025 年 8 月 8 日 · 周五 · 第 104 期 · 约 2 分钟

本期头条

GPT 5 共测

旗舰版 gpt-5 在 SWE-bench Verified 得分 74.9%、Aider polyglot 88%,支持 40 万 token 上下文;gpt-5-mini 成本为旗舰版 1/5,SWE-bench 71.0%。

领域大模型形态新品

云中江树:GPT-5 屠榜式发布,从提示词到智能体能力这六大方面值得关注

GPT-5 在 LMArena 与 Artificial Analysis 均居第一,幻觉率较 o3 降低约 80%;输入价格仅为 GPT-4o 的一半,Plus 订阅降至 10 美元 / 月。

领域大模型形态新品

云中江树:GPT-5 提示工程指南

官方提示工程指南,覆盖 reasoning_effort、verbosity 等新参数;实测 TauBench-Retail 得分从 73.9% 提升到 78.2%。

领域大模型形态教程

近 7 天另有 3 条提到「Cursor」,最近的 08-0708-04

署名云中江树

歸藏:不吹不黑,GPT-5 代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案

GPT-5 前端代码能力与 Claude 4.1 相当,略逊于 Gemini 2.5 Pro;在公众号封面提示词测试中 GPT-5 表现优于其他模型,内容未超出画布。

领域大模型

近 7 天另有 1 条提到「Claude 4.1」,在 08-06

署名歸藏

GPT5 横空出世:AGI 卡壳,未见跨越式升级, 深度解析

GPT-5 在 WebDev Arena 等多项测试中位居第一梯队但优势微弱,被网友戏称 GPT4.6;发布会重点转向编程与语音,并大幅下调 API 价格,免费用户也可体验。

领域大模型

近 7 天另有 3 条提到「Cursor」,最近的 08-0708-04

云舒:当你想不通一件事的时候,试试这个提示词帮你拆掉思维里的墙

作者用该提示词与 Gemini 2.5 Pro 讨论编程 SOP 迭代,得出需将 SOP 外化成工具的结论;提示词无标准流程与示例,仅约千字,靠模型自行理解行事准则。

领域产品形态教程

这一期的 6 条,到这儿全了

更新的一期在 08-09

顺着这一期的「Claude Code」,共学里有一篇

拆解 OpenClaw:从被动到主动,手搓一个最小「龙虾」》→