跳到正文

值得读的 7

2026 年 8 月 2 日 · 周日 · 第 456 期 · 约 2 分钟

本期头条

7.27—8.2|本周 AI 论文精选

做智能体训练的人七篇里只有 ReOPD 给了可复现的省钱路径,其余是基准刷分;周报本身不筛,得自己翻。

NOOA 用 Python 对象抽象智能体开发,在 SWE-bench Verified 等基准评测;ReOPD 复用教师轨迹做同策略蒸馏,工具调用次数为零且提速至少 4 倍。

字节 Seedance 2.5 杀疯了!我尝试了 10 个逆天案例(附省积分秘诀)

想低成本试 sd2.5 的人省积分三条路里最实用的是黑屏素材减半,租号买号有风险;案例提示词可直接抄,但积分成本得先算清。

常规可直接生成 30 秒,另有 30–180 秒超长模式;最多支持 30 图、10 视频、10 音频参考。

近 7 天另有 3 条提到「Seedance 2.5」,最近的 08-0107-31

领域视频生成形态教程

2026 年顶尖 AI 实验室如何构建 RL 智能体:从 RLHF 到 RULER

想给智能体任务上 RL 的人「可验证奖励」才是 RL 用于智能体的分水岭,数学 / 代码之外的任务缺的只是评分函数。

从 RLHF 到 RLVR 再到 RULER,系统提示词正被用作奖励函数;DeepSeek R1-Zero 仅用 GRPO 与可验证奖励,将 AIME 2024 从 15.6% 提升至 77.9%。

领域大模型署名AviChawla

一文读懂 Agent 的三层工程:Harness、Loop 与 Graph

调试 Agent 的工程师最锋利的一句是「不要围绕信心循环,要围绕证据循环」;诊断规则按失败类型选修复层,可当排查清单用。

将智能体工程拆为运行环境、循环、图三层,分别对应环境、反馈与流程;给出按失败类型选择修复层的诊断规则。

近 7 天另有 3 条提到「MCP」,最近的 07-3007-29

领域Agent形态观点署名Lunar

AI 时代的“HTML 时刻”:一个被严重低估的知识标准 OKF

正在定义企业知识库的人OKF 的价值不在格式本身,而在把知识生产与消费解耦、并给知识加可信度;V0.2 的来源与时效机制才是它区别于普通 Wiki 的关键。

OKF 由 Google Cloud 于 2026 年 6 月发布,近期更新至 V0.2 并加入来源、验证、时效性等机制;OKF 将知识定义为 Markdown 文件加 YAML 元数据的可交换产物,并区分生产与消费方。

领域大模型形态观点署名贾克斯的平行世界

Reddit 蓝海帖挖掘:Research SEO & GEO 增长新机会

做 Reddit 引流的人给了可复制的筛选标准:vote/comments 两位数以下、月流量高。

用 Ahrefs 筛出 vote 少、comments 少但月流量 12k 的蓝海 Reddit 帖;从 Top Pages、SERP 反查、GEO 监控和增长中帖子四个方向挖掘,优先匹配强商业意图关键词。

领域行业动态

Luna 降价 80%,老金教你 20 美元 Plus 当 100 美元 Pro 用

Codex Plus 用户Luna Max 约等于 Sol Medium、成本六分之一,但成功率约 70%、耗时多一半;适合接边界清楚的活,别赌最难一题。

Luna API 价格下调 80%,Luna Max 跑分约 75 分、成本约为 Sol 的六分之一;正文给出 Sol 负责判断、Luna 负责执行的模型分工提示词与 luna_worker 自定义代理配置。

领域开发形态教程署名金先森是朝鲜族阿

这一期的 7 条,到这儿全了

更新的一期在 08-03