宝玉:从 TL 到 EM:我终于不再盯着 AI 写代码了
从 TL 转为 EM 角色后不再逐行审查 AI 代码,改为制定方案并验收结果;技术选型不再局限于自身技能树,BaoCut 新版本跨平台方案直接选用从未写过的 Rust。
从 TL 转为 EM 角色后不再逐行审查 AI 代码,改为制定方案并验收结果;技术选型不再局限于自身技能树,BaoCut 新版本跨平台方案直接选用从未写过的 Rust。
Work 与 Codex 共享智能体额度池,Chat 独立计费;GPT-5.6 分 Sol、Terra、Luna 三档,API 价格 5/30、2.5/15、1/6 美元每百万 Token。
Claude Code 团队将循环分为回合制、目标导向、基于时间和主动式四类;文中给出 SKILL.md 验证示例与各循环的 token 控制策略。
Cursor 与 SpaceX 签下潜在价值 600 亿美元的收购协议;其收入在不到一年内翻了十倍,突破 10 亿美元大关。
OpenAI 成立估值 140 亿美元的部署公司并收购 Tomoro 获得 150 名 FDE;Anthropic 与黑石、高盛等成立合资公司投入 15 亿美元。
Fiona Fung 在 Code with Claude 2026 大会分享管理经验,主张砍掉陈旧流程、以代码为事实来源;她列出正在失效的旧流程清单,并强调验证、评审与安全成为新瓶颈。
Anthropic 2026 年 Q1 增速年化约 80 倍,远超原计划的每年 10 倍,是 Claude 限速主因;公司已与 SpaceX 签下 Colossus 1 数据中心全部算力,超 300 MW、22 万张 NVIDIA GPU。
Karpathy 称 2025 年 12 月后 AI 生成代码已直接可用,进入完全 Vibe Coding 状态;他提出 Software 3.0 范式,认为 MenuGen 这类 App 会被模型原生能力直接吞掉。
Salesforce 宣布 27 年来最激进架构转型,开放 100 多个 MCP 工具与技能;Ramp 的 MCP 周活跃用户三个月增长 10 倍。
Anthropic 将功能交付周期从半年压到一天,靠 research preview 与 evergreen launch room 机制;Cat 面试数百 PM 后发现多数人仍用 6-12 个月路线图思维。
Claude Design 基于 HTML 和 JS,可直接导入代码仓库;作者认为设计工具的单一事实来源将回归代码,Figma 面临被颠覆的 Sketch 时刻。
由 Claude Opus 4.7 驱动,输出可运行 React 代码而非静态稿;支持组织级设计系统与代码库理解,Brilliant 反馈复杂交互从 20 多轮提示降到 2 轮。
AI 优先战略的落地依赖自动化测试、CI/CD、监控、架构与任务管理等工程基础;适合后端驱动产品,不适合 UI 密集、质量敏感或安全要求高的场景。
Claude Managed Agents 在云端托管智能体基础设施,按用量收费,Sentry 几周上线自动修 bug 流程;Anthropic 年经常性收入突破 300 亿美元,是去年 12 月的三倍。
Codex 团队几乎不写产品规格文档,整个 spec 只有 10 个要点;规划哲学是只做 8 周以内的近期和远期方向,不做中期路线图。
Claude 3.5 Sonnet 仅用 bash 与文本编辑器工具即在 SWE-bench Verified 达 49%;Opus 4.6 在 BrowseComp 上通过过滤工具输出将准确率从 45.3% 提升至 61.6%。
OpenAI 砍掉 Sora 并收到 1100 亿美元融资,完成下一代模型 Spud 预训练;Brockman 称 AGI 进度自评 70-80%,Super App 将合并 ChatGPT、Codex 和浏览器 Atlas。
Claude 自主发现并利用 Ghost CMS 首个关键级 SQL 注入漏洞,读取全部管理员凭证;还发现 Linux 内核 NFS v4 中自 2003 年存在的堆缓冲区溢出。
Notion 的 AI harness 约每六个月推倒重写一次;Simon Last 个人纪录是一个编码 Agent 连续运行 13 天。
分类器运行在 Sonnet 4.6 上,两阶段过滤将误报率从 8.5% 降至 0.4%;真实过度主动操作的漏检率为 17%,连续被拦截 3 次或累计 20 次会转交人工处理。
Sora App 上线五天破百万下载后热度骤降,一月下载量环比跌 45%、累计收入仅 140 万美元;OpenAI 已关停 Sora,转向下一代模型 Spud 与企业级工具。
企业养虾难在知识体系而非模型;飞书以数据、关系、操作、权限四层框架适配 OpenClaw,开放 2500 多个 API。
AI 编码工具加速了开发者的内循环,但外循环未改善,整体交付速度提升有限;Forsgren 建议用 AI 审查代码并追踪 Developer Flow 而非采用率。
Karpathy 自 2024 年 12 月起基本不手写代码,工作模式转为指挥多 Agent 并行;他开源了 AutoResearch 并发布 200 行 Python 实现的 MicroGPT。
用「离生产力远近」与「知识保鲜期」两轴划分四象限,分别对应跳过、维持地图感、动手试试、深度投入四种策略;OpenClaw 从右下角象限在四个月内冲到右上角。
Gumloop 获 Benchmark 领投 5000 万美元 B 轮融资;创始人 Max 因被美国遣返并禁入 5 年而被迫创业,从 AutoGPT 社区需求做出日处理 400 万工作流的平台。
Ramp 将架构收敛为“一个 Agent + 一千种技能”,统一对话入口 Omnihat;Policy Agent 在超 100 亿美元支出中做出 2600 多万次决策,阻止 51 万笔违规交易。
翻译工作流从提示词、推理模型演进到 Agent 阶段,核心转变是让模型用目标语言“重写”而非“翻译”;Agent 翻译通过文件系统做外部记忆、子 Agent 并行分块,并用共享提示词文件解决术语一致性问题。
多稿合并可交给 AI 完成,用推理模型效果更好;重复工作可固化为 Skill,文中给出完整 merge-drafts Skill 文件与两种创建方式。
陶哲轩在 SAIR 基金会演讲中称形式验证是数学大规模协作的关键,其等式理论项目三个月内由 50 人解决了 2200 万道代数问题。
设计师做设计稿的时间从 60-70% 压缩到 30-40%;Jenny 认为 AI 在品味和判断上会越来越好,但构建软件最难的部分不是构建本身。
Anthropic 与五角大楼谈判破裂,仅剩国内大规模监控与全自主武器两条红线;被封杀数小时后 OpenAI 宣布达成包含相同限制的协议。
斯坦福首门 AI 软件开发课 CS146S 2025 年秋季开课,超 100 名学生报名;讲师 Mihail Eric 认为初级开发者面临裁员、毕业生翻倍、AI 替代三重风暴。
Dario 称 2019 年即看到 scaling laws 迹象并说服 OpenAI 重视,但安全理念分歧导致离开创办 Anthropic;Anthropic 2022 年曾做出 Claude 1 但选择不发布以避免军备竞赛。
OpenAI 内部大多数人已不再打开 IDE,代码绝大部分由 AI 编写;Embiricos 认为 AI 应每天帮助人类数万次,瓶颈在人机交互而非模型。
Cursor 设计团队仅 4 人,几乎所有工程师也参与设计;Ryo 认为传统设计师定义正在失效,人类一次最多管理约 4 个 Agent。
Notion 年收入超 6 亿美元、估值约 110 亿美元;Custom Agents 即将公开发布,alpha 客户 Ramp 已节省约 2000 人类工时。
提示词只能决定格式与语气,真正决定内容质量的是素材、模型与审稿三件事;作者认为写作质量最好的模型是 Claude Opus 4.6,并指出审稿能力是 AI 替代不了的隐性门槛。
Claude Code 发布 6 个月年化收入达 10 亿美元,贡献 GitHub 4% 公共代码提交;Anthropic 人均工程生产力增长 150%,Boris 个人 100% 用 Claude Code 写代码。
Jeff Dean 在 Latent Space 播客中回顾蒸馏技术起源与 Gemini 诞生过程;Flash 模型 token 处理量超 50 万亿,驱动 Gmail、YouTube 与搜索 AI Mode。
用 Stop Hook 拦截未提交变更并触发 /commit 技能;技能按主题分组生成中文 commit message,避免 git add . 粗暴操作。
Dario 称 1-3 年内有 50% 概率出现“数据中心里的天才之国”,10 年内 90% 确信;AI 编程当前带来约 15-20% 总生产力提升,半年前约 5%。
OpenAI 官方给出智能体工程实战手册,核心是 Skills、Shell 工具与上下文压缩三个 API 能力;Glean 数据显示技能路由曾致触发率下降约 20%,加负面示例后恢复。
Anthropic 报告预测 2026 年编程从人写转向人指挥 AI Agent 写;报告梳理八大趋势,涵盖开发周期巨变、多 Agent 协同与长时间运行 Agent 构建完整系统。
AI 越强对输入容错越高,但需求定义与验收标准仍需人来做;把软件工程等同于写代码、把提示词工程等同于背咒语,都是把局部当全部。
Calvin French-Owen 认为 Claude Code 通过子 Agent 拆分上下文和 grep 检索胜出;LLM 正取代 Google 成为开发者工具推荐引擎,开源项目如 Supabase 因此受益。
作者提出选择性尝鲜、亲手实测、透过现象看本质、关注底层技术四条判断框架;以 OpenClaw 与 MoltBook 为例对比真创新与有保质期的引爆点。
SpaceX 以 1.25 万亿美元估值吞并 xAI,马斯克预测 36 个月内太空将成为 AI 最经济的部署位置;每 33 万块 GB300 芯片需 1GW 电力,冷却占 40%。
Peter Steinberger 认为 AI 抹平语法痛苦,保留工程思维与品味;作者总结工程思维三习惯:拆分、全局、三问。
ClawdBot 从一小时原型长到 30 万行代码,支持 WhatsApp、Telegram、iMessage;Peter 认为 AI 将取代手机上 80% 的 app,编程语言不再重要。
Sebastian 和 Nathan 在 Lex Fridman 播客聊了 4 小时,覆盖中美竞争、模型对比、规模定律与 AGI 时间线;两人认为中国开源模型至少几年内会持续,DeepSeek 可能正在失去王冠。
两天内三万个 AI Agent 在 Moltbook 注册,内容重复率高达 36.3%;Skills 文件被扫出 11 个安全问题,其中 7 个为严重级别。
管理能力成为驾驭 AI Agent 的关键,Ethan Mollick 提出基于人工耗时、成功概率与协同成本的委派公式;提高成功率靠更好的指令、评估与反馈,均依赖专业知识。
Peter Steinberger 用 10 天 vibe-code 出 Clawdbot,GitHub 星标近 9 万,因 Anthropic 要求改名 Moltbot;他主张 CLI 优于 MCP,称 MCP 无法规模化。
Altman 承认 GPT-5 写作失败并归因于资源分配取舍,宣布大幅放缓招聘;预测到 2027 年底 GPT 5.2x 级别智能成本降低 100 倍以上。
Skills 与脚本的本质差异在于 Agent 调度与自然语言编排,而非功能本身;确定性任务仍应交给代码,不确定任务交给 Agent。
Skill 与提示词的核心差异在于执行系统是 ChatBot 还是 Agent,Agent 能调用工具完成配图等任务;Skill 具备可复用、可组合、可迭代、可渐进加载四重价值。
Skills 应因需而建,避免过度封装;作者以 baoyu-skills 和小红书 Skill 为例说明可组合、可迭代的用法。
Anthropic 经济指数报告分析 200 万次 Claude 对话,提出经济原语框架;AI 对高学历任务加速效果比低学历高 30%,但复杂任务成功率更低。
Tool Search 在工具说明书超过上下文 10% 时自动启用懒加载,官方示例中工具定义占用从 15 万 token 降至 2000 token,节省 98.7%;Anthropic 还提出用写代码方式调用工具的 Code Mode,可绕过模型上下文。
Google Cloud 高级 AI PM 提出 PM 的翻译层正被 AI Coding Agent 压缩,规格书变成产品本身;新技能聚焦定义问题、上下文喂养与品味,但传统企业与合规领域仍难消失。
提出五步框架(拆分、编排、存储、分摊、迭代)将 Workflow 转化为可进化的 Skill;用自然语言编排替代拖拽节点,确定性逻辑交给脚本,Agent 处理判断任务。
核心是沟通而非编程,需把输入、处理、输出、边界说清楚;每次迭代交付一个能跑的小版本,并让 AI 主动澄清需求。
ChatGPT 网站流量同比下跌 22%,Gemini 同比增长 49%;AI 编程工具赛道企稳回升,Lovable 恢复至 +23%,Bolt 跌至 -39%。
Cursor 提出动态上下文发现模式,五个优化手段均以文件系统为底层抽象;MCP 工具瘦身术经 A/B 测试减少 46.9% Token 消耗。
黄仁勋在 CES 2026 上预言应用将告别预编译时代,未来在 GPU 上实时生成每个像素;他总结了 2025 年大模型的三个拐点:推理模型、Agentic 系统爆发和开源模型崛起。
Boris 分享 9 条 Claude Code 实战技巧,强调开箱即用、多 Agent 并行、用 Opus 4.5 而非 Sonnet;团队共享 CLAUDE.md 并频繁更新规则,用 Plan 模式、斜杠命令和子 Agent 自动化重复工作。
Claude Code 年化收入超 5 亿美元,三个月用户量涨 10 倍;团队 90% 代码由 Claude Code 自己编写,采用 TypeScript 与 React 技术栈。
Karri Saarinen 提出设计应分问题、概念、执行三阶段,先质疑问题本身;AI 时代执行变快,但定义问题与方向的能力更值钱。
以 Notion 创始人 Ivan Zhao 的文章为引,用钢铁与蒸汽机类比 AI 对个人、组织与经济的重构;文中提到 Notion 1000 人公司活跃着 700 多个 AI Agent。
团队基于 Claude Agent SDK 搭建原型,用本地文件系统与 Skill 化改造解决私有组件适配;复盘发现产品失败源于习惯阻力与 80/20 瓶颈,最终转向将设计系统封装为 Skill 嵌入现有开发环境。
提示词写作核心是想法而非格式,用大白话起步再让 AI 优化;把稳定提示词模板化,设定变量让场景可变换。
Anthropic 提出用功能清单、进度文件和浏览器自动化解决长任务 Agent 的三大失败模式;功能清单用 JSON 数组而非 Markdown,避免模型篡改。
Surge AI 测试 9 个模型处理 150 个客服任务,GPT-5 和 Claude Sonnet 4.5 失败率仍超 40%;文章提出智能体能力金字塔框架,分基本功、适应性、抓地力、常识推理四级。
OpenAI 承诺未来数年投入 1.4 万亿美元购买算力,Sam 称风险在于算力不足;微软新协议获得 OpenAI 最强模型七年免版税使用权。
用 Claude Code 当监工,每完成一个任务就重开 Codex 的 session,避免上下文爆掉;Claude Code 每次启动和监控 codex 都起子 Agent,主 Agent 上下文占用极小。