昨晚,硅谷经历了 AI 诸神之战。
Gemini 3.8 Flash 在 DeepSWE v1.1 上约 74%,单任务成本 2.36 美元;Muse Spark 1.3 达 75.4%,工具调用减少约 20%、token 消耗减少约 25%。
Gemini 3.8 Flash 在 DeepSWE v1.1 上约 74%,单任务成本 2.36 美元;Muse Spark 1.3 达 75.4%,工具调用减少约 20%、token 消耗减少约 25%。
Tara Seshan 将 AI 产品演进分为聊天、Agent 接任务、长期在线 AI 同事三阶段;她认为产品设计窗口只有未来两三个月,执行交给 Agent 后人的核心是掌舵与结果责任。
AI 能完成许多岗位 30% 到 40% 的任务,人类完成的那 60% 会更有价值;AI 暴露较高岗位中 22~25 岁员工就业人数低于趋势值 19%。
八个月里超 1.8 万人提交 issue 或 PR,总量超 11.1 万条,周下载量最高达 470 万;项目累积约 9500 个配置项,6 月被宣布“已死”后下载量反而创新高。
自进化须满足持久更新、验证约束与控制面分离三项要求;更新可进入模型参数或 Prompt、Memory、Skill、Workflow、Harness 等脚手架,两条路径各有成本与风险。
Anthropic 产品负责人 Dianne Penn 回顾公司从五名工程师成长为前沿 AI 定义者的历程;她提出评测即新的 PRD,并指出约 80% 的“不遵循指令”问题实为 JSON 输出错误。
日本企业已从“要不要用 AI”进入“怎么用得更便宜”阶段,Token 费用成为普遍痛点;中国开源模型因可微调、可本地化,来源背景已不再是企业决策的决定因素。
提出思维三层次模型:NPC、主角、程序员,第三层能同时持有多种视角;认为社交媒体算法通过两极分化内容劫持注意力,但社交媒体本身可成为新教育体系与职业路径。
两位 YC 负责人建议先研究富人如何看病、旅行、理财,再降本交付给大众;强调十一星体验练习与对旅程负责,而非只优化现有流程 10%。
Sarah Tavel 认为模型差距缩小后竞争转向产品直觉,社交功能可让高手经验流动;她建议先做单人任务再长社交层,并警惕无加速器的飞轮。
Ian Silber 认为 AI 已是出色的产品设计师,人的价值在于理解用户未说出口的需求与发明新交互;OpenAI 招设计师不要求 AI 背景,但看重好奇心与原型能力。
Tom Yeh 主张用纸笔拆解 Transformer 与矩阵运算,认为拿到答案不等于真正掌握;他建议区分底层知识与易变工具,把时间花在能跨周期复用的基础上。
Stripe 上新成立企业数量同比接近翻倍,中位表现优于一年前;Patrick 认为 AI 时代窄切口更拥挤,应选择偏离共识的起点。
走访纽约大学、卡内基梅隆、南加大等五所美国高校,观察到 AI 恐慌退潮、AI 成为大学工具层、规则细化到课程与作业、考核转向过程与口试等四个趋势;斯坦福通过 AI Playground 统一接入 ChatGPT、Claude、Gemini 等模型。
Claude Tag 以团队成员身份加入 Slack,共享团队上下文;Anthropic 产品团队 65% 的代码已由内部版 Claude Tag 产生。
人才市场已分化为跨职能精英被争抢、单一技能新人难获面试的两极;招聘应先用岗位定义锁定前 1% 目标,再以工作试做验证判断。
Jeff Dean 预测 AI 智能体已能执行数天至数周的长周期编程任务;他建议初创公司深耕上下文工程与垂直领域数据。
图工程分数据层与 Agent 执行层两层含义,核心是把关系当一等公民;多 Agent 图的最小原子是完整 Loop,且大多数节点不应是 LLM。
Whatnot 目前只有二十多位 PM,过去两年收到 31832 份简历仅录用一人;Tom 认为 PM 不该按人头配齐,资深 PM 应把九成时间花在 IC 工作上。
OKF 由 Google Cloud 于 2026 年 6 月发布,近期更新至 V0.2 并加入来源、验证、时效性等机制;OKF 将知识定义为 Markdown 文件加 YAML 元数据的可交换产物,并区分生产与消费方。
Khan Academy 的 Anthropic 年度账单约 120 万美元,由约 200 名工程师使用;Khan 与 TED、ETS 推出 Constellation Institute,学位上限 1 万美元。
以深度学习发展史为线索,从 GPU、AlexNet 讲到 Transformer 与 AlphaGo Zero;作者提出历史、范式变迁、人的视角三个读论文框架。
从 Prompt 到 Loop 再到 Graph 的五代工程演进,Loop 是控制论在 AI 领域的落地;官方方案含 Automations、Worktrees、Maker-Checker、Connectors、Memory 五大组件。
从 TL 转为 EM 角色后不再逐行审查 AI 代码,改为制定方案并验收结果;技术选型不再局限于自身技能树,BaoCut 新版本跨平台方案直接选用从未写过的 Rust。
World Labs 收购 SceniX 后,李飞飞与 Yunzhu Li 对谈机器人数据与评估难题;Marble 可将图片或文字生成三维世界,SceniX 用 Real-to-Sim-to-Real 流程缩短训练链路。
Anthropic 核心团队多位成员出身物理,Scaling Laws 作者 Kaplan 为理论物理博士;作者认为大模型研究正从工程学转向自然科学,Scaling Laws 仍处于开普勒阶段。
月活从年初约 65 万增至 6 月底约 1300 万,ARR 约 4000 万美元;Anthropic 限制 Claude Code 订阅在 OpenCode 中使用,反而带来关注。
陈冕在专访中称 LibTV 收入仅 3-4% 来自投流,月投流花费百万人民币;他认为 AI 应用毛利率短期不超过 30%,并强调长期主义需账上有百亿美金。
徐新在播客中输出 51 条方法论,覆盖赛道研究、创始人判断与具身智能判断;她认为具身智能渗透率约 2%–3%,商业化应先从 To B 切入。
核心判断是 Agent 不缺代码、缺可信完成,执行外壳比推理核心更稀缺;Claude Code 为 Opus 5 等新模型删掉超 80% 的 system prompt,coding eval 无损失。
学习是控制论系统,先定目标再输出,缺哪补哪;笔记系统要解决找回而非整理,可用 Claude Code 配 Obsidian 或 Eden 自动分类。
不同 AI 平台信源偏好差异明显,豆包移动端抖音占比接近 28%;高引用标题多含年份、榜单、推荐等词,长度 31 到 50 字表现较好。
图谱由节点、边、共享状态构成,单智能体循环本质是边指回自身的单节点图谱;Anthropic 数据显示多智能体系统 token 消耗约为单次聊天的 15 倍。
Supademo 上线两年半,ARR 超 300 万美元,MRR 略高于 25 万美元;免费工具贡献约 20% 流量,并将 15% 到 20% 的访客转为注册用户。
Hiro Analytics 上线 19 个月做到百万美元 ARR,月经常性收入约 9.62 万美元;它通过邮件营销代理商间接服务品牌,按代理商管理的客户数量收费。
Mark Pincus 提出 Proven、Better、New 产品框架,强调先借鉴已验证模式再改善;以 Zynga、Rovio、OMGPOP 为例说明借鉴比从零创新成功率更高。
ChatCut 从 2025 年 2 月的 PaperCut 演进到 2026 年 7 月接入 Codex/ChatGPT,任务入口从独立应用外移到通用 Agent;黄叔实测在 Codex 中对话即可完成剪辑、字幕、音效和 BGM,但气口和转写文字仍需手动修正。
David Senra 十年访谈 400 多位创始人,将共同点压缩为「专注」;他主张创始人应找到与问题的匹配而非模仿他人,并认为 AI 时代熟练使用工具者价值可放大数十倍。
作者对比了 Fable 5、GPT 5.6 Sol、Deepseek V4、Kimi K3、Qwen3.8-Max 五款模型的体感;建议高难任务用 Fable 5,日常开发用 GPT 5.6 Sol,To C 产品选 Deepseek V4。
用 Git Worktree 为每个 AI 任务分配独立目录,实现几十个 Agent 并行开发互不干扰;任务拆解能力成为独立开发者第一道分水岭,基础设施投入优先于功能开发。
Netflix 首席产品与技术官 Elizabeth Stone 认为 AI 时代专业能力仍稀缺,但更看重系统型人才;公司正增加分布式系统与基础设施背景的中央工程人才。
单一循环会因古德哈特定律、向上盲视、冲突与测量衰减四种方式失效;图架构通过配对、层级、仲裁与审计循环解决,但缺少锚点时仍会循环自证地失败。
模型势能达几年最强而应用市场冷度跌回谷底,投资机构普遍表示不再看应用;智谱、MiniMax 接连上市被视为见顶信号,Openclaw 爆火带动上千家公司跟进。
FDE 门槛不在工程师懂业务,而在产品内核、知识抽取与专家配合三件事;专家知识应写成带例外分支的决策树,交付采用两周一切片的贪吃蛇节奏。
Claude Code 设计负责人称终端产品设计转向行为、状态与心智模型;她提出 Claude Tag 让组织共享同一个 Claude,并强调设计师应外包执行、保留判断。
五个问题聚焦过去行为而非未来意愿,强调共享屏幕观察真实工作流;HeyGen 靠 1800 次访谈转向 AI 视频翻译,2025 年突破 1 亿美元 ARR。
Granola 估值达 15 亿美元,团队约六七十人;创始人认为会议记录只是入口,真正目标是成为 AI 原生工作方式中的上下文入口。
E Bufar 展示 Paxel、Sodazine 与 Startup School 三个项目,几乎不再从零做页面;她强调上下文文件(soul.md)越完整 Agent 结果越好。
作者在 Medeo 两年专注 AI 视频制作工具,离职后密集访谈短剧、工具、内容与分发玩家;核心结论是视频价值发生在被看见与结算的时刻,制作效率提升不自动带来议价权。
6000 份受访者中 50% 感到被 AI 放大、27% 觉得角色被重写;严重倦怠从 44.7% 升至 54.7%,最担心的是同薪多产。
Seth Godin 认为品牌是顾客可验证的承诺,靠稳定兑现而非声量建立信任;他建议用 AI 提升产品价值而非削减成本,并给出 Garagiste 靠邮件名单做到三千万美元营收的案例。
Work 与 Codex 共享智能体额度池,Chat 独立计费;GPT-5.6 分 Sol、Terra、Luna 三档,API 价格 5/30、2.5/15、1/6 美元每百万 Token。
点阵图把每个用户每天是否完成关键动作铺成二维表,比 DAU 等聚合指标更能暴露真实使用与续约风险;David 建议早期团队从天粒度开始,选代表核心价值的事件而非登录次数。
Mosseri 认为 AI 让产品团队变小、品味变贵,策略不能外包给模型;Instagram 正用 LLM 让用户看懂自己的算法,并押注真人关系与探索型推荐。
Greg Isenberg 提出 Agent SaaS 卖的是工作而非软件,建议从已有工资单的重复流程切入;给出最小 Agent 四类起步形态与 1500 美元设置费加月费的定价锚点。
Dan Koe 提出最保值的技能是懂人性,包含 3 种心理张力与 5 个心理杠杆;文中附可直接套用的句式与一个立刻能做的练习。
Groupon 计划 2027 年成为 AI-native 公司,任务由 Agent 执行、人类指挥审阅;每个职能都要能构建 Agent,并建立 truth layer 与 eval 体系支撑生产。
魏小康先后在字节和美团担任招聘负责人,现创业做 AI 招聘产品;他认为优秀创始人的共同特质是学习能力强、好奇心重、Ego 小、动力强、精力好。
Pincus 认为消费产品虽暂不可投资但机会最大,建议先看手机首页找未被重新发明的服务;他提出 Proven、Better、New 三件事分开测,并强调分发要长在产品动作里。
Socher 认为岗位是否被压缩取决于需求弹性,软件需求会放大而插画会承压;他建议看富人现在买什么来寻找机会,并预测不会指挥 Agent 几年后会像不会用电脑一样尴尬。
嘉宾启源分享大厂方法论在独立开发中的两面性;人机协作比例一年内从人 60% 机器 40% 反转至机器 99% 人 1%。
作者基于在 OpenAI、DeepMind、Scale 等公司的经历,给出六条职业建议;核心观点是未来十年最有价值的工作是那些无法在模型训练周期内被评分的事情。
五阶段流水线依次为数据清洗与分词、预训练、监督微调、奖励建模、强化学习;预训练目标仅为预测下一个 token,幻觉由此而来。
Justin Schroeder 主张用组合替代继承,拆出多个窄域小 Agent 协同工作;单个任务可带来超过 80% 的 token efficiency,且 2026 年 token 价格按 IQ 调整后上涨 29%。
Agent 循环由思考、行动、观察三步构成,状态分上下文窗口与外部存储两层;配置文件应短于 100 行,只写项目具体规则。
Matt Pocock 提出 Skill Hell 概念,主张区分用户触发与模型自动触发;主文件写小、用 leading words 压缩做法、拆开前置步骤让 Agent 一次只做一件事。
区分智能体与循环,强调生产级系统靠循环而非单次调用;给出 20 个循环设计模式,分质量改进、记忆、规划、探索四类,含生成-批判-重写、Reflexion、目标分解等。
role:user 协议把数据与指令塞进同一信道,导致销毁式中断与 Prompt 注入防不住;作者尝试从协议层重构,先定义主体身份再谈消息路由。
模型与 Harness 趋同后,Agent 能力边界由 Context 决定;Context 是活的、会在使用中生长,动态 Context 是下一场产品战争的关键。
Codex 使用量自 1 月以来增长 6 倍,周活超 500 万;OpenAI 内部近 100% 员工每周使用,范围已越过工程团队。
Google Search Console 灰度生成式 AI 报告,可查看页面在 AI Overview 等位置的曝光;建议优先做 Best/VS/Tool 页面承接转化,How-to/Can 内容用于品牌露出。
AI 正在瓦解 if-else 范式,使界面可即时生成并持续演化;委托模式将人从操作 App 中解放,但信息与服务源头仍不可替代。
AI 选择外部引用源时,真正被答案吸收的只有两三篇;GEO 内容工程需盯住重排、装配、引用三个环节,证据密度高的内容更易被引用。
创业一年复盘,用 Cursor 写了约 40 万行代码;提出 SaaS 不会死亡、程序员需从写代码转向审阅整合 AI 代码等判断。
Clay 每月运行超 3.5 亿个增长 Agent,连接 4000 多万家公司与 9 亿联系人;其架构从 Lambda 迁至 ECS,缓存策略最高可省 70% 模型账单。
Elman 认为 AI 消费产品应重写旧习惯而非只做聊天框,留存压过增长;付费 AI 改变创业成本,端侧推理将分担云端。
AI 让构建成本下降后,产品经理的首要工作仍是决定不做什么;Agent 时代 PM 需定义输出标准并训练 Agent,发现阶段比构建更重要。
Agent Memory 已分化为规则、画像、历史召回、证据链与技能沉淀五层;Claude Code 用 CLAUDE.md、Codex 用 AGENTS.md 作为规则层,Hermes 以 MEMORY.md 与 USER.md 常驻注入并设长度上限。
正文列出 30 个智能体工程概念,涵盖执行循环、状态管理、配置层等核心机制;强调指令质量比模型大小更重要,并引用 SkillsBench 研究佐证。
Airtable CEO 认为顶尖 1% 用户已在管理 Agent 小队,工作从亲手执行转向设计任务与判断结果;他建议先找低风险场景试错,并看好 Telegram 成为 Agent 主导平台。
YC 合伙人 Max Kolysh 整理几十位创始人的回答,给出前 10 个客户的战术清单;核心是先确认买家时间花在哪里,再手动撬动人脉与线下出现,工具放到 10-20 个客户之后。
YC 合伙人 Tom Blomfield 提出公司应从人传人结构转向系统读系统,AI loop 需五层闭环;他判断中层管理协调层将被 AI 接管,未来扩张受 token 使用量而非 headcount 限制。
Record & Replay 基于 Computer Use 视觉理解生成 Skill,回放时重新决策而非精确重放;与传统 RPA 的 selector 坐标录制不同,更适合半结构化、需判断的运营流程。
Anthropic 内部工程师人均季度代码提交量达 2021-2025 年基线的 8 倍;Fiona Fung 认为编码不再是瓶颈,团队稀缺资源转向判断力与验证能力。
循环工程由触发器、动作、证据、记忆和停止条件五部分组成;产品经理应从每周产品信号循环这类重复性任务起步,并用 GitHub 保存产物版本历史。
智能体无停止条件循环 6 小时,产生 847 次调用、210 万 token,账单 200 美元;修复仅需最大步骤计数器、空结果处理器和低置信度升级路径。
从 Prompt 到 Context、Loop、Harness 四个阶段,对应 AI 系统从单轮对话到软件系统的能力扩展;Harness 包含 Loop、评测、记忆、可观测性与安全边界。
Anthropic 2026 年 Q1 收入单季超 3 倍增长,按年化约 80 倍;Dario 预计 AI 可能在未来一到五年消除一半入门级白领岗位。
Cursor 与 SpaceX 签下潜在价值 600 亿美元的收购协议;其收入在不到一年内翻了十倍,突破 10 亿美元大关。
/goal 等自驱 loop 在 20 美元档位会烧穿额度;Mic 用 Greptile 代码评审 loop,低于 4/5 分不让代码进生产,超 1000 行改动几乎拿不到 5/5。
Mark Pincus 提出 Proven, Better, New 产品方法,强调先抄对再创新;他认为 AI 应优先用于快速测试失败而非更快构建,并指出 AI 尚未成为消费级平台。
架构只是五阶段流程里最不重要的部分,数据、缩放、对齐、评测与系统才是决胜点;Chinchilla 结论为每参数约 20 个训练 token,计入推理成本后升至每参数 150 个以上。
Pedro Franceschi 认为 AI 是 2025 年 12 月才真正被发明,CEO 必须成为首席 AI 官;Brex 内部用 Magpie 系统追踪每一美元 token 的去向与回报。
Skill 是把专家经验、工作流、品味和工具调用封装成可分发、可复用、可迭代的 Agent 能力单元;好 Skill 的信息架构应是「中心短,辐射厚」。
Claude Code 发布一周年,Anthropic 复盘工程团队工作方式变化;Boris 称已能驱动上千个 Agent 组成的树,错误会写回 CLAUDE.md 或技能。
Claude Code 团队工程师提出 agentic software engineering 概念,强调工程任务需接入团队信息与工具;上下文窗口是团队级使用的硬边界,MCP 适合公开集成、内部流程优先用 CLI 加 skill。
谷歌每天 20% 的搜索 Query 未被解决,蓝海词永远存在;新站第一个月应优先做多语言与响应式技术基建,别急着上量。
Evans 认为 coding 是 AI 首个跑出硬需求的场景,Anthropic 聚焦 coding 的策略已见成效;模型层可能像云厂商一样被应用层抽象,价值会落在更上层。
Tony Fadell 认为 AI 让构建变便宜,但产品人的品味、判断力与故事能力更贵;他主张 1.0 产品靠少数人做 opinion-based decision,并强调微观管理应管决策而非执行。
AJ 从大厂裸辞后 0 融资、0 预算,靠一份在线共享文档冷启动,做出覆盖 900 万用户的 WaytoAGI 社区;同期收费卖课的 AI 社区大多失败,只有免费开源的他还在牌桌。
建议避开通用赛道、从 niche 切入,用红人营销与 SEM 快速验证 ICP;新站 SEO 目标应环比对标竞品增长曲线倒推,而非拍脑袋。
Claude Code 一年内做到 25 亿美元年化收入、编码市场约 51% 份额;Anthropic 将质量判断推进到真实运行的代码里,主张任何人都应能发布到生产环境。
Codex 与 Claude Code 几乎同时上线 /goal 命令,支持声明式验收与长任务无人值守;作者判断一问一答式 Vibe Coding 已过时,进入 Goal Coding 时代。
YC 合伙人 Charlie Warren 提出 AI-native 服务公司应销售结果而非席位或 token;选市场需满足低信任门槛、低判断、高智能门槛与监管友好四特征,并警惕早期需求陷阱。
Hassabis 预判 AGI 将在 2030 年左右实现,并称 AI 影响力将是工业革命的 100 倍;他呼吁建立动态监管,并认为智能与意识可分离。
腾讯研究院发布 3 万字报告,提出组织竞争力 =人才密度×AI 杠杆 / 组织摩擦公式;报告从个体觉醒到组织启示四章展开,聚焦超级个体如何聚合为超级团队。
Granola 3 年做到 15 亿美元估值,创始人 Chris Pedregal 主张在闭门测试中打磨产品直到明显优于对手;内部 Agent Nacho 连接公司工具,负责拉数据等机械工作。
Token、Embedding、Attention、Transformer 等 10 个概念逐一拆解;附 temperature 参数对照表与上下文窗口容量示例。
梳理了智能体从提示词、工作流到自主规划与 Skill 的演进脉络;将 Dify、n8n、扣子归为构建平台,Claude Code、Codex 归为执行型智能体产品。
Razorpay 创始人称 AI 正在拆掉构建速度这道护城河,唯一差异化是判断速度;他列出监管准入、客户信任、创始人与问题的深度连接三样 AI 无法加速的壁垒。
Benedict Evans 认为 AI 与互联网、移动互联网同等重要但仅此而已;软件开发已先受冲击,咨询公司反而更忙,岗位冲击难以预测。
梦琪复盘一年创业,认为垂直 Agent 有结构性困局,最终从 toB 转向 toC;她指出行业里真正可用的产品不到 10%,且美国创业生态存在充流水等骚操作。
Arize AI CPO 现场用 Claude Code 和 Arize Phoenix 演示了从用户反馈到 agent 生成优先级报告、再用 trace 和 eval 校验的完整链路;她认为 AI native 团队里 PM 与工程师的边界正在变薄,会看 trace 和 eval 的 PM 已进入前 1%。
WaytoAGI 从导航起步生长为高度自治的 AI 共创网络,核心是共学、共创、共识机制;AJ 认为 AI 时代最稀缺的是能让人持续行动、校准、互相成就的环境。
OpenAI frontier 团队 Ryan Leopo 分享内部工作方式:代码从昂贵资产变成需管理的负债,团队用模块化边界让 PM 和设计师直接接触可执行产物;内部实验从空代码库让 Codex 完成完整软件工程,并建议团队假设雇五个 Codex 实习生来吸收并行产能。
Ivan Zhao 提出人才公式 Talent = Capability × Taste × Agency,认为 Capability 正被 AI 贬值;Notion 已解散 CMO 组织并放弃产品规划,改为逐周即兴。
闭门会现场话题从 AI 产品转向教育焦虑,多位嘉宾提出教育体系是国家的 HR 部门、创新来自冗余等观点;讨论涉及裁员、代际冲突与 AI 对教育体系的冲击。
OpenAI 产品负责人 Tibo 称 Agent 将在未来几个月扩展到所有知识工作;Codex 上超过 50% 的任务已是非技术任务。
Every 创始人 Dan 认为 PM 和全栈设计师会因 AI 变强,前提是亲自上手模型;公司应先养一个超级 Agent,个人 Agent 待模型稳定后再普及。
Railway 团队仅 35 人,服务约 300 万用户,每周新增约 10 万;公司自建裸金属服务器,回本周期约 3 个月。
Anthropic 的 ARR 从 9B 增长到 45B,估值约 1 万亿美元;其战略聚焦 coding,而 OpenAI 内部项目一度多达约 300 个。
OpenAI 于 2026 年 5 月成立 OpenAI Deployment Company,收购 Tomoro 获得约 150 名 FDE,初始投资超 40 亿美元;FDE 的本质是客户现场学习与生产部署机制,需与平台结合形成飞轮。
GitHub 将缓存命中率目标定在 94% 以上,缓存输入成本仅为正常输入的约 10%;采用 Haiku 执行、Opus 顾问的 advisor 策略,以低成本接近 Opus 能力。
Claude Code 工程师 Thariq Shihipar 主张用 HTML 文件替代 Markdown 作为 AI 计划与 spec 的载体,理由是长 Markdown 计划无人愿读;他还提出长任务运行等于批准计算预算,人应扮演 compute allocator 角色。
Prompt、Context、Harness 三层嵌套,分别控制表达、认知与行动;未来稀缺的是把工作拆成 AI 可执行、可检查的系统。
Yutori 联合 CEO 认为 Agent 产品最大问题是行业正把低可靠正常化,首次试用跑不通会失去用户信任;长任务中 10% 的步骤错误会复利放大,成功率随流程长度显著下滑。
Hassabis 认为 AGI 约 2030 年实现,当前还缺连续学习、长期推理和记忆;他建议创业者别把商业模式押在算力免费上,深科技路线需把 AGI 算进中途变量。
中亚总人口 8000 万,30 岁以下占比超 55%,智能手机渗透率超 85%;2024 年中国与中亚双边贸易额达 948 亿美元,过去 10 年翻 3 倍。
把 Skill 类比为提示词的固定化与渐进披露,并借方文山三句诗拆解 Context Engineering 的角色、参考信息与约束三层;作者认为 AI 时代值钱的是人类经验与判断力。
Every 增长负责人约 80% 工作时间在 Codex 桌面应用内完成;他从 Claude Code 迁移至 Codex,人工确认步骤保留在外部应用。
OpenAI 成立估值 140 亿美元的部署公司并收购 Tomoro 获得 150 名 FDE;Anthropic 与黑石、高盛等成立合资公司投入 15 亿美元。
Anthropic 发布 36 页创始人手册,将创业拆为想法、MVP、上线、规模化四阶段;强调 AI 时代判断力取代执行力,成为创始人核心壁垒。
Agent View 位于 Claude Code v2.1.139,仍为 Research Preview;后台会话消耗订阅额度,本地会话在睡眠或关机时停止。
记忆分 L1 上下文、L2 压缩、L3 检索、L4 长期规则四层,彼此独立;Hermes 在上下文用量达 50% 时触发压缩,并自动生成 Skill 实现自我进化。
Claude 年化收入从年初约 90 亿美元增至一季度末超 300 亿美元;Anthropic 内部超 90% 代码由 Claude Code 编写。
Fiona Fung 在 Code with Claude 2026 大会分享管理经验,主张砍掉陈旧流程、以代码为事实来源;她列出正在失效的旧流程清单,并强调验证、评审与安全成为新瓶颈。
Google AI Overview 已覆盖超 20% 关键词,排名第一的页面点击量平均减少 34.5%;71,000 个网站中 Google 搜索占 42% 流量,所有 AI 助手合计仅 0.29%。
Chesky 判断未来 12 到 24 个月消费级 AI 将复兴;Airbnb 内部 Project Hawaii 小队第一年带来约 2 亿美元收入增量。
Harness 工程把智能体视为模型加脚手架,失败应转化为永久规则;Claude Code、Cursor、Codex 等本质都是 Harness,底层模型相同但行为由 Harness 决定。
红杉峰会提出 MADS 框架(护城河、可供性、扩散),认为智能体将以极低边际成本规模化专业服务;预测未来 99.9% 的认知工作将由机器完成。
HTML 相比 Markdown 信息密度更高、更易读且便于分享;Claude Code 可直接生成 HTML 制品,无需专门技能配置。
Anthropic 平台负责人称 managed agents 正从补全端点走向带文件系统、记忆和工具的云端电脑;内部法律审稿 Agent 先做第一轮筛查,拿不准的再进法务收件箱。
第一性原理思维源自亚里士多德,强调从不可再拆解的根本真理出发推理;Musk 用其将火箭材料成本压缩至售价的 2%,Bezos 则区分 Type 1 与 Type 2 决策以决定何时适用。
欧洲并非单一市场,需从语言本地化、合规文件、渠道分销与客户决策四个维度拆解;德国重专业与稳定、英国重效率与表达、法国重本地信任、荷兰重国际化枢纽价值。
为国内与出海业务建立 GEO 红线治理框架,涵盖红线界定、风险识别、供应商审计等;将 GEO 风险拆为价值观层、信息质量层与 AI 系统攻击层三层。
Claude Code 创建者 Boris 今年未亲手写一行代码,上周单日完成 150 个 PR;他预测一年后模型对齐将使安全与权限外壳变轻,团队将出现跨学科通才。
Anthropic 2026 年 Q1 增速年化约 80 倍,远超原计划的每年 10 倍,是 Claude 限速主因;公司已与 SpaceX 签下 Colossus 1 数据中心全部算力,超 300 MW、22 万张 NVIDIA GPU。
过去一周 Codex 下载或安装超 4600 万次,Claude Code 不到 50 万次;Codex 在电脑控制、长任务自治与自动审批上胜出,Claude 在对话与远程能力上仍有优势。
Stripe 数据显示 AI 公司约 18 个月达到 3000 万美元 ARR,是 2018 年顶尖 SaaS 的三倍速度;LLM 到 Stripe 文档的流量同比增长 10 倍。
从 tokenization、embedding、attention 到 prefill/decode 两阶段与 KV caching 的第一性原理梳理;decode 阶段逐 token 生成,瓶颈在内存带宽而非算力。
Karpathy 称 2025 年 12 月后 AI 生成代码已直接可用,进入完全 Vibe Coding 状态;他提出 Software 3.0 范式,认为 MenuGen 这类 App 会被模型原生能力直接吞掉。
Box CEO 认为 AI 进入企业系统的速度会比预期慢,企业软件卖的是多年业务经验压成的操作系统;未来软件用户将从人扩展到成百上千个 Agent,产品需为机器用户设计入口、权限与审计。
多位硅谷创业者给出从零做到月入 1 万美元的路径:先找无聊小众市场,第 30 天收第一笔钱;Replit 创始人分享 CFO 用其平台 3 个月做出应用、收入接近 500 万美元。
CLI 正从人机界面变成 Agent 与软件之间的通用语言;Slock 团队 7 人配 40 个 Agent,把人和 Agent 放进同一协作环境。
Allie K. Miller 认为非技术人应把 AI 当可交付任务的同事而非搜索框;她通过案例说明 agent 能放大被卡住的业务,如服务型创业者客户数从 12 增至约 35 个。
Marc Andreessen 认为风险投资更应警惕“错过的错误”而非“做错的错误”;他引用 Arthur Rock 的观点,称伟大创始人带来的上升空间足以打破规则。
基于约 2000 份真实岗位描述总结;核心技能为 LLM 基础、RAG、Agents、测试、监控与评估,支撑技能含 Python、Web 开发、云与数据库。
作者从离职到年入数百万团队,总结出好内容、需求、服务、变现四步闭环;强调先接非标需求、按自己愿意的价格定价,服务从真实交付中长出来。
Kimi CLI 作者 RC 认为 CLI 只是 local agent 的第一步,后续可封装 SDK 引入 GUI;他预测模型越进步越有利于攻方,安全与反爬攻防将加剧。
Evan Spiegel 认为 AI 时代分发比产品市场匹配更稀缺,软件功能易复制而生态难复制;Snap 已用 AI 自动发现近一万个 bug,并强调工程护栏的重要性。
Anthropic 将功能交付周期从半年压到一天,靠 research preview 与 evergreen launch room 机制;Cat 面试数百 PM 后发现多数人仍用 6-12 个月路线图思维。
王子涵在 NeurIPS、ICLR 等顶会发表十余篇论文,引用 1600 余次;他提出环境开放程度决定 Agent 智能指数的观点。
YC 合伙人 Diana Hu 提出 AI 应成为公司操作系统而非工具,强调闭环系统与可查询组织;软件工厂模式下人类写规格、AI 写代码,传统管理层级将消失。
sub-agent 在隔离上下文中执行单一任务并压缩结果,agent teams 通过共享上下文与通信实现协作;按上下文边界而非角色拆分,任务独立用 sub-agents、相互依赖用 teams。
AI 暴露高的岗位里年轻人就业增长慢了 16%,资深员工变化不大;未来白领工作更像指挥 AI agents 做实现,战略思考与社会互动能力更值钱。
提出 AI 三明治模型:人类负责定义问题与最终打磨,中间执行交给 Agent;Compound Engineering 四步流程强调把踩坑经验沉淀回系统。
Mahesh Yadav 认为 Builder PM 的核心是快速把判断变成可运行原型,而非会写代码;他建议 PM 先用 n8n 理解 Agent 构成,再用 Claude Code 委派工作。
Nikhyl Singhal 认为 PM 岗位数量创新高但旧版岗位定义消失,AI 吃掉机械动作、判断力成为核心;未来 12-24 个月组织将先裁减旧编制再以更少 AI-first 人员重建。
Claude Design 基于 HTML 和 JS,可直接导入代码仓库;作者认为设计工具的单一事实来源将回归代码,Figma 面临被颠覆的 Sketch 时刻。
Profound 服务接近 12% 的财富 500 强团队;James 认为品牌需被模型引用和推荐,而非仅追求搜索排名。
Notion 的 Custom Agents 重做了四五次才真正可用,早期受限于模型能力与上下文长度;团队认为 Agent 时代真正难的是重做整个工作系统,而非单点功能。
Lenny's Newsletter 订阅量达 120 万,Podcast 每期下载 10 万到 20 万次;他坚持下午 3 点前不安排会议,以维持工作与生活的平衡。
AI 竞争正从能力竞争走向人格竞争,Claude 因气质与命名方式被感知为"有灵魂";改变 AI NPS 的头号办法是让重要的事情变得又便宜又快,下一代 AI 界面将不止于聊天框。
Phil Carter 将增长拆为价值创造、传递与捕获三段,强调 first session 内完成转化;试用开始发生在 day zero 的比例已超 80%,Runna 月测创意从几十个增至 400 多个。
AI 优先战略的落地依赖自动化测试、CI/CD、监控、架构与任务管理等工程基础;适合后端驱动产品,不适合 UI 密集、质量敏感或安全要求高的场景。
报告共 423 页、9 个章节,新增 AI 与科学、AI 与医疗两章;中美模型性能差距收窄至 2.7%,美国私人 AI 投资达 2859 亿美元。
Box 同时维护人用与 Agent 用两套接口,Agent 接口设计时间已与人类界面相当;Levie 认为 vibe coding 无法替代 SAP,领域知识才是护城河。
Anthropic CEO 称约 50% 初级白领岗位可能在未来 1-5 年内消失;银行柜员案例显示技术冲击分嵌入工作流与重塑范式两条路径,ROI 决定人是否留下。
Agent 产品翻车的根因是产品经理还在用做 SaaS 的脑子做 Agent;提出 PACT 框架与代理权阶梯,强调按决策类型切分人机协作边界。
LLM 本质是逐字预测的接龙模型,Token 是比词更小的计费单位;Harness 是 Prompt 的高阶进化,把身份、规则、工具、格式打包成完整指令体系。
Eric Schmidt 认为全球至少能容纳 10 家大型模型公司,多数在美国,中国会有几家;他判断中国在低成本机器人领域会赢,因电动车产业积累了电机与系统专业知识。
OpenAI 发布 13 页政策白皮书,承认经济收益可能集中在少数公司;提出公共财富基金、四天工作制、AI 接入权等具体方案。
Anthropic 工程主管 Felix 称执行力已免费,品味成为新护城河;Co-Work 团队 10 天冲刺上线,内部已有超 100 个产品原型并行探索。
Harrison Chase 认为 Harness 比模型更关键,Agent 前沿正从模型转向周边技术栈;Long Horizon Agent 与 Conversational Agent 是当前两种主要形态。
MoE 将 Transformer 每层前馈子层替换为多个 expert,由 router 为每个 token 选出 top-k 个执行;稀疏激活让模型参数巨大但每个 token 只运行一小部分,降低推理成本。
Anthropic 14 个月 ARR 从 10 亿冲到 190 亿,增长团队 70% 时间在处理"成功灾难";Claude Code 将工程师产出提升 2-3 倍,PM 与设计师缺口扩大。
Harness 是包裹 LLM 的整套软件基础设施,含编排循环、工具、记忆、上下文管理等 12 个组成部分;LangChain 仅改进 harness 层即在 TerminalBench 2.0 上从前 30 名外升至第 5 名。
持续学习可发生在模型、harness、context 三个层次,模型层面临灾难性遗忘;traces 是驱动各层学习的关键,LangSmith 用于收集 traces。
Codex 团队几乎不写产品规格文档,整个 spec 只有 10 个要点;规划哲学是只做 8 周以内的近期和远期方向,不做中期路线图。
太空数据中心边际成本随发射次数增加而下降,盈亏平衡点约 500 美元 / 公斤;下一代面向星舰的型号单颗功率 200 千瓦,单次发射提供 10 兆瓦算力。
80% 的 AI PM 岗位只是传统 PM 加 AI 功能,真正 AI 原生岗位仅占 20%;AI PM 的核心差异在于概率性系统设计,需掌握提示词优化、上下文工程、RAG 的优先级框架。
从工程视角拆解 LLM、Token、Context、Prompt、Tool、MCP、Agent 与 Agent Skill 的底层原理;给出 token 与汉字换算经验值及各模型上下文窗口容量。
人类在 agent 系统中被抽象为可调用函数,承担审批、打分、处理例外等五类职责;MCP 正从工具协议向 sampling、elicitation、durable tasks 等更深层扩展。
Andreessen 认为四件事同时发生构成质变,浏览器作为图形中间层将被 Agent 取代;Pi + OpenClaw 架构让 Agent 实现模型无关,软件正从稀缺走向过剩。
作者从单点问答转向 Deep Research 与批量生图工具,再交由 Codex 读 PRD 自动生图;最后改为先做原型再补 PRD。
DevRev 与 Palantir 主张知识图谱路线,DeepSeek Engram 提出参数内化知识;Engram 实现 O(1) 检索与 75/25 参数分割,但面临不可解释性。
2025 年 11 月 GPT-5.2 与 Claude Opus 4.5 越过编程 agent 临界点;StrongDM 用 agent swarm 模拟用户测试,每日 token 成本 1 万美元。
Claude 3.5 Sonnet 仅用 bash 与文本编辑器工具即在 SWE-bench Verified 达 49%;Opus 4.6 在 BrowseComp 上通过过滤工具输出将准确率从 45.3% 提升至 61.6%。
Mo Gawdat 预测 2027 年前后 AI 冲击达到峰值,就业市场将在两到三年内出现大规模位移;他建议创业者转向壁球式快速响应模式,并掌握 AI 作为认知延伸工具。
Anthropic 三角色架构跑出 4 小时 124 美元的成本;Cursor 递归 Planner-Worker 架构峰值吞吐约 1000 commits/hour。
OpenAI 砍掉 Sora 并收到 1100 亿美元融资,完成下一代模型 Spud 预训练;Brockman 称 AGI 进度自评 70-80%,Super App 将合并 ChatGPT、Codex 和浏览器 Atlas。
裸模型有四大硬伤:无记忆、不能执行代码、知识过时、无工作环境;Harness 六大组件逐一补救,System Prompt 贯穿始终。
泄露版本为 @anthropic-ai/claude-code v2.1.88,含 1,900 个 TypeScript 源文件、512,000 行代码;源码暴露了 KAIROS、Coordinator、ULTRAPLAN 等未发布功能。
Claude 自主发现并利用 Ghost CMS 首个关键级 SQL 注入漏洞,读取全部管理员凭证;还发现 Linux 内核 NFS v4 中自 2003 年存在的堆缓冲区溢出。
马斯克称 recursive self-improvement 将在 2027 年实现 AGI,经济规模 10 年内增长 10 倍;Optimus 3 处于最后完善阶段,将是最先进机器人。
Harness Engineering 指为 AI 搭建的整套工作环境,包含约束、上下文、验证、修复与生命周期管理;LangChain 实验显示仅改工作环境,同一模型编程成绩从 52.8% 升至 66.5%。
Kuse.ai 以 bootstrap 方式做到千万刀 ARR,定价从固定改为 usage-based;团队判断 agent 时代垂类难走通,并围绕核心场景搭建 agentic evaluation pipeline。
Gamma 上线 3 年多突破 1 亿美金 ARR、用户超 7,000 万,完成 a16z 领投的 6,800 万美金融资;上周推出 Gamma Imagine,从 AI PPT 工具升级为 AI 原生设计平台。
52 天内发布 74 次,含两个新模型、桌面 Agent 平台 Cowork 及二十多个 Claude Code 功能更新;Anthropic 工程师 60% 的工作由 Claude 完成,Cowork 从零到发布仅用 10 天。
Notion 的 AI harness 约每六个月推倒重写一次;Simon Last 个人纪录是一个编码 Agent 连续运行 13 天。
Cognition 工程师已不打代码,管理 Devon 一小时抵得上亲自干六到十二小时;客户今年前两个月 Devon 使用量超过去年全年。
Anthropic 用评估器 Agent 迭代 5-15 轮,6 小时 200 美元交付完整游戏;OpenAI 五个月零手写构建百万行代码,依赖分六层用 linter 强制。
作者对中国硬件生态转为看好,对软件生态转为看衰;中国软件公司估值中位数已与美国看齐,MiniMax 估值约 400 亿美元而 ARR 不足 1 亿美元。
两位增长顾问复盘了放弃的 AI 方向:AI 玄学因准确度不足被弃,AI auto reply 类产品被 Workflow 替代;Kostja 弃用 Monica,因工作流已整体迁移到 Cursor。
林俊旸离职后首发长文,判断 AI 下一阶段是智能体式思考;回顾 o1 与 R1 证明推理后训练可规模化,并提及 Qwen3 的混合思考模式。
全球科技公司 PM 开放职位超 7,300 个,较 2023 年初低谷高 75%;工程师开放职位超 67,000 个,AI 相关岗位呈曲棍球棒式增长。
分类器运行在 Sonnet 4.6 上,两阶段过滤将误报率从 8.5% 降至 0.4%;真实过度主动操作的漏检率为 17%,连续被拦截 3 次或累计 20 次会转交人工处理。
Sora App 上线五天破百万下载后热度骤降,一月下载量环比跌 45%、累计收入仅 140 万美元;OpenAI 已关停 Sora,转向下一代模型 Spud 与企业级工具。
约 50% 投资是对早期赢家的追加,私募市场增速普遍超 30%;Waymo 完成 160 亿美元 D 轮融资,估值 1260 亿美元。
AI 智能体规模化落地的瓶颈在运营层而非模型能力;Sim 平台以 Apache 2.0 开源,GitHub 星标超 2.7 万,提供 Mothership 自然语言指挥中心。
Workstream 联合创始人 Max 王若愚在访谈中探讨 AI 取代白领能力后人类的剩余价值,并分享其用 Claude Code 实现产品研发全流程自动化的实践。
提出注意力残差机制,将注意力从序列轴转向深度轴,解决标准残差逐层稀释与隐状态爆炸问题;分块注意力残差在块数 N=8 时效果接近全注意力残差且开销可控。
提出 UDD(用户主导开发)概念,主张开发权从公司转移到用户;对比 SDD、Vibe Coding 等范式,认为它们仍属供给侧效率优化。
从 Prompt 到 Context 再到 Harness,协作方式经历三次进化;Harness 管理记忆、工具、编排、护栏等模型运行环境。
YC 合伙人认为模型能力爆发式增长,AGI 时刻已至;agents 将自主选择工具,形成与人类经济并行的 agent economy。
AI 编码工具加速了开发者的内循环,但外循环未改善,整体交付速度提升有限;Forsgren 建议用 AI 审查代码并追踪 Developer Flow 而非采用率。
Karpathy 自 2024 年 12 月起基本不手写代码,工作模式转为指挥多 Agent 并行;他开源了 AutoResearch 并发布 200 行 Python 实现的 MicroGPT。
某厂传出 4 月裁 30%、5 月清退外包的消息,官方回应称只是正常项目调整;作者认为画师被冲击的根源是身份认同震动,解法是从执行者切换为创造者。
2025 年 VivaTech 吸引超 18,000 名访客与 14,000 家参展创业公司;参展公司中 20% 表示曾借此直接促成融资。
用「离生产力远近」与「知识保鲜期」两轴划分四象限,分别对应跳过、维持地图感、动手试试、深度投入四种策略;OpenClaw 从右下角象限在四个月内冲到右上角。
Gumloop 获 Benchmark 领投 5000 万美元 B 轮融资;创始人 Max 因被美国遣返并禁入 5 年而被迫创业,从 AutoGPT 社区需求做出日处理 400 万工作流的平台。
Anthropic 内部活跃使用数百个 Skills,按用途归纳为九类;每类给出示例与编写要点,强调 Skills 是含脚本与资源的文件夹而非纯 markdown。
OpenClaw 作者 Peter Steinberger 在 OpenAI 官方访谈中回顾其从 PSPDFKit 到开源项目的历程;OpenClaw 已在旧金山线下聚集近千人,维也纳超 300 人报名。
AI 辅助、多智能体协作、AI 原生是三种不同的系统架构,而非同一升级路线上的三个阶段;小红书根因定位准确率从 40%+ 提升至 80%+,华为云提出 1 分钟发现、5 分钟定界、10 分钟恢复的目标体系。
ElevenLabs ARR 从 2 亿增至 3.3 亿美元仅用 5 个月,D 轮估值 110 亿美元;增长负责人 Luke Harries 详解通用型 GTM、网状组织与视频营销打法。
论文发现原始块存储的召回效果优于摘要与事实提取;召回系统建议采用 BM25 与 Embedding 多路召回并加大模型重排序。
Dario Amodei 称公众未意识到指数增长已近尾声,其 2017 年提出的七要素缩放假说至今未变;他 90% 确信十年内数据中心将诞生堪比国家的天才智能体。
Clay 联合创始人 Varun Anand 亲述 GTM 工程师岗位定义与三大业务板块;该岗位每月新增招聘需求约 400 个,Clay 估值达 31 亿美元。
a16z 认为数据 Agent 表现不佳的关键原因是缺乏正确的数据上下文,而非模型能力不足;提出构建现代上下文层,包含自动化构建、人工精修、自更新等五步架构。
Trace 与 Span 构成调用树,上下文传播靠 traceparent 头;阿里云 3 小时 16 分钟故障、CrowdStrike 8500 万美元更新等案例说明追踪的价值与成本。
METR 研究显示 Agent 任务长度每 7 个月翻一番,但模型性能随上下文增长而下降;文章提出七大设计模式,核心是上下文管理。
LLM 训练分预训练、指令微调、强化学习三步;Agent 通过工具调用与 ReAct 框架实现任务闭环,Manus 是典型代表。
OpenClaw 架构由 Agent Loop、Tools、Gateway 三模块构成,Gateway 是其差异化核心;Gateway 负责不关机、多平台接入、会话隔离、排队控制、心跳巡查与记忆刷盘六件事。
腾讯推出 Qclaw 并接入微信生态,一键安装降低使用门槛;作者认为微信有望成为 AI Agent 时代的操作系统,但指出 80% 用户可能只会将其当作高级待办。
9 位硅谷 AI 高管对子女教育的共识是回归人的品质而非技术;Marc Andreessen 主张深度使用 AI 并强调 agency,Mustafa Suleyman 则主张保留学习中的摩擦感。
Boris Cherny 在 Meta 工作七年,负责过 Facebook Groups、Instagram 及全公司代码质量;他每天用 Claude Code 提交 20-30 个 PR,一行代码都不手写。
真格基金合伙人戴雨森判断 25 年中国模型与美国差距缩短至 6-12 个月;他认为当前 CAPEX 投入比互联网泡沫时期更大更快,泡沫下需做真正有价值的事。
Reddit 被 ChatGPT 等大模型引用次数是同类平台的 2-4 倍;AI Answers 用户量从年初 100 万增长到 1500 万。
OpenClaw 与 EvoMap 的自主性实为外部预设的服从,缺乏内在价值判断;人类自主性源于内稳态与自由能原理,而非奖励函数。
陶哲轩在 SAIR 基金会演讲中称形式验证是数学大规模协作的关键,其等式理论项目三个月内由 50 人解决了 2200 万道代数问题。
品牌词搜索意图天然偏向品牌方,第三方抢排名转化差且易被投诉降权;建议用 alternatives、vs、review 等决策页承接比较流量,首页专注自身品牌词加一个核心通用词。
设计师做设计稿的时间从 60-70% 压缩到 30-40%;Jenny 认为 AI 在品味和判断上会越来越好,但构建软件最难的部分不是构建本身。
Anthropic 与五角大楼谈判破裂,仅剩国内大规模监控与全自主武器两条红线;被封杀数小时后 OpenAI 宣布达成包含相同限制的协议。
斯坦福首门 AI 软件开发课 CS146S 2025 年秋季开课,超 100 名学生报名;讲师 Mihail Eric 认为初级开发者面临裁员、毕业生翻倍、AI 替代三重风暴。
Dario 称 2019 年即看到 scaling laws 迹象并说服 OpenAI 重视,但安全理念分歧导致离开创办 Anthropic;Anthropic 2022 年曾做出 Claude 1 但选择不发布以避免军备竞赛。
Harness 是让模型作为 Agent 工作的系统,包含 Context、Tool、Workflow 三个工程维度;核心挑战是 LLM 无状态与复杂任务有状态之间的冲突。
记忆系统核心是写入、检索、老化、治理四环闭环,超长上下文只能推迟问题;企业侧存在商业平台数据访问权限与开源记忆层两条路线,开源共性架构为事实提取、向量编码、存储检索与审计。
模型进化分智力线与多模态生成线,数据飞轮驱动模型持续变强;agent team 已内化到 Claude 4.6、Codex 5.3 等模型中,AI coding 在初创公司占比超 99%。
2026 年 2 月 5 日 Anthropic 与 OpenAI 同日发布 Claude Opus 4.6 和 GPT-5.3 Codex,编程能力与判断力显著提升;METR 数据显示 AI 能独立完成专家级任务时长约每 4 到 7 个月翻倍。
OpenClaw 用户主要交互界面是 Telegram 而非自带 Web UI;多 agent 架构需要 supervisor 大总管与统一记忆层,记忆是当前最大短板。
提出以角色对话为核心的 Chat-as-OS 交互框架,划分 L0-L4 交互分级;角色间可拉群协作、消息转发与跨群流转,支持主持与自动两种模式。
面向非工程师的 AI 应用学习路线,分方法论、入门、进阶、洞察四模块;强调动手为先、场景驱动、溯源学习、功利学习、输出沉淀五个心法。
OpenAI 内部 95% 的工程师日常使用 Codex,100% 的 PR 由 Codex 审核;使用 Codex 的工程师提交的 PR 数量比不使用者多 70%。
用 y=kx+b 和老师教学生的比喻,把 SFT、RLHF、PPO 拆给非技术读者;指出 SFT 会让模型交对齐税,冷启动指令微调让续写模型变成问答模型。
OpenAI 内部大多数人已不再打开 IDE,代码绝大部分由 AI 编写;Embiricos 认为 AI 应每天帮助人类数万次,瓶颈在人机交互而非模型。
2026 年 1-2 月软件板块蒸发近 2 万亿美元市值;Gartner 预测到 2030 年至少 40% 的企业 SaaS 支出将转向基于使用量、Agent 或结果的定价模式。
Cursor 设计团队仅 4 人,几乎所有工程师也参与设计;Ryo 认为传统设计师定义正在失效,人类一次最多管理约 4 个 Agent。
Notion 年收入超 6 亿美元、估值约 110 亿美元;Custom Agents 即将公开发布,alpha 客户 Ramp 已节省约 2000 人类工时。
Gemini 3 预训练负责人称其提升源于团队协作与多维度改进,非单一突破;行业正从“数据无限”向“数据有限”范式转变,合成数据需谨慎使用。
作者称 GPT-5.3 Codex 与 Opus 4.6 已具备判断力与品味,能自主完成开发;预测 1-5 年内白领认知工作将被大规模取代。
OpenAI 计划为免费用户推出广告,被视为 2026 年最大“不算新闻的新闻”;a16z 认为广告是 AI 产品规模化触达十亿用户的最佳方式,并细数了七种潜在变现路径。
龙虾生态中约 15% 的社区 skills 含恶意指令,ClawHavoc 事件发现 341 个恶意 skills;ClawHub 上有 5,700 多个 skills,用户流失率每层超九成。
提示词只能决定格式与语气,真正决定内容质量的是素材、模型与审稿三件事;作者认为写作质量最好的模型是 Claude Opus 4.6,并指出审稿能力是 AI 替代不了的隐性门槛。
Claude Code 发布 6 个月年化收入达 10 亿美元,贡献 GitHub 4% 公共代码提交;Anthropic 人均工程生产力增长 150%,Boris 个人 100% 用 Claude Code 写代码。
东旭认为 Coding Agent 能力已跨过奇点,10 万行代码内项目人类只需提需求;Clawdbot 底层是类似 Claude Code 的编程 Agent,可能成为未来操作系统。
游戏行业 AI 岗位分 infra、算法、应用、流程四类,前两者重学历经验、后两者与研运强相关;学习路径建议从自身工作痛点切入,按场景组合工具并沉淀为模板。
Seedance 2.0 以统一多模态架构实现从分镜到音画合成的全流程智能化;传统 AI 短剧制作依赖多工具拼接的工业组装流程,前期筹备与中期制作环节繁琐且一致性难保证。
Jeff Dean 在 Latent Space 播客中回顾蒸馏技术起源与 Gemini 诞生过程;Flash 模型 token 处理量超 50 万亿,驱动 Gmail、YouTube 与搜索 AI Mode。
作者认为 DAU 优先、工具到平台、SaaS 面向人这三套旧打法在 AI 时代失效;未来 SaaS 最大客户是 Agent,产品经理需转向设计 Agent 友好的接口与权限。
Peter Steinberger 披露 Meta 与 OpenAI 争夺收购 OpenClaw,他坚持项目必须保持开源;OpenClaw 具备自修改源码能力,他预言 AI 智能体将消灭 80% 的 App。
黄仁勋称未来十年算力将提升 100 万倍,写代码只是打字,领域知识才是超级力量;建议企业让百花齐放、允许员工安全实验各种模型,而非死磕 ROI。
Dario 称 1-3 年内有 50% 概率出现“数据中心里的天才之国”,10 年内 90% 确信;AI 编程当前带来约 15-20% 总生产力提升,半年前约 5%。
Seedance 2.0 的全能参考实现跨光线、跨风格的角色资产无缝融合,泛化能力大幅提升;作者认为大众媒体消费市场的进入门槛已几乎归零,首尾帧工作流范式将告别。
2025 年中国具身智能融资总额约 360 亿元,是 2024 年的两倍多;12 月单月融资 62.47 亿元,轮次更靠后、商业化方向更明确。
a16z 发布 2026 年 big ideas 预测,聚焦 AI 原生工业基础与物理可观测性;预测 2026 年主流用户提示框将消亡,AI 应用转向主动观察与介入。
调研发现 AI 付费本质是赛博雇佣关系,初始定价即起薪;付费用户续费率应以 70% 为基准,免费版太够用会杀死付费。
李飞飞认为空间智能是 AI 下一前沿,World Labs 专注三维四维世界建模;AI 是文明级技术,任何依赖计算的设备最终都会依赖 AI 计算。
GitHub 前 CEO 创立 Entire 获 6000 万美元种子轮,发布 Checkpoint 在 Git 之上捕获推理链;Git 缺失 Why 层,Agent 正用 Issue 与 PR 隐式通讯。
Anthropic 报告预测 2026 年编程从人写转向人指挥 AI Agent 写;报告梳理八大趋势,涵盖开发周期巨变、多 Agent 协同与长时间运行 Agent 构建完整系统。
杨攀认为 2026 年产业重心从提升模型能力转向为 Agent 构建基础设施;他判断未来软件付费将从 SaaS 转向 Anthropic、OpenAI 等 Token 生产者。
ARK Invest 预测 2030 年全球 GDP 增速将破 7%,比特币目标价上调至 150 万美元;中美 AI 差异化发展,中国凭开源路线突围,美国主导应用层全球竞争力。
作者提出选择性尝鲜、亲手实测、透过现象看本质、关注底层技术四条判断框架;以 OpenClaw 与 MoltBook 为例对比真创新与有保质期的引爆点。
以中美对抗视角分两大部分、各三章节整理 2025 年 AI 行业,共 181 页 PPT;内容覆盖模型、产品、市场、资本与开源竞争,并附播客与视频版本。
SpaceX 以 1.25 万亿美元估值吞并 xAI,马斯克预测 36 个月内太空将成为 AI 最经济的部署位置;每 33 万块 GB300 芯片需 1GW 电力,冷却占 40%。
玉伯在九坤创投活动中分享创业三问与产品三问;YouMind 定位为内容创作者的创作环境,核心是“万物化稿、稿生万物”。
CL-bench 基准测试中 GPT-5.1 得分 23.7%,为前沿模型最好成绩,平均分仅 17.2%;测试发现模型更擅长依赖预训练知识而非从上下文中学习新知识。
OpenClaw 的心跳、永久记忆与自我迭代三大机制可迁移到智能家居,让 AI 主动感知、记住习惯并自我进化;现有 HA/ 米家等平台仍是规则驱动的被动自动化,AI 应作为决策层与自动化共生。
a16z AI 应用团队认为 AI 是既有技术周期的叠加而非新周期,护城河重要性反而更高;约 15% 的成年人每周使用 ChatGPT,企业级 AI 采用正加速。
ClawdBot 从一小时原型长到 30 万行代码,支持 WhatsApp、Telegram、iMessage;Peter 认为 AI 将取代手机上 80% 的 app,编程语言不再重要。
OpenAI Codex 产品负责人称瓶颈在人类而非算力;Sora 安卓 App 从立项到上线仅 28 天。
Sebastian 和 Nathan 在 Lex Fridman 播客聊了 4 小时,覆盖中美竞争、模型对比、规模定律与 AGI 时间线;两人认为中国开源模型至少几年内会持续,DeepSeek 可能正在失去王冠。
两天内三万个 AI Agent 在 Moltbook 注册,内容重复率高达 36.3%;Skills 文件被扫出 11 个安全问题,其中 7 个为严重级别。
Skills 本质是基于文件系统的 Context Offloading 机制,通过系统提示词引用外部文件按需加载;Claude Code 的上下文管理依赖文件系统与 Shell 命令工具。
管理能力成为驾驭 AI Agent 的关键,Ethan Mollick 提出基于人工耗时、成功概率与协同成本的委派公式;提高成功率靠更好的指令、评估与反馈,均依赖专业知识。
嘉宾从 2009 年起研究开源,2025 年加入硅谷开源 AI 大数据公司 Datastrato.ai;其核心项目 Apache Gravitino 已捐献至 Apache 软件基金会。
Peter Steinberger 用 10 天 vibe-code 出 Clawdbot,GitHub 星标近 9 万,因 Anthropic 要求改名 Moltbot;他主张 CLI 优于 MCP,称 MCP 无法规模化。
Altman 承认 GPT-5 写作失败并归因于资源分配取舍,宣布大幅放缓招聘;预测到 2027 年底 GPT 5.2x 级别智能成本降低 100 倍以上。
Skills 与脚本的本质差异在于 Agent 调度与自然语言编排,而非功能本身;确定性任务仍应交给代码,不确定任务交给 Agent。
总结 Vibe Coding 的四个心法:速度优先、借力打力、放大自己、持续进化;强调先跑起来再迭代、用截图驱动 AI 理解意图、从执行者转为指挥官。
达沃斯论坛上多位嘉宾讨论 AI 原生组织与神经脊柱概念;预测 2026 年 AI 将自我构建、极长周期自主代理成为现实。
Skill 与提示词的核心差异在于执行系统是 ChatBot 还是 Agent,Agent 能调用工具完成配图等任务;Skill 具备可复用、可组合、可迭代、可渐进加载四重价值。
AI 闹钟与拍学机是今年出货量最大的 AI 硬件,主要靠教育机构渠道销售;涂鸦通过平台缓存大模型数据压低 token 成本,主导出海玩具方案市场。
Skills 应因需而建,避免过度封装;作者以 baoyu-skills 和小红书 Skill 为例说明可组合、可迭代的用法。
通用 LLM 助手市场呈赢家通吃趋势,仅 9% 用户为多款产品付费;2026 年多模态与应用生成被视为消费级 AI 破局关键。
Google 论文发现重复输入提示词可将非推理模型准确率从 21.33% 提升至 97.33%;原理是让模型在第二遍时能回看第一遍的完整信息。
MCP 协议除 Tools 外还定义了 Resources 与 Prompts 两类被忽视的接口;Skill 本质是上下文知识包,可通过 MCP Resource 方式分发,两者边界正在模糊。
Skill 是给 AI 写的说明书,自动调用且全局生效;与提示词、Projects、Memory、MCP、Agent、工作流的区别逐一讲清。
Codex 自 ChatGPT5 发布以来规模增长 20 倍,每周处理数万亿字符;产品负责人认为 AGI 级生产力的真正瓶颈是人类打字速度。
Dan Koe 的《How to fix your entire life in 1 day》曝光量过亿;文章拆解出 7 条人生重启方法论,核心是改变身份而非行动。
OpenAI 将在未来几周于美国测试 ChatGPT 广告,免费用户与 ChatGPT Go 用户可见,Plus 和 Pro 用户不受影响;广告基于对话意图匹配而非关键词竞价,并承诺不影响回答内容。
Anthropic 经济指数报告分析 200 万次 Claude 对话,提出经济原语框架;AI 对高学历任务加速效果比低学历高 30%,但复杂任务成功率更低。
LinkedIn 数据显示到 2030 年岗位所需技能 70% 将变化;LinkedIn 以 Full Stack Builder 模式取代传统 APM 计划,用 Pod 小分队跨职能构建产品。
AI 陪伴行业三年未出现超 3000 万 MAU 产品,核心用户为 13-24 岁社恐青少年,18-24 岁占比 65.4%;作者提出通过内容化降低门槛、混合陪伴介入现实来突破天花板。
GPT-5.1 首次让聊天中所有模型都成为推理模型,并引入自动切换器与风格特质功能;团队通过改进上下文窗口与指令遵循来提升模型温暖度。
星巴克自 2019 年打造 AI 平台 Deep Brew,覆盖产品研发、烘焙、门店调度等全链路;FlavorGPT 将新品研发周期压缩至 6 个月,绿点助手将新人培训时间从 30 小时降至 12 小时。
从 UTF-8 字节序列讲起,逐步拆解 BPE 合并 token 的过程;词表大小可达 10 万级,embedding 矩阵行数对应词表、列数对应特征维度。
Fal 平台可同时访问超 600 个生成式媒体模型;生成 5 秒 24 帧视频的算力消耗是生成 200 个 token 文本的 12000 倍,4K 分辨率再增 10 倍。
Google Cloud 高级 AI PM 提出 PM 的翻译层正被 AI Coding Agent 压缩,规格书变成产品本身;新技能聚焦定义问题、上下文喂养与品味,但传统企业与合规领域仍难消失。
YC Winter26 批次中 Anthropic 首次超过 OpenAI 成为创始人最常用 API,占比超 52%;AI 经济进入稳定期,竞争正从模型能力转向产品化能力。
评估的核心是检查结果而非对话记录,区分能力评估与回归评估;pass@k 与 pass^k 两个指标对同一模型给出截然不同的结论。
李飞飞在访谈中回顾了从成都到新泽西的成长经历,以及 ImageNet 的诞生背景;她强调 AI 是文明级技术,但人们正在忽视人在其中的重要性。
CES 2026 最佳 AI 奖颁给英伟达 Rubin GPU,3360 亿晶体管,同等延迟下每百万 token 成本降至十分之一;榜单还涵盖摩托罗拉 Qira、Pebble Index 01 录音戒指等 24 个产品。
唐杰、杨植麟、林俊旸等人在 AGI-Next 前沿峰会上同台,分别提出 RLVR、Muon 优化器与混合架构等新方向;杨植麟称 Kimi K2 在 HLE 基准达 45% 准确率。
黄仁勋发布 Vera Rubin 平台,6 芯片协同使训练 GPU 需求减少 4 倍、推理成本降低 10 倍;开源 1700 小时真实驾驶数据与 Cosmos 模型框架。
ChatGPT 网站流量同比下跌 22%,Gemini 同比增长 49%;AI 编程工具赛道企稳回升,Lovable 恢复至 +23%,Bolt 跌至 -39%。
Claude Code 于 2025 年 2 月随 Claude 3.7 Sonnet 发布,截至 12 月 2 日年化收入达 10 亿美元;2025 年各大实验室均推出推理模型,推理与工具结合催生了代码 agent 和异步 agent。
黄仁勋在 CES 2026 上预言应用将告别预编译时代,未来在 GPU 上实时生成每个像素;他总结了 2025 年大模型的三个拐点:推理模型、Agentic 系统爆发和开源模型崛起。
解析层与检索层是决定 RAG 效果的两道坎,解析层是 0 分门槛,检索层是从 60 到 90 分的天花板;解析层因难、脏、贵而容易商业化,检索层因无标准答案而难以收费。
Anthropic 在资源明显少于 OpenAI、Google 的情况下,选择专注 Coding 场景训练模型;其核心逻辑是把可靠性前置到训练阶段,以降低长期资源约束下的返工与重训成本。
OpenAI CEO Sam Altman 称企业级市场是 2026 年重点发力方向,2025 年 B 端业务增长已超过 C 端;他预计 ChatGPT 领先优势会扩大而非缩小。
季逸超因 GPT-3 冲击放弃自研模型,选择“借力”各家最强模型;Manus 曾放弃 AI 原生浏览器,转向云端浏览器形态。
作者 2025 年离职后以 Build-Learn-Share 闭环做内容与产品,Chat Memo 自然增长到 1 万用户;文中附有年度文章自荐清单与个人方法论。
CDP 对浏览器控制有明确能力边界,tabs 管理需间接组合多个 API,快捷键需按 OS 适配;设置菜单、登录弹窗等 App 级功能 CDP 无法感知。
提出流形约束超连接(mHC)架构,将 H_res 限制在双随机矩阵流形上,合成映射增益从 3000 降至 1.6;在 3B、9B、27B 模型上测试,训练开销仅增加 6.7%。
Trae 总注册用户 600 万,覆盖近 200 个国家和地区;Builder 模式使用率 80%,Bugfix 场景占比 35%-38% 超过代码生成。
作者从 2021 年离开职场,经历三次转型,2025 年靠《AI 编程蓝皮书》起号,与 Trae 合作课程,付费会员突破 1000+;2026 年计划组建团队,聚焦 AI 编程思维教学。
DeepSeek R1 以开源权重发布,训练成本约 500 万美元;2025 年大模型开发重心转向 RLVR 与 GRPO,刷榜现象泛滥。
创业一年未倒闭,全员发 iPhone 17 Pro Max;Raphael 上线无限画板功能,支持文生图、图生图、去背景等。
Claude Code 年化收入超 5 亿美元,三个月用户量涨 10 倍;团队 90% 代码由 Claude Code 自己编写,采用 TypeScript 与 React 技术栈。
Meta 以数十亿美元收购 Manus 母公司蝴蝶效应,为 Meta 成立以来第三大收购;收购前 Manus 正以 20 亿美元估值融资,ARR 已突破 1 亿美元。
吴恩达认为中国在开源权重模型发布上已远超美国;他主张用迭代式 Agentic 工作流替代一次性提示,并建议孩子借助 AI 学习编程。
作者复盘了智能座舱文生图壁纸项目的失败经历,指出当时文生图模型在语义理解、审美和速度上均不达标;团队最终采用人工标注 30 万张图加向量检索的方案,但效果仍不理想。
嘉宾为 AFFiNE 联创 COO,曾 43 天获 1 万 GitHub star;分享内容源自其为奇绩创坛录制的《软件出海第一课》。
作者认为 Cursor 是新手性价比最高的起点,不建议小白直接用 Claude Code;强调方向比工具重要,并用 Gemini 3 Pro 做了两个电商选品智能体项目。
AI Native PM 工作流从需求挖掘到运营增长六个维度全面重构,核心是原型驱动与代码驱动;传统 PRD 退化为逻辑备忘录,交互即代码、代码即文档。
Notion CEO Ivan Zhao 以钢铁与蒸汽机为喻,认为 AI 是新时代的奇迹材料;文中称 Notion 已有 700 多个 AI 代理承担重复性工作。
Karri Saarinen 提出设计应分问题、概念、执行三阶段,先质疑问题本身;AI 时代执行变快,但定义问题与方向的能力更值钱。
pSEO 的本质是规模化信息增量,公式为模板设计×结构化内容创作×自动化;实操分三步:规划关键词簇、模块化内容生成、工程化闭环发布。
以 Notion 创始人 Ivan Zhao 的文章为引,用钢铁与蒸汽机类比 AI 对个人、组织与经济的重构;文中提到 Notion 1000 人公司活跃着 700 多个 AI Agent。
2025 年 Agent 架构收敛至 Claude Code 与 Deep Agent 为代表的通用型形态;Anthropic 于 9 月将 Claude Code SDK 更名为 Claude Agent SDK。
两位 CEO 均认为 21 岁创业缺乏客户拓展与规模化经验;Anton 指出全球仅 0.5% 的人会编程,Lovable 目标是为 99% 的非技术用户打造产品。
Demis 预计 AGI 还需 5-10 年,且需要 1-2 个关键性突破;他认为当前 Agent 尚不可靠,一年后才会接近能独立完成完整任务的水平。
Google 发布 A2UI,让 Agent 通过受限组件库安全地绘制交互界面;作者预测 Anthropic 将推出 Artifacts 2.0,补上交互层。
a16z 认为当前 AI 不算泡沫,因为企业靠现有模型按当前利润率很快能盈利;纯软件奇点难以实现,推进研发必须进行更多实验。
论文提出 GEO 方法可将内容在生成引擎中的可见性提升最高 40%;排名第五的网站使用 GEO 后可见性提升 115%,排名第一的网站可能下降 30%。
11 月出海 AI Web 端前 100 名合计约 4.4 亿次访问,App 端月活逼近四亿;字节系 App 月活合计约 1.4 亿,占榜单三分之一。
YC F25 批次 156 家公司中 83 家为 AI 公司,占比 53%;AI Agent 基础设施、垂直 AI 员工与语音 AI 成为热门方向。
Eric Schmidt 与 Graham Allison 在哈佛论坛追忆基辛格,认为 AI 变革堪比科学革命;他称 AI 生成代码能力已具革命性,人类需保持主导地位。
B 端智能体落地本质是专家知识×技术能力的乘法,缺一不可;企业采购分先买平台再买智能体和直接买项目两条路径,后者又分保守派与激进派。
OpenAI 内部 Codex 采用率超 92%,使用 Codex 的工程师合并 PR 多 70%;现场演示 12 小时从空目录重写完整项目,7 小时 200 轮迭代产出 500 行 diff。
AI 火种车团队 11 天在云南跑 1073 公里,覆盖 6 所学校、2000+ 孩子和 150+ 老师;资方撤资后华为资助解决机票住宿并援助机器狗。
ElevenLabs 基础设施团队仅 11 人,约 20 个产品团队各 5-10 人;公司已取消头衔制度,研究超三个月产品团队可自由加新模型。
李飞飞认为空间智能是具身智能的“大脑”,世界建模将带来前所未有的创造自由;她强调信任本质上属于人类,不能外包给机器。
2025 年企业 Agent 落地呈现四种形态:技术编排流、模型生态流、独立极客流、业务底座流;金蝶苍穹 Agent 开发平台支持 30+ 大模型、预置 10+ 任务流模板与 100+ 业务工具。
Wabi 定位为 mini app 集合平台,Kuyda 认为独立 Vibe Coding 必死;AI 输入法赛道火热,Wispr 4 个月融资 8100 万美元。
Skill 采用 model-invoked 三层渐进披露加载,与 Slash Command 的 user-invoked 形成对比;官方 pdf skill 通过 description 动作词与 references 拆分实现按需加载。
AI Chatbots 领域增量最大,达 10.5 亿,主要来自 Google Gemini 和 ChatGPT;出海占比 Top5 领域为办公 Agent、拍照搜题、数字人、图生视频、会议总结。
智谱开源 Open-AutoGLM,基于 ADB 与视觉大模型,内置 50 多个国民级 APP 包名映射;豆包手机发布 4 天后因大厂封禁被迫调整功能。
Mercor 估值突破 100 亿美元,ARR 达 5 亿美元;Lightwheel 从仿真数据源切入,被视为第三代数据平台候选。
V3.2 推理 Benchmark 追平 GPT-5、略低于 Gemini-3-Pro,且开源;V3 仅用 500 多万美元训练成本即达到不输 Claude 3.5 的成绩。
AI 推理市场规模 2024 年 914 亿美元,预计 2032 年达 3494 亿美元;谷歌 TPU 年产量预计 2028 年达 700 万片,推理场景性价比为 GPU 的 2-3 倍。
Pollo AI 完成 1400 万美元融资,由高成资本领投、真格基金跟投;注册用户超 2000 万,月活超 600 万,年化收入超 2000 万美元,今年 5 月已实现盈亏平衡。
对 132 名工程师和研究人员调查并访谈,员工在 59% 的工作中使用 Claude,生产力提升 50%;Claude Code 自主操作数从 10 项增至约 20 项,27% 的 AI 辅助工作是原本不会开展的任务。
推理能力追平 GPT-5-High,Speciale 版在 IMO 和 IOI 拿金牌;DSA 将注意力复杂度从 O(L²) 降到 O(Lk),后训练预算超预训练 10%。
AI 时代教育核心从答案转向问题感、模型化思维与 AI 协作能力;传统学科保留但重写大纲,课程一半为重构版学科、四分之一为 AI 素养、四分之一为项目与人生技能。
TestSprite 完成 670 万美元种子轮融资,累计融资约 810 万美元;产品通过 MCP 嵌入 Cursor、Trae 等 AI IDE,自动生成测试计划、用例、代码与自愈修正。
钱力从特斯拉离职后创业,先做男士内裤起家,后打造桌面陪伴机器人 KT2 成为 Kickstarter 众筹冠军;访谈复盘了从 0 到 1 打造爆款硬件的完整路径。
Google 论文指出,忽略生成速度时,完全生成式界面比标准 LLM 输出更受用户偏好;CopilotKit 提出声明式、混合式、完全生成式三种类型,并推出 AG-UI 协议。
AGFS 将远程服务、云存储、数据库封装为文件系统接口,致敬 Plan 9;Claude Code 用文件系统加 bash 击败复杂 embedding 索引路线。
传统 B2B 增长渠道在 AI 冲击下加速失效,生态系统飞轮成为新增长突破口;Gamma 将超一半增长归功于 KOL,ElevenLabs 仅凭 50 名员工达成 1 亿美元 ARR。
Adam 认为 1-2 年内可解决上下文适配与计算机使用瓶颈,实现大部分人力工作自动化;Amjad 提出“功能性 AGI”概念,认为当前大模型依赖海量数据与人力,未走在通往 AGI 的本质路径上。
Sandy Diao 分享 Pinterest、Meta、Descript 的增长经验,强调增长假设需结合数据洞察与用户故事;指出盲目看数据与抄袭竞品是常见错误。
黄叔复盘从写万字长文切入 AI 圈到接商单再转向 AI Coding 的历程;他认为 AI 编程渗透率不足 1%,要做教普通人搞钱的'蓝翔技校'。
谷歌确立全栈式 AI 战略,自研 TPU 芯片掌握算力主导权;Gemini 2.5pro、Nano Banana、Veo3 等模型覆盖多模态,产品生态全面 AI 化。
Surge AI 测试 9 个模型处理 150 个客服任务,GPT-5 和 Claude Sonnet 4.5 失败率仍超 40%;文章提出智能体能力金字塔框架,分基本功、适应性、抓地力、常识推理四级。
李飞飞认为世界模型是超越语言模型的下一个前沿;其公司 World Labs 发布的首款产品 Marble 可将制作周期缩短 40 倍。
用动图演示 Token、Embedding、Transformer 等 14 个 AI 术语;人脑约 600 万亿突触参数,GPT-4 有 1.76 万亿参数。
本期周报提出 AI 替代工作的三级跳路径:移民替代本土、远程工作替代移民、机器人替代远程工作;强调人写内容的核心是价值观与私有数据。
Cluely CEO Roy Lee 在 TechCrunch Disrupt 2025 分享其“传播大于产品”的创业哲学;他认为社交媒体已极端化,初创公司必须靠病毒式传播脱颖而出。
Skills 通过渐进披露机制按需加载指令、脚本与资源,避免撑爆上下文;官方明确 Projects 解决背景知识、Skills 解决流程方法,两者互补。
LeCun 计划未来数月内离开 Meta 并创办初创公司,正洽谈融资;扎克伯格已调整 AI 战略,以 143 亿美元聘请 Alexandr Wang 领导超级智能团队。
阿真分享用视觉语言描述字体效果而非具体字体名;她零基础用 Vibe Coding 几小时做出浏览器插件。
K2-Thinking 采用 fake-quantization+STE 的 W4A16 QAT 方案,post-training 阶段近乎无损;INT4 精度下完整 RL iteration 耗时减少约 10%-20%。
YC 合伙人建议 AI 创业公司进入传统行业时先找能快速落地的切入点,而非全面自动化;早期核心竞争力是学习速度,AI 工具无法替代创始人的销售能力。
将任务分为智能规划与系统化执行两个独立阶段,核心组件含智能规划、系统化执行与动态重规划;适用于复杂研究分析与创意内容生成,优势是认知负担分离,局限是规划成本高、实时响应弱。
调查 30 位欧洲 Agent 初创创始人并访谈 40+ 从业者;62% 的初创公司已利用业务线或核心支出预算,混合与按任务定价各占 23%。
OpusClip 前增长产品负责人谢君陶从获客、转化、留存、洞察四维度分享增长框架;节目还讨论了增长团队搭建、低预算 AB Test 与定价策略等话题。
论文提出 CBOW 与 Skip-gram 两种高效词向量模型,可在不到一天内从 16 亿单词数据集学习高质量词向量;向量运算可捕捉语法与语义关系,如 King-Man+Woman 接近 Queen。
提出创业竞争力公式为非共识认知乘以高质量服务,并强调高质量服务须由非共识定义;认为 AI 主动性的体现是预期违背,且大语言模型只能接收和生成语言。
OpenAI 承诺未来数年投入 1.4 万亿美元购买算力,Sam 称风险在于算力不足;微软新协议获得 OpenAI 最强模型七年免版税使用权。
多主题研究任务中模型到第 8-9 个项目时开始编造内容,源于上下文窗口的架构约束;Wide Research 通过并行子代理架构解决,每个子代理拥有独立上下文窗口。
Phota Labs 定位为用生成式 AI 重构记忆场景的品类定义者,而非传统修图工具;团队由伯克利计算摄影博士与 Adobe 背景的联创组成,已获 a16z 投资。
承诺未来几年建设超 30GW 算力、投入 1.4 万亿美元;2026 年 9 月实现实习生级 AI 研究助手,2028 年 3 月诞生完全自动化 AI 研究员。
论文提出基于 CHC 理论的十维 AGI 量化评估框架,GPT-4 得分 27%、GPT-5 得分 57%;长期记忆存储是当前最大瓶颈,两者得分均为 0%。
S&P 500 AI 板块自 2022 年 11 月以来累计回报 165%,非 AI 板块仅 24%;Mag 7 回报率从 2023 年 76% 降至 2025 年 YTD 16%,AI 剔除 Mag 7 板块回报率从 45% 升至 30%。
AJ 用 2 年时间将社区做到 800 万成员,知识库累计访问量突破 4000 万次;社区已从内部诞生 47 个创业项目。
a16z 认为视频模型进入专业化阶段,Sora 2 擅长叙事、Veo 3 擅长物理仿真;产品层仍有巨大空白,LiblibAI 完成 1.3 亿美元 B 轮融资。
Atlas 浏览器与 ChatGPT 深度打通,左侧边栏同步对话列表、右侧侧边栏支持一键全屏截图;由 Firefox 前首席开发者 Ben Goodger 带队,团队含 Arc 与苹果设计师。
累计 500 万 + 用户,月访 250–300 万,过去一年营收增长 18 倍;生成 20–30 秒、贴图约 1 分钟,空间分辨率三轴翻倍。
作者从 23 年弃用 ChatGPT 到如今每天与 AI 协作 8-10 小时,核心方法是高频实践、总结复盘迭代优化和保持探索欲;文中对比了 GPT-5、Gemini 2.5 Pro、Claude 4.5 等模型的能力差异,并分享了用 AI 写 PRD 迭代几十个版本至 3.0 的经验。
用演员类比拆解 SystemPrompt、UserPrompt、MCP、上下文工程、SubAgent 与 Skill 的关系;指出 Skill 是上下文工程从手工作坊走向工业化生产的关键抽象。
Airtable CEO Howie Liu 提出 CEO 必须重回一线亲自写代码;组织拆为快思考与慢思考双速团队,鼓励员工取消会议一周去玩 AI 产品。
嘉宾为 AFFiNE 联合创始人,分享从误区心态到获客留存的出海方法论;内容覆盖价值主张确认、早期用户获取、PMF 与本土化运营等阶段。
传统项目管理工具假设人有时间 review 所有产出,但 AI 一天能产出一个人一周的工作量;新系统按 70% 自动处理、20% 瞄一眼、10% 必须决策来过滤。
Karpathy 认为 AGI 仍需十年,当前乐观预测多为融资;他提出 AI 是模仿人类数据的“幽灵”而非演化的“动物”,并预测 AGI 将平滑融入约 2% 的 GDP 增长曲线。
AI Agent 技术基建已成熟,但体验掉队源于交互仍停留在命令式旧范式;以 Gamma Agent 为样本,提出推理大脑、执行四肢、协作面孔的三位一体模型。
从 Manus 与 HeyGen 的对比切入,分析美国对华投资禁令(反向 CFIUS)对 AI 企业出海融资的影响;Minimax 跨境版权诉讼暴露生成式 AI 训练数据的法律灰区。
Manus 联合创始人 Peak 详解 Context Engineering 五大方案:卸载、缩减、检索、隔离与缓存;Manus 采用分层 Action Space,仅用 10-20 个原子函数避免上下文混乱。
作者复盘自研虚拟人李洛云从开发到开源的全过程,指出陪伴类虚拟人存在使用频度低、召回率低、渗透率低、可替代性高等产品逻辑漏洞;情感交付受 LLM 不可控性影响,存在伦理与合规风险。
Qwen 与豆包同时内测记忆功能,支持显式记忆与用户控制;Kimi 此前已推出记忆空间,ChatGPT 去年 4 月率先上线。
作者认为 OpenAI 在 AI 理论研究与工程上最强,但 AI 原生产品能力在御三家中最弱;Sam Altman 正进行一场失败概率很高的史诗级赌博,一旦失败行业将迎来寒冬。
作者结合两年多 AI 产品实践修订 25 条核心认知,重点在「如何设计产品」;强调找到 Model-Product-Market-Fit 最关键,建议 AI 项目 0-1 阶段组成 AI native 闭环小团队。
Pavel Durov 在播客中强调自律通往自由,坚持正确之事且不惧失去;Telegram 通过限制人力迫使自动化,管理近 10 万台服务器。
Meshy 奖学金 2025 公布,大奖 1 万美元授予向剑锋与唐嘉祥,另有 8 位优秀奖各 5000 美元;作者以 CEO 视角重读 PhD,提出科研从基本功到影响力的两阶段论。
Groq 创始人认为 OpenAI 与 Anthropic 推理算力翻倍后收入一个月内几乎翻倍;自研芯片的真正价值在于拿回对命运的主导权。
OpenAI 发布 AgentKit 与 Agent Builder,被解读为对 n8n 的冲击;作者认为自动化方向明确,但传统自动化平台在非 AI 流程上仍有价值。
CB Insights 发布 69 页《AI Agent Bible》报告,提出面向 2026 年的六大关键预测;报告指出代码类 Agent 领跑商业化,Anysphere 的 Cursor ARR 达 5 亿美元。
Anthropic 官方文章的中文翻译,提出上下文工程概念,解释上下文腐化源于注意力预算有限;给出系统提示词、工具、示例三方面的优化原则。
全球 SaaS 市场年收入约 3000 亿美元,而美国劳动力市场年薪酬总额高达 13 万亿美元;软件商业模式正从按席位收费转向按结果收费。
基于 Mercury 20 万客户支付数据,OpenAI 与 Anthropic 位列 AI 应用支出前二;创意工具成最大单一类别,Replit 收入约为 Lovable 的 15 倍。
Sora 2 发布 24 小时内引爆短剧、广告、动漫、声乐等五大创作方向;OpenAI 通过独立 App 将工程能力打包,实现从玩具到工具的跃迁。
以诺齐克“体验机器”思想实验为引,将 Sora 2 与字节跳动推荐算法并置,论证二者正共同建造一台以商业利益为导向的个性化内容“体验机器”;结尾回到“是否愿意走进幸福机器”的哲学追问。
V3.2-Exp 通过 DSA 稀疏注意力将推理成本从平方级降至接近线性,H800 集群测试成本曲线斜率仅为平方级的 1/20;对比 Gemini 2.5 Pro 与 Claude Sonnet 4.5 对超长上下文加价,DeepSeek 实现了顶级模型未做到的线性成本推理。
姚顺雨在访谈中提出创业公司最大机会是设计不同交互方式,可能产生超越 ChatGPT 的超级应用;他认为语言是实现泛化而发明的工具,智能边界将由不同 Super App 共同定义。
2025 年上半年国内 AI 硬件投融资 114 起、总额超 145 亿元;Plaud 年化收入逼近 2.5 亿美元,BubblePal 累计销量超 25 万台。
黄仁勋称 AI 推理将迎来十亿倍增长,提出预训练、后训练、推理三大扩展定律;英伟达转向年度发布周期,一年内性能提升 30 倍,并强调主权 AI 与对华竞争策略。
Pulse 将 ChatGPT 从被动问答转为主动推送,被视为走向国民应用的关键一步;讨论认为其数据飞轮与个性化能力可能推动 DAU/MAU 接近微信级别。
OpenAI 首席战略官称算力不是 AI 公司真正壁垒,关键在于组织结构;Anthropic 七位联合创始人股份平等,ARR 达 72.68 亿美元,人效 1154 万美元 / 人。
ChatGPT Pulse 能基于用户聊天记录与日历等外接应用主动研究并在适当时机推送服务;作者据此提出「主动感知型智能体」概念,包含全域感知、记忆、异步思考、自主行动与主动打断五个要素。
核心模型为 Gemini 2.5 Flash-Lite,通过 UI 章程与 UI 交互 JSON 驱动界面即时生成;系统利用流式输出与生成式 UI 图谱实现渐进渲染与状态保持。
吴泳铭提出通往 ASI 的三阶段路线:智能涌现、自主行动、自我迭代;阿里云将推进三年 3800 亿 AI 基础设施计划,2032 年能耗规模较 2022 年提升 10 倍。
Palona AI 90% 代码由 AI 编写,20 人团队无全职 PM;任川从工作流、人才、组织三维度总结 AI Native 团队实操经验。
团队认为图像质量提升空间有限,下一步重点是让模型理解用户意图;用户最常提的需求是更高分辨率、透明背景和更好的文字渲染。
从提示工程到上下文工程的范式升级,强调提问与判断两大元能力;AI 能生成提示词但无法替代个人风格。
ChatGPT 流量转化率比谷歌搜索高 6 倍;早期初创公司可通过落地页、YouTube 视频和 Reddit 评论在 AEO 中快速获胜。
ReAct 通过思想-行动-观察循环将 LLM 从内容生成器提升为任务执行器;Plan & Execute 与 ReWOO 通过静态计划与变量传递降低 Token 消耗,但牺牲了实时适应性。
LayerX 以每半年一款的速度扩充 Bakuraku 系列,SmartHR 已拥有约 18 款产品;两家公司均以客户反馈驱动多产品扩展,并采用分阶段部署与交叉销售策略。
追踪的 500 个 Product Hunt SaaS 项目 8 个月后 97.4% 失败,仅 13 个盈利;幸存者共同点是开发前已有付费客户。
报告预测到 2030 年训练前沿 AI 集群成本将超 1000 亿美元,需数吉瓦电力;AI 将在软件工程、数学、分子生物学和天气预报等科研领域带来变革。
NoteBookLM 三栏结构源于上千次迭代,Audio Overview 助其月访问量半年增长 56% 至 4800 万;产品坚持克制,不堆砌功能。
截至 2025 年 7 月全球约 10% 成年人使用 ChatGPT,周用户 7 亿;非工作类消息占比升至 70% 以上,实用指导、信息查询和写作三类占全部对话近 80%。
StarterStory 统计显示,独立创客年营收多集中在 5 万至 25 万美元区间,软件赛道占比 22.2% 居首;2014 至 2023 年,1-10 人小团队占比从 38.8% 升至 62.5%。
报告显示 Claude 自动化任务占比首次超过增强型协作,从 49.1% 对 47%;教育类任务占比从 9% 涨至 13%,管理、金融类任务占比下降。
AJ 分享 WaytoAGI 从个人文档生长为 900 万人社群的过程,强调无目的性与轻量化运营;37 城同步线下活动与东京千人大会均靠成员自发协作完成。
大观资本自 2015 年起 All in 出海赛道,现聚焦 AI 应用层与中间层;短剧、SaaS、跨境电商是当前热门赛道。
MCP 是有状态的协议体系,包含 Host 与 Registry 两部分,基于 JSON-RPC 2.0 并支持 Stdio 与 SSE 传输;与无状态的 API 在上下文管理和工具发现上存在本质区别。
少卿提出预见 UI 概念,主张用 GUI 的确定性承接 CUI 的自由度;AI 将扮演超级 OS 角色,实现全局感知与主动服务。
官方指南强调工具数量宜少而精,将相关功能打包并用参数区分;返回结果应使用自然语言描述而非代码或 ID,并考虑 Token 消耗提供简洁与详细两种模式。
即使 temperature=0 采用贪婪采样,GPU 并行浮点运算的微小误差仍会导致 LLM 输出不稳定;文章据此给出多次采样投票、CPU 推理、结果后处理等应对策略。
Vibe Coding 与低代码平台在维护调试、稳定性、Token 焦虑和门槛四方面存在核心差异;顶级 Vibe Coder 实际会在脑中先做工作流编排再让 AI 执行。
GEO 旨在让品牌信息被生成式 AI 直接采纳并整合进回答;与传统 SEO 相比,GEO 从追求链接排名转向成为 AI 答案的一部分。
GEO 与 SEO 的核心差异在于从关键词转向用户问题,AI 更看重内容权威性与数据;Reddit 纯人工有机运营账号封号率不低于 10%。
UGC 视频转化率比品牌内容高 102%,点击率是专业广告的 4 倍而单次点击成本低 50%;Sandy Diao 给出从寻找创作者、白名单授权到 AI 工具补充的完整执行策略。
硅谷共识从 Scaling Law 转向 Token 消耗量,7 月环比增长超 20%;GPT-5 被视为 AGI 预期修正的转折点,转向全栈能力与效率比拼。
BAI 资本合伙人汪天凡在访谈中提出 AI 投资四大方向:媒体颠覆、产业改造、中国优势、一人公司;并给出「野心家、小天才、好学生、大坏蛋」的创始人光谱。
讯飞晓医 C 端去年未产生直接收入,G/B 端政府与区域医疗平台采购贡献 3.9 亿元;京东健康 2024 年总收入 582 亿元,净利润 47.9 亿元。
通过自然语言对话即可生成生产级前后端代码,技术栈为 React、TypeScript 和 Tailwind CSS;2.0 版本新增多人协作、安全扫描与自定义域名功能。
提出以上下文工程为核心的 Human-in-the-Loop 开发范式,主张用 Obsidian 管理战略上下文、Cursor 执行战术编码;指出 Vibe Coding 仅适用于原型,严肃产品开发需人机协同。
将个人成长类比为提示词工程,主张用思维链、怪诞提示词等 AI 技术反向管理自身认知;正文给出自我提示、多智能体、函数调用、湿件维护四层框架。
训练 GPT-4 级模型成本超 1 亿美元,需数万块 H100 GPU;OpenAI、软银、甲骨文启动 5000 亿美元星际之门计划。
将上下文工程归纳为写入、筛选、压缩、隔离四类模式;指出过长上下文会引发投毒、干扰、混淆、冲突四类性能问题。
Brian Balfour 预测 ChatGPT 将在未来 6 个月进入平台增长周期阶段 2,成为堪比 App Store 和 Facebook 广告的分销渠道;文章给出初创公司 All in、成熟公司多点下注及以始为终的行动建议。
OpenAI 从 GPT-1 到 GPT-4 逐步走向闭源,以安全与成本为由限制访问;Meta 开源 LLaMA 后社区衍生出 Alpaca、Vicuna 等版本,谷歌内部文档承认开源已追上闭源。
百万级上下文窗口存在投毒、干扰、混淆、冲突四类失效模式;伯克利函数调用排行榜显示提供超过一个工具时所有模型表现均变差。
谷歌 2022 年报告显示,三位数加法正确率在参数量突破约 130 亿时从 10% 跃升至 90% 以上;训练 GPT-3 花费约 1200 万美元,GPT-4 估计约 7900 万美元。
作者以两年实战经历对比三平台,认为 Coze 是产品化 Bot 工厂、Dify 是工程化平台、n8n 是图灵完备的底层画布;从定位、灵活性、易用性、生态四个维度展开分析。
BVP 研究 20 家高增长 AI 创业公司,提出超新星与闪耀星两类增长范式,新基准 Q2T3 取代 T2D3;报告预测生成式视频 2026 年爆发,企业级 AI 评估与数据溯源成为刚需。
FlowSpeech 发布后 MRR 增加 3 倍,ARR 突破一个小目标;演讲提出用显著收益、人群增长、自带传播三标准判断正确问题。
好提示可让模型准确率从 0% 升至 90%;少样本、任务分解、自我批评、附加信息、集成五种技术仍有效,角色提示与奖励威胁已失效。
Context Engineering 关注如何为 Agent 动态组装上下文,而非单次 Prompt 技巧;Manus 联合创始人提出围绕 KV 缓存设计、避免动态增删工具等六条实践。
提出橙汁理论区分“真实”与“真相”,并以火鸡归纳困境说明大数据局限;引用多伊奇猜想论,给出好猜想的三个标准:难以篡改、可以检验、解释深度。
GPT-5 统一入口并大幅降价,API 输入 1.25 美元 / 百万 tokens;OpenAI 与 Anthropic、Google、Meta、字节等巨头在 AGI 路线上分道扬镳,转向可用性与渠道竞争。
Claude Code 上线 5 个月实现年化 4 亿美元营收,Anthropic 大部分代码由其编写;负责人 Boris Cherny 详解终端设计哲学、工具使用与 claude.md 记忆系统。
从打孔卡到 AI 助手的编程史梳理,重点讲解 Vibe Coding 概念与 AI 理解编程意图的原理;AI 通过分析开源代码与项目上下文,感知程序员风格并生成贴合架构的代码。
LeCun 认为传统 AI 缺乏对物理世界的直观理解,提出世界模型概念;Meta 的 I-JEPA 用 16 个 A100 GPU 在 72 小时内训练出 632M 参数模型,效率提升 2-10 倍。
14 岁辍学,靠两款 VR 游戏年入 500-600 万美金;新 AI 产品 Proactor 于 7 月 8 日发布,视频获 62 万访问量。
Meta 向顶尖 AI 研究员开出 4 年 3 亿美元薪酬包,某专家收到 12.5 亿美元 /4 年报价;全球日均手机使用时长 5.2 小时进入平台期,巨头转向争夺存量时间。
OpenAI 通用大模型在 IMO 2025 题目上六题做对五题,获金牌级成绩且未针对数学优化;戴雨森认为数学推理比编程更难,AI 解 IMO 证明题意味着理工科知识生成方式可能改变。
Anthropic 以 32% 份额超越 OpenAI 成为企业大模型市场新领头羊;企业模型 API 支出半年翻倍至 84 亿美元,开源模型采用率从 19% 降至 13%。
MCP 由 Anthropic 于 2024 年推出并开源,旨在标准化 LLM 与外部工具、数据源的连接;采用客户端-服务器架构,由主机、客户端、服务器三部分组成。
Vibe Coding 本质是以 AI 速度堆积技术债,适合原型与一次性项目;长期维护项目需像管实习生一样用短绳拴住 AI,强调放慢、防御与偏执。
AI 模型可完成任务的时间跨度约每 7 个月翻一番;通往人类级智能需补齐知识、记忆与监督三大支柱。
Anthropic 研究发现模型蒸馏中存在“潜意识学习”,教师模型的隐藏特性会通过无关数据传递给学生模型;当师生模型来自不同架构家族时该效应失效,可作缓解策略。
微软与卡内基梅隆大学论文指出生成式 AI 会削弱批判性思维;作者提出 AI 驾驭者与 AI 乘客的分野,并给出六条成为驾驭者的方法。
辛顿在 WAIC 发表《数字智能是否会取代生物智能?》演讲,用“养老虎”比喻警示超级智能风险;百度曾以 4400 万美元竞拍辛顿团队未果,后培养出 Anthropic CEO 等 AI 人才。
从 ELIZA 讲起,梳理 Agentic AI 五阶段进化谱系;核心是思考-行动-观察循环,并对比 ReAct 与 Reflexion 框架。
Agentic RAG 将复杂问题拆解为子问题并迭代检索、交叉验证;核心组件包括查询规划器、迭代检索器和信息综合器。
Dify 采用 Python/Flask 集成化架构,Coze 基于 Go 微服务拆分为 Studio 与 Loop 两项目;Coze 模块化利于大型企业独立扩展,Dify 一体化适合中小团队。
报告基于近 150 个深度访谈与多家头部企业调研,梳理出 AI Coding 在七个方向上的非共识;AI Coding 公司正以极小团队规模快速达到千万至 5 亿美元 ARR。
用餐厅比喻拆解前后端、API 与软件开发全流程;按四代演进梳理对话式 AI、代码助手、AI 原生 IDE 与全栈式开发平台。
以训马师蒙蒂·罗伯茨的故事类比 AI 对齐,讲解 RLHF 与 DPO 两种偏好学习方法;讨论价值观多元性、对齐陷阱与过度限制的平衡问题。
RAG 通过知识库构建、向量化存储、相关性检索和增强生成四步让大模型从闭卷考试转向开卷考试;嵌入模型与向量数据库(如 Pinecone、Milvus、Faiss)是核心技术支撑。
Manus 押注上下文工程而非端到端训练,将发布周期从数周缩至几小时;KV 缓存命中率是生产环境最关键指标,Claude Sonnet 命中与未命中缓存成本相差十倍。
上下文工程取代提示词工程成为行业共识,核心是为 AI 搭建包含记忆、外部资料与工具的工作环境;上下文窗口从几千词扩展到百万 token,企业可用低成本接入知识库替代微调。
提示词 =指令 + 上下文,上下文比指令更重要;上下文窗口是 AI 的短期记忆容量,智能体中记忆与工具的本质是为 LLM 提供决策上下文。
多模态 AI 训练分三步:单模态预训练、模态对齐(如 CLIP 的 4 亿图文对配对训练)、多任务指令微调;对齐是核心挑战,高质量多模态指令数据稀缺。
梳理了 GPT、Gemini、Claude、DeepSeek、豆包、通义千问等主流模型的适用场景;给出按网络、价格、速度、上下文长度四个维度选择模型的方法。
以尼采“上帝已死”为引,将 AI 比作“合成神”,探讨其作为非人代理的创造力与主权特质;展示《人机共著图谱》《逻辑幻想机》《异形体》等艺术项目,论证 AI 从工具转向本体论建构者。
CLI 是计算机交互的母语,AI Agent 用 CLI 执行任务比模拟 GUI 点击更高效;GUI 是预定义的,无法应对非预设的复杂意图,AI 时代应从学会使用工具转向学会表达意图。
2025 年 AI 绘画平台分对话、webui、comfyui 三类,模型分平台自有与开源两类;司法实践已有春风案、伴心案、透明艺术椅案三个判例,均认可体现人独创性投入的 AI 图片受著作权保护。
Notion 创始人 Ivan Zhao 在京都 IVS 2025 分享,将 AI 开发比作酿酒而非造桥;Notion 仅用一个月发布首个 AI 产品,并因京都工艺文化重塑产品理念。
文心 4.5 系列开源含 10 款模型,旗舰采用 4240 亿总参数多模态异构 MoE 架构;在 28 个基准测试中的 22 个上超越 DeepSeek-V3-671B-A37B-Base。
高考志愿报告 Agent 上线不到一个月生成超 1000 万份报告,峰值并行处理 250 万份任务;数据侧覆盖 8657 个权威站点、21.3 亿网页。
Cognition AI 主张默认采用单线程线性智能体,强调共享完整上下文轨迹;Anthropic 与 LangChain 则从不同角度探讨多智能体系统的适用场景。
从生物智能演化、计算架构演进和人机关系三个角度梳理 AI Agent 的能力、技术架构与软硬件形态;提出模型底座—Agent 操作系统—垂直智能 Agent 的三层架构路径。
AI 在计算、记忆与模式识别上占优,但缺乏真正的创造力、情感共鸣与道德判断;5 岁儿童创造力测试 98% 达天才水平,成年后仅剩 2%。
报告预测颠覆式创新将占全球经济三分之二,六大科技巨头影响力进一步提升;作者认为通用型 Agent 企业没有出路,垂直领域 Agent 短期更有前景。
Shopify CEO 与 Karpathy 提出以“上下文工程”取代“提示工程”;Anthropic 多 Agent 隔离上下文比单 Agent 性能高 90.2%。
纳德拉称 AI 是继客户端-服务器、互联网、移动云之后的第四次平台革命,须以社会与经济盈余换取能源消耗的社会许可;他认为变革管理是 AI 部署的最大瓶颈,软件工程师将演变为软件架构师。
作者提出四步学习工作流:判断价值、阅读思考、与人和 AI 讨论、实践复盘;强调 AI 提供多维度视角,人提供经历后的思考,AI 与人应是协作关系。
AI 将普通程序员生产力提高约 56%,普通写作者效率提升超 37%;长期使用 AI 创作的用户创造力感知会显著下降。
提出软件 3.0 范式,以自然语言为程序、由 LLM 驱动;主张构建半自主产品而非完全自主代理,并建议为 Agent 重构基础设施如 lms.txt。
AI 幻觉分为信息冲突型与无中生有型两类,根源在训练数据质量与对齐过程;文中给出数据清洗、对齐等应对策略。
通用 Agent 市场是大模型公司主战场,创业公司机会在垂直领域;Coding 是衡量 AGI 最关键的先验指标,可能拿走大模型产业阶段性 90% 的价值。
Cognition 认为多智能体架构弊大于利,推荐单线程线性设计;Anthropic 则用主控-工作者模式在开放性研究任务中取得更好效果。
DeepSearch 被定义为智能信息预处理增强技术,核心是迭代式搜索-阅读-推理循环;火山引擎通过 MCP 方式落地并开源 deep_search_mcp 项目。
Codex 模型与 o3 同源,通过额外强化学习微调以对齐专业工程师的品味;OpenAI 认为未来最高效的编程模式是异步自主 Agent,开发者将任务委托给云端 Agent 而非实时结对。
Zara 提出完整看完长干货视频、跟随 Builders 而非 Influencers 的输入方法;黄叔实践后总结出学习-实践-链接-输出的闭环框架。
报告共 340 页,指出 AI 技术变革速度远超互联网时代,ChatGPT 两年达到 3650 亿年搜索量而 Google 用了 11 年;OpenAI 年化收入 92 亿美元、估值 3000 亿美元,收入倍数 33 倍。
flowith 团队仅 10 人,成员多为 95 后与 00 后;Neo 主打无限步骤、无限上下文与无限工具,发布后登上 B 站热搜第一。
YouWare 上线次日即获近 4000 个用户上传项目;明超平认为 AI 产品应最大化利用智能红利,追求 value per token。
Anthropic 内部超 70% 的 Pull Request 由 Claude 生成;MCP 最初由两名工程师在集成 Google Drive 和 GitHub 时自发原型验证而来。
员工平均每天浪费 47 分钟找资料,相当于每年损失 19 天;智能知识中枢可将跨部门沟通从 3 次降至 1 次、响应时间从 8 小时缩至 5 分钟以内。
王坚在 BEYOND EXPO 提出计算本质是能力延伸,三体计算星座已发射 12 颗卫星实现 3000 公里稳定通信;他认为 AI 应用创新关键在于发现模型能力,而非纠结 AGI 定义。
Lilian Weng 系统梳理 test-time compute 范式,涵盖思维链、强化学习与外部工具使用;文章末尾提出 reward hacking、CoT 忠实性等开放研究问题。
MCP 由 Anthropic 提出,面向结构化上下文注入;ACP 由 IBM 提出,面向本地低延迟环境。
从大型 SaaS 被忽视的痛点或外包平台重复发包中挖需求,Bank Statement Converter 靠单一功能做到月入 3 万美元;旧金山 AI 创业者分 VC-backed 与 Bootstrapped 两类,Commons 等社区提供从-1 到 0 的孵化支持。
视频 Agent 能批量理解素材、自动剪辑并 AIGC 补全,帮普通人把零散照片视频重组为完整回忆;作者以 B 站 227 万播放的《One Last Kiss》Vlog 为例,认为其意义在于唤醒个人记忆与情感连接。
Workday CEO 主张将 AI 定位为增长引擎而非成本杀手,并推行全员 AI 培训;公司发布 agent 系统记录产品,统一管理人类与数字工作者。
施密特在 TED 断言 AI 红利窗口只剩 3 年,算力成本 2028 年前再降 10 倍;他提出 AI 正从对话工具变为流程系统,企业红利属于敢交出流程的人。
OpenAI 预测 2025-2027 年 AI 将从 Agent 进入 Innovator 阶段,可自主发现新知识;AI 科学家系统每篇论文生成成本不到 15 美元,质量接近顶会水准。
以相册搜图为例,对比 iOS 相册与 Google Photo 在召回率与精确率上的取舍,主张 Google 的召回率优先更合理;提出更好的设计是首屏精确率优先、后续屏召回率优先。
AI 搜索生成内容若与原创表达构成实质性相似即构成侵权,AI 不能成为抄袭的挡箭牌;「拼好文 2.0」通过 AI 改写多篇原文,使传统版权监测失效,但实质内容未变仍属抄袭。
E2B 为 AI Agent 提供沙盒执行环境,支持代码解释、强化学习与桌面操作;沙盒是 Agent Infra 的关键基础设施,多家云厂商与操作系统厂商正积极布局。
GPT-4o 于 2024-05-13 发布,API 价格比 GPT-4 Turbo 降 50%;2025-03-25 内置原生图像生成,支持精准文本渲染与多轮对话编辑。
a16z 预判 AI 时代开发逻辑被重写,提出 9 个新范式;核心转变包括意图驱动的版本控制、AI 驱动的动态仪表板、文档成为交互式知识库。
红杉第三届 AI 峰会闭门 6 小时,150 位创始人达成共识:AI 不再卖工具而是卖收益;Sam Altman 给出 2025-2027 年 AI 代理、发现新知识、进入物理世界的路线图。
2 个月涨粉 1 万 +,5 篇文章阅读过万;分享基于《高效能人士的七个习惯》的“双杠杆”实践心得。
Gemini 2.5 Pro 05-06 版在 WebDev Arena 登顶,力压 Claude 3.7 Sonnet;支持将 YouTube 视频直接生成可视化网页,目前仅 AI Studio 可用。
作者以写作、代码、医疗三个场景复盘,得出 AI 效果取决于人的认知深度;认为想熟练掌握技能仍需亲自学习,AI 只能帮人抵达普通基准线。
李继刚提出提示词本质是改变模型能量路径,分结构化、压缩式、共振式三种写法;他认为 AI 默认按训练河床回应,需引导其跳出平庸。
Agent 定义采用 Anthropic 版本,即模型基于环境反馈使用工具的程序;Tool Use 方案分代码派与视觉派,MCP 统一了调用标准,A2A 被视作大厂争夺话语权的产物。
Bolt 两个月冲到 2000 万美元 ARR、超 200 万用户;文章拆解透明度、引导式输入、互动性、可预测性、无缝集成五大设计秘诀。
Fellou 定位为全球首款 Agentic Browser,但作者认为其本质是本地运行的 AI 代理而非浏览器;作者提出用户 Profile、Preference、情境理解三要素与预见 UI 是 AI 产品基础,Fellou 通过本地运行与自动鉴权间接构建了这些要素。
Agent 本质是 LLM + Tools,模型本身无状态、靠外部上下文模拟记忆;Anthropic、OpenAI、Google 对 Agent 定义尚未达成共识。
用大白话和图示解释 20 个 AI 术语,涵盖 ReAct、Agent、RLHF、MoE 等概念;正文含思维树代码块示例。
华科团队综述 MCP 核心组件、工作流程与服务器生命周期,并分析各阶段安全风险;Anthropic、OpenAI、Cursor 等已集成 MCP,社区平台提供数千个服务器。
提出以角色对话为核心的 Chat-as-OS 交互框架,划分主持与自动两种群聊模式;交互基于预见 UI 理念,支持跨群消息流转与角色主动发消息。
AI 降低了产品执行门槛,但同质化泛滥,品味成为区分平庸与优秀的关键;品味体现在简洁、识别真问题、远见与整体和谐,并以 Notion、Arc Browser、博朗为例。