一篇讲透 Agent 自进化飞轮怎么搭:评测→记忆→落地→控制
提出评测→记忆→落地→控制四齿飞轮方法论,强调评测可信度优先于系统复杂度;Harness 层自改进实测迭代次数减少 70%、Token 消耗降低 80%+。
提出评测→记忆→落地→控制四齿飞轮方法论,强调评测可信度优先于系统复杂度;Harness 层自改进实测迭代次数减少 70%、Token 消耗降低 80%+。
知识生产 99.7% 由流程自动沉淀,6 月新增踩坑卡片 716 条;需求交付从天级压到小时级,代码审查轮次从 2-4 轮降到 1.1 轮。
提出确定性、Rubric、人工三类评分器组合的测评框架,覆盖功能、过程、效率、鲁棒性、体验五维度;已在 TPerf 性能平台智能分析 Agent 项目中落地验证。
Skill 本质是结构化 Prompt Engineering,物理上为含 SKILL.md 的文件夹;Anthropic 采用三级渐进式加载机制,Level 1 常驻约 50-150 Token。
OpenClaw 采用 TypeScript 微内核架构,以 Gateway 为中心,支持 20+ 通道插件接入;Hermes 核心仍为单体,记忆管理半自动,两者各有取舍。
DeepSeek-V4 预览版上线并开源,Pro 为 1.6T 参数稀疏激活 49B,Flash 为 284B 参数稀疏激活 13B,均默认 1M 上下文;架构上引入 mHC 多流约束残差连接,解决超长上下文下标准 Transformer 的容量、路由与深度瓶颈。