月合 2000 PR:米其林厨房与 Agent 友好仓库
Lauren Tan(Potato)· 约 38–41 分钟演讲 · 完整学习整理
Lauren(Potato)讲她如何把 verification、skill、仓库硬约束与 GrokBot 外环叠在一起,爬上高信任,从而出现「上月约 2000 个生产 PR」的吞吐。推文常夹带求职/$850k 包装;正文按演讲内容细读,不把营销句当成口述事实。
吞吐来自信任,信任来自环境:verification(CLI + feature map)证明正确;PStack 教高质量做法;Dune 把捷径焊成正道;GrokBot 外环把 Slack/Sentry 等信号自动交给 cloud agents。人从肉瓶颈变成园丁。
这场是谁、谈什么
- 形式
- 约 38–41 分钟演讲(X 视频约 41 分;同源讲稿约 38 分)
- 来源
- X · sheemamoto 推文视频
- 演讲人
- Lauren Tan · Potato(带 e)· 做 Grok Bot @ SpaceX AI
- 论点
- 把 agent 环境设好 → 个人/团队像高产出厨房,而不是盲刷会话
- 主隐喻
- Michelin kitchen(明确不喜欢 software factory 当主标签)
- 主线
- trust · verification · Control Glass · feature map · PStack · 五层约束 · Dune · gardener · GrokBot 外环
- 关键数字
- 上月约 2000 生产 PR(非 initially 目标)· 入职约 6 个月旅程
部分转发热帖写「数百份简历 / 开价 $850k / 20–30 agents」。那是剪辑包装,不是本讲逐字内容。本页只保留演讲里可核对的机制与数字(含 2000 PR、Michelin、Dune、外环)。
密时间轴(按讲稿结构)
时间轴按论证块,不伪造精确秒点。
- 开场2000 PR 与信任不在时也要信 agent 产出高质量
- 隐喻Michelin kitchen对人仍负责最终菜品;刀具/编制/训练决定结果
- 故事Agents window 性能入职 Cursor;PR 墙;人手看 DevTools
- 转折我是瓶颈把工程知识灌进 agent 队,而不是永远亲自取证
- 阶段1–5 agents最难爬出:不在场就做错;无信任就别开 100 个
- 验证谱skills → 形式化CDP/trace 可走很远;Lean/TLA+ 仍开放难题
- Control GlassCLI + 取证skill 目录内固定 CLI,禁止每次重写脚本
- Feature map物化记忆模糊截图可导航;自动化维护地图
- 质量层PStack调试/功能/原型 playbook;正确 + 高质量
- 约束梯五层仓库 > 静态分析 > rules/Bugbot/skills > 文风(最弱)
- Dune捷径=正道为人烦、为 agent 友好;禁注释防「注释合理化敷衍」
- 园丁gardener早期掐掉反模式病毒;lint 先止血再清理
- 外环GrokBotconnectors + routines → 自动拉起 cloud agents
- 收束纠偏优先序先让错误不可能 → lint → 再叠软规则/skill
论点:环境决定吞吐,隐喻选厨房
主张: 若把 agent 的环境设得足够好,产出可像个人或团队级「软件工厂」——更高质量、更高速率。
但她立刻改口: 不喜欢 software factory。更贴的是 Michelin kitchen:
- 技术工作仍有创造性,不是流水线量产。
- Agent 时代你可能不再亲自「切菜」,但仍对最终菜品负责。
- 编制(line cook / sous chef / dishwasher 比例)、设备、训练,决定能不能稳定出菜。
厨房隐喻的重点不是浪漫,而是 setup:刀具、分工、训练不到位时,加人(或加 agent)只会更乱。
起源故事:人手性能工作 → Verification
入职约 6 个月前(Cursor,并入 SpaceX AI 之前):无现成 agent skill。任务是支援 agents window(IDE 替代方向)性能。PR 落地极快,她无法判断是否在回归。日常:Chrome DevTools、performance trace、heap snapshot——极度手工。
挫折点:「我们有 agent,我在干什么?」于是做 verification skill:让 agent 自己跑应用、采 trace、找热点,并对着指标 hill climb。
她强调:从未以「每月 2000 PR」为目标。技能、工具、仓库改造事后都归到同一主题——trust:自己是瓶颈;要把工程师知识灌进 agent 队,停止处处挡路。
低信任区:1–5 个 agent 为什么最难爬出
早期阶段特征:
- 每个会话都要 babysit、纠偏。
- 人不在,事情停或做错。
- 想跳到约 100 个 agent / cloud agents,但信任不足 → 结果是 slop PR、回归、bug。
没有信任时并行放大,只会制造更贵的垃圾。先修信任机制,再加并行度。
Verification 光谱:从 CDP 到形式化
| 端 | 含义 | 可达性 |
|---|---|---|
| 低端(可立即做) | Verification skill:跑应用、CDP、trace、heap | 大多数团队;她认为已能走很远 |
| 高端(开放题) | 形式化:Lean、TLA+ 等,证明业务不变量 | 很难;很少人真正拥有 |
正确性定义:功能是否做了你要的事(结账按钮是否真结账)。Verification 给经验证据。它不自动等于性能品味或代码质量——后者要另铺 skill。
Control Glass = CLI + Feature map
第一款 skill:Control Glass(经 CDP 跑 agents window 并取证)。迭代后固定两块:
CLI(放在 skill 目录内)
- 目标:可重复跑应用、采证据、对照性能门槛。
- 禁止每个 session 现场造脚本(不一致、费上下文)。
- 要持续投资,覆盖真实用例。
Feature map(她命名;像 sitemap 的物化记忆)
- 触发:Slack 来一张含糊截图 + 三个问号;agent 能跑应用却不懂用户指哪。
- 内容:有哪些功能、如何到达、快捷键、点哪个 DOM、功能做什么。
- 存在 skill 目录;有自动化维护。
- 与 CLI 组合后:既能控应用,也能理解内外用户请求。
结果:verification 变成团队关键基础设施,持续维护。
PStack:正确之外还要「像好工程师」
Verification → 正确性。高质量还要:调试、做功能、做原型等 playbook。PStack(Potato Stack)是她的 skill 集合;资深工程师应共建团队 skill 库。与 verification 叠用:既证明做对,也证明做得像样;并可收集真实性能遥测。
五层信任环境(强 → 弱)
她给出连续统。推荐投资顺序:越硬越优先。
- 1 仓库 / 架构
- 最佳记忆;agent 爱扩展已有模式;让坏法变得不可能
- 2 静态分析
- lint、编译诊断、CI;重复犯错 → 加规则或改结构
- 3 Rules / Bugbot / Skills
- 常被遵循,也可被忘记或被驾驶者忽略
- 4 (同层软引导)
- 与上一项同属 guidance,非硬红
- 5 Style guide
- 几乎只靠人审;高 PR 速率下不可扩展
只靠文风与人肉评论 = 流程大洞。人审适合发现缺口,不适合当唯一执法。
仓库是 agent 的 memory:它读到什么模式,就倾向复制什么。反模式会像病毒扩散;好模式也会。
Dune:为人锁死、为 agent 铺路
Dune = GrokBot 的 agent 友好客户端框架。灵感来自 agents window 性能坑。核心原则:
Agent 爱抄近路 → 把容易走的路设计成正确的路。
对人可能「很烦、很锁」;对上下文很少的 agent(以及设计/PM/CEO 驾驶的 agent)反而合适。
反模式病毒与禁注释
小 workaround 或「解释性注释」会被 agent 复制;几天到几周可变成默认模式。更糟:agent 用注释合理化「为什么不修根因,只打补丁」。Dune 禁止代码注释,挡住这条传播路径。
Gardener(园丁)角色
每个团队需要有人早期识别杂草/虫害(反模式),在扩散前掐掉。Dune 三原则:
- 删已有技术债(减少可复制坏样板)。
- 单一铺好的路(blessed path):一事一法;CI/lint 引导走上它。
- 见坏模式先写 lint 止血——不必总能立刻清完;先停止扩散,再让 agent 清理。
心智模型:保持仓库处于「你乐见 agent 复制」的状态。
结构例子
- Feature 共置单目录;entry point(类似路由);transcript cards;host(VM)与 client 分离。
- Electron:main 与 renderer 严禁混用(agents window 曾把慢代码误导入 renderer)。
- 渲染预算:60 FPS → 每帧约 16ms;120 FPS → 约 8ms。用 import 依赖图硬执行边界。
主题不是「必须用 Dune」,而是:自建 agent 友好框架,把部落知识从人审评论抽进仓库记忆。
外环:GrokBot × Cursor
GrokBot 擅长 outer loop:接 Slack、DataDog、Sentry、PlanetScale 等,汇总后决策。有人叫 company brain;她认为不必神化——agent 本来就会用工具。
机制:
- GrokBot routines:订阅 Slack 线程、Sentry 告警等,自动触发。
- 自动拉起 cloud agents。
- 再叠加 Cursor automations / SDK,复用同一套 agent 基建做更复杂任务。
仓库 + rules + skills 与外环复利:自动复现 bug、自动开 PR,价值落到整队。她再次划掉 software factory,改称个人 mission control kitchen。
纠偏优先序(只带走一张幻灯片)
每当你发现自己在纠正 agent,按此顺序选最有效的一层:
- 改仓库 / 架构 / 数据结构 → 让该错误范畴上不可能。
- 加静态分析(lint / CI)。
- 再叠 rules、Bugbot、skills。
- 并用质量向 skill 教「如何像好工程师工作」。
做完后,你信任的是环境,agent 才能「自由」。她说这不是秘密,是大量苦工;GrokBot 仓库是她亲投下的例子。联系:X @potato(带 e)。
原话意译(高信息密度)
- 上月合入约 2000 个生产 PR;能力来自「我不在时仍可信」。
- 不喜欢 software factory;更像米其林厨房——你仍对最终菜品负责。
- 早期性能工作全靠人手 DevTools;我才是瓶颈。
- Verification:让 agent 自己跑、自己采证、对着指标往上爬。
- 1–5 个 agent 的 babysit 阶段最难爬出;无信任勿开 100 个。
- 无信任的云端并行 = slop PR 与回归。
- Verification 有光谱:CDP skill 可走很远;形式化仍难。
- Control Glass 要固定 CLI,不要每个会话重写脚本。
- Feature map 是物化记忆;否则模糊截图只能瞎猜。
- 正确性 ≠ 质量;PStack 教像工程师一样工作。
- 仓库是最佳记忆;agent 默认扩展所见模式。
- 重复犯错 → lint;更好 → 让错误变得不可能。
- 只靠 style guide 人审,在高 PR 速率下会垮。
- Agent 爱捷径 → 把捷径设计成正道(Dune)。
- 反模式像病毒;注释可变成「不修根因」的借口,故禁注释。
- 团队需要园丁:先止血(lint),再清理。
- 把部落知识从评论区抽进框架,让仓库成为可复制的好快照。
- GrokBot 做外环:routines 订阅信号并拉起 cloud agents。
- 不需要神话公司大脑;接好工具就会用。
- 纠偏时优先让错误不可能,而不是再写一条软规则。
可执行 takeaways
- 把 verification 建成带 CLI 的 skill。 做对:不同 agent 取证路径一致,不再现场造脚本。
- 加 feature map + 自动维护。 做对:含糊截图能变成可复现路径。
- 正确性与质量分开投资。 做对:有 verification 证据,也有工程 playbook(如 PStack)。
- 按五层从上到下加固。 做对:重复人审评论下降;同类错误变 CI 红或根本写不出来。
- 见反模式先写 lint 止血。 做对:坏样板停止扩散,再安排清理 PR。
- 设计单一铺好路径。 做对:新 agent / 非工程驾驶者也默认走上同一结构。
- 审视「无害」模式(如注释)是否在被复制成敷衍。 做对:合理化补丁的借口变少。
- 指定园丁职责(人可轮值)。 做对:杂草在早期被发现,而不是月后成林。
- 用 GrokBot routines 接外环,再踢 cloud agents。 做对:Slack/Sentry 类信号减少人手渡船。
- 纠偏时先问能否让错误不可能。 做对:规则文件不必无限变长,仓库形状在替你执法。
同属 Lauren 线索:本页偏「2000 PR + 厨房 + 五层约束 + 外环」完整演讲;另一篇直播问答更展开 trust curve、eval、auto-merge 现场数字。可对照读,不必当成同一场录像。
专有名词小词典
- Michelin kitchen
- 质量与分工隐喻;对照「工厂=量产低质」联想
- trust / trust graph
- 对 agent 产出的信任;决定可并行度
- verification
- agent 真跑真采证并对照标准
- Control Glass
- 经 CDP 控制 agents window 并取证的 verification skill
- feature map
- 功能导航与操作记忆;服务模糊报告
- CLI-in-skill
- 把可重复取证脚本固化在 skill 目录
- PStack
- Lauren 的工程 playbook skill 插件集
- hill climb
- 对着可测指标连续小改
- Dune
- GrokBot agent 友好框架;捷径=正道;强边界
- gardener
- 专责早期清除反模式、写 lint 止血的角色
- paved path
- 唯一推荐做法;由结构与 CI 引导
- outer loop
- Slack/Sentry 等外部信号进入工作的路径
- routines
- GrokBot 对信号的订阅与自动触发
- cloud agents
- 云端执行复现/修复/开 PR 的 agent
- Bugbot
- 规则/审查层;偏软于 CI 硬红
- formal verification
- Lean/TLA+ 等形式化;光谱高端
一句话带走
先建可自检的厨房(verification + 硬仓库),再接外环自动上菜。2000 PR 是信任与环境的结果,不是把聊天窗开到 2000 个。