月合 2000 PR:米其林厨房与 Agent 友好仓库

Lauren Tan(Potato)· 约 38–41 分钟演讲 · 完整学习整理

sourcehttps://x.com/sheemamoto/status/2099571838514864241

Lauren(Potato)讲她如何把 verification、skill、仓库硬约束与 GrokBot 外环叠在一起,爬上高信任,从而出现「上月约 2000 个生产 PR」的吞吐。推文常夹带求职/$850k 包装;正文按演讲内容细读,不把营销句当成口述事实。

一句话结论

吞吐来自信任,信任来自环境:verification(CLI + feature map)证明正确;PStack 教高质量做法;Dune 把捷径焊成正道;GrokBot 外环把 Slack/Sentry 等信号自动交给 cloud agents。人从肉瓶颈变成园丁。

A

这场是谁、谈什么

形式
约 38–41 分钟演讲(X 视频约 41 分;同源讲稿约 38 分)
来源
X · sheemamoto 推文视频
演讲人
Lauren Tan · Potato(带 e)· 做 Grok Bot @ SpaceX AI
论点
把 agent 环境设好 → 个人/团队像高产出厨房,而不是盲刷会话
主隐喻
Michelin kitchen(明确不喜欢 software factory 当主标签)
主线
trust · verification · Control Glass · feature map · PStack · 五层约束 · Dune · gardener · GrokBot 外环
关键数字
上月约 2000 生产 PR(非 initially 目标)· 入职约 6 个月旅程
关于推文包装

部分转发热帖写「数百份简历 / 开价 $850k / 20–30 agents」。那是剪辑包装,不是本讲逐字内容。本页只保留演讲里可核对的机制与数字(含 2000 PR、Michelin、Dune、外环)。

B

密时间轴(按讲稿结构)

时间轴按论证块,不伪造精确秒点。

  1. 开场2000 PR 与信任不在时也要信 agent 产出高质量
  2. 隐喻Michelin kitchen对人仍负责最终菜品;刀具/编制/训练决定结果
  3. 故事Agents window 性能入职 Cursor;PR 墙;人手看 DevTools
  4. 转折我是瓶颈把工程知识灌进 agent 队,而不是永远亲自取证
  5. 阶段1–5 agents最难爬出:不在场就做错;无信任就别开 100 个
  6. 验证谱skills → 形式化CDP/trace 可走很远;Lean/TLA+ 仍开放难题
  7. Control GlassCLI + 取证skill 目录内固定 CLI,禁止每次重写脚本
  8. Feature map物化记忆模糊截图可导航;自动化维护地图
  9. 质量层PStack调试/功能/原型 playbook;正确 + 高质量
  10. 约束梯五层仓库 > 静态分析 > rules/Bugbot/skills > 文风(最弱)
  11. Dune捷径=正道为人烦、为 agent 友好;禁注释防「注释合理化敷衍」
  12. 园丁gardener早期掐掉反模式病毒;lint 先止血再清理
  13. 外环GrokBotconnectors + routines → 自动拉起 cloud agents
  14. 收束纠偏优先序先让错误不可能 → lint → 再叠软规则/skill
C

论点:环境决定吞吐,隐喻选厨房

主张: 若把 agent 的环境设得足够好,产出可像个人或团队级「软件工厂」——更高质量、更高速率。

但她立刻改口: 不喜欢 software factory。更贴的是 Michelin kitchen:

  • 技术工作仍有创造性,不是流水线量产。
  • Agent 时代你可能不再亲自「切菜」,但仍对最终菜品负责。
  • 编制(line cook / sous chef / dishwasher 比例)、设备、训练,决定能不能稳定出菜。

厨房隐喻的重点不是浪漫,而是 setup:刀具、分工、训练不到位时,加人(或加 agent)只会更乱。

D

起源故事:人手性能工作 → Verification

入职约 6 个月前(Cursor,并入 SpaceX AI 之前):无现成 agent skill。任务是支援 agents window(IDE 替代方向)性能。PR 落地极快,她无法判断是否在回归。日常:Chrome DevTools、performance trace、heap snapshot——极度手工。

挫折点:「我们有 agent,我在干什么?」于是做 verification skill:让 agent 自己跑应用、采 trace、找热点,并对着指标 hill climb。

她强调:从未以「每月 2000 PR」为目标。技能、工具、仓库改造事后都归到同一主题——trust:自己是瓶颈;要把工程师知识灌进 agent 队,停止处处挡路。

E

低信任区:1–5 个 agent 为什么最难爬出

早期阶段特征:

  • 每个会话都要 babysit、纠偏。
  • 人不在,事情停或做错。
  • 想跳到约 100 个 agent / cloud agents,但信任不足 → 结果是 slop PR、回归、bug。
边界

没有信任时并行放大,只会制造更贵的垃圾。先修信任机制,再加并行度。

F

Verification 光谱:从 CDP 到形式化

端 含义 可达性
低端(可立即做) Verification skill:跑应用、CDP、trace、heap 大多数团队;她认为已能走很远
高端(开放题) 形式化:Lean、TLA+ 等,证明业务不变量 很难;很少人真正拥有

正确性定义:功能是否做了你要的事(结账按钮是否真结账)。Verification 给经验证据。它不自动等于性能品味或代码质量——后者要另铺 skill。

G

Control Glass = CLI + Feature map

第一款 skill:Control Glass(经 CDP 跑 agents window 并取证)。迭代后固定两块:

  1. CLI(放在 skill 目录内)

    • 目标:可重复跑应用、采证据、对照性能门槛。
    • 禁止每个 session 现场造脚本(不一致、费上下文)。
    • 要持续投资,覆盖真实用例。
  2. Feature map(她命名;像 sitemap 的物化记忆)

    • 触发:Slack 来一张含糊截图 + 三个问号;agent 能跑应用却不懂用户指哪。
    • 内容:有哪些功能、如何到达、快捷键、点哪个 DOM、功能做什么。
    • 存在 skill 目录;有自动化维护。
    • 与 CLI 组合后:既能控应用,也能理解内外用户请求。

结果:verification 变成团队关键基础设施,持续维护。

复现并采 trace经验证据自动改到更好模糊信号Feature mapControl Glass CLI对照门槛Hill climb
H

PStack:正确之外还要「像好工程师」

Verification → 正确性。高质量还要:调试、做功能、做原型等 playbook。PStack(Potato Stack)是她的 skill 集合;资深工程师应共建团队 skill 库。与 verification 叠用:既证明做对,也证明做得像样;并可收集真实性能遥测。

I

五层信任环境(强 → 弱)

她给出连续统。推荐投资顺序:越硬越优先。

1 仓库 / 架构
最佳记忆;agent 爱扩展已有模式;让坏法变得不可能
2 静态分析
lint、编译诊断、CI;重复犯错 → 加规则或改结构
3 Rules / Bugbot / Skills
常被遵循,也可被忘记或被驾驶者忽略
4 (同层软引导)
与上一项同属 guidance,非硬红
5 Style guide
几乎只靠人审;高 PR 速率下不可扩展

只靠文风与人肉评论 = 流程大洞。人审适合发现缺口,不适合当唯一执法。

仓库是 agent 的 memory:它读到什么模式,就倾向复制什么。反模式会像病毒扩散;好模式也会。

J

Dune:为人锁死、为 agent 铺路

Dune = GrokBot 的 agent 友好客户端框架。灵感来自 agents window 性能坑。核心原则:

Agent 爱抄近路 → 把容易走的路设计成正确的路。

对人可能「很烦、很锁」;对上下文很少的 agent(以及设计/PM/CEO 驾驶的 agent)反而合适。

反模式病毒与禁注释

小 workaround 或「解释性注释」会被 agent 复制;几天到几周可变成默认模式。更糟:agent 用注释合理化「为什么不修根因,只打补丁」。Dune 禁止代码注释,挡住这条传播路径。

Gardener(园丁)角色

每个团队需要有人早期识别杂草/虫害(反模式),在扩散前掐掉。Dune 三原则:

  1. 删已有技术债(减少可复制坏样板)。
  2. 单一铺好的路(blessed path):一事一法;CI/lint 引导走上它。
  3. 见坏模式先写 lint 止血——不必总能立刻清完;先停止扩散,再让 agent 清理。

心智模型:保持仓库处于「你乐见 agent 复制」的状态。

结构例子

  • Feature 共置单目录;entry point(类似路由);transcript cards;host(VM)与 client 分离。
  • Electron:main 与 renderer 严禁混用(agents window 曾把慢代码误导入 renderer)。
  • 渲染预算:60 FPS → 每帧约 16ms;120 FPS → 约 8ms。用 import 依赖图硬执行边界。

主题不是「必须用 Dune」,而是:自建 agent 友好框架,把部落知识从人审评论抽进仓库记忆。

K

外环:GrokBot × Cursor

GrokBot 擅长 outer loop:接 Slack、DataDog、Sentry、PlanetScale 等,汇总后决策。有人叫 company brain;她认为不必神化——agent 本来就会用工具。

机制:

  • GrokBot routines:订阅 Slack 线程、Sentry 告警等,自动触发。
  • 自动拉起 cloud agents。
  • 再叠加 Cursor automations / SDK,复用同一套 agent 基建做更复杂任务。

仓库 + rules + skills 与外环复利:自动复现 bug、自动开 PR,价值落到整队。她再次划掉 software factory,改称个人 mission control kitchen。

复现 / 修复 / 开 PRDune / lint / CI人做园丁而非肉代理外环信号GrokBot routinesCloud agents硬约束仓库可抽样信任
L

纠偏优先序(只带走一张幻灯片)

每当你发现自己在纠正 agent,按此顺序选最有效的一层:

  1. 改仓库 / 架构 / 数据结构 → 让该错误范畴上不可能。
  2. 加静态分析(lint / CI)。
  3. 再叠 rules、Bugbot、skills。
  4. 并用质量向 skill 教「如何像好工程师工作」。

做完后,你信任的是环境,agent 才能「自由」。她说这不是秘密,是大量苦工;GrokBot 仓库是她亲投下的例子。联系:X @potato(带 e)。

M

原话意译(高信息密度)

  1. 上月合入约 2000 个生产 PR;能力来自「我不在时仍可信」。
  2. 不喜欢 software factory;更像米其林厨房——你仍对最终菜品负责。
  3. 早期性能工作全靠人手 DevTools;我才是瓶颈。
  4. Verification:让 agent 自己跑、自己采证、对着指标往上爬。
  5. 1–5 个 agent 的 babysit 阶段最难爬出;无信任勿开 100 个。
  6. 无信任的云端并行 = slop PR 与回归。
  7. Verification 有光谱:CDP skill 可走很远;形式化仍难。
  8. Control Glass 要固定 CLI,不要每个会话重写脚本。
  9. Feature map 是物化记忆;否则模糊截图只能瞎猜。
  10. 正确性 ≠ 质量;PStack 教像工程师一样工作。
  11. 仓库是最佳记忆;agent 默认扩展所见模式。
  12. 重复犯错 → lint;更好 → 让错误变得不可能。
  13. 只靠 style guide 人审,在高 PR 速率下会垮。
  14. Agent 爱捷径 → 把捷径设计成正道(Dune)。
  15. 反模式像病毒;注释可变成「不修根因」的借口,故禁注释。
  16. 团队需要园丁:先止血(lint),再清理。
  17. 把部落知识从评论区抽进框架,让仓库成为可复制的好快照。
  18. GrokBot 做外环:routines 订阅信号并拉起 cloud agents。
  19. 不需要神话公司大脑;接好工具就会用。
  20. 纠偏时优先让错误不可能,而不是再写一条软规则。
N

可执行 takeaways

  1. 把 verification 建成带 CLI 的 skill。 做对:不同 agent 取证路径一致,不再现场造脚本。
  2. 加 feature map + 自动维护。 做对:含糊截图能变成可复现路径。
  3. 正确性与质量分开投资。 做对:有 verification 证据,也有工程 playbook(如 PStack)。
  4. 按五层从上到下加固。 做对:重复人审评论下降;同类错误变 CI 红或根本写不出来。
  5. 见反模式先写 lint 止血。 做对:坏样板停止扩散,再安排清理 PR。
  6. 设计单一铺好路径。 做对:新 agent / 非工程驾驶者也默认走上同一结构。
  7. 审视「无害」模式(如注释)是否在被复制成敷衍。 做对:合理化补丁的借口变少。
  8. 指定园丁职责(人可轮值)。 做对:杂草在早期被发现,而不是月后成林。
  9. 用 GrokBot routines 接外环,再踢 cloud agents。 做对:Slack/Sentry 类信号减少人手渡船。
  10. 纠偏时先问能否让错误不可能。 做对:规则文件不必无限变长,仓库形状在替你执法。
与站内其他篇的关系

同属 Lauren 线索:本页偏「2000 PR + 厨房 + 五层约束 + 外环」完整演讲;另一篇直播问答更展开 trust curve、eval、auto-merge 现场数字。可对照读,不必当成同一场录像。

O

专有名词小词典

Michelin kitchen
质量与分工隐喻;对照「工厂=量产低质」联想
trust / trust graph
对 agent 产出的信任;决定可并行度
verification
agent 真跑真采证并对照标准
Control Glass
经 CDP 控制 agents window 并取证的 verification skill
feature map
功能导航与操作记忆;服务模糊报告
CLI-in-skill
把可重复取证脚本固化在 skill 目录
PStack
Lauren 的工程 playbook skill 插件集
hill climb
对着可测指标连续小改
Dune
GrokBot agent 友好框架;捷径=正道;强边界
gardener
专责早期清除反模式、写 lint 止血的角色
paved path
唯一推荐做法;由结构与 CI 引导
outer loop
Slack/Sentry 等外部信号进入工作的路径
routines
GrokBot 对信号的订阅与自动触发
cloud agents
云端执行复现/修复/开 PR 的 agent
Bugbot
规则/审查层;偏软于 CI 硬红
formal verification
Lean/TLA+ 等形式化;光谱高端
P

一句话带走

先建可自检的厨房(verification + 硬仓库),再接外环自动上菜。2000 PR 是信任与环境的结果,不是把聊天窗开到 2000 个。