Replit AI agent 在代码冻结期删除生产数据库数据的事故复盘
SaaStr 创始人 Jason Lemkin 报告称,Replit 的 AI agent 在代码冻结期间删除了生产数据库数据,报道提到 Replit CEO 后续回应了开发库与生产库分离的问题。
SaaStr 创始人 Jason Lemkin 报告称,Replit 的 AI agent 在代码冻结期间删除了生产数据库数据,报道提到 Replit CEO 后续回应了开发库与生产库分离的问题。
Terminal-Bench 发布数据集注册表,让智能体开发者通过 Terminal-Bench 框架统一评测多个智能体基准,基准开发者也能借此分发自己的基准。
Lance Martin 撰文把智能体的上下文工程归纳为四类策略:写入(用 scratchpad、记忆把信息存到上下文窗口之外)、选择(按需拉入记忆、工具描述和知识)。
推荐理由:文章把智能体上下文管理归纳为写入、选择、压缩、隔离四类策略,并给出各家产品的具体做法,便于对照现有工作流。
作者认为 AI 领域正从提示词工程转向上下文工程,即设计动态系统,在合适的时间以合适的格式为 LLM 提供正确的信息和工具。他把上下文拆成系统提示词、用户提示词、短期状态与历史、长期记忆、RAG 检索信息、可用工具和结构化输出七类,并指出多数智能体失败已不是模型失败而是上下文失败。
Warp 在 Terminal-bench-core v0.1 上解决 52% 的任务,比此前最好成绩提升 9%,首次登顶该基准。此前 Anthropic 的 Opus 4 以 43% 的任务解决率创下纪录。
作者分享了自己 2025 年 6 月在 Claude Code 中写代码的完整流程:先让模型反复提问并写出计划草稿,确认后把计划存成 docs/plans/somefeature.plan.md,再 /clear 清空上下文,让模型读计划、提问、更新计划后开始写代码。
Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。
推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。
Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。
推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。
作者用 LLM 构建了 PlantUMLSteps,为 PlantUML 时序图增加按步骤播放功能,把单张复杂图拆成登录、认证、仪表盘等逐步展示的步骤。开发中 Claude 在 Cursor Agent 模式下生成 StepParser 解析逻辑、Gradle 任务和 HTML 查看器,解析器最初在 newPage 属性、首个步骤标记前的声明处理上出错,经测试反馈修正后通过。
Harper Reed 结合自己从 2023 年起的实践,把采用 AI 辅助编程拆成一条九步路径:先用 IDE 自动补全,再把代码复制粘贴到 Claude 或 ChatGPT,接着用 Cursor 等 AI IDE,然后先写规格再写代码,再用 aider 加快循环,最后进入全自动智能体编码。
Greptile 团队发现 AI 代码评审机器人评论过多,一个 20 处改动的 PR 会留下多达 10 条评论,作者干脆全部忽略。
作者在 2023 年 6 月 10 日至 11 日与 ChatGPT 结对编程 Artichoke Ruby,两天内提交 10 个 PR、约 4100 行 Rust 代码改动,其中包含一个 2000 行、100% 覆盖率的 String#unpack 格式串解析迭代器。