Superpowers 作者用 CLAUDE.md 拦截智能体提交的低质 PR
Superpowers 作者 Jesse Vincent 称项目 GitHub star 已超 12 万,随之而来大量由智能体自动提交的低质 PR,仓库 PR 拒绝率达 94%。
推荐理由:Superpowers 作者用 94% PR 拒绝率说明智能体批量提 PR 的现状,并给出可复用的 CLAUDE.md 拦截写法。
值得一用的新工具、新 Skill、新 MCP Server 和开源项目。
Superpowers 作者 Jesse Vincent 称项目 GitHub star 已超 12 万,随之而来大量由智能体自动提交的低质 PR,仓库 PR 拒绝率达 94%。
推荐理由:Superpowers 作者用 94% PR 拒绝率说明智能体批量提 PR 的现状,并给出可复用的 CLAUDE.md 拦截写法。
TeamPCP 通过被污染的 Trivy GitHub Action 劫持 LiteLLM 的 CI/CD 流水线,窃取 PyPI 发布凭证后发布了带后门的 LiteLLM 1.82.7 和 1.82.8。
推荐理由:复盘 LiteLLM 被投毒事件的三阶段攻击链与 .pth 持久化机制,可帮助排查自身 CI/CD 与 Kubernetes 风险。
作者提出用智能体会话日志来改进 CLAUDE.md 或 AGENTS.md 文件:Claude Code 的会话存在 ~/.claude/projects,Codex 存在 ~/.codex/sessions,都是 JSONL 格式但 schema 不同。
推荐理由:作者用智能体会话日志反推 CLAUDE.md 的改进点,并开源了一个 CLI 把搜索从几分钟压到几秒。
Jesse Vincent 发布开源工具 packnplay,用一条 packnplay run claude --dangerously-skip-permissions 命令即可启动预配置好的临时容器运行编码智能体。
推荐理由:作者把在容器里跑编码智能体的繁琐配置封装成一条命令,并公开了处理 Claude Code 凭据冲突的具体做法。
作者在让智能体开发 Web 应用时,常遇到客户端 JavaScript 的 bug,智能体靠读代码解决不了就会启动浏览器 MCP 交互调试,只为看浏览器控制台日志,既费 token 又慢。
推荐理由:作者给出一个可复用的前后端日志桥接做法,让编码智能体不用浏览器 MCP 也能看到前端日志。
Terminal-Bench 发布 2.0 版本和 Harbor 包,前者是经过更严格验证、难度更高的智能体评测基准,后者用于评估和优化智能体。Harbor 重写了 Terminal-Bench 的测试框架,支持云端部署容器、面向 RL 和 SFT 的 rollout 接口,并兼容任何可装入容器的智能体。
推荐理由:Terminal-Bench 2.0 与 Harbor 同时发布,读者可了解智能体评测基准的验证方式与云端扩展思路。
作者 Jesse Vincent 用一下午把 Superpowers 和整套 SKILL.md 体系移植到 OpenAI Codex CLI,随 Superpowers 3.3.0 发布。
推荐理由:作者把 Claude 的 SKILL.md 体系移植到 Codex CLI,并给出工具映射与安装方式,可据此判断跨模型复用 Skill 的可行性。
作者为 Claude Code 构建了 episodic-memory 插件,让它能检索过去的会话记录。Claude Code 默认把 ~/.claude/projects 下的 .jsonl 会话日志在一个月后删除,可通过 ~/.claude/settings.json 的 cleanupPeriodDays 延长保留。
推荐理由:作者把 Claude Code 的会话日志做成可语义检索的情景记忆,读者可据此判断长期上下文如何跨会话保留。
作者为 Claude Code 自建了轻量 Chrome MCP 与 Skill,名为 superpowers-chrome,启动时 MCP 配置仅占 947 token,而微软 Playwright MCP 仅可用状态就要 13678 token(约占上下文窗口 7%)。
推荐理由:作者用自建 Chrome MCP 对比 Playwright MCP 的 token 开销,给出面向 LLM 设计工具接口的具体取舍。
作者 Jesse Vincent 发布 Superpowers,一套基于 Claude Code 新插件系统的 Skill 集合,安装后通过 session-start hook 注入引导提示,让 Claude 主动搜索并使用 Skill。
推荐理由:作者把自用的编码智能体工作流打包成可安装的 Skill 插件,读者能直接复用其头脑风暴到 TDD 的实现流程。
Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。
推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。