跳到正文

新工具与 Skill

值得一用的新工具、新 Skill、新 MCP Server 和开源项目。

最新精选

第 21–31 条 · 共 31 条
3/31周二
3/24周二
  1. Permission Protocol · AI Agent Incident Tracker88

    TeamPCP 通过被污染的 Trivy GitHub Action 在 PyPI 投毒 LiteLLM 1.82.7 和 1.82.8

    TeamPCP 通过被污染的 Trivy GitHub Action 劫持 LiteLLM 的 CI/CD 流水线,窃取 PyPI 发布凭证后发布了带后门的 LiteLLM 1.82.7 和 1.82.8。

    推荐理由:复盘 LiteLLM 被投毒事件的三阶段攻击链与 .pth 持久化机制,可帮助排查自身 CI/CD 与 Kubernetes 风险。

2/8周日
12/10周三
12/2周二
  1. Jesse Vincent69

    给编码智能体搭一个前后端日志桥接,方便调试 Web 应用

    作者在让智能体开发 Web 应用时,常遇到客户端 JavaScript 的 bug,智能体靠读代码解决不了就会启动浏览器 MCP 交互调试,只为看浏览器控制台日志,既费 token 又慢。

    推荐理由:作者给出一个可复用的前后端日志桥接做法,让编码智能体不用浏览器 MCP 也能看到前端日志。

11/7周五
  1. Terminal-Bench · News62

    Terminal-Bench 发布 2.0 版本与 Harbor 评测优化包

    Terminal-Bench 发布 2.0 版本和 Harbor 包,前者是经过更严格验证、难度更高的智能体评测基准,后者用于评估和优化智能体。Harbor 重写了 Terminal-Bench 的测试框架,支持云端部署容器、面向 RL 和 SFT 的 rollout 接口,并兼容任何可装入容器的智能体。

    推荐理由:Terminal-Bench 2.0 与 Harbor 同时发布,读者可了解智能体评测基准的验证方式与云端扩展思路。

10/27周一
10/23周四
  1. Jesse Vincent69

    用 episodic-memory 给 Claude Code 补上跨会话记忆

    作者为 Claude Code 构建了 episodic-memory 插件,让它能检索过去的会话记录。Claude Code 默认把 ~/.claude/projects 下的 .jsonl 会话日志在一个月后删除,可通过 ~/.claude/settings.json 的 cleanupPeriodDays 延长保留。

    推荐理由:作者把 Claude Code 的会话日志做成可语义检索的情景记忆,读者可据此判断长期上下文如何跨会话保留。

10/19周日
  1. Jesse Vincent71

    作者自建 superpowers-chrome MCP,把启动开销从 13678 token 降到 947

    作者为 Claude Code 自建了轻量 Chrome MCP 与 Skill,名为 superpowers-chrome,启动时 MCP 配置仅占 947 token,而微软 Playwright MCP 仅可用状态就要 13678 token(约占上下文窗口 7%)。

    推荐理由:作者用自建 Chrome MCP 对比 Playwright MCP 的 token 开销,给出面向 LLM 设计工具接口的具体取舍。

10/9周四
5/19周一
  1. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。