Skip to content

#Agent

0 items today
4/7Tue
4/6Mon
  1. 宝玉78

    Claude Code Token-Saving Guide: Be Careful with the 1M Context—Neither Never Opening a New Session Nor Always Opening One Is Right

    Baoyu walks through Claude Code's prompt caching mechanism to explain why quotas burn so fast, and lays out rules for saving tokens. He points out that caching only applies to prefixes, the main agent's cache window is 1 hour, and sub-agents' is 5 minutes. Reading from cache costs about one-tenth of recomputing, so frequent /clear actually triggers a full-price context rebuild. The rule of thumb: if the cache is still warm and the task hasn't changed, keep chatting; only start a new session when the cache has expired, the task has shifted, or there's too much context noise.

    Why it matters: Starting from the prompt caching mechanism, this explains Claude Code's quota consumption and gives the criteria for deciding whether to continue a session or start over, plus configuration you can copy.

4/5Sun
4/3Fri
4/1Wed
3/31Tue
  1. Paper Compute · Engineering Blog58

    Paper Compute 发布 tapes 与 stereOS,为生产环境运行 AI 智能体提供可观测与隔离基础设施

    Paper Compute 发布面向生产环境 AI 智能体的基础设施,包含 tapes 和 stereOS 两个组件。tapes 是零埋点的可观测层,以反向代理形式部署在智能体与推理服务之间,无需 SDK 或改代码,只需一个环境变量,即可捕获并生成可验证、防篡改的执行记录,并支持异常检测。

    Awaiting translation

  2. Martin Alderson74

    Telnyx、LiteLLM 与 axios 供应链攻击:作者主张用移动端式沙箱重构操作系统

    过去一周有攻击者接连投毒多个开源包,从 Trivy 开始,波及 Telnyx(受影响包约 15 万次/周下载)、LiteLLM(约 2200 万次/周)以及 3 月 31 日被攻击的 axios npm 包(至少 1 亿次/周下载),恶意版本会植入木马窃取安装机器的敏感数据。

    Awaiting translation

3/30Mon
3/28Sat
3/27Fri
3/25Wed
3/24Tue
  1. Permission Protocol · AI Agent Incident Tracker88

    TeamPCP 通过被污染的 Trivy GitHub Action 在 PyPI 投毒 LiteLLM 1.82.7 和 1.82.8

    TeamPCP 通过被污染的 Trivy GitHub Action 劫持 LiteLLM 的 CI/CD 流水线,窃取 PyPI 发布凭证后发布了带后门的 LiteLLM 1.82.7 和 1.82.8。

    Awaiting translation

    Why it matters: 复盘 LiteLLM 被投毒事件的三阶段攻击链与 .pth 持久化机制,可帮助排查自身 CI/CD 与 Kubernetes 风险。

3/19Thu
3/18Wed
  1. Hacker News · AGENTS.md71

    把 AGENTS.md 当作目录而非说明书,附生成提示词

    作者认为多数 AGENTS.md 写得太长,把编码规范、架构决策、产品背景全塞进一个文件,而 LLM 每次启动任务都要读一遍,大部分内容与当前工作无关。他建议把 AGENTS.md 控制在约 100 行,只作为目录链接到 docs/ 下的架构、规范、测试等文档和产品背景文档,让智能体按任务自行拉取所需内容。

    Awaiting translation

3/17Tue
  1. Paper Compute · Engineering Blog78

    日志即自愈反馈回路:用遥测让智能体跨会话积累经验

    作者让智能体在 stereOS 虚拟机里用 PyBoy 无头运行宝可梦红,速度约为实时的 100 倍,智能体自己输出 NAV、BATTLE、BACKTRACK 等日志前缀,这些日志经 tapes 代理流入 Kafka,再由 Flink SQL 做 STUCK_LOOP、TOKEN_SPIKE 异常检测,JSONL 与 DuckDB 负责跨会话查询。

    Awaiting translation

    Why it matters: 作者用终端里跑宝可梦的智能体做实验,展示日志如何变成跨会话的观测记忆并反哺下一轮运行。

3/16Mon
  1. Permission Protocol · AI Agent Incident Tracker62

    AI 编码工具误引入存在漏洞的 Next.js 依赖,生产服务器被植入挖矿程序

    一份运营者报告称,AI 辅助编码工具生成的 Next.js 应用固定了一个存在漏洞的依赖,该漏洞随后通过 CVE-2025-29927 被利用。部署后自动化扫描器访问了本应由中间件保护的内部端点,生产服务器上运行起挖矿程序。报告认为,引入已知严重依赖风险的 PR 在发布前应经过审批路径,而运行时利用仍需漏洞扫描和环境隔离。

    Awaiting translation

  2. 宝玉78

    The 8 Levels of Agent Engineering: From Tab Completion to Autonomous Agent Teams

    Bassim Eledath breaks the practical path of AI-assisted programming into 8 levels, from tab completion and agentic IDEs to context engineering, compound engineering, MCP and Skills, Harness Engineering, background agents, and finally autonomous agent teams.

    Why it matters: The author lays out AI-assisted programming as 8 levels, from tab completion to autonomous agent teams, so readers can figure out where their own team stands.

3/15Sun
3/13Fri
  1. Ryan Lopopolo60

    智能体利用率成为新的性能天花板

    作者 Ryan Lopopolo 提出智能体利用率是新的性能天花板,认为模型智能要转化为工程产出,取决于智能体在整个软件生命周期中被允许做多少事。他给出的数据是 2026 年 3 月使用 GPT-5.2 时,无 Symphony 每人每天 3-5 个 PR,接入 Symphony 后每人每周约 75 个 PR,差别来自 Symphony 让智能体保持忙碌。

    Awaiting translation

  2. Ryan Lopopolo71

    别再把代码当成最终产物:Symphony 作者谈规范驱动开发

    Ryan Lopopolo 以 Symphony 为例提出,代码不应被视为最终产物,规范才是分发物。Symphony 是一个基于 issue tracker 的智能体编排系统,先以 SPEC.md 形式分发,Elixir 参考实现只是衍生产物,README 邀请读者把 SPEC.md 交给自己的编码智能体,用任意语言重建。

    Awaiting translation

    Why it matters: 作者用 Symphony 的 spec 蒸馏循环说明代码只是可替换产物,为规范驱动开发提供了一条可迁移的路径。

  3. Ryan Lopopolo74

    智能体时代的生产函数变了:实现不再稀缺,验证才是

    作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。

    Awaiting translation

    Why it matters: 作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。

3/12Thu
  1. Hacker News · Prompt Injection62

    Ask HN:生产环境如何缓解提示词注入

    作者在 Hacker News 分享生产环境中缓解提示词注入的多层做法。输入侧包括在系统提示词中强制角色边界、在 API 层用独立的 user 角色隔离用户内容与系统指令、对工具调用参数在执行前做 schema 校验;输出侧则用评估指标对模型输出打分,检查事实正确性、指令遵循与安全性,RAG 场景还要验证答案确实基于检索到的上下文。

    Awaiting translation

3/9Mon
  1. Paper Compute · Engineering Blog78

    我让 Agent 玩 1000 回合宝可梦,它始终没走出卧室

    作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。

    Awaiting translation

    Why it matters: 作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。

  2. Jesse Vincent67

    Superpowers 5 发布:新增可视化头脑风暴与 spec 评审循环

    Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。

    Awaiting translation

    Why it matters: 作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。

  3. OpenAI Developer Blog · Codex87

    OpenAI 如何用 Skills 加速 Agents SDK 仓库维护

    OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。

    Awaiting translation

    Why it matters: OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。

3/8Sun
3/4Wed
3/3Tue
  1. Paper Compute · Engineering Blog36

    别再优化模型了,开始加固运行时:stereOS 为 AI 智能体打造可验证执行底座

    stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。

    Awaiting translation