跳到正文

#Agent

今日 0 条
7/18周五
7/15周二
7/1周二
  1. Hacker News · Context Engineering 讨论78

    智能体的上下文工程:写入、选择、压缩与隔离四类策略

    Lance Martin 撰文把智能体的上下文工程归纳为四类策略:写入(用 scratchpad、记忆把信息存到上下文窗口之外)、选择(按需拉入记忆、工具描述和知识)。

    推荐理由:文章把智能体上下文管理归纳为写入、选择、压缩、隔离四类策略,并给出各家产品的具体做法,便于对照现有工作流。

  2. Hacker News · Context Engineering 讨论62

    AI 的新技能不是提示词工程,而是上下文工程

    作者认为 AI 领域正从提示词工程转向上下文工程,即设计动态系统,在合适的时间以合适的格式为 LLM 提供正确的信息和工具。他把上下文拆成系统提示词、用户提示词、短期状态与历史、长期记忆、RAG 检索信息、可用工具和结构化输出七类,并指出多数智能体失败已不是模型失败而是上下文失败。

6/25周三
6/24周二
6/4周三
  1. Martin Fowler · Exploring Generative AI66

    自主编码智能体实测:一次 OpenAI Codex 运行记录

    Martin Fowler 给 OpenAI Codex 布置了一个前端标签格式化的化妆类小任务,并完整公开了 Codex 的日志和生成的 PR。日志显示 Codex 主要靠 grep 反复文本搜索定位代码,中途因把 AGENTS.md 误写成 AGENT.md 来回折腾,还因删掉 .yarnrc 导致测试无法运行,最终 PR 里有两个回归测试失败。

    推荐理由:作者完整记录 Codex 自主完成一次前端小任务的日志,并对比 6 次运行结果,展示后台编码智能体在环境配置和代码复用上的真实短板。

5/19周一
  1. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    推荐理由:Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。

5/14周三
  1. Martin Fowler · Exploring Generative AI62

    用 LLM 构建 PlantUML 分步播放扩展 PlantUMLSteps

    作者用 LLM 构建了 PlantUMLSteps,为 PlantUML 时序图增加按步骤播放功能,把单张复杂图拆成登录、认证、仪表盘等逐步展示的步骤。开发中 Claude 在 Cursor Agent 模式下生成 StepParser 解析逻辑、Gradle 任务和 HTML 查看器,解析器最初在 newPage 属性、首个步骤标记前的声明处理上出错,经测试反馈修正后通过。

4/17周四
12/19周四
6/13周二