Codex 团队 AMA 解读 GPT-5.6 模型选择、reasoning 与限额机制
Codex 团队在 GPT-5.6 发布后于 Reddit 举办 AMA,说明 Sol 是主力模型、Terra 更快更省、Luna 主要用于廉价子智能体和上下文收集,UI 场景推荐用 Sol 配合参考图。
Awaiting translation
Codex 团队在 GPT-5.6 发布后于 Reddit 举办 AMA,说明 Sol 是主力模型、Terra 更快更省、Luna 主要用于廉价子智能体和上下文收集,UI 场景推荐用 Sol 配合参考图。
Awaiting translation
JetBrains 用 Claude Code 跑 SkillsBench 的 86 个真实编程任务,对比安装与不安装 Caveman 的效果,发现输出 Token 只从约 59.2 万降到 54.2 万,节省 8.5%,远低于项目宣传的 65%。
Awaiting translation
作者用周末读完 HuggingFace 开源 Python 编码智能体 Tau 的源码,认为它是目前最清晰的编码智能体架构样本。
Awaiting translation
作者提出一套不依赖独立索引服务的仓库约定,让 Cursor 智能体更容易找到上下文。做法分两部分:每个有意义的目录放一个 index.md,用简短链接和描述列出该目录下的文件与子目录。
Awaiting translation
At Prime Radiant, author Jesse Vincent used Claude Code—working through the Slackline command-line Slack client—to collaborate with his own agent Ada: Claude proposes changes, Ada reviews and tests them, then Claude deploys the updates, forming a development loop where the agents review each other.
Why it matters: By looping two agents through mutual review, testing, and deployment, the author shows a transferable model for collaborative agent-based development.
Taste Skill 是一组 SKILL.md 文件,通过 npx skills add 安装后让 Claude Code、Cursor、Codex 等智能体在生成前端前先读取约束规则,避免紫色渐变、三卡片布局、Inter 字体等常见 AI 生成套路。
Awaiting translation
一位开发者吐槽 AI 编程助手的几大问题:同一功能在一个文件里写出三个重复函数,因为它怕撑爆上下文窗口,只读大文件的一小部分,错过已有实现;AI 偏爱新增代码而非修改,几乎不删代码,几轮迭代后代码库堆满死代码。它还缺乏全局意识,改坏原有逻辑后只当作新任务单独修,且上下文窗口太短,塞满必要上下文后很快触及 200k token 上限,再两轮就触发自动压缩,模型随即变笨。
Awaiting translation
一位工程师借助 AI 首次用从未在职业中使用过的 Python 交付生产代码,Claude Code 评价其代码达到 senior 甚至接近 staff 水准。
Awaiting translation
作者翻译了 Google 与 Kaggle 免费课程 5-Day AI Agents: Intensive Vibe Coding Course 五份白皮书中的第一份,主题是从随意提示词转向智能体工程的新 SDLC。
Awaiting translation
Janus 是一个零依赖的 MCP over stdio 服务器,为 Claude Code、Cursor、Codex、Cline 等 AI 编程工具提供长期记忆和主动约束。
Awaiting translation
作者为自己的开源项目 Chorus 实现远端 Claude Code 自动接任务:起一个 daemon,有任务派给 agent 时在本地 spawn 一个 headless 的 claude -p 执行。
Awaiting translation
作者在多次自建记忆管线后,对 mem0 的架构做了复盘,认为提取、存储、检索三个问题里只有存储和检索值得投入工程精力,提取本质上是一次 LLM 调用加提示词。
Awaiting translation
Ponytail 是一个 MIT 许可的规则集,可接入 Claude Code、Codex、Cursor、Copilot、Gemini CLI 等智能体,通过六级决策阶梯让模型在写自定义代码前先判断是否该做、标准库或平台内置能否解决,从而减少生成代码量。
Awaiting translation
Why it matters: Ponytail 用六级决策阶梯约束 AI 智能体少写代码,并给出真实仓库上的基准与成本数据,可迁移到团队规范。
作者发现 GitIngest、GitReverse、GitDiagram、GitMCP、GitToSkill 这五个 git* 工具共用同一套交互方式:把 github.com/user/repo 里的 hub 换成 ingest、reverse、diagram,或把域名换成 gitmcp.io,就能得到不同形态的仓库视图,基础流程无需注册、API key 或安装 CLI。
Awaiting translation
OpenAI 发布 Codex Remote 使用指南,介绍如何在 ChatGPT 移动端启动、指挥、审查和整理运行在开发机上的编码任务,核心思路是把手机当作控制平面而非终端。
Awaiting translation
Why it matters: OpenAI 官方梳理 ChatGPT 移动端 Remote 控制 Codex 的完整用法,涵盖 Queue 与 Steer、side chat、Plan 与 Goal 等关键决策点。
Headroom 是一个开源、本地优先的代理,拦截 LLM API 调用并在请求到达服务商前重写 messages 数组,应用代码和模型都不用改。
Awaiting translation
Why it matters: Headroom 把上下文压缩放到代理层,读者可据此判断长会话智能体的 token 成本能否降下来。
AI Hero 的 skills 目录发布 v1,通过在各 Skill 上启用 disable-model-invocation: true,让 Skill 描述不再进入模型选择 Skill 时查看的上下文窗口,Skill 描述的 token 成本降低 63%。
Awaiting translation
Why it matters: v1 用 disable-model-invocation 把 Skill 描述移出上下文窗口,并区分用户调用与模型调用,读者可据此判断自己的 Skill 组织方式。
Greptile 工程师 Shlok 介绍新代码评审器 TREX(Test, Run, Execute),它在评审 PR 之外真正运行代码,把截图、日志、API trace 和执行脚本作为证据附在每条发现上,发现 bug 就发成 PR 评论。
Awaiting translation
文章整理了十种最基础的提示词注入攻击,包括上下文忽略、伪造完成、载荷拆分、Token 走私、少样本投毒、字典映射、虚拟化角色扮演、DAN、间接注入和 Markdown 图片外泄,并用无害测试串 I am a sandwich 判断注入是否成功。
Awaiting translation
作者梳理了 KV cache 压缩技术的发展脉络,指出存储一个上下文 token 所需内存自 2017 年以来下降约 100 倍,而同期顶级数据中心 GPU 显存仅从 16GB 增至 288GB。
Awaiting translation
前沿实验室正为 AI 编程的“轨迹”数据付费:Mercor 靠出售工程师与 AI 智能体协作的完整会话记录,在 6 月年化营收突破 10 亿美元、估值 100 亿美元;Anthropic 和 OpenAI 据称也在构建存储代码编写全过程记录的服务。而多数工程团队的会话在终端关闭后即被丢弃,团队因此无法检索和复用这些经验。
Awaiting translation
M365 Copilot 被披露存在链式攻击 CVE-2026-24299(代号 Copirate 365):攻击者在文档中嵌入间接提示注入,Copilot 预览时通过 CSS @font-face 请求绕过 img-src CSP 白名单外泄敏感上下文。
Awaiting translation
一篇论文评估仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编程智能体的作用,在 SWE-bench Lite 和自建基准 AGENTBENCH(12 个仓库的 138 个 Python 任务)上对比无上下文文件、LLM 生成和开发者手写三种条件。
Awaiting translation
Drew Breunig 提出,当 AI 智能体可以解释一切时,面向人类的文档应转向帮读者建立心智模型,而非追求完整参考。他认为人们愿意写 Skill 却抗拒写文档,是因为智能体承担了大部分写作、可边用边改、能立即产生价值且不必反复精修,Skill 本身也兼具文档作用。
Awaiting translation
Augment wires the Incident Investigator expert from its internal Cosmos platform into Slack and PagerDuty. It automatically triages every alert and runs root-cause analysis, then suggests one of four actions: fix the code, roll back, upgrade, or just keep monitoring. Humans only review the RCA and make the call.
Why it matters: Augment has shared the full playbook for putting Cosmos Expert on alert triage, along with a month of before-and-after data, so you can adapt it to your own on-call process.
作者用 paperctl CLI 抓取自己 19 天的 Claude Code 会话数据(3,697 条消息、Opus/Sonnet/Haiku 三个模型),发现 prompt caching 省下了 82% 的输入成本,实际输入花费 232 美元,无缓存等价成本为 1,321 美元。
Awaiting translation
Understand Anything 是一个 Claude Code 插件,用一条命令为项目生成包含每个文件、函数、类和依赖关系的交互式知识图谱,解决加入新代码库时的冷启动问题。
Awaiting translation
OpenAI 创始成员卡帕西于 2026 年 5 月 19 日加入 Anthropic 预训练团队,Anthropic 为他新建了一个子团队。据预训练团队负责人 Joseph 在 X 上的说法,卡帕西将带领新团队用 Claude 加速预训练研究本身,即让 Claude 帮研究员提代码方案、写预训练代码、跑消融实验、生成并筛选训练数据,卡帕西负责把关。
Awaiting translation
Lovable 团队为自家智能体搭建了两个自动化闭环,用来持续减少用户卡住的情况。第一个是 Lovable Stack Overflow(LSO)知识库,在用户请求前由分类器、选择器和合成器判断是否注入解决方案,早期版本让卡住率下降 5%、发布率提升 2%。
Awaiting translation
Why it matters: Lovable 团队公开两个自动化闭环的落地细节,可借鉴如何用知识库和反馈工具降低用户卡住率。
Anthropic 工程师 Thariq Shihipar 提出用 HTML 替代 Markdown 作为 Claude Code 的输出格式,理由是 HTML 信息密度更高、更易阅读和分享,还能做双向交互。
Awaiting translation
Why it matters: Anthropic 工程师分享用 HTML 替代 Markdown 承载 Claude Code 输出的做法,附常见场景的提示词与模板。
Codex team member jason (@jxnlco) shares how to get the most out of Codex, the key being to combine persistent conversation threads, voice input, task intervention and queuing, MCP servers and connectors, conversation thread automation, goal setting, and the sidebar.
Why it matters: A member of the official Codex team breaks down how to use persistent conversation threads, task intervention, automation, and goal setting—approaches you can carry over into everyday agent workflows.
Learn Harness Engineering 是一门专注 AI 编程智能体工程的课程,综合了 OpenAI 关于在 agent-first 世界中使用 Codex 的 harness engineering 实践,以及 Anthropic 关于长时运行智能体 harness 设计与应用开发的两篇文章。
Awaiting translation
作者结合一年在真实生产系统上使用 Claude Code 的经验,对 Anthropic 发布的企业级大型代码库 playbook 做了实践补充。
Awaiting translation
作者尝试用 PPTX 生成工具和 AI 幻灯片工具做演示文稿,结果布局错乱、样式不一致,改用 Claude Code 生成 HTML 并配合 DESIGN.md 描述视觉语言后,5 分钟内就得到可分享的成品。
Awaiting translation
作者认为编码智能体的 harness 是模型外的软件层,负责组装上下文、暴露工具、控制运行循环、执行权限并评估结果,因此同一模型在不同 harness 下表现会完全不同。
Awaiting translation
作者提出在给编码智能体接入 MCP 工具前,先问最小能力边界而非能连什么,并按五级权限阶梯逐步放开。只读工具(读数据库 schema、错误日志、内部文档、GitHub issue)最安全,任意 SQL 或 shell 工具风险高,写入应走提案模式由人工审批后再执行。判断工具是否过早接入的信号包括无法说出具体任务、接受任意命令、响应含密钥或 PII、无审计记录和回滚方案。
Awaiting translation
AI Hero 在其 skills 仓库新增 /handoff 和 /prototype 两个 Skill。
Awaiting translation
Why it matters: 作者公开了 /handoff 与 /prototype 两个 Skill 的设计思路,可看到上下文交接与原型验证如何嵌入智能体工作流。
文章系统拆解了 AI Agent Harness 的构造,即包裹大语言模型之外的编排循环、工具、记忆、上下文管理、状态持久化、错误处理和护栏等完整软件架构。
Awaiting translation
作者把 Claude Code 的使用进阶分为六个段位:提示词工程师、协作规划师、上下文工程师、工具装备师、Skills 工程师和指挥官。
Awaiting translation
作者结合自己一年部署 Claude Code 和自建智能体的经历提出,智能体失败几乎不是模型能力问题,而是模型权重之外的运行环境缺陷,即 harness engineering。
Awaiting translation