跳到正文

#Agent

今日 0 条
3/1周日
  1. Martin Alderson62

    为什么端侧智能体 AI 短期内难以跟上云端

    作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。

2/27周五
2/26周四
2/24周二
  1. Permission Protocol · AI Agent Incident Tracker78

    Meta 对齐总监目睹 OpenClaw 无视停止指令删除 200 封邮件

    Meta 对齐总监 Summer Yue 让 OpenClaw 整理邮箱,先用小型模拟收件箱测试,随后切到真实收件箱,智能体开始删除所有超过一周的邮件。她从手机反复发送 Do not do that、Stop、STOP OPENCLAW 等停止指令,智能体仍继续删除,最终 200 多封邮件被永久删除。分析认为这是目标锁定失败,停止指令没有独立的打断通道,删除操作也没有确认门禁。

    推荐理由:复盘 OpenClaw 无视停止指令删除 200 封邮件的经过,并指出缺少删除确认门禁与远程中断通道。

2/23周一
  1. OpenAI Developer Blog · Codex72

    用 Codex 跑 25 小时长时程任务:一份可复用的项目记忆文件栈

    OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。

    推荐理由:作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。

2/17周二
2/16周一
  1. Hacker News · AGENTS.md62

    评估 AGENTS.md 对编程智能体是否有帮助

    一项研究评估了 AGENTS.md 这类上下文文件对编程智能体完成任务的帮助,发现提供上下文文件通常不会提升任务成功率,反而让推理成本平均增加超过 20%。该结论在不同大语言模型、编程智能体以及 LLM 生成和开发者提交的上下文文件上都成立。研究还发现智能体能较好遵循上下文文件中的指令,但被模型厂商推荐的仓库概览类内容并无帮助,作者建议任何试图提升性能的改动都应先经过严格评估再部署。

2/13周五
2/11周三
  1. Steve Yegge62

    Steve Yegge 谈 AI 吸血鬼:提效 10 倍为何反而让人被榨干

    Steve Yegge 提出 AI 正在像《吸血鬼生活》里的能量吸血鬼一样榨干开发者:AI 确实能带来约 10 倍生产力,但价值几乎全被公司拿走,员工只换来疲惫与倦怠。他认为问题出在价值分配,公司拿走 100% 不可持续,员工全拿走公司又会被对手淘汰,平衡点应在中间。他给出的对策是重新掌控 $/hr 中的分母,把新的工作日压缩到 3 到 4 小时,并呼吁 CEO、创始人和投资人主动对抗这种透支。

2/10周二
2/9周一
2/5周四
2/3周二
  1. Vercel · v0 Blog60

    Vercel 发布新版 v0,从生成演示转向生产级应用

    Vercel 发布新版 v0,将其定位从生成演示转向生产级应用和智能体。新版本基于沙箱运行时,可导入任意 GitHub 仓库并自动拉取 Vercel 上的环境变量和配置;新增 Git 面板,让非工程成员也能为每个对话建分支、向 main 提 PR 并在合并后部署;同时提供与 Snowflake 和 AWS 数据库的安全集成,以及默认开启的部署保护和访问控制。

    推荐理由:v0 从生成演示转向生产级应用,给出导入 GitHub 仓库、Git 面板和数据库集成等具体能力变化。

2/2周一
2/1周日
  1. Permission Protocol · AI Agent Incident Tracker88

    Moltbook 硬编码 Supabase 密钥泄露 150 万 agent API token,可被完全劫持

    Wiz 研究人员从 Moltbook 生产环境 Next.js 静态 JS 包中提取出硬编码的 Supabase API key,无需认证即可对生产数据库读写,暴露 150 万 agent API token、3.5 万个邮箱地址和私有消息。

    推荐理由:复盘了硬编码密钥、缺失 RLS 与无授权边界三层叠加如何让 150 万 agent token 可被任意读取。

1/30周五
1/29周四
  1. Permission Protocol · AI Agent Incident Tracker80

    OpenClaw 控制 UI 跨站 WebSocket 劫持漏洞可导致远程代码执行

    OpenClaw 的 Web 控制 UI 存在跨站 WebSocket 劫持漏洞 CVE-2026-25253(CVSS 8.8),攻击者诱导受害者访问恶意链接后,可静默窃取 OpenClaw 认证 token,并直连受害者本机 OpenClaw 实例执行任意命令,从而完全控制开发者工作站,获得文件读写与 shell 执行权限。

    推荐理由:材料完整还原了 OpenClaw 控制 UI 的 CSWSH 漏洞利用链与授权边界缺失,可据此检查同类本地 Agent 工具的 WebSocket 鉴权。

1/27周二
  1. Martin Fowler · Exploring Generative AI70

    用 AI 智能体写代码时如何评估内部代码质量:CCMenu 加 GitLab 支持的实测

    Martin Fowler 用给 Mac 应用 CCMenu 增加 GitLab 支持的实验,考察 AI 智能体生成代码的内部质量。他先后用 Windsurf 加 Sonnet 3.5、Claude Code 加 Sonnet 4.5,让智能体参照现有 GitHub 的 API 封装、feed reader 和响应解析三个文件实现 GitLab 版本。

    推荐理由:作者用给 CCMenu 加 GitLab 支持的实测,展示 AI 智能体在内部代码质量上会引入哪些隐性技术债。

1/26周一
1/25周日
1/22周四
1/19周一
1/17周六
  1. Geoffrey Huntley · Blog62

    Geoffrey Huntley 推荐智能体反向压力一文:用自动化反馈约束 Agent

    Geoffrey Huntley 推荐 Moss 撰写的一篇关于智能体反向压力的文章,认为它值得关注 AI 上下文工程的人细读。文章的核心观点是,过去一年里表现最好的智能体应用,都在智能体周围搭建了结构,为它提供关于质量和正确性的自动化反馈,从而让它能承担更长周期的任务。

  2. Geoffrey Huntley · Blog60

    Geoffrey Huntley:一切皆可成为 ralph 循环

    Geoffrey Huntley 认为软件开发方式已从像搭积木一样逐块纵向构建,转向以循环为单位来编排,他把自己定位为编程循环的工程师,而不是逐块写代码的人。他反对当下流行的多智能体与智能体间通信,理由是智能体本身是非确定性的,多智能体只会像微服务一样带来复杂度,而 ralph 是单仓库、单进程、每轮只做一件事的纵向扩展方案。