Skip to content

All updates

0 items today
3/17Tue
  1. 宝玉87

    How Anthropic’s Team Uses Claude Code Skills: Nine Categories and Writing Tips

    Thariq Shihipar, an engineer on Anthropic’s Claude Code team, summed up what the team learned from using hundreds of active Skills internally, sorting them into nine categories: library and API references, product validation, data acquisition and analysis, business process automation, code scaffolding, code quality and review, CI/CD and deployment, operations runbooks, and infrastructure operations.

    Why it matters: Anthropic’s internal classification system for hundreds of Skills, along with its writing tips, can be adapted to help teams design their own Skills.

  2. Paper Compute · Engineering Blog78

    日志即自愈反馈回路:用遥测让智能体跨会话积累经验

    作者让智能体在 stereOS 虚拟机里用 PyBoy 无头运行宝可梦红,速度约为实时的 100 倍,智能体自己输出 NAV、BATTLE、BACKTRACK 等日志前缀,这些日志经 tapes 代理流入 Kafka,再由 Flink SQL 做 STUCK_LOOP、TOKEN_SPIKE 异常检测,JSONL 与 DuckDB 负责跨会话查询。

    Awaiting translation

    Why it matters: 作者用终端里跑宝可梦的智能体做实验,展示日志如何变成跨会话的观测记忆并反哺下一轮运行。

  3. Geoffrey Huntley · Blog22

    Geoffrey Huntley:AI 时代的认知安全与前沿实验室的模型权重操控风险

    Geoffrey Huntley 提出"认知安全"概念,警告人们日常依赖单一前沿实验室的 AI 做决策,等于把认知能力外包给他人。他引用 Anthropic 的 Golden Gate Claude 实验说明,通过修改模型权重可让 Claude 无论对话内容都围绕金门大桥,并推测未来搜索或社交平台可能让广告主竞拍模型权重中的排名。他认为唯一解法是自己训练模型,以保护认知安全、业务运营与供应链。

    Awaiting translation

  4. Geoffrey Huntley · Blog31

    AI 作为经济战:开源模型如何成为国家间的金融武器

    Geoffrey Huntley 认为开源模型正被用作国家间的经济武器:中国厂商免费或以约 5 美元/月开放前沿开源模型,而美国向头部实验室投入数万亿美元,本地模型目前仅落后前沿实验室两到四个月。他建议预算有限的学生使用这些开源模型,企业则应按本地推理可用的思路构建业务,并提醒信任与断供风险同样适用于前沿实验室。

    Awaiting translation

3/16Mon
  1. Permission Protocol · AI Agent Incident Tracker62

    AI 编码工具误引入存在漏洞的 Next.js 依赖,生产服务器被植入挖矿程序

    一份运营者报告称,AI 辅助编码工具生成的 Next.js 应用固定了一个存在漏洞的依赖,该漏洞随后通过 CVE-2025-29927 被利用。部署后自动化扫描器访问了本应由中间件保护的内部端点,生产服务器上运行起挖矿程序。报告认为,引入已知严重依赖风险的 PR 在发布前应经过审批路径,而运行时利用仍需漏洞扫描和环境隔离。

    Awaiting translation

  2. 宝玉78

    The 8 Levels of Agent Engineering: From Tab Completion to Autonomous Agent Teams

    Bassim Eledath breaks the practical path of AI-assisted programming into 8 levels, from tab completion and agentic IDEs to context engineering, compound engineering, MCP and Skills, Harness Engineering, background agents, and finally autonomous agent teams.

    Why it matters: The author lays out AI-assisted programming as 8 levels, from tab completion to autonomous agent teams, so readers can figure out where their own team stands.

3/15Sun
3/13Fri
  1. Ryan Lopopolo60

    智能体利用率成为新的性能天花板

    作者 Ryan Lopopolo 提出智能体利用率是新的性能天花板,认为模型智能要转化为工程产出,取决于智能体在整个软件生命周期中被允许做多少事。他给出的数据是 2026 年 3 月使用 GPT-5.2 时,无 Symphony 每人每天 3-5 个 PR,接入 Symphony 后每人每周约 75 个 PR,差别来自 Symphony 让智能体保持忙碌。

    Awaiting translation

  2. Ryan Lopopolo71

    别再把代码当成最终产物:Symphony 作者谈规范驱动开发

    Ryan Lopopolo 以 Symphony 为例提出,代码不应被视为最终产物,规范才是分发物。Symphony 是一个基于 issue tracker 的智能体编排系统,先以 SPEC.md 形式分发,Elixir 参考实现只是衍生产物,README 邀请读者把 SPEC.md 交给自己的编码智能体,用任意语言重建。

    Awaiting translation

    Why it matters: 作者用 Symphony 的 spec 蒸馏循环说明代码只是可替换产物,为规范驱动开发提供了一条可迁移的路径。

  3. Ryan Lopopolo74

    智能体时代的生产函数变了:实现不再稀缺,验证才是

    作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。

    Awaiting translation

    Why it matters: 作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。

  4. Martin Alderson78

    How to OCR Documents with Qwen 3.5 Series Models

    The author used the open-source multimodal Qwen 3.5 series models for PDF OCR: first exporting each page as an image at 100 dpi with PyMuPDF, then feeding the images to the model for recognition. In testing, Qwen3.5-9B hit the sweet spot between quality and speed, while the smaller 0.8B to 2B models tended to go off track on complex documents, summarizing the content instead of transcribing it.

    Why it matters: The author tested Qwen 3.5 models of various sizes for PDF OCR, and shares two reusable paths—local and via OpenRouter—along with cost data.

3/12Thu
  1. Hacker News · Prompt Injection62

    Ask HN:生产环境如何缓解提示词注入

    作者在 Hacker News 分享生产环境中缓解提示词注入的多层做法。输入侧包括在系统提示词中强制角色边界、在 API 层用独立的 user 角色隔离用户内容与系统指令、对工具调用参数在执行前做 schema 校验;输出侧则用评估指标对模型输出打分,检查事实正确性、指令遵循与安全性,RAG 场景还要验证答案确实基于检索到的上下文。

    Awaiting translation

3/11Wed
  1. Lovable · Blog36

    Lovable Workspace Knowledge 的 9 种团队用法

    Lovable 的 Workspace Knowledge 允许管理员定义持久化指令,自动应用到工作区内的每个项目,覆盖编码规范、测试要求、库偏好和架构边界。官方给出 9 种用法,包括强制 TypeScript strict 模式、统一使用 shadcn/ui、Zustand、Zod 与 Tailwind CSS,并默认执行 Bun 前端测试、Deno 后端测试和浏览器端到端验证。

    Awaiting translation

3/9Mon
  1. Paper Compute · Engineering Blog78

    我让 Agent 玩 1000 回合宝可梦,它始终没走出卧室

    作者构建的宝可梦红版自主 Agent 跑了 1000 回合仍停在卧室,原因是它把背景瓦片图地址 0xC4F2 当成文本框状态标志,一直按 A 键却不知道卡住。

    Awaiting translation

    Why it matters: 作者用 1000 回合卡在卧室的失败复盘,说明记录并回放 Agent 会话状态比改提示词更能定位静默故障。

  2. Jesse Vincent67

    Superpowers 5 发布:新增可视化头脑风暴与 spec 评审循环

    Superpowers 5 发布,作者称最喜欢的改动是 Visual Brainstorming 伴随工具,它会在智能体认为有内容需要展示时提示用户,通过本地 web 服务器加载智能体写出的 HTML 片段,并把浏览器里的点击和反馈回传给智能体,以替代 Claude 常生成的 ASCII 图。

    Awaiting translation

    Why it matters: 作者是 Superpowers 维护者,文中说明了 5.0 的视觉头脑风暴、spec 评审循环和子智能体开发三项变化,可据此判断是否值得接入现有工作流。

  3. OpenAI Developer Blog · Codex87

    OpenAI 如何用 Skills 加速 Agents SDK 仓库维护

    OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。

    Awaiting translation

    Why it matters: OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。

3/8Sun
3/7Sat
3/5Thu
  1. Lovable · Blog22

    产品团队如何在 Lovable 上构建原型与内部工具

    Lovable 面向产品团队推出模板库,覆盖构建前与上线后两类验证场景。构建前,PM 可自行搭建可运行原型,用于功能验证、范围澄清、高管演示和引导流程测试;上线后,可构建功能采用看板、路线图与发布追踪器、反馈分诊看板和更新日志生成器,接入 Mixpanel、Amplitude、Linear 等工具,让结果持续可见。

    Awaiting translation

  2. Lovable · Blog22

    Lovable 如何用不到一天搭建行业情报工具

    Lovable 的产品营销经理和解决方案架构师在不到一天内搭出一个竞争情报中心,无需工程师参与。该工具从 Slack 自动同步竞争信号并打标签,追踪竞品提及频率,还从通话记录和交易数据中自动关联赢单/输单分析。Lovable 同时发布了可用的起步模板。

    Awaiting translation

  3. Terminal-Bench · News30

    Terminal-Bench 3.0 公开征集任务贡献

    Terminal-Bench 3.0 已进入开发阶段,目标收录 100 个多样化任务,发布时最强模型的解决率不超过 30%。任务需为可通过命令行完成并程序化验证的真实计算机工作,覆盖更长周期、多微服务/文件系统/数据库等更丰富环境及专家级知识,合并窗口开放至 5 月底。贡献者提交一个被接受的任务即可在最终版本中获得署名。

    Awaiting translation

  4. Lovable · Blog71

    Lovable 如何每分钟路由十亿 token:多回退链与项目级粘性负载均衡

    Lovable 的基础设施团队公开了其 LLM 供应商负载均衡方案,用于在峰值每分钟超过十亿 token 的流量下避免“model provider unavailable”。

    Awaiting translation

    Why it matters: Lovable 公开了每分钟十亿 token 规模下的多供应商负载均衡方案,可借鉴其用 PID 控制器和项目级粘性保住 prompt caching 的做法。

3/4Wed
3/3Tue
  1. Paper Compute · Engineering Blog36

    别再优化模型了,开始加固运行时:stereOS 为 AI 智能体打造可验证执行底座

    stereOS 是一个基于 Linux 的操作系统,把 AI 编码智能体跑在各自独立的沙箱虚拟机里,每个智能体拥有独立内核、内存和磁盘,与宿主机不共享任何资源。它采用完整虚拟机而非 Firecracker、Cloud Hypervisor 等 microVM,以保留安全启动、GPU 直通和嵌套虚拟化能力,并称热 VM 可在 70ms 内让智能体执行首个有效动作。

    Awaiting translation

3/2Mon
  1. Drew Breunig31

    从 Anthropic 与国防部之争看 AI 采购的真正问题:内嵌判断而非使用条款

    Anthropic 与美国国防部之间的争执,核心并非使用条款,而是模型内嵌的判断。作者认为,AI 采购不同于其他技术采购,因为模型带有内嵌视角,军方等大买家会要求审计并影响后训练过程。他认同 Anthropic 的使用红线,并称自己选择 Claude,同时指出这场争论需要冷静展开。

    Awaiting translation

3/1Sun
  1. Martin Alderson62

    为什么端侧智能体 AI 短期内难以跟上云端

    作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。

    Awaiting translation