跳到正文

全部动态

今日 0 条
4/10周五
  1. Ryan Lopopolo65

    怎样才算把活干好:写清非功能性需求才能让 AI 智能体收敛

    Ryan Lopopolo 认为,AI 让验证问题变得明显,因为每个真实任务都依赖一个我们几乎从不写下来的问题,即怎样才算把活干好。产出和评审都涉及语气、品味、风险容忍度、打磨程度、可接受的捷径和完成标准等大量非功能性决策,过去团队靠组织设计、社交规范、招聘和入职把这些隐含规则传递给人,而模型无法走招聘流程,因此交给它的任务基本都欠规范。

    推荐理由:作者以在 OpenAI 做代码智能体的经历说明,非功能性需求不写下来,评审智能体就会陷入无休止的拉扯。

4/7周二
  1. Augment Code · Blog38

    Augment Code 谈单模型工程时代终结:已接入 Gemini 3.1 Pro,与 Claude、GPT-5 并列

    Augment Code 本月新增 Gemini 3.1 Pro,成为其继 Claude、GPT-5 之后的第三个可选模型。作者认为模型、harness 与 orchestration 三层解耦后,切换模型只是改一个设置而非迁移,因此单模型押注已不再成立。文中提到 GPT-5.4 每消息价格比此前所用模型便宜约 2.6 倍,且过去十三个月里领先模型已三次易主。

4/6周一
4/2周四
  1. Drew Breunig48

    智能体开发的第二阶段:从克隆移植走向重新构想

    智能体开发正从克隆和移植进入第二阶段——重新构想。Cheng Lou 用 Claude Code 和 Codex 对照浏览器真实行为迭代数周,做出仅几 KB、不依赖 CSS 和 DOM 测量的文本排版库 Pretext;Cloudflare 发布 TypeScript 编写的无服务器 CMS EmDash,被称为 WordPress 的精神继任者。编码智能体大幅降低了挑战成熟软件的成本。

4/1周三
3/28周六
3/27周五
3/26周四
  1. 宝玉36

    在中国 AI 生态圈摸底两周:Delphi Ventures 合伙人谈硬件看好、软件看衰与估值泡沫

    Delphi Ventures 创始合伙人 José Maria Macedo 在中国考察两周后,对硬件更看好、对软件更看衰。他称深圳硬件供应链让迭代速度远超西方,超 70% 原材料采购自大湾区;但中国闭源模型与西方差距可能扩大,Anthropic 二月收入达 60 亿美元,而中国最好模型 ARR 仅几千万美元。

3/25周三
3/24周二
3/23周一
  1. Hacker News · Prompt Injection20

    Ask HN:没遇到过提示词注入,就说明安全吗?

    一位使用 open claw 的用户在 Hacker News 提问:自己更担心提示词注入而非坏代码,但从未见过有人真的被注入攻击,也没见过终端命令误删全部文件的情况。他认为从演绎上看最坏情况都存在,但从归纳上看从未发生,因此怀疑把 open claw 当成真实安全风险是否理性,并表示要等到 HN 上有人被提示词注入才会真正担心。

3/20周五
  1. Terminal-Bench · News34

    Terminal-Bench 如何设计好的基准任务

    Terminal-Bench 发布任务设计指南,提出好的基准任务应具备对抗性、难度和可读性:指令像给资深工程师那样清晰直接,测试只验证结果而非实现细节,允许替代解法并防止 reward hacking。难度应来自问题本身,而非苛刻的输出格式或隐藏假设。作者建议亲自运行任务、检查容器、执行 oracle 并观察真实智能体轨迹,失败运行尤其能揭示任务是否真正困难。

  2. 宝玉36

    AI 发展太快跟不上?一张四象限图帮你做减法

    面对 AI 迭代过快带来的 FOMO,可以用“离当前生产力远近”和“知识保鲜期长短”两根轴把新事物分成四个象限:远且短的直接跳过,远但长的只需 15 分钟读篇解读维持地图感,近但短的值得花几小时上手,近且长的才深度投入。象限会随时间移动,OpenClaw 从个人项目到 GitHub 最热开源项目就是右下角冲向右上角的例子。

3/18周三
3/17周二
  1. Geoffrey Huntley · Blog22

    Geoffrey Huntley:AI 时代的认知安全与前沿实验室的模型权重操控风险

    Geoffrey Huntley 提出"认知安全"概念,警告人们日常依赖单一前沿实验室的 AI 做决策,等于把认知能力外包给他人。他引用 Anthropic 的 Golden Gate Claude 实验说明,通过修改模型权重可让 Claude 无论对话内容都围绕金门大桥,并推测未来搜索或社交平台可能让广告主竞拍模型权重中的排名。他认为唯一解法是自己训练模型,以保护认知安全、业务运营与供应链。

  2. Geoffrey Huntley · Blog31

    AI 作为经济战:开源模型如何成为国家间的金融武器

    Geoffrey Huntley 认为开源模型正被用作国家间的经济武器:中国厂商免费或以约 5 美元/月开放前沿开源模型,而美国向头部实验室投入数万亿美元,本地模型目前仅落后前沿实验室两到四个月。他建议预算有限的学生使用这些开源模型,企业则应按本地推理可用的思路构建业务,并提醒信任与断供风险同样适用于前沿实验室。

3/16周一
3/13周五
  1. Ryan Lopopolo60

    智能体利用率成为新的性能天花板

    作者 Ryan Lopopolo 提出智能体利用率是新的性能天花板,认为模型智能要转化为工程产出,取决于智能体在整个软件生命周期中被允许做多少事。他给出的数据是 2026 年 3 月使用 GPT-5.2 时,无 Symphony 每人每天 3-5 个 PR,接入 Symphony 后每人每周约 75 个 PR,差别来自 Symphony 让智能体保持忙碌。

  2. Ryan Lopopolo71

    别再把代码当成最终产物:Symphony 作者谈规范驱动开发

    Ryan Lopopolo 以 Symphony 为例提出,代码不应被视为最终产物,规范才是分发物。Symphony 是一个基于 issue tracker 的智能体编排系统,先以 SPEC.md 形式分发,Elixir 参考实现只是衍生产物,README 邀请读者把 SPEC.md 交给自己的编码智能体,用任意语言重建。

    推荐理由:作者用 Symphony 的 spec 蒸馏循环说明代码只是可替换产物,为规范驱动开发提供了一条可迁移的路径。

  3. Ryan Lopopolo74

    智能体时代的生产函数变了:实现不再稀缺,验证才是

    作者认为,软件组织一直把人的实现时间当作稀缺投入,智能体打破了这个假设,因此策略必须可执行、验证必须随实现规模扩展。他以在大型 TypeScript 代码库开启 ESLint 的 no-await-in-loop 规则为例,发现 600 处违规,过去这需要昂贵的迁移,现在一个 PR 就能完成修复并补齐测试覆盖。

    推荐理由:作者以开启 ESLint 规则、迁移 600 处违规的亲身实践,说明智能体时代实现成本下降后,约束与验证为何成为新的稀缺环节。

3/9周一
3/8周日
3/7周六
3/4周三
3/2周一
  1. Drew Breunig31

    从 Anthropic 与国防部之争看 AI 采购的真正问题:内嵌判断而非使用条款

    Anthropic 与美国国防部之间的争执,核心并非使用条款,而是模型内嵌的判断。作者认为,AI 采购不同于其他技术采购,因为模型带有内嵌视角,军方等大买家会要求审计并影响后训练过程。他认同 Anthropic 的使用红线,并称自己选择 Claude,同时指出这场争论需要冷静展开。

3/1周日
  1. Martin Alderson62

    为什么端侧智能体 AI 短期内难以跟上云端

    作者 Martin Alderson 认为,端侧智能体 AI 在消费级设备上短期内难以实用,瓶颈是内存、KV cache 与推理速度。他指出 3B 模型量化后约需 2GB、7B 约需 5GB,而手机端上下文常被限制在 4K token,仅工具定义就可能占满;即便 32K 上下文,7B Q4 模型的 KV cache 也已超出 iPhone 17 的内存。

2/27周五
2/26周四
2/22周日
2/19周四
  1. Paper Compute · Engineering Blog38

    tapes.dev:为 AI 智能体补齐持久化会话捕获这一缺失原语

    tapes.dev 以透明代理形式为 AI 智能体提供持久化会话捕获,零代码改动,将智能体指向 localhost:8080 即可记录每一次原始请求与响应,形成只追加、可确定性重放的历史记录。当前 OpenTelemetry、Langfuse、LangSmith 等工具只提供日志、追踪和成本看板,会话结束后无法从某个决策点恢复。tapes.dev 称这是让智能体可编排、可自愈的基础层。

2/17周二
2/15周日