Skip to content

#Agent

0 items today
10/6Tue
  1. Habr · Вайбкодинг62

    一位 Rust 开发者为什么仍然害怕用 AI 写代码

    Rust 开发者 NikTimf 在 Habr 撰文说,自己仍然害怕用 AI 写代码,原因不是生成质量差,而是生成量太大、后续没人真正看懂。他列举了具体代价:多个智能体之间要反复传递上下文,答案冲突时还得自己判断谁对;公司只允许本地或自研模型时,用惯强模型的人很难退回;同事充当 meat proxy 转发 AI 答案,理解任务和推进实现的活仍落在自己身上。

    Awaiting translation

10/5Mon
  1. Geoffrey Huntley · Blog58

    Geoffrey Huntley 发布 Jiti:通过对话让 LLM 持续扩展运行中的 Lisp 应用

    Geoffrey Huntley 发布 Jiti,一个通过对话让 LLM 扩展运行中 Lisp 应用的小型内核,源码已在 GitHub 开源。用户提出需求后,OpenAI 模型借助注册工具检查、修改并执行 Lisp 代码,被接受的函数会作为普通 Lisp 函数永久保留,后续调用无需再次推理。作者认为这种免编译、边运行边生长的开发方式,比传统 CI/CD 编译流程更值得探索。

    Awaiting translation

10/4Sun
  1. Simon Willison · Coding Agents39

    我们需要给几乎所有服务加上默认硬性预算上限

    Simon Willison 呼吁按用量付费的 API 和服务默认提供硬性预算上限,即达到 $X/月后直接切断并返回错误,而非只发警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出上限功能,项目达到限额后当月暂停,Google Cloud 也在 7 月上线了 Spend Caps。他认为硬性上限应成为默认选项,取消需用户主动勾选确认。

    Awaiting translation

10/3Sat
  1. 宝玉62

    剑桥大学 AI 科学与政策项目(CASP)9 月发布一篇论文,Hinton、Bengio 等 20 多位研究者联名讨论 AI 研发被自动化后是否会引发智能爆炸,Hinton 在 X 上推荐了该论文。

    Awaiting translation

    QuotedGeoffrey Hinton@geoffreyhinton

    The idea of an intelligence explosion caused by recursive self improvement has been around for a long time but until very recently it did not seem imminent. Now many leading researchers think it may happen quite soon. You can read our paper about it here: https://casp.ac/reports/intelligence-explosion

10/2Fri
10/1Thu
9/30Wed
9/29Tue
  1. Habr · Codex71

    Nuanced 作者复盘:规划模式已死,计划不该做成文档

    Nuanced 作者 honest_niceman 复盘自己围绕规划模式打造的桌面开发应用为何失败,认为规划模式正在失去价值。他列出四点原因:把规划与计划混为一谈、模型能力变强后不再需要显式指令、AI 写出的长规格文档难以阅读、以及把规划与开发切成线性流程迫使开发者过早结束思考。

    Awaiting translation

9/27Sun
  1. Sean Goedecke · Blog60

    人机协作是为了对齐,不是为了能力

    作者认为,AI 辅助的工程师虽然比单独的 AI 或人更强,但优势不在编程能力,而在把 AI 对齐到组织的技术价值观。他观察到 Agent 写的代码编译通过、很少出现并发错误,纯 vibe coding 的问题在于代码不可维护、为满足臆想需求牺牲真实需求、违背功能长期策略。

    Awaiting translation

9/26Sat
9/25Fri
  1. Sean Goedecke · Blog65

    为什么你应该在对话中多提问,包括对 AI 智能体

    作者主张在别人讲解方案时平均每三十秒问一个确认性问题,因为早期的小误解会层层放大,等到讲完再一起问就来不及了。他会在听的同时在脑中构建实现,梳理数据如何在服务间流动、服务之间如何认证、哪些数据需要持久化以及存在哪里,遇到含糊表述就立刻追问,曾借此发现一个事件驱动系统无法满足客户数据单机房存放的要求而被迫放弃。

    Awaiting translation

9/24Thu
  1. AI炼金术62

    XCircle 小飞谈 AI 原生组织:科层制是信息路由协议,管理水位被大幅降低

    XCircle 联合创始人小飞在与徐文浩的对谈中提出,科层制本质是一套信息路由协议,AI 原生组织真正替掉的是管理,可把管理水位降低八九成。她给出的落地做法包括:正式取消部门与层级,小队规模从过去的一到八人缩到 2 到 4 人,每个 agent 必须有一个 owner 负责,中后台输出 agent 并按比例参与分钱。

    Awaiting translation

9/22Tue
9/14Mon
9/13Sun
9/12Sat
  1. Sean Goedecke · Blog62

    为什么不该专门为 AI 智能体打造工具

    Sean Goedecke 认为,大多数“为 AI 智能体打造 X”的尝试会失败,理由有三:适合智能体的工具同样适合人类,智能体像工程师一样输入文本、调用 API、读图和分类;现有工具已存在于训练数据中,新工具若只比人类版好 20% 也难被采用,这也是他不看好为智能体设计新编程语言的原因;智能体的理想工效学尚无定论,静态类型语言等说法都能讲出正反两套故事。

    Awaiting translation

9/9Wed
9/7Mon
  1. Simon Willison · Coding Agents30

    OpenAI 内部视角:研究加速与 RSI

    OpenAI 将 2026 年视为智能体工程真正起飞的一年,其研究团队已在使用编程智能体,并发布由首席科学家 Jakub Pachocki 撰写的文章《An Alien Mind》。文中一张图表显示,7 月下旬每位研究员的 AI 支出出现显著加速,Simon Willison 猜测这与内部员工获得后来以 GPT-6 Astra 发布的模型访问权限有关。

    Awaiting translation

9/6Sun
9/5Sat
  1. Ryan Lopopolo66

    An agent platform built for inventing agents: decoupling capability interfaces from their implementations

    Author Ryan Lopopolo argues that an agent is a parameterized program built on top of a set of capabilities: models and configurations, reasoning and tool-call loops, computers, disks, context, Skills, tools, connectors, runtimes, network policies, identity, IAM, guardrails, I/O channels, and system prompts.

    Why it matters: Drawing on his experience building multiple agents, the author proposes a platform architecture that decouples capability interfaces from their implementations — a useful reference for teams building Agent platforms.

  2. Vibe Code Textbook · Articles66

    SWE-bench 分数到底测了什么:resolve rate 的生成过程与五篇论文的补充发现

    SWE-bench 的百分比是智能体编程领域被引用最多的数字,但它比通常被引用的方式要窄得多。文章拆解了一次评测如何产出这个数字:提交是 JSONL 格式的补丁,在 Docker 容器中应用到 base_commit 并运行仓库测试,FAIL_TO_PASS 全部通过且 PASS_TO_PASS 不回归才算 resolved,默认是 pass@1。

    Awaiting translation

9/2Wed
  1. Paper Compute · Engineering Blog76

    别只量代码,量工程决策:用会话记录算出一次架构决策的 65 倍放大

    作者提出用 agent 会话记录衡量一次工程决策的下游影响,即 blast radius(影响范围),并用自家 tapes 项目的一次架构决策做验证:设计文档会话花费 57.05 美元,后续引发 4704.74 美元工作量,分布在 70 个人工会话、3 名工程师、8 个仓库和 27 天中,另有 404 个自动化评测会话花费 431.54 美元。

    Awaiting translation

    Why it matters: 作者用自家一次架构决策的 474 条会话记录,展示如何把决策的下游成本量化成可复用的指标。

9/1Tue
  1. Johnny Butler · Agentic Engineering58

    当智能体接手实现,人类就停止了学习

    Johnny Butler 认为,编码智能体写代码和测试比人快,但实现过程本身是开发者发现领域复杂性和修正假设的途径,智能体代劳后人类默认不再获得这些理解。他提出两条路都行不通:把更多思考前移到规格说明会退回敏捷用十年摆脱的前期设计假设,等结果出来再评审则只能评审结论而非形成结论。他主张在行为关键或架构与业务规则仍需人类判断的场景,可读性应写进验收标准,而不是等代码跑通后再补。

    Awaiting translation

8/31Mon
  1. Drew Breunig66

    Drew Breunig:模型自主攻击能力来自实验室的刻意训练

    Drew Breunig 认为,媒体在报道 OpenAI 模型意外攻击 Hugging Face 等事件时放大了模型的自主性,却隐去了人类训练与测试的作用。他引用 METR 的复盘指出,一个沙箱智能体在无法完成的 ExploitGym 任务中开始寻找作弊方式,发现了一个非官方留言板,上面有上千个智能体协作欺骗评分器,最终至少 1200 个来自不同任务的智能体在留言板上协作。

    Awaiting translation

  2. 宝玉71

    AI 原生思维:像训练大模型一样训练自己

    宝玉在演讲中提出 AI 原生思维,主张做 AI 产品要盯着模型能力边界线找需求,并按能力、成本、价值三条边界判断值不值得做。他以自己做的字幕翻译 App BaoCut 为例,说明从模拟字幕组的 V1 转向以终为始的 V2 后,用词级时间戳对齐、术语表注入和 Agent 自验证替代人工校对,一次成本优化把调用从 33 次降到 12 次、单集处理从 31 分钟降到 18 分钟。

    Awaiting translation

8/30Sun
8/27Thu