有人试过让大模型当开发经理指挥多个低级模型吗?gpt-6-sol 表现较差
V2EX 用户讨论让大模型担任开发经理、指挥多个低级模型做开发和测试的多会话方案。发帖人称 gpt-6-sol 做开发经理表现较差,做事畏首畏尾、一晚上没什么进展。
Awaiting translation
V2EX 用户讨论让大模型担任开发经理、指挥多个低级模型做开发和测试的多会话方案。发帖人称 gpt-6-sol 做开发经理表现较差,做事畏首畏尾、一晚上没什么进展。
Awaiting translation
2022 年 11 月 30 日 ChatGPT 上线,到 2026 年 9 月不到四年,AI 从聊天框走向 Agent 工作系统。
Awaiting translation
Thorsten Ball 在 Register Spill 的 Joy & Curiosity #101 中提出,框架已不再是最大的开发者生产力杠杆,AI 智能体比它大一百倍,语法和工具易用性也不再重要。
Awaiting translation
METR 2025 年 7 月的实验让 16 名开源开发者随机在允许和禁止使用 AI 的条件下完成任务,结果用 AI 时反而慢 19%,而参与者自认快了 20%。
Awaiting translation
XCircle 联合创始人小飞在与徐文浩的对谈中提出,科层制本质是一套信息路由协议,AI 原生组织真正替掉的是管理,可把管理水位降低八九成。她给出的落地做法包括:正式取消部门与层级,小队规模从过去的一到八人缩到 2 到 4 人,每个 agent 必须有一个 owner 负责,中后台输出 agent 并按比例参与分钱。
Awaiting translation
TypeSafe 创始人 Diogo Almeida 发布笔记,提出把 coding agent 的 harness 围绕 Jev 重构:大模型负责写代码和复杂推理,Jev 负责选工具、挑上下文、路由请求等高频小决策,输入状态和问题,输出选项、评分或断言为真的概率,再由普通代码使用这些结果。
Awaiting translation
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agent 构建者的晚间交流活动。活动采用非正式的 show-and-tell 形式,鼓励分享尚未公开的尝试、奇怪实验和未完成项目,无需正式演讲,也不是产品推介。
Awaiting translation
Simon Willison 和 Jesse Vincent 将于 10 月 14 日晚在旧金山举办一场关于 agentic engineering 的小型交流活动,约三周后举行。活动采用非正式展示与交流形式,鼓励参与者分享正在尝试的项目、未公开的实验和尚未完成的作品,无需正式演讲,可在 Luma 报名。
Awaiting translation
作者统计上月 1731 次智能体会话、花费 17816 美元,能精确到每次会话的成本、模型和目录,却无法回答这些工作是为了什么。
Awaiting translation
作者用智能体从零开发了 pi 的移动端前端 Pi Pocket,六周内达到 300 次提交,如今几乎不再逐行审查代码。他认为智能体适合边界清晰的小任务、重构和规划,但产出的代码普遍过度设计,规模比自己写大约 10-20%,样式和文档也偏模板化,且模型在主观判断上总顺着用户。作者目前只把这种方式用于个人项目,工作代码仍以 Claude 生成为主,自己写的不到 1%。
Awaiting translation
Thorsten Ball 在 Register Spill 中称 Jev 不是 LLM,而是“为软件直接使用的快速结构化决策”而建的模型,TypeSafe 将其描述为“非结构化状态输入、带类型的概率决策输出”的前沿智能函数调用。
Awaiting translation
PC Gamer 报道称,用 AI 工具快速生成老主机游戏 PC 移植(recomp)正在游戏模拟与逆向社区引发摩擦。DK64 随机化社区成员推出 DK64 Recompiled,明确反对依赖 AI vibe coding 的同类项目,理由是后者修改了 N64 图形渲染基础模块 RT64,会带来管理和兼容性问题。
Awaiting translation
Awaiting translation
Awaiting translation
作者对比 Google 的 Open Knowledge Format(OKF)与 OpenViking 两种智能体记忆方案,认为二者解决相似问题但层次不同。
Awaiting translation
Sean Goedecke 认为,当模型推理速度达到每秒数千 token 时,瓶颈会从生成 token 转移到工具调用:读文件是 100ms 还是 10ms、跑测试是 500ms 还是两秒,将决定智能体是近乎即时响应还是让用户等上几分钟。
Awaiting translation
Armin Ronacher 用 Opus 5 按提示词生成了一篇模仿 David Sacks 风格的推文,Pangram 判定其为 100% AI 生成。Pangram 通过让 LLM 改写和部分编辑人类文本自造训练数据,官方称误判人类文本率为 0.0041%、漏检 AI 文本率为 0.34%。
Awaiting translation
近五千名数学家(含 25 位菲尔兹奖得主)签署《A Severe Misalignment of AI in Mathematics》声明,认为 AI 解题只是工具和代理指标,真正目标是概念理解与洞察。
Awaiting translation
一位开发者提出,当一天主要处理文档而非写代码时,即使同样忙碌疲惫,也会因缺少代码文件和已合并 PR 这类"证据"而觉得没做正经工作。他为此 vibe coding 了一个工具,分析当天与 AI 智能体的会话记录,生成日/周总结来证明自己的产出。
Awaiting translation
Codex 出现 503 Service Unavailable 报错,提示 auth_unavailable: no auth available,涉及 providers=codex 下的 GPT-5.5 和 GPT-5.6-sol 两个模型,上游返回 server_is_overloaded。发帖者称这两个模型都用不了,工作几乎无法进行。
Awaiting translation
Cursor 于 9 月 3 日更新服务条款中的出口管制条款,9 月 4 日起俄罗斯用户开始大量收到 API not available in your region,部分 Pro 订阅者收到退订邮件,官方尚未发布停止在俄服务的声明。
Awaiting translation
作者认为按席位、token 或 PR 数衡量 AI 投入都算错了分母,业务买的是功能,应按功能窗口统计从调研、建单、编码、上线到早期修复的全部人力与 AI 成本。
Awaiting translation
OpenAI 将 2026 年视为智能体工程真正起飞的一年,其研究团队已在使用编程智能体,并发布由首席科学家 Jakub Pachocki 撰写的文章《An Alien Mind》。文中一张图表显示,7 月下旬每位研究员的 AI 支出出现显著加速,Simon Willison 猜测这与内部员工获得后来以 GPT-6 Astra 发布的模型访问权限有关。
Awaiting translation
Armin Ronacher 想给廉价 CarPlay 加密狗刷第三方固件,LLM 向他推荐了 Rust 重写的 CarPlay 协议实现 CatPlay,他随后买到非原作者的 Carlinkit Mini Ultra 硬件,又靠 Kimi K3 和 Sol 完成刷机并让 CatPlay 适配该 SoC。
Awaiting translation
OpenAI 的 Codex 团队 Tibo Sottiaux 承诺,只要 Astra 未出现在用户的付费 ChatGPT 账号上,每等一天就补偿一次 banked reset,可完整刷新 Codex/ChatGPT Work 的五小时和每周用量。
Awaiting translation
作者提出用 agent 会话记录衡量一次工程决策的下游影响,即 blast radius(影响范围),并用自家 tapes 项目的一次架构决策做验证:设计文档会话花费 57.05 美元,后续引发 4704.74 美元工作量,分布在 70 个人工会话、3 名工程师、8 个仓库和 27 天中,另有 404 个自动化评测会话花费 431.54 美元。
Awaiting translation
Why it matters: 作者用自家一次架构决策的 474 条会话记录,展示如何把决策的下游成本量化成可复用的指标。
作者梳理 Anthropic Fable 5.1 系统卡(212 页)中与 SWE 任务相关的细节,指出推理档位并非越高越好:在 FrontierCode Main 子集上。
Awaiting translation
有研究和咨询实践显示,AI 平均并未提升开发效率:部分团队获得明显提速,另一部分反而变慢。作者认为,引入 AI 这类强力加速器时,初期减速是自然现象,如同全城从自行车换汽车却还没考驾照,事故先增多,随后才恢复正常并提速。他提醒过程中别搞垮产品、别流失成员,并询问各团队引入智能体开发后如何衡量效能。
Awaiting translation
Z.AI 确认 GLM-5.3 Flash 的全部推理运行在国产硬件上,但未公布芯片厂商、吞吐或功耗数据,也无人独立验证。作者推测其使用的是华为昇腾 910c 系列,该芯片约 600W、INT8 算力约 1.6PFLOP/s,性能约为四年前 H100 的 60%,且缺少原生 FP8 支持。作者认为真正的瓶颈是缺乏可量产的 EUV 光刻,业界普遍认为 2030 年前难以实现规模化生产。
Awaiting translation
Simon Willison 转述剑桥大学计算机教授、OCaml 编译器核心维护者 Anil Madhavapeddy 的观察:OCaml 项目补丁刚被公开讨论,约十分钟内就有网站开始探测百分号编码的路径穿越序列,说明自动化监控在盯着公开仓库。
Awaiting translation
Addy Osmani 建议每隔几周运行一次 Claude Code 的 /doctor,单独用 /memory 检查记忆,并让每条指令重新证明自己的价值,因为模型、harness 和代码库都在变,旧配置会留下。
Awaiting translation
Why it matters: 作者结合自身配置审计经验与近期研究,说明 Agent 配置文件为何会腐化,以及如何按节奏清理。
Paul Dix 称 AI 编写了 100 万行代码,并在随后几个月里不断打磨,最终产出一款可靠软件,目前运行在数百万台开发者机器上。他认为,即便有人以“有可对照的 oracle、语言转换很简单”来贬低这件事,这种说法也低估了它的意义。只要建立验证系统并给出明确方向,AI 就能产出高度复杂、高度精密的软件,并持续改进到真正可用。
Awaiting translation
GitSkills 数据集对 187 万个去重 Skill 做语言识别后发现,14.3% 的 Skill 正文不是英语,其中中文占 6.2%,高于 GitHub 仓库文档 3.3% 的中文比例。非英语 Skill 占比从 2026 年 Q1 的 13.0% 升至 Q2 的 16.3%,三个月涨 3 个百分点,而 GitHub 整体非英语文档从 3.7% 到 13.0% 用了十年。
Awaiting translation
Armin Ronacher 回应 Sean Goedecke "工作中不应愤怒"的观点,认为面对 AI 带来的变化,更合理的情绪是迷茫和焦虑而非愤怒,因为愤怒需要一个可归咎的对象,而 AI 的冲击让所有人都身处不确定之中。他建议用不确定感催生好奇心、用兴奋感去实验,并指出 AI 带来的收益更多体现在员工业余时间发布的副业项目上,而非公司利润。
Awaiting translation
Paper Compute 团队审计了 6 月 16 日至 8 月 14 日两个月的 766 次真实 Agent 会话,其中只有 29 次被沉淀为可复用 Skill,其余 737 次留在会话库里。
Awaiting translation
Drew Breunig 认为,Fable 发布后智能体编程的免费午餐结束了:过去等新模型降价就能掩盖代码和上下文策略的问题,如今 Fable 成本太高,而 Opus、5.6、K3、GLM 对多数代码已够用,开发者开始考虑把哪部分工作交给哪个模型。
Awaiting translation
Stripe 以 75 亿美元收购 OpenRouter,致投资人的信被曝光。GitHub 披露月提交量自 4 月以来从 14 亿增至 29 亿,新增 300 万 CPU 核心和 120 PB 高速存储。作者还回顾了 GitHub 开源贡献、StackOverflow、TDD、文本编辑器等曾被视为基石的开发实践在近两年的式微。
Awaiting translation
V2EX 网友讨论 vibe coding 时偏好 TUI 还是 GUI:支持 TUI 的一方认为配合 tmux、vim 可多任务并行且方便远程续接进度,GUI 支持者则认为 @文件、工作目录、对话交互和内置浏览器预览优势明显。有回复提到 GUI 在中文输入和频繁预览场景更合适,也有人认为 Claude Code 更原生的方式是 CLI。
Awaiting translation
作者认为这个夏天是开源权重模型的转折点,多数智能体任务已不再必须依赖前沿模型。他列举了 OpenAI 将 5.6 Luna 降价 80%、Sol 降价 20%,Meta 在贡献者档位把 Muse Spark 1.2 压到 $0.10/$0.20 per MTok,以及 Anthropic 因算力紧张而难以跟进降价。
Awaiting translation
Armin Ronacher 认为,LLM 让熟悉一门语言的过程不再重要,语言选择的影响因此大幅下降,程序员可以按宣传而非自身经验来选语言。
Awaiting translation