Vibe Coding 的陷阱:为什么 AI 厂商喜欢你的模糊提示词
文章从认知科学角度分析 Vibe Coding 的兴起:自然语言提示词消除了编程语法门槛,让任何人都能把脑中的想法直接变成可运行的应用。但作者指出,用户脑中的心智模型越模糊,对技术需求的描述就越不精确,也就越依赖 AI 厂商补全细节,这正是厂商获利的关键。作者认为“先澄清需求”(Clarify First)才是 AI 工程的未来。
Awaiting translation
文章从认知科学角度分析 Vibe Coding 的兴起:自然语言提示词消除了编程语法门槛,让任何人都能把脑中的想法直接变成可运行的应用。但作者指出,用户脑中的心智模型越模糊,对技术需求的描述就越不精确,也就越依赖 AI 厂商补全细节,这正是厂商获利的关键。作者认为“先澄清需求”(Clarify First)才是 AI 工程的未来。
Awaiting translation
Rust 开发者 NikTimf 在 Habr 撰文说,自己仍然害怕用 AI 写代码,原因不是生成质量差,而是生成量太大、后续没人真正看懂。他列举了具体代价:多个智能体之间要反复传递上下文,答案冲突时还得自己判断谁对;公司只允许本地或自研模型时,用惯强模型的人很难退回;同事充当 meat proxy 转发 AI 答案,理解任务和推进实现的活仍落在自己身上。
Awaiting translation
有用户观察到 GPT 6.1 似乎更省 token,猜测原因是后训练或注入机制让模型感知到上下文剩余量,从而产生压力。例如模型会主动提及"还剩约 26k""37000 token 上下文已用 28000、剩 18000"等剩余额度,并据此压缩工作范围。
Awaiting translation
Geoffrey Huntley 发布 Jiti,一个通过对话让 LLM 扩展运行中 Lisp 应用的小型内核,源码已在 GitHub 开源。用户提出需求后,OpenAI 模型借助注册工具检查、修改并执行 Lisp 代码,被接受的函数会作为普通 Lisp 函数永久保留,后续调用无需再次推理。作者认为这种免编译、边运行边生长的开发方式,比传统 CI/CD 编译流程更值得探索。
Awaiting translation
OpenAI 负责 ChatGPT 和 Codex 的 Tibo Sottiaux 在 Lenny's Podcast 访谈中表示,让用户自己搭循环、画流程图、反复调教工作流只是过渡,真正会赢的是 Dots 这类会学习、永远在线的 agent。
Awaiting translation
针对 GPT-4、Claude 3.5 等 LLM 在多轮对话中出现的上下文遗忘和迎合用户(sycophancy)问题,123sudo 推出项目感知工作区 9xChat,将 AI 锚定到本地项目文件而非脆弱的聊天历史,并支持在同一窗口并排运行 GPT-4 与 Claude 3.5 互相写码和审查,上下文保留在本地且不用于训练。
Awaiting translation
Personal Agent(个人智能体)被定义为持久记忆+工具执行+目标规划、以个体为中心的代理系统,是交互范式从"问—答"到"交代—办成"的迁移。其热度源于记忆基础设施成熟、MCP 标准化与模型同质化下的入口焦虑,工程重心在记忆质量、上下文工程与可靠性三处,开源侧可用 OpenClaw+Mem0+MCP 快速拼出原型。
Awaiting translation
作者认为 Personal Agent 是持久记忆加工具执行加目标规划的个体代理系统,交互范式从问答转向交代任务,本轮热度来自记忆基础设施成熟、MCP 标准化和巨头入口焦虑,而非单一技术突破。
Awaiting translation
国内 Personal Agent 产品 Today AI 发布,可连接飞书、钉钉、Linear 等应用获取个人 Context,主动发现并推进任务,而非等待用户输入 Prompt,发布期可免费领取一亿 Token。作者认为它与 Meta Muse 同属 OpenClaw 思路的延续,差别在于把记忆做成产品层,让 Agent 从对话框转向主动协作。
Awaiting translation
面对 LLM 和 AI 智能体带来的行业剧变,资深工程师 Sean Goedecke 建议初级工程师不要轻信 ZIRP 时代的建议,不要参与政治斗争,保持友善和尽责。他同时提醒不要恐慌 AI,也不要完全回避 AI,而应把 AI 智能体的建议当作参考,用自己的判断去理解系统,避免成为只转发 AI 输出的“肉代理”。
Awaiting translation
Rust 开发者 Nikita 认为 AI 只加速了写代码这一段,上下文准备、审查、测试和修复仍要人来做,因此该按“到可上线改动”的时间算收益,而不是按模型首次响应算。
Awaiting translation
作者对比 Google 的 Open Knowledge Format(OKF)与 OpenViking 两种智能体记忆方案,认为二者解决相似问题但层次不同。
Awaiting translation
Sean Goedecke 认为,大多数“为 AI 智能体打造 X”的尝试会失败,理由有三:适合智能体的工具同样适合人类,智能体像工程师一样输入文本、调用 API、读图和分类;现有工具已存在于训练数据中,新工具若只比人类版好 20% 也难被采用,这也是他不看好为智能体设计新编程语言的原因;智能体的理想工效学尚无定论,静态类型语言等说法都能讲出正反两套故事。
Awaiting translation
Author Ryan Lopopolo argues that an agent is a parameterized program built on top of a set of capabilities: models and configurations, reasoning and tool-call loops, computers, disks, context, Skills, tools, connectors, runtimes, network policies, identity, IAM, guardrails, I/O channels, and system prompts.
Why it matters: Drawing on his experience building multiple agents, the author proposes a platform architecture that decouples capability interfaces from their implementations — a useful reference for teams building Agent platforms.
模型能力再强,其"好工作"的先验也未必与你的标准一致,因此始终需要围绕模型整理环境,让它在非功能性要求上偏向你或组织认可的选择。模型变好不会让这种上下文学习(ICL)需求消失。所谓 Harness Engineering,本质是一组技巧,为 ICL 提供即时机会,在不束缚推理模型的前提下对齐模型行为。
Awaiting translation
宝玉在演讲中提出 AI 原生思维,主张做 AI 产品要盯着模型能力边界线找需求,并按能力、成本、价值三条边界判断值不值得做。他以自己做的字幕翻译 App BaoCut 为例,说明从模拟字幕组的 V1 转向以终为始的 V2 后,用词级时间戳对齐、术语表注入和 Agent 自验证替代人工校对,一次成本优化把调用从 33 次降到 12 次、单集处理从 31 分钟降到 18 分钟。
Awaiting translation
Addy Osmani 在博客中提出,智能体能跳过写代码、调试、读别人代码这些原本积累经验的环节,因此刻意练习变得必要,他建议在提示前先形成假设、多问为什么、读 diff、预测失败点,并偶尔手写小问题。
Awaiting translation
Armin Ronacher 撰文解释推理轨迹的本质:模型被训练在最终回答前把思考写入 scratchpad,GPT-OSS 的 Harmony 格式用 analysis 与 final 标记区分,推理内容与最终答案使用相同文本。
Awaiting translation
Drew Breunig 提出用「情境化智能体」来定义 harness:Harrison Chase 所说的系统提示词、规划工具、文件系统和子智能体构成开发者控制的核心循环,harness 则管理循环之外的世界,包括会话、环境、仓库、记忆、Skills、团队、组织和模型这些由内向外、使用人数递增而变动递减的层次。
Awaiting translation
DeepSeek AI 与北京大学在论文中提出时空可组合性,形式化了 DeepSeek Harness 底层开源 TypeScript 微内核 Cordis 的架构。
Awaiting translation
作者认为把 ASD-STE100、Orwell 六规则、GovUK 等写作规范直接写进全局 CLAUDE.md 或 AGENTS.md,会让模型在推理时同时满足词汇约束,从而降低思考质量。
Awaiting translation
Hacker News 上一位用户发帖追问:Claude Code、Codex 等框架为何要引入 Skill 概念,而不是用组织良好的 Markdown 文档加 AGENTS.md 指向文件。
Awaiting translation
作者认为托管智能体是 2026 年初各平台共同押注的方向,Anthropic、OpenAI、Google、AWS 都在推出同类产品,其核心特征是异步执行、面向生产环境的最小权限隔离和可并行扩展。
Awaiting translation
Addy Osmani proposes that a software factory has three layers—loop, harness, and factory. The factory isn’t a smarter agent; it’s multiple loops with harnesses feeding into a single review gate, with humans controlling the outer loop.
Why it matters: The author breaks the software factory into three layers—loop, harness, and factory—and points out that validation, not generation, is the real bottleneck.
作者提出 coding agent 等于模型加 harness,harness 指模型之外的所有代码、配置与执行逻辑,包括提示词、工具、上下文策略、Hook、沙箱、子智能体和反馈回路。
Awaiting translation
一位工程师借助 AI 首次用从未在职业中使用过的 Python 交付生产代码,Claude Code 评价其代码达到 senior 甚至接近 staff 水准。
Awaiting translation
作者翻译了 Google 与 Kaggle 免费课程 5-Day AI Agents: Intensive Vibe Coding Course 五份白皮书中的第一份,主题是从随意提示词转向智能体工程的新 SDLC。
Awaiting translation
作者梳理了 KV cache 压缩技术的发展脉络,指出存储一个上下文 token 所需内存自 2017 年以来下降约 100 倍,而同期顶级数据中心 GPU 显存仅从 16GB 增至 288GB。
Awaiting translation
前沿实验室正为 AI 编程的“轨迹”数据付费:Mercor 靠出售工程师与 AI 智能体协作的完整会话记录,在 6 月年化营收突破 10 亿美元、估值 100 亿美元;Anthropic 和 OpenAI 据称也在构建存储代码编写全过程记录的服务。而多数工程团队的会话在终端关闭后即被丢弃,团队因此无法检索和复用这些经验。
Awaiting translation
一篇论文评估仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编程智能体的作用,在 SWE-bench Lite 和自建基准 AGENTBENCH(12 个仓库的 138 个 Python 任务)上对比无上下文文件、LLM 生成和开发者手写三种条件。
Awaiting translation
Drew Breunig 提出,当 AI 智能体可以解释一切时,面向人类的文档应转向帮读者建立心智模型,而非追求完整参考。他认为人们愿意写 Skill 却抗拒写文档,是因为智能体承担了大部分写作、可边用边改、能立即产生价值且不必反复精修,Skill 本身也兼具文档作用。
Awaiting translation
作者用 paperctl CLI 抓取自己 19 天的 Claude Code 会话数据(3,697 条消息、Opus/Sonnet/Haiku 三个模型),发现 prompt caching 省下了 82% 的输入成本,实际输入花费 232 美元,无缓存等价成本为 1,321 美元。
Awaiting translation
OpenAI 创始成员卡帕西于 2026 年 5 月 19 日加入 Anthropic 预训练团队,Anthropic 为他新建了一个子团队。据预训练团队负责人 Joseph 在 X 上的说法,卡帕西将带领新团队用 Claude 加速预训练研究本身,即让 Claude 帮研究员提代码方案、写预训练代码、跑消融实验、生成并筛选训练数据,卡帕西负责把关。
Awaiting translation
作者认为编码智能体的 harness 是模型外的软件层,负责组装上下文、暴露工具、控制运行循环、执行权限并评估结果,因此同一模型在不同 harness 下表现会完全不同。
Awaiting translation
Awaiting translation
@karpathy and I are back! At @sequoia AI Ascent 2026. And a lot has changed. Last year, he coined “vibe coding”. This year, he’s never felt more behind as a programmer. The big shift: vibe coding raised the floor. Agentic engineering raises the ceiling. We talk about what it means to build seriously in the agent era. Not just moving faster. Building new things, with new tools, while preserving the parts that still require human taste, judgment, and understanding.
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中提出,Vibe Coding 抬高所有人做软件的下限,Agentic Engineering 则要在用 Agent 提速的同时保住专业软件的质量、安全和责任门槛。
Awaiting translation
DX 对 500 家公司的纵向研究显示,AI 带来的 PR 速度中位提升为 7.5%,平均 13%,最高 70%。DX CTO Justin Reock 指出,工程师只有约 16% 的时间在写代码,只优化这一环,个位数提升就是预期结果;真正决定产出的是系统,包括代码模块化、文档、CI/CD 速度与智能体编排。
Awaiting translation
Ryan Lopopolo 认为,AI 让验证问题变得明显,因为每个真实任务都依赖一个我们几乎从不写下来的问题,即怎样才算把活干好。产出和评审都涉及语气、品味、风险容忍度、打磨程度、可接受的捷径和完成标准等大量非功能性决策,过去团队靠组织设计、社交规范、招聘和入职把这些隐含规则传递给人,而模型无法走招聘流程,因此交给它的任务基本都欠规范。
Awaiting translation
Why it matters: 作者以在 OpenAI 做代码智能体的经历说明,非功能性需求不写下来,评审智能体就会陷入无休止的拉扯。
Notion 联合创始人 Simon Last 在 No Priors 播客访谈中表示,他从 2025 年夏天起不再手写代码,个人纪录是一个编码 Agent 连续运行 13 天。
Awaiting translation
UC San Diego 研究团队通过 13 场实地观察和 99 名资深开发者的问卷(共 112 人,中位经验 10 年,使用 Claude Code、Cursor、GitHub Copilot、Windsurf)发现,专业开发者并不 vibe coding,而是通过规划和监督严格控制智能体。
Awaiting translation