CTO 采用 AI 开发工具前最关心的五个问题:Lovable 的回应
Lovable 针对 CTO 和 CIO 采用 AI 开发工具前最常见的五类顾虑给出回应:影子 IT、厂商评估疲劳、需求与实现之间的落差等。Lovable 称其编辑、审批、发布为独立的服务端权限,发布需显式授权,代码可导出为 React、TypeScript、Tailwind CSS 并同步至 GitHub,且客户提示词、代码与工作区数据不用于训练模型。
Awaiting translation
Lovable 针对 CTO 和 CIO 采用 AI 开发工具前最常见的五类顾虑给出回应:影子 IT、厂商评估疲劳、需求与实现之间的落差等。Lovable 称其编辑、审批、发布为独立的服务端权限,发布需显式授权,代码可导出为 React、TypeScript、Tailwind CSS 并同步至 GitHub,且客户提示词、代码与工作区数据不用于训练模型。
Awaiting translation
Lovable 发布指南,教创始人用内置安全扫描器在发布时检查项目漏洞,并持续修复发现的问题。指南建议对登录流程、数据库、用户权限、支付集成和错误处理做针对性安全审查,并可通过 Aikido 集成做渗透测试。应对流量高峰时,可让智能体优化代码,并在 Cloud 高级设置中升级数据库实例规格。
Awaiting translation
Anthropic 的 Thariq Shihipar 复盘了 Claude Code 工具设计中的取舍,核心主张是工具要贴合模型自身能力,而判断能力边界只能靠观察输出和反复实验。
Awaiting translation
Why it matters: Anthropic 工程师复盘 Claude Code 工具设计的取舍,给出可迁移到自建智能体的判断方法。
Augment Code 本月新增 Gemini 3.1 Pro,成为其继 Claude、GPT-5 之后的第三个可选模型。作者认为模型、harness 与 orchestration 三层解耦后,切换模型只是改一个设置而非迁移,因此单模型押注已不再成立。文中提到 GPT-5.4 每消息价格比此前所用模型便宜约 2.6 倍,且过去十三个月里领先模型已三次易主。
Awaiting translation
Augment Code 将 AI 原生转型划分为四个阶段:约 70% 的组织仍停留在第一阶段(在日常工作流中集成 AI 智能体),不到 10% 让智能体自主承担工作,几乎无人达到完全智能体编排。
Awaiting translation
Lovable 发布创始人安全指南,梳理技术尽调实际评估的五个领域:数据访问控制、基础设施安全、漏洞管理、依赖与供应链卫生、事件响应与运营成熟度。Lovable 将安全能力嵌入生成流程,AI 安全智能体在代码呈现给用户前独立审查漏洞,代码变更、发布前和后台分析都会自动触发扫描,并在多次重新生成间追踪问题以防回归。
Awaiting translation
Terminal-Bench 发布任务设计指南,提出好的基准任务应具备对抗性、难度和可读性:指令像给资深工程师那样清晰直接,测试只验证结果而非实现细节,允许替代解法并防止 reward hacking。难度应来自问题本身,而非苛刻的输出格式或隐藏假设。作者建议亲自运行任务、检查容器、执行 oracle 并观察真实智能体轨迹,失败运行尤其能揭示任务是否真正困难。
Awaiting translation
Lovable 不再只构建全栈应用,其 AI 智能体现在能运行代码和 Python 脚本,直接分析文件与数据,并生成可下载的表格、PDF、幻灯片、Word 文档、图片和视频。它支持将 CSV、PDF 或截图转成可用的应用,也能生成营销报告、投资人 deck 和发票等专业文档,并导出为 PDF、PowerPoint、Excel、Word 或 CSV。
Awaiting translation
Lovable 把非技术团队与工程团队的交接设计成流程中的必要环节:产品、市场等角色先在 Lovable 中构建可交互原型并验证,确认后再同步到 GitHub 仓库,导出的是标准可读代码,工程团队可在 Claude Code、Cursor 等环境中接手。原型与上线之间设有刻意停顿,非技术团队负责快速验证,工程团队仍掌握上线决定权。Lovable 还提供安全中心、基于角色的发布权限等管控措施。
Awaiting translation
Lovable 的 Workspace Knowledge 允许管理员定义持久化指令,自动应用到工作区内的每个项目,覆盖编码规范、测试要求、库偏好和架构边界。官方给出 9 种用法,包括强制 TypeScript strict 模式、统一使用 shadcn/ui、Zustand、Zod 与 Tailwind CSS,并默认执行 Bun 前端测试、Deno 后端测试和浏览器端到端验证。
Awaiting translation
OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。
Awaiting translation
Why it matters: OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。
Terminal-Bench 团队宣布正在开发 Terminal-Bench-Science(TB-Science),面向生命科学、物理科学、地球科学及数学与计算科学等自然科学领域,目标构建 100+ 个可执行基准任务,在容器化环境中以确定性程序化验证评估 AI 智能体。
Awaiting translation
销售团队正用 Lovable 自建客户专属演示环境、交互式 ROI 计算器、会后跟进应用、CPQ 工具和动态幻灯片等销售工具。ElevenLabs 的 CS 团队借此将演示搭建时间缩短 50%,Atonom 则用自建 CRM 替换 Salesforce,省下 40,000 美元。
Awaiting translation
Lovable 面向产品团队推出模板库,覆盖构建前与上线后两类验证场景。构建前,PM 可自行搭建可运行原型,用于功能验证、范围澄清、高管演示和引导流程测试;上线后,可构建功能采用看板、路线图与发布追踪器、反馈分诊看板和更新日志生成器,接入 Mixpanel、Amplitude、Linear 等工具,让结果持续可见。
Awaiting translation
Lovable 的产品营销经理和解决方案架构师在不到一天内搭出一个竞争情报中心,无需工程师参与。该工具从 Slack 自动同步竞争信号并打标签,追踪竞品提及频率,还从通话记录和交易数据中自动关联赢单/输单分析。Lovable 同时发布了可用的起步模板。
Awaiting translation
Terminal-Bench 3.0 已进入开发阶段,目标收录 100 个多样化任务,发布时最强模型的解决率不超过 30%。任务需为可通过命令行完成并程序化验证的真实计算机工作,覆盖更长周期、多微服务/文件系统/数据库等更丰富环境及专家级知识,合并窗口开放至 5 月底。贡献者提交一个被接受的任务即可在最终版本中获得署名。
Awaiting translation
Lovable 的基础设施团队公开了其 LLM 供应商负载均衡方案,用于在峰值每分钟超过十亿 token 的流量下避免“model provider unavailable”。
Awaiting translation
Why it matters: Lovable 公开了每分钟十亿 token 规模下的多供应商负载均衡方案,可借鉴其用 PID 控制器和项目级粘性保住 prompt caching 的做法。
OpenAI 宣布 Codex 可通过 Figma MCP Server 生成 Figma 设计文件,并支持设计稿与代码双向流转。
Awaiting translation
Why it matters: 官方给出 Codex 与 Figma MCP 双向打通的具体操作步骤,读者可据此判断设计到代码的往返流程能否落地。
Lovable 将编辑、审批、发布拆分为独立权限,发布同时受显式权限与审批状态双重限制,未获授权的操作在系统中直接不可执行。平台采用基于角色的访问控制,审批在构建内容的同一系统内完成,源代码不离开客户安全边界,Lovable 不克隆客户 GitHub 仓库、不拉取应用代码、不要求访问内部 CI/CD。
Awaiting translation
Lovable 用 Lovable 搭建了一个直连 Linear 的产品发布路线图,把每个发布的 Linear 项目、工程团队、发布日期、分级和负责 PMM 集中在一处,并支持“ask the roadmap”查询。发布按 Tier 1 至 Tier 4 分级,对应预定义的物料清单,Tier 1 仍有 1–3 周准备时间。该工具由一名 PMM 和一名 PM 搭建,没有工程师参与。
Awaiting translation
Atonom 用 Lovable 自建 CRM,把每年 4 万美元的 Salesforce 合同换成约 1200 美元(含托管)的方案,且未损失所需功能。其财务负责人 Jason 三小时内做出可用原型,团队随后不再登录 Salesforce,系统覆盖线索捕获、商机创建、ARR/MRR 跟踪与销售看板,并直接接入自家 AI SDR 智能体 Zoey。
Awaiting translation
OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。
Awaiting translation
Why it matters: 作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。
Vercel 发布新版 v0,将其定位从生成演示转向生产级应用和智能体。新版本基于沙箱运行时,可导入任意 GitHub 仓库并自动拉取 Vercel 上的环境变量和配置;新增 Git 面板,让非工程成员也能为每个对话建分支、向 main 提 PR 并在合并后部署;同时提供与 Snowflake 和 AWS 数据库的安全集成,以及默认开启的部署保护和访问控制。
Awaiting translation
Why it matters: v0 从生成演示转向生产级应用,给出导入 GitHub 仓库、Git 面板和数据库集成等具体能力变化。
OpenAI's developer blog explains how to systematically test Codex Agent Skills with evals, turning "it feels better" into comparable scores.
Why it matters: It lays out a complete workflow for systematically validating Codex Skills with evals, from defining success criteria to deterministic checks and scoring.
Skyscanner 工程师把 OpenAI 的 Codex CLI 接入 JetBrains IDE 的 MCP server,让 Codex 能调用 IDE 的 get_file_problems 检查文件错误、执行预设的 run configurations 跑测试和 lint。
Awaiting translation
Why it matters: Skyscanner 工程师把 Codex CLI 接入 JetBrains MCP,让 AI 直接读取 IDE 报错并跑测试,读者可借鉴这套反馈闭环。
In the Codex Cookbook, OpenAI lays out a complete workflow for modernizing a legacy codebase with Codex CLI, using a COBOL portfolio system as the example and moving through five phases built around an ExecPlan design document.
Why it matters: Using a COBOL portfolio system as the example, it offers reusable documents and a validation workflow for modernizing legacy code in phases with Codex CLI.
Terminal-Bench has released version 2.0 and the Harbor package. The former is a more rigorously validated, harder benchmark for evaluating agents; the latter is for evaluating and optimizing agents. Harbor rewrites Terminal-Bench's test harness, supports deploying containers in the cloud, provides rollout interfaces for RL and SFT, and works with any agent you can put in a container.
Why it matters: Terminal-Bench 2.0 and Harbor are released together, so readers can see how the agent evaluation benchmark is validated and how to scale it in the cloud.
Dagster Labs 分享了用 OpenAI Codex 加速技术文档写作、跨媒介内容转换和文档覆盖度评估的实践。他们重写了 CONTRIBUTING.md,明确文档层级、结构和最佳实践,让 Codex 能据此生成符合规范的文档;还借助 gh 命令让 Codex 解读 PR 的 diff 和描述,并让 Codex 把教程改写成 YouTube 视频脚本。
Awaiting translation
Why it matters: Dagster 团队把 Codex 用于文档写作、PR 解读和内容跨媒介转换,其中用文档生成代码来反向衡量文档覆盖度的做法可以迁移。
OpenAI 第三届 DevDay 首次全程用 Codex 参与搭建,从舞台演示、社区大厅街机到产品本身都由它协助完成。Codex 自行实现 VISCA 协议控制网络摄像头,并搭建灯光 MCP server;Codex CLI 让 Romain Huet 一个下午就完成初版。
Awaiting translation
OpenBlock Labs 的智能体 OB-1 在按正确超时限制重新提交成绩后,重新成为 Terminal-Bench 排行榜得分最高的智能体。此前该提交将数据集中每个任务的超时统一改为固定 30 分钟,而多数任务原本限时 5 分钟,导致 75 个任务超时被放宽、2 个不变、3 个被缩短。
Awaiting translation
OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。
Awaiting translation
Why it matters: 官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。
Terminal-Bench 发布数据集注册表,让智能体开发者通过 Terminal-Bench 框架统一评测多个智能体基准,基准开发者也能借此分发自己的基准。
Awaiting translation
Warp 在 Terminal-bench-core v0.1 上解决 52% 的任务,比此前最好成绩提升 9%,首次登顶该基准。此前 Anthropic 的 Opus 4 以 43% 的任务解决率创下纪录。
Awaiting translation
Terminal-Bench 新增 parallelize-graph 和 feal-linear-cryptanalysis 两个高难度任务,分别要求智能体用 Unified Parallel C 实现基因组组装的并行 de Bruijn 图构建,以及对 FEAL 类分组密码实施已知明文线性密码分析攻击。
Awaiting translation
Anthropic 将 Terminal-Bench 列为 Claude 4 模型卡七项基准之一,Claude 4 Opus 在 Terminal-Bench-Core 上取得 43.2% 的 SOTA 成绩。Dario Amodei 在 Code with Claude 主题演讲中也提及该基准。Terminal-Bench 团队表示将在未来几天验证 Claude 4 的表现并更新官方排行榜。
Awaiting translation
Terminal-Bench 团队发布研究预览版智能体 Terminus,用于在终端中一致地评估语言模型驱动自主智能体的能力,发布时其性能在 Terminal-Bench 上仅次于 Claude Code。Terminus 采用单工具设计,仅通过 tmux 会话发送标准按键操作,并借助 LiteLLM 支持几乎所有 API 或本地托管模型,且完全自主运行、不请求用户输入。
Awaiting translation
Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。
Awaiting translation
Why it matters: Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。