Перейти к содержимому

Все новости

Сегодня 0 материалов
18.04сб
  1. Lovable · Blog20

    CTO 采用 AI 开发工具前最关心的五个问题:Lovable 的回应

    Lovable 针对 CTO 和 CIO 采用 AI 开发工具前最常见的五类顾虑给出回应:影子 IT、厂商评估疲劳、需求与实现之间的落差等。Lovable 称其编辑、审批、发布为独立的服务端权限,发布需显式授权,代码可导出为 React、TypeScript、Tailwind CSS 并同步至 GitHub,且客户提示词、代码与工作区数据不用于训练模型。

    Ожидает перевода

13.04пн
  1. Lovable · Blog22

    如何在 Lovable 上构建安全、可扩展的业务

    Lovable 发布指南,教创始人用内置安全扫描器在发布时检查项目漏洞,并持续修复发现的问题。指南建议对登录流程、数据库、用户权限、支付集成和错误处理做针对性安全审查,并可通过 Aikido 集成做渗透测试。应对流量高峰时,可让智能体优化代码,并在 Cloud 高级设置中升级数据库实例规格。

    Ожидает перевода

10.04пт
  1. claude.dev · Anthropic Developer Blog74

    Anthropic 工程师谈 Claude Code 的工具设计:如何像智能体一样思考

    Anthropic 的 Thariq Shihipar 复盘了 Claude Code 工具设计中的取舍,核心主张是工具要贴合模型自身能力,而判断能力边界只能靠观察输出和反复实验。

    Ожидает перевода

    Почему это важно: Anthropic 工程师复盘 Claude Code 工具设计的取舍,给出可迁移到自建智能体的判断方法。

07.04вт
  1. Augment Code · Blog38

    Augment Code 谈单模型工程时代终结:已接入 Gemini 3.1 Pro,与 Claude、GPT-5 并列

    Augment Code 本月新增 Gemini 3.1 Pro,成为其继 Claude、GPT-5 之后的第三个可选模型。作者认为模型、harness 与 orchestration 三层解耦后,切换模型只是改一个设置而非迁移,因此单模型押注已不再成立。文中提到 GPT-5.4 每消息价格比此前所用模型便宜约 2.6 倍,且过去十三个月里领先模型已三次易主。

    Ожидает перевода

25.03ср
  1. Lovable · Blog22

    Lovable 创始人安全指南:技术尽调看什么,AI 构建的应用如何应对

    Lovable 发布创始人安全指南,梳理技术尽调实际评估的五个领域:数据访问控制、基础设施安全、漏洞管理、依赖与供应链卫生、事件响应与运营成熟度。Lovable 将安全能力嵌入生成流程,AI 安全智能体在代码呈现给用户前独立审查漏洞,代码变更、发布前和后台分析都会自动触发扫描,并在多次重新生成间追踪问题以防回归。

    Ожидает перевода

20.03пт
  1. Terminal-Bench · News34

    Terminal-Bench 如何设计好的基准任务

    Terminal-Bench 发布任务设计指南,提出好的基准任务应具备对抗性、难度和可读性:指令像给资深工程师那样清晰直接,测试只验证结果而非实现细节,允许替代解法并防止 reward hacking。难度应来自问题本身,而非苛刻的输出格式或隐藏假设。作者建议亲自运行任务、检查容器、执行 oracle 并观察真实智能体轨迹,失败运行尤其能揭示任务是否真正困难。

    Ожидает перевода

  2. Lovable · Blog38

    Lovable 从建应用扩展到文档、表格、图片与视频生成

    Lovable 不再只构建全栈应用,其 AI 智能体现在能运行代码和 Python 脚本,直接分析文件与数据,并生成可下载的表格、PDF、幻灯片、Word 文档、图片和视频。它支持将 CSV、PDF 或截图转成可用的应用,也能生成营销报告、投资人 deck 和发票等专业文档,并导出为 PDF、PowerPoint、Excel、Word 或 CSV。

    Ожидает перевода

19.03чт
  1. Lovable · Blog22

    Lovable 如何让非技术团队完成原型到生产的交接而不绕过工程团队

    Lovable 把非技术团队与工程团队的交接设计成流程中的必要环节:产品、市场等角色先在 Lovable 中构建可交互原型并验证,确认后再同步到 GitHub 仓库,导出的是标准可读代码,工程团队可在 Claude Code、Cursor 等环境中接手。原型与上线之间设有刻意停顿,非技术团队负责快速验证,工程团队仍掌握上线决定权。Lovable 还提供安全中心、基于角色的发布权限等管控措施。

    Ожидает перевода

11.03ср
  1. Lovable · Blog36

    Lovable Workspace Knowledge 的 9 种团队用法

    Lovable 的 Workspace Knowledge 允许管理员定义持久化指令,自动应用到工作区内的每个项目,覆盖编码规范、测试要求、库偏好和架构边界。官方给出 9 种用法,包括强制 TypeScript strict 模式、统一使用 shadcn/ui、Zustand、Zod 与 Tailwind CSS,并默认执行 Bun 前端测试、Deno 后端测试和浏览器端到端验证。

    Ожидает перевода

09.03пн
  1. OpenAI Developer Blog · Codex87

    OpenAI 如何用 Skills 加速 Agents SDK 仓库维护

    OpenAI 用 Codex 配合仓库内的 Skills、AGENTS.md 和 GitHub Actions 维护 Agents SDK 仓库,把验证、发布准备、示例集成测试和 PR 评审变成可重复流程。

    Ожидает перевода

    Почему это важно: OpenAI 官方公开了用 Skills、AGENTS.md 和 GitHub Action 维护 Agents SDK 仓库的完整配置,可迁移到其他开源项目。

08.03вс
05.03чт
  1. Lovable · Blog15

    销售团队如何在 Lovable 上自建演示、ROI 工具与 CRM

    销售团队正用 Lovable 自建客户专属演示环境、交互式 ROI 计算器、会后跟进应用、CPQ 工具和动态幻灯片等销售工具。ElevenLabs 的 CS 团队借此将演示搭建时间缩短 50%,Atonom 则用自建 CRM 替换 Salesforce,省下 40,000 美元。

    Ожидает перевода

  2. Lovable · Blog22

    产品团队如何在 Lovable 上构建原型与内部工具

    Lovable 面向产品团队推出模板库,覆盖构建前与上线后两类验证场景。构建前,PM 可自行搭建可运行原型,用于功能验证、范围澄清、高管演示和引导流程测试;上线后,可构建功能采用看板、路线图与发布追踪器、反馈分诊看板和更新日志生成器,接入 Mixpanel、Amplitude、Linear 等工具,让结果持续可见。

    Ожидает перевода

  3. Lovable · Blog22

    Lovable 如何用不到一天搭建行业情报工具

    Lovable 的产品营销经理和解决方案架构师在不到一天内搭出一个竞争情报中心,无需工程师参与。该工具从 Slack 自动同步竞争信号并打标签,追踪竞品提及频率,还从通话记录和交易数据中自动关联赢单/输单分析。Lovable 同时发布了可用的起步模板。

    Ожидает перевода

  4. Terminal-Bench · News30

    Terminal-Bench 3.0 公开征集任务贡献

    Terminal-Bench 3.0 已进入开发阶段,目标收录 100 个多样化任务,发布时最强模型的解决率不超过 30%。任务需为可通过命令行完成并程序化验证的真实计算机工作,覆盖更长周期、多微服务/文件系统/数据库等更丰富环境及专家级知识,合并窗口开放至 5 月底。贡献者提交一个被接受的任务即可在最终版本中获得署名。

    Ожидает перевода

  5. Lovable · Blog71

    Lovable 如何每分钟路由十亿 token:多回退链与项目级粘性负载均衡

    Lovable 的基础设施团队公开了其 LLM 供应商负载均衡方案,用于在峰值每分钟超过十亿 token 的流量下避免“model provider unavailable”。

    Ожидает перевода

    Почему это важно: Lovable 公开了每分钟十亿 token 规模下的多供应商负载均衡方案,可借鉴其用 PID 控制器和项目级粘性保住 prompt caching 的做法。

26.02чт
  1. OpenAI Developer Blog · Codex66

    Codex 接入 Figma MCP Server,实现设计与代码双向转换

    OpenAI 宣布 Codex 可通过 Figma MCP Server 生成 Figma 设计文件,并支持设计稿与代码双向流转。

    Ожидает перевода

    Почему это важно: 官方给出 Codex 与 Figma MCP 双向打通的具体操作步骤,读者可据此判断设计到代码的往返流程能否落地。

25.02ср
  1. Lovable · Blog22

    Lovable 如何为非技术团队设计治理、权限与安全机制

    Lovable 将编辑、审批、发布拆分为独立权限,发布同时受显式权限与审批状态双重限制,未获授权的操作在系统中直接不可执行。平台采用基于角色的访问控制,审批在构建内容的同一系统内完成,源代码不离开客户安全边界,Lovable 不克隆客户 GitHub 仓库、不拉取应用代码、不要求访问内部 CI/CD。

    Ожидает перевода

  2. Lovable · Blog24

    Lovable 如何用 Linear 打造产品发布追踪器

    Lovable 用 Lovable 搭建了一个直连 Linear 的产品发布路线图,把每个发布的 Linear 项目、工程团队、发布日期、分级和负责 PMM 集中在一处,并支持“ask the roadmap”查询。发布按 Tier 1 至 Tier 4 分级,对应预定义的物料清单,Tier 1 仍有 1–3 周准备时间。该工具由一名 PMM 和一名 PM 搭建,没有工程师参与。

    Ожидает перевода

24.02вт
  1. Lovable · Blog34

    Atonom 如何用 Lovable 自建 CRM 替换每年 4 万美元的 Salesforce 合同

    Atonom 用 Lovable 自建 CRM,把每年 4 万美元的 Salesforce 合同换成约 1200 美元(含托管)的方案,且未损失所需功能。其财务负责人 Jason 三小时内做出可用原型,团队随后不再登录 Salesforce,系统覆盖线索捕获、商机创建、ARR/MRR 跟踪与销售看板,并直接接入自家 AI SDR 智能体 Zoey。

    Ожидает перевода

23.02пн
  1. OpenAI Developer Blog · Codex72

    用 Codex 跑 25 小时长时程任务:一份可复用的项目记忆文件栈

    OpenAI 用 GPT-5.3-Codex 在 Extra High 推理档下从空仓库连续运行约 25 小时、消耗约 13M token、生成约 3 万行代码,做出一个可测试的设计工具。

    Ожидает перевода

    Почему это важно: 作者用 25 小时、13M token 的实测展示长时程智能体如何靠持久化项目记忆和逐里程碑验证保持不跑偏。

03.02вт
  1. Vercel · v0 Blog60

    Vercel 发布新版 v0,从生成演示转向生产级应用

    Vercel 发布新版 v0,将其定位从生成演示转向生产级应用和智能体。新版本基于沙箱运行时,可导入任意 GitHub 仓库并自动拉取 Vercel 上的环境变量和配置;新增 Git 面板,让非工程成员也能为每个对话建分支、向 main 提 PR 并在合并后部署;同时提供与 Snowflake 和 AWS 数据库的安全集成,以及默认开启的部署保护和访问控制。

    Ожидает перевода

    Почему это важно: v0 从生成演示转向生产级应用,给出导入 GitHub 仓库、Git 面板和数据库集成等具体能力变化。

22.01чт
  1. OpenAI Developer Blog · Codex82

    Системное тестирование Agent Skills в Codex с помощью Evals

    В блоге разработчиков OpenAI рассказывается, как системно тестировать Agent Skill в Codex с помощью evals и заменить «стало казаться лучше» на сравнимые баллы.

    Почему это важно: Полный процесс системной проверки Skill в Codex с помощью eval — от определения критериев успеха до детерминированных проверок и оценки.

11.01вс
  1. OpenAI Developer Blog · Codex71

    Skyscanner 如何用 JetBrains MCP 增强 Codex CLI

    Skyscanner 工程师把 OpenAI 的 Codex CLI 接入 JetBrains IDE 的 MCP server,让 Codex 能调用 IDE 的 get_file_problems 检查文件错误、执行预设的 run configurations 跑测试和 lint。

    Ожидает перевода

    Почему это важно: Skyscanner 工程师把 Codex CLI 接入 JetBrains MCP,让 AI 直接读取 IDE 报错并跑测试,读者可借鉴这套反馈闭环。

19.11ср
  1. OpenAI · Codex Cookbook67

    Как поэтапно переделать легаси-кодовую базу с помощью Codex CLI

    OpenAI в Codex Cookbook описывает полный процесс переделки легаси-кодовой базы с помощью Codex CLI на примере системы управления инвестиционным портфелем на COBOL: пять этапов вокруг проектного документа ExecPlan.

    Почему это важно: На примере системы управления инвестиционным портфелем на COBOL показаны переиспользуемые документы и процесс проверки для поэтапной переделки легаси-кодовой базы с помощью Codex CLI.

07.11пт
  1. Terminal-Bench · News62

    Terminal-Bench выпустил версию 2.0 и пакет оптимизаций для оценки в Harbor

    Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.

    Почему это важно: Вместе с Terminal-Bench 2.0 вышел Harbor — читатели узнают, как проверяются бенчмарки для агентов и как масштабировать их в облаке.

27.10пн
  1. OpenAI Developer Blog · Codex64

    Dagster Labs 如何用 Codex 做技术文档与教学

    Dagster Labs 分享了用 OpenAI Codex 加速技术文档写作、跨媒介内容转换和文档覆盖度评估的实践。他们重写了 CONTRIBUTING.md,明确文档层级、结构和最佳实践,让 Codex 能据此生成符合规范的文档;还借助 gh 命令让 Codex 解读 PR 的 diff 和描述,并让 Codex 把教程改写成 YouTube 视频脚本。

    Ожидает перевода

    Почему это важно: Dagster 团队把 Codex 用于文档写作、PR 解读和内容跨媒介转换,其中用文档生成代码来反向衡量文档覆盖度的做法可以迁移。

10.10пт
  1. OpenAI Developer Blog · Codex50

    Codex 如何支撑 OpenAI DevDay 2025

    OpenAI 第三届 DevDay 首次全程用 Codex 参与搭建,从舞台演示、社区大厅街机到产品本身都由它协助完成。Codex 自行实现 VISCA 协议控制网络摄像头,并搭建灯光 MCP server;Codex CLI 让 Romain Huet 一个下午就完成初版。

    Ожидает перевода

09.09вт
  1. Terminal-Bench · News38

    Terminal-Bench 排行榜回应超时争议:OB-1 重新提交成绩后重回榜首

    OpenBlock Labs 的智能体 OB-1 在按正确超时限制重新提交成绩后,重新成为 Terminal-Bench 排行榜得分最高的智能体。此前该提交将数据集中每个任务的超时统一改为固定 30 分钟,而多数任务原本限时 5 分钟,导致 75 个任务超时被放宽、2 个不变、3 个被缩短。

    Ожидает перевода

29.08пт
  1. OpenAI · Codex Cookbook74

    在 GitLab CI/CD 中用 Codex CLI 自动做代码质量检查与安全修复

    OpenAI Codex Cookbook 给出把 Codex CLI 接入 GitLab CI/CD 的完整做法,用于生成 CodeClimate JSON 代码质量报告、把 SAST 结果整理成 security_priority.md,并让 Codex 输出可 git apply 的补丁。

    Ожидает перевода

    Почему это важно: 官方 Cookbook 给出把 Codex CLI 接入 GitLab CI 的完整配置,含提示词约束、JSON 标记提取与 diff 校验,可直接照搬。

15.07вт
25.06ср
20.06пт
  1. Terminal-Bench · News22

    Terminal-Bench 新增科学计算与密码学任务:UPC 并行基因组组装与 FEAL 线性密码分析

    Terminal-Bench 新增 parallelize-graph 和 feal-linear-cryptanalysis 两个高难度任务,分别要求智能体用 Unified Parallel C 实现基因组组装的并行 de Bruijn 图构建,以及对 FEAL 类分组密码实施已知明文线性密码分析攻击。

    Ожидает перевода

23.05пт
  1. Terminal-Bench · News32

    Anthropic 在 Claude 4 模型卡中引入 Terminal-Bench,Claude 4 Opus 创下 43.2% 新 SOTA

    Anthropic 将 Terminal-Bench 列为 Claude 4 模型卡七项基准之一,Claude 4 Opus 在 Terminal-Bench-Core 上取得 43.2% 的 SOTA 成绩。Dario Amodei 在 Code with Claude 主题演讲中也提及该基准。Terminal-Bench 团队表示将在未来几天验证 Claude 4 的表现并更新官方排行榜。

    Ожидает перевода

19.05пн
  1. Terminal-Bench · News48

    Terminal-Bench 推出研究预览版智能体 Terminus

    Terminal-Bench 团队发布研究预览版智能体 Terminus,用于在终端中一致地评估语言模型驱动自主智能体的能力,发布时其性能在 Terminal-Bench 上仅次于 Claude Code。Terminus 采用单工具设计,仅通过 tmux 会话发送标准按键操作,并借助 LiteLLM 支持几乎所有 API 或本地托管模型,且完全自主运行、不请求用户输入。

    Ожидает перевода

  2. Terminal-Bench · News62

    Terminal-Bench 发布首个终端智能体评测基准

    Terminal-Bench 发布首个版本,用于量化 AI 智能体在终端中执行复杂任务的能力,首发数据集 Terminal-Bench-Core-v0 包含 80 个手工编写并人工验证的任务,每个任务配有独立 Docker 环境、人工验证的解法与测试用例。

    Ожидает перевода

    Почему это важно: Terminal-Bench 给出 80 个带 Docker 环境和测试用例的终端任务,可用来横向比较不同智能体在命令行中的实际表现。