跳到正文

#测试/验证

今日 0 条
10/6周二
  1. Tproger · Программирование12

    Future AGI 1.47.0 新增通话指标并改进 AI 智能体回答评估

    Future AGI 1.47.0 发布,在运行分析中新增通话与语音指标卡片,并修复模拟通话结果与运行详情的对齐问题。评估对话时,错误语言回答、涉及其他产品的回答以及未获回复的请求现统一计为未处理请求;测试环境评估还修复了完整提示词和对话参与者标识的传递。聊天构建器页面支持折叠与调整宽度,宽度在窗口缩放后保留。

10/5周一
  1. Tproger · Программирование15

    Future AGI 1.46.0 为模拟分析加入决策优先级

    Future AGI 发布 1.46.0,核心改动在 Simulate 模块,为分析多次运行结果引入决策优先级,Runs 标签页现按环境中完整运行次数显示徽章。该版本还优化了运行摘要生成,以及 API v3 搜索场景时的任务处理,适合运行次数较多的团队。项目支持自行部署,云版本可免费开始使用。

9/29周二
9/23周三
  1. Lovable · Blog60

    Lovable 上线 Opus 5.5:构建更快,质量与 Opus 5 持平

    Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。

    推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。

8/21周五
  1. OpenAI Developer Blog · Codex65

    OpenAI 发布 Daybreak 与 Codex Security 安全工作流

    OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。

    推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。

8/20周四
6/15周一
  1. Jesse Vincent78

    Superpowers 6 发布:构建提速最高 50%、token 花费降低最高 60%

    Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。

    推荐理由:作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。