Future AGI 1.47.0 新增通话指标并改进 AI 智能体回答评估
Future AGI 1.47.0 发布,在运行分析中新增通话与语音指标卡片,并修复模拟通话结果与运行详情的对齐问题。评估对话时,错误语言回答、涉及其他产品的回答以及未获回复的请求现统一计为未处理请求;测试环境评估还修复了完整提示词和对话参与者标识的传递。聊天构建器页面支持折叠与调整宽度,宽度在窗口缩放后保留。
Future AGI 1.47.0 发布,在运行分析中新增通话与语音指标卡片,并修复模拟通话结果与运行详情的对齐问题。评估对话时,错误语言回答、涉及其他产品的回答以及未获回复的请求现统一计为未处理请求;测试环境评估还修复了完整提示词和对话参与者标识的传递。聊天构建器页面支持折叠与调整宽度,宽度在窗口缩放后保留。
Future AGI 发布 1.46.0,核心改动在 Simulate 模块,为分析多次运行结果引入决策优先级,Runs 标签页现按环境中完整运行次数显示徽章。该版本还优化了运行摘要生成,以及 API v3 搜索场景时的任务处理,适合运行次数较多的团队。项目支持自行部署,云版本可免费开始使用。
南洋理工大学 S-Lab、A*STAR 和 UIUC 团队提出 V-Rubrics,将 50,248 个视觉样本拆成 352,938 条可逐项检查的准则,让视觉事实、推理步骤和任务要求分别参与奖励计算。
Cloudflare 发布 Worker Previews,让每个 Git 分支拥有独立且接近生产的环境,各自有稳定 URL、独立配置和状态,并带独立可观测性。
Cursor 发布 Rollouts 和 Security Review 两个 bot,均面向团队版和企业版开放。
推荐理由:官方给出两个 bot 的监控与安全审查流程,读者可据此判断能否接入现有交付链路。
Lovable 上线 Opus 5.5,官方称其与 Opus 5 结果持平,但完成步数减少三分之一到一半。在 Lovable 内部基准上,Opus 5.5 在 0-to-1 构建和迭代改代码两项与 Opus 5 打平,验证纪律一项高出 4% 到 6%;各档推理强度下每任务步骤数减少 26% 到 57%,输入 token 减少 21% 到 59%,差异在 95% 置信水平上显著。
推荐理由:Lovable 官方给出 Opus 5.5 与 Opus 5 在步骤数和 token 上的对比数据,可据此判断构建效率的实际变化。
OpenAI 推出 Daybreak,把 ChatGPT、Codex Security 和开源 Codex Security CLI 组合成一套安全防御工作流,覆盖 PR 合并前审查、仓库与漏洞积压排查、CI 定期检查。
推荐理由:官方给出 Codex Security 从 PR 审查、仓库扫描到 CLI 批量扫描的完整用法,可据此判断如何接入现有安全流程。
Simon Willison 用 Claude Code for web 做了一个约 150 行、零依赖的 TypeScript 服务原型,基于 Bun 1.4 实验性的 Bun.WebView 提供 shot-scraper 风格的 JSON API,支持执行 JavaScript 和输出 PNG/JPEG/WebP 截图,无需 Puppeteer 或 Playwright。
Superpowers 6 发布,作者称在 Anthropic 评测基准上构建耗时降低 50%、token 花费降低 60%,主要来自合并规范符合性与代码质量两个评审 agent、预先生成评审用的 diff 包让评审者少跑 git,以及调整编排器对任务所需 agent 类型的指引。
推荐理由:作者用自建评测套件量化了 Superpowers 6 在构建耗时和 token 花费上的改进,并公开了实验记录与失败结论。