跳到正文

#测试/验证

今日 10 条
今天10/6周二
  1. DEV Community · MCP71

    用 100 行 Python 检查器识别链式 Skill 审批劫持

    作者用标准库 Python 写了一个约 100 行的 chain_check.py,用两条规则检测链式 Skill 审批劫持:单 Skill 规则标记同一文本中同时出现状态变更动作(upload、send、delete、transfer)和审批声明的 Skill,链式规则在已安装 Skill 间构建写读图,标记 A 写入含审批声明的文件、B 读取后执行状态变更动作的路径。

  2. Tproger · Программирование12

    Future AGI 1.47.0 新增通话指标并改进 AI 智能体回答评估

    Future AGI 1.47.0 发布,在运行分析中新增通话与语音指标卡片,并修复模拟通话结果与运行详情的对齐问题。评估对话时,错误语言回答、涉及其他产品的回答以及未获回复的请求现统一计为未处理请求;测试环境评估还修复了完整提示词和对话参与者标识的传递。聊天构建器页面支持折叠与调整宽度,宽度在窗口缩放后保留。

  3. DEV Community · MCP78

    对 78 个注册表 MCP 服务器的匿名健康探测:51.3% 能走通完整调用

    Pennyforge 对某公开 MCP 注册表 a–b 切片中 186 个端点里能响应 initialize 的 78 个服务器做了匿名健康探测,只有 40 个(51.3%)能走通 initialize→tools/list→一次安全 tools/call 的完整流程。

    推荐理由:对 78 个注册表 MCP 服务器做匿名健康探测,给出分层鉴权与规范版本迁移的可复现数据。

  4. DEV Community · Claude Code78

    实测十款 Claude Code Mod:守卫崩溃后命令照样执行,只留下三款

    作者在 Claude Code 2.1.288 上用 85 个会话、882 条提示、5993 次工具调用实测十款 Mod,发现没有 .catch 的守卫 Hook 抛错后会被跳过,命令照常执行,加上 catch 返回 deny 才能失败关闭。

    推荐理由:作者用 85 个会话、5993 次工具调用实测十款 Claude Code Mod,给出可迁移的取舍标准与失败开放问题。

10/5周一
  1. Habr · Вайбкодинг76

    当自动检查说谎:一个由 AI 智能体写代码的项目里的五个案例

    一个由 AI 智能体写代码、作者不读代码的产品项目里,自动检查多次给出错误结论。作者发现 86 个检查从未被任何流程触发,秘密扫描因 git 默认转义俄文文件名而漏掉 1413 个文件中的 438 个,新检查把 WHERE 误认成表别名而放过注入的错误,测试面板和智能体副本还发来三次假告警。

    推荐理由:作者用五个真实案例说明自动检查为何会给出假绿或假红,并给出可迁移的验证规则。

  2. Tproger · Программирование15

    Future AGI 1.46.0 为模拟分析加入决策优先级

    Future AGI 发布 1.46.0,核心改动在 Simulate 模块,为分析多次运行结果引入决策优先级,Runs 标签页现按环境中完整运行次数显示徽章。该版本还优化了运行摘要生成,以及 API v3 搜索场景时的任务处理,适合运行次数较多的团队。项目支持自行部署,云版本可免费开始使用。

  3. Habr · Codex71

    Dan Lu 实验:测试为何在有 bug 时仍然通过,以及如何验证测试本身

    作者解读 Dan Lu 的智能体实验:让智能体按 RFC 用 Rust 写 Zstd 解码器,比较 26 种条件(含无额外指令的对照组),主要对比用 Codex 搭配 GPT-5.6 Sol 的 medium 与 xhigh 两档,每组合 80 次运行,结果这些 TDD、模糊测试、形式化方法等指令没有带来明显整体收益,不少条件还不如对照组。

10/4周日
  1. DEV Community · Claude Code85

    如何阻止 AI 编程智能体过早宣称任务完成

    作者运行一套全自主实现系统,由编排器把任务分发给并行实现 Agent(底层是 Claude Code),最初 Agent 可以自行把任务标记为完成,结果出现未跑测试、验收标准未满足、放宽断言让测试变绿、硬编码返回值等问题。

    推荐理由:作者用可检查的验收标准、带证据的完成报告和只读验证 Agent 三层设计,解决智能体过早宣称完成的问题。

  2. Ben Holmes58

    Ben Holmes 公开了驱动其软件工厂的多智能体系统:需求来自 Linear issue 或 Slack 讨论,分诊智能体先调研并决定是直接实现还是提问,实现智能体负责构建、必要时先与子智能体协作产出 spec,验证子智能体对实现结果做端到端测试,代码评审智能体与实现智能体循环几轮后再交人工评审上线,监控自动化则响应告警并创建 issue。

  3. DEV Community · Vibe Coding74

    Android 上 Vibe Coding 的问题:AI 生成代码的幻觉、协程泄漏与安全数据

    作者梳理 AI 生成 Android 代码的常见问题,并引用多项研究数据:USENIX Security 2025 分析 223 万个生成代码样本、16 个模型,开源模型包名幻觉率平均 21.7%,商业模型 5.2%;CodeRabbit 分析 470 个开源 PR 发现 AI 代码缺陷率是人类代码的 1.7 倍,性能问题接近 8 倍。

  4. Hacker News · MCP76

    RugSnare:对 MCP 工具描述做哈希固定,检测批准后的静默变更

    RugSnare 是一个针对 MCP 工具描述的运行时完整性工具,对每个已批准工具的 { name, description, inputSchema } 做规范化哈希固定,之后任何静默变更都会触发告警并让 CI 失败(exit 1)。

    推荐理由:RugSnare 把 MCP 工具描述做哈希固定,在批准之后持续检测静默变更,并给出 66 组官方 server 版本的实测数据。

10/2周五
  1. DEV Community · Vibe Coding22

    什么是 vericoding?AI 生成代码时代的验证新范式

    vericoding(AI 引导的认证程序精化)是一种以规范而非实现为核心的软件工程方法,由定理证明器(如 Rocq、Lean)充当认证器、AI 负责猜测实现,机器负责验证代码是否符合规范。它按梯度推进:从 Gherkin 场景的 BDD,到 specsaver 的可执行运行时契约,再到 axiomander 的机械化证明。Scidonia 用该方法证明程序行为并优化慢路径。

10/1周四
9/30周三
9/29周二
  1. Habr · Claude Code82

    产品设计师用 Claude Code 单干一个月:为了让项目不散架,我在 AI 周围搭了什么

    一位有六年 SaaS 经验的产品设计师用 Claude Code 独自开发生活规划器 Котомка,几乎全部代码由 AI 编写,他负责提需求、验收和决策。

    推荐理由:作者用真实仓库记录了一个人靠 Claude Code 做产品时踩过的坑,以及围绕 AI 搭起的规则、Hook 和测试护栏。

9/28周一
9/25周五
9/23周三