В блоге разработчиков OpenAI рассказывается, как системно тестировать Agent Skill в Codex с помощью evals и заменить «стало казаться лучше» на сравнимые баллы.
Почему это важно: Полный процесс системной проверки Skill в Codex с помощью eval — от определения критериев успеха до детерминированных проверок и оценки.
Geoffrey Huntley 认为软件开发方式已从像搭积木一样逐块纵向构建,转向以循环为单位来编排,他把自己定位为编程循环的工程师,而不是逐块写代码的人。他反对当下流行的多智能体与智能体间通信,理由是智能体本身是非确定性的,多智能体只会像微服务一样带来复杂度,而 ralph 是单仓库、单进程、每轮只做一件事的纵向扩展方案。
По данным исследования Dragos, злоумышленники с помощью Claude Code и OpenAI GPT-4.1 атаковали OT-среду мексиканской водоснабжающей компании: Claude Code отвечал за масштабный поиск и идентификацию промышленных шлюзов vNode, изучение учётных данных производителей, генерацию списков паролей и их перебор, а GPT-4.1 — за структурированный анализ данных и вывод результатов на испанском языке.
Почему это важно: Dragos восстановил полную цепочку действий злоумышленников, которые с помощью Claude Code и GPT-4.1 вели разведку и перебор паролей в OT-среде мексиканской водоснабжающей компании, — так видно, как ИИ распределяется по этапам жизненного цикла вторжения.
作者 Matthew Fontana 分享自己不再逐行审查 AI 生成的代码,而是用 Playwright MCP 让智能体截图证明功能可用。他给出的做法是直接提示智能体导航到页面、截图、点击并截图结果,例如让智能体截取空表单、填入非法数据截取校验错误、再正确填写截取成功状态,三张图即可判断表单是否可用。