Перейти к содержимому

Все новости

Сегодня 0 материалов
22.12пн
  1. Hacker News · AI Code Review 讨论38

    在 PR URL 后加 .diff,10 秒获得 AI 代码审查

    在任意 GitHub PR 链接末尾加上 .diff,复制原始 diff 粘贴进 Claude、ChatGPT 等 LLM,即可在 10 秒内获得初步代码审查,无需 Copilot Enterprise、浏览器扩展或特殊工具。作者强调这不能替代同事的真实代码审查,但能快速发现明显问题、补充遗漏的边界情况,缩短开发周期。

    Ожидает перевода

20.12сб
  1. Jesse Vincent70

    用 Codex 和 ChatGPT 5.2 反编译 Android 游戏 Wordiest 并移植到 iOS

    作者把 Wordiest 最后一个 Android APK 交给 Codex + ChatGPT 5.2,半小时内得到可玩的核心游戏,几小时后完成 Android 与 iOS 版本,全程未写也未读一行代码。

    Ожидает перевода

    Почему это важно: 作者用 Codex 反编译 Android 游戏并移植到 iOS,展示了智能体开发中难易直觉失效的真实体验。

19.12пт
  1. Paper Compute · Engineering Blog20

    Paper Compute 为 AI 智能体构建缺失的可靠性底座

    Paper Compute 提出为 AI 智能体补上缺失的 harness,用分布式系统原语解决可靠性问题,而非依赖更强的模型。其三项能力包括确定性重放、无限上下文虚拟化和可验证状态转换,后者要求智能体的变更符合 ACID 且可审计。公司同时强调可观测性优先,认为遥测是安全、成本控制与故障恢复的前提。

    Ожидает перевода

  2. Jesse Vincent68

    Проверяем поддержку Skills в OpenAI Codex CLI на практике

    Автор на практике проверил новую поддержку Skills в OpenAI Codex CLI: пока функция скрыта за фич-флагом, включить её можно командой codex --enable skills.

    Почему это важно: Автор протестировал поддержку Skills в Codex, сравнил её с тем, как загружаются Skills в Claude Code, и показал структуру каталогов и правила срабатывания.

18.12чт
  1. Jesse Vincent60

    Superpowers 4.0 发布:代码评审拆分为规格评审与代码评审两个智能体

    Superpowers 4.0 发布,核心改动是把实现步骤后的代码评审拆成两个智能体:先由 spec review 智能体确认实现符合计划,通过后 code review 智能体再检查代码质量,两步都改为循环执行,协调智能体知道实现者修复后要重跑评审。

    Ожидает перевода

17.12ср
  1. Jesse Vincent66

    Skill в Claude Code не срабатывает? Возможно, модель их просто не видит

    Claude Code даёт модели знать о существующих Skill, добавляя их названия и описания в системный промпт. Но если Skill слишком много или поле описания слишком длинное, в системный промпт они не попадут — и модель не сможет их использовать. К тому же промпт требует, чтобы модель не использовала Skill, которых в этом списке нет.

    Почему это важно: Автор объясняет, почему Claude Code не активирует установленные Skill, и предлагает готовое временное решение через переменную окружения.

15.12пн
  1. Permission Protocol · AI Agent Incident Tracker60

    报道称 AI 编码机器人失误导致 AWS 服务中断

    据 Financial Times 报道,中国区一次持续 13 小时的 AWS 服务中断被归因于使用 Amazon Kiro AI 编码智能体时的用户操作失误。Amazon 据称将该事件描述为影响极其有限。报道指出,生产环境的删除、重建或发布变更本应经过签名审批流程,但公开信息未披露具体控制边界,因此无法确认智能体是否触及部署代码、内部工具或发布操作。

    Ожидает перевода

12.12пт
  1. Hacker News · AI Code Review 讨论66

    DeepSource 发布 Autofix Bot:静态分析与 AI 混合的代码审查智能体

    DeepSource(YC W20)团队发布 Autofix Bot,一个把静态分析与前沿 AI 智能体结合的代码审查智能体,面向 AI 编码工作流。其混合架构分三步:5000+ 确定性检查器建立高精度基线并由子智能体抑制误报,AI 审查以静态发现为锚点并调用 AST、数据流图、控制流、导入图等工具,最后由子智能体生成修复、静态校验后输出干净的 git patch。

    Ожидает перевода

10.12ср
  1. Jesse Vincent68

    packnplay: одна команда запускает ИИ-агент для разработки в контейнере

    Джесси Винсент выпустил открытый инструмент packnplay: команда packnplay run claude --dangerously-skip-permissions запускает заранее настроенный временный контейнер для работы ИИ-агента разработки.

    Почему это важно: Автор упаковал в одну команду всю возню с настройкой запуска ИИ-агента для разработки в контейнере и рассказал, как конкретно решать конфликты учётных данных Claude Code.

08.12пн
  1. Martin Alderson34

    构建软件的成本真的下降 90% 了吗?

    拥有近 20 年经验的开发者 Martin Alderson 认为,agentic coding 正把软件开发的劳动力成本大幅压低:原本一个月的内部工具项目现在一周完成,Claude Code 数小时就能写出 300+ 个单元与集成测试。他援引 Jevons 悖论指出,成本下降会释放大量被压抑的软件需求,而领域知识将成为开发者唯一的护城河。

    Ожидает перевода

05.12пт
03.12ср
02.12вт
  1. Jesse Vincent69

    Собираем мост логов между фронтендом и бэкендом для ИИ-агента по разработке, чтобы было проще отлаживать веб-приложения

    Когда автор разрабатывает веб-приложение с помощью ИИ-агента, он часто натыкается на баги в клиентском JavaScript. Если агент не может решить их, просто читая код, он запускает интерактивную отладку через браузерный MCP — только чтобы посмотреть логи в консоли браузера. И токены тратятся, и медленно.

    Почему это важно: Автор предлагает переиспользуемый способ организовать мост логов между фронтендом и бэкендом, чтобы ИИ-агент видел логи фронтенда и без браузерного MCP.

01.12пн
  1. Jesse Vincent28

    Claude Opus 4.5 谈 MCP 设计:为凌晨两点半的运维新手而设计

    Claude Opus 4.5 在阅读一篇关于 MCP 设计的文章后提出,MCP 应让用户无需理解 JMAP 的 blob 架构就能读邮件,设计目标是"凌晨两点半的运维新手"。作者用打过补丁的 JMAP MCP 服务器让 Claude 清理收件箱并学习其写作风格,随后尝试让它代为处理拖延已久的邮件,结果并不理想,如今转而让 Claude 自己构建 JMAP MCP。

    Ожидает перевода

30.11вс
  1. Martin Alderson62

    作者认为我们正处在评测看不见的 GPT-4 式跃迁中

    作者 Martin Alderson 认为当前模型进步是一次更微妙的 GPT-4 时刻,但现有基准测不出来。他指出 Gemini 3 Pro Preview 在设计网页和落地页上明显强于其他模型,并给出流程:上传产品 CSS 让模型提取设计系统,再结合产品截图生成 HTML 原型。

    Ожидает перевода

25.11вт
24.11пн
21.11пт
  1. Jesse Vincent62

    Double Shot Latte:用 Stop hook 让 Claude Code 自动继续干活

    作者发布 Claude Code 插件 Double Shot Latte(DSL),用 Stop hook 在 Claude 想停下来请求人工确认时,把最近几条消息交给另一个 Claude 实例判断是否真的需要人介入,倾向于让它继续工作;若 Claude 在五分钟内三次尝试停止则放弃接管。

    Ожидает перевода

19.11ср
  1. OpenAI · Codex Cookbook67

    Как поэтапно переделать легаси-кодовую базу с помощью Codex CLI

    OpenAI в Codex Cookbook описывает полный процесс переделки легаси-кодовой базы с помощью Codex CLI на примере системы управления инвестиционным портфелем на COBOL: пять этапов вокруг проектного документа ExecPlan.

    Почему это важно: На примере системы управления инвестиционным портфелем на COBOL показаны переиспользуемые документы и процесс проверки для поэтапной переделки легаси-кодовой базы с помощью Codex CLI.

16.11вс
07.11пт
  1. Terminal-Bench · News62

    Terminal-Bench выпустил версию 2.0 и пакет оптимизаций для оценки в Harbor

    Terminal-Bench выпустил версию 2.0 и пакет Harbor: первый — это более строго проверенный и сложный бенчмарк для оценки агентов, второй — для их оценки и оптимизации. Harbor переписал тестовый фреймворк Terminal-Bench: теперь можно разворачивать контейнеры в облаке, есть интерфейсы rollout для RL и SFT, а также совместимость с любыми агентами, которые упаковываются в контейнер.

    Почему это важно: Вместе с Terminal-Bench 2.0 вышел Harbor — читатели узнают, как проверяются бенчмарки для агентов и как масштабировать их в облаке.

02.11вс
  1. Martin Alderson34

    Excel 智能体能否释放 1 万亿美元经济价值?

    继 Shortcut 和 Microsoft 的 Agent Mode 之后,Claude for Excel 的推出让 Excel 智能体成为新热点。作者估算,美国约 7090 万管理及专业岗位从业者中,38% 的工作时间花在 Excel 上,对应约 2.4 万亿美元年人力成本,即使只提升 50% 效率,也意味着至少 1 万亿美元被浪费的工时。

    Ожидает перевода

27.10пн
  1. Jesse Vincent74

    Переносим Skills и Superpowers в OpenAI Codex CLI

    Автор Джесси Винсент за один вечер перенёс Superpowers и всю систему SKILL.md в OpenAI Codex CLI; релиз вышел вместе с Superpowers 3.3.0.

    Почему это важно: Автор перенёс систему SKILL.md из Claude в Codex CLI, показал соответствие инструментов и способ установки — по этому можно судить, реально ли переиспользовать Skill между моделями.

  2. OpenAI Developer Blog · Codex64

    Dagster Labs 如何用 Codex 做技术文档与教学

    Dagster Labs 分享了用 OpenAI Codex 加速技术文档写作、跨媒介内容转换和文档覆盖度评估的实践。他们重写了 CONTRIBUTING.md,明确文档层级、结构和最佳实践,让 Codex 能据此生成符合规范的文档;还借助 gh 命令让 Codex 解读 PR 的 diff 和描述,并让 Codex 把教程改写成 YouTube 视频脚本。

    Ожидает перевода

    Почему это важно: Dagster 团队把 Codex 用于文档写作、PR 解读和内容跨媒介转换,其中用文档生成代码来反向衡量文档覆盖度的做法可以迁移。

25.10сб
  1. Jesse Vincent62

    一个让 Claude Code 派两个子智能体竞争评审代码的提示词技巧

    作者分享了一个用于 Claude Code 的代码评审提示词:让 Claude 派两个子智能体仔细评审第 5 阶段,告诉它们彼此在竞争,要求同时检查架构和实现,并称找出更多问题的一方会获得晋升。作者表示这个简单提示词的效果远超预期,并提到后续还会写更多关于代码评审提示词的内容。

    Ожидает перевода

24.10пт
  1. Jesse Vincent36

    用 ChatGPT Atlas 的 Agent 模式清理 Facebook 信息流

    作者用 ChatGPT Atlas 的 Agent 模式自动清理 Facebook 信息流,通过一段提示词让智能体持续滚动页面、隐藏赞助帖并对含 Follow/Join 链接的帖子点“不感兴趣”,最终信息流只剩自己关注的人发布的真实帖子。作者对 AI 浏览器的提示注入风险仍持警惕,表示目前不会把银行或邮箱凭据交给这类浏览器。

    Ожидает перевода

23.10чт
  1. Jesse Vincent69

    Дополняем Claude Code эпизодической памятью с помощью episodic-memory

    Автор сделал для Claude Code плагин episodic-memory, который умеет искать по записям прошлых сессий. По умолчанию Claude Code удаляет журналы сессий в формате .jsonl из каталога ~/.claude/projects через месяц; этот срок можно продлить с помощью cleanupPeriodDays в файле ~/.claude/settings.json.

    Почему это важно: Автор превратил журналы сессий Claude Code в эпизодическую память с семантическим поиском, так что читатель может сам оценить, как долгосрочный контекст сохраняется между сессиями.

19.10вс
  1. Jesse Vincent71

    Автор собрал собственный superpowers-chrome MCP и снизил затраты на запуск с 13678 токенов до 947

    Для Claude Code автор сделал лёгкий Chrome MCP и Skill под названием superpowers-chrome: при запуске конфигурация MCP занимает всего 947 токенов, тогда как Microsoft Playwright MCP только на активное состояние требует 13678 токенов — это примерно 7% контекстного окна.

    Почему это важно: Автор сравнил расход токенов у собственного Chrome MCP и Playwright MCP и показал, какие компромиссы возникают при проектировании интерфейса инструментов для LLM.

17.10пт
16.10чт
  1. Jesse Vincent78

    Anthropic запустила официальную систему Skills в Claude Code, Claude.ai и Claude API

    Anthropic одновременно запустила собственную систему Skills в Claude Code, Claude.ai и Claude API, и вскоре автор Джесси Винсент выпустил новую версию Superpowers, переведённую на официальные Skills.

    Почему это важно: Опираясь на почти месяц реального использования, автор сравнивает официальные Skills с собственными решениями и рассказывает, чем пришлось пожертвовать при переходе.

15.10ср
  1. Martin Fowler · Exploring Generative AI74

    拆解 Spec-Driven Development:Kiro、spec-kit 与 Tessl 三种工具实测

    Martin Fowler 试用 Kiro、spec-kit 和 Tessl 三款自称实现 spec-driven development(SDD)的工具,把 SDD 归纳为 spec-first、spec-anchored、spec-as-source 三个层次,并指出目前所有方案都停留在 spec-first。

    Ожидает перевода

    Почему это важно: 作者亲手试用 Kiro、spec-kit 和 Tessl 三款 SDD 工具,给出 spec-first、spec-anchored、spec-as-source 三层划分,并指出小任务被过度规格化的问题。