GitHub 发布 AI 代码评审开放基准 ReviewBench
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
Ожидает перевода
Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。
Ожидает перевода
Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。
Вышел AI Hero Skills v1.3: добавлены три навыка — /implement-spec, /pr и /retro, а основной процесс, который раньше шёл от /grill-with-docs через /to-spec к /to-tickets, теперь охватывает ещё реализацию, пул-реквесты и ретроспективу.
Почему это важно: Автор достроил набор навыков до полной цепочки — от написания спецификации до пул-реквеста и ретроспективы — и рассказал, чем пришлось пожертвовать на каждом этапе и что пока сделано грубо.
i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso
Почему это важно: На примере Лорен Тан, которая за месяц смёрджила 2500 пул-реквестов, Баоюй показывает, что отказ от построчного ревью возможен только при проверке навыками и ограничениях в виде правил, и описывает условия, при которых этот подход применим у него самого.
Lovable выпустила Chats — агента, который работает на уровне рабочего пространства, может вести диалог между проектами и запускать сборку. После подтверждения изменений он передаёт задачу builder-агенту внутри проекта и возвращает ход выполнения обратно в диалог.
Почему это важно: Lovable раскрыла трёхуровневую архитектуру Chats: траектории, входящие сообщения и активация. Её можно перенести на собственную оркестрацию мультиагентных систем.
Cursor выпустил двух ботов — Rollouts и Security Review, доступных для Team и Enterprise.
Почему это важно: Официально описаны процессы мониторинга и проверки безопасности для этих двух ботов — читатели могут оценить, можно ли встроить их в существующий конвейер доставки.
Lovable выпустила Opus 5.5; по заявлению компании, результаты сопоставимы с Opus 5, но число шагов до завершения сократилось на треть–половину. На внутреннем бенчмарке Lovable Opus 5.5 сравнялся с Opus 5 в двух задачах — сборке от 0 до -1 и итеративных правках кода — и превзошёл его на 4%–6% по дисциплине проверки; при всех уровнях интенсивности рассуждений число шагов на задачу снизилось на 26%–57%, а объём входных токенов — на 21%–59%; различия значимы при доверительном уровне 95%.
Почему это важно: Lovable официально приводит данные сравнения Opus 5.5 и Opus 5 по числу шагов и токенов — по ним можно оценить реальное изменение эффективности сборки.
Lovable выпустила превью-движок OJ, с нуля реализованный на Rust: он читает существующий vite.config.ts и через слой совместимости запускает настоящие плагины Vite — один бинарник, без установки инструментов в проект.
Почему это важно: Lovable переписала превью-движок OJ на Rust и привела сравнение с Vite по холодному старту и потреблению памяти, а также данные канареечного развёртывания в продакшене.
Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.
Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.
В официальном блоге OpenAI даны рекомендации по настройке Skills, AGENTS.md и промптов задач под GPT-6 Astra: описание Skill должно быть по возможности коротким и чётко указывать, где он применим; для многошаговых Skills корневой документ служит минимальной маршрутизацией — не стоит превращать Skill в слишком детальный список шагов.
Почему это важно: OpenAI опубликовал рекомендации по чистке Skills, AGENTS.md и промптов под GPT-6 Astra — их можно перенести и на конфигурацию существующих репозиториев.
Cursor выпустил функцию «Проекты» для длительной работы — например, над одной фичей, миграцией или целым приложением. Она месяцами удерживает контекст и делегирует задачи тысячам подчинённых ИИ-агентов. Проекты работают на облачных агентах: координирующий агент не пишет код, а только планирует, распределяет задачи и принимает результаты; когда нужны локальные тесты, он запускает локальных агентов. В каждом проекте поддерживается набор файлов, синхронизируемых между облаком и локальными машинами, — так постепенно накапливаются результаты исследований, артефакты и понимание кодовой базы.
Почему это важно: В официальном описании приведены механизмы совместного использования контекста и автоматического запуска для многолетней работы нескольких агентов в рамках проекта — по ним можно понять, как именно берут на себя длительные задачи.
GitHub выпустил Project HydraFusion в Copilot CLI в статусе исследовательского превью: оркестрация на уровне рантайма выбирает, какая модель из нескольких провайдеров будет выполнять задачу. Пользователь выбирает HydraFusion так же, как обычную модель, а оплата идёт по стандартным тарифам каждой модели.
Почему это важно: GitHub приводит сравнение трёх режимов оркестрации HydraFusion и трёх базовых вариантов по стоимости и качеству — по нему можно судить, что даёт многомодельная оркестрация на реальных задачах программирования.
Автор построил в Codex с помощью Astra космическую исследовательскую игру Void Explorer — с 2,048 звёздными системами и более чем 10,000 процедурно генерируемыми планетами — и рассказал о полном процессе: от промпта до архитектуры, тестирования и измерения производительности.
Почему это важно: Автор использовал Astra в Codex, чтобы сделать полноценную игру, и показал переносимый процесс совместной работы — от промпта до тестирования и измерения производительности.
Cline перенесла расширение VS Code с монолитного ядра примерно на 76,000 строк на Cline SDK и построила собственный механизм постепенного выката: в одном установочном пакете лежат loader и две версии расширения — legacy и next, — а функциональный флаг PostHog по проценту решает, какую активировать; при падении происходит автоматический откат к legacy, а флаг в любой момент можно опустить до 0% как kill switch.
Почему это важно: Официальный разбор того, как Cline перевела расширение VS Code для 1100 тысяч пользователей на новый harness, с механизмом постепенного выката и сравнением метрик до и после.
GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。
Ожидает перевода
Почему это важно: GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。
Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.
Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.
Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.
Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.
Команда Cline собрала на Cline SDK ИИ-агента для код-ревью: проверка разбита на два цикла агента — review и judge, — а управляющий скрипт затем отправляет все оставшиеся замечания одним событием COMMENT в пул-реквест на GitHub.
Почему это важно: Полный разбор плагина, хуков и двухэтапного цикла ИИ-агента для код-ревью, который можно перенести на другие сценарии автоматизированной проверки.
Lovable официально разобрала, как подключить приложения платформы к сторонним сервисам: сначала поддержали MCP как временное решение для получения контекста в чате, затем создали собственные app connectors, а запросы между опубликованными приложениями и сторонними API проксирует Connector Gateway — он хранит учётные данные и логику их обновления, так что развёрнутые приложения не касаются секретных ключей.
Почему это важно: Lovable официально разобрала, как превратить коннекторы в переиспользуемую инфраструктуру; этот опыт будет полезен командам, которые занимаются интеграциями со сторонними сервисами и управлением учётными данными.
Инженеры OpenAI используют Codex вместе с открытым приложением для ноутбуков Runme, чтобы автоматизировать рутинную работу, например запуск оценки моделей. Делается это так: в ноутбуке Runme пишут целевые ячейки, Codex читает цель, составляет план и ждёт одобрения человека, а затем выполняет его, фиксируя команды, вывод и выводы — включая пройденные тупики.
Почему это важно: Автор передал процесс оценки Codex с помощью ноутбука Runme и WebMCP; читатели могут перенять его подход к постановке целей, согласованию и накоплению контекста.
OpenAI представила Daybreak — набор инструментов для защиты, объединяющий ChatGPT, Codex Security и открытый CLI Codex Security. Он покрывает проверку пул-реквестов до слияния, разбор репозиториев и накопившихся уязвимостей, а также регулярные проверки в CI.
Почему это важно: В официальной документации описан полный сценарий работы с Codex Security — от проверки пул-реквестов и сканирования репозиториев до пакетного сканирования через CLI. По нему можно понять, как встроить инструмент в существующие процессы безопасности.