Перейти к содержимому
07.10 · ср

Новые избранные материалы

06.10вт
  1. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    Ожидает перевода

    Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

03.10сб
  1. TonyBai80

    Pi 1.0: движок агентов, лежащий в основе OpenClaw, поглотил MCP — а заодно вышел Pi Durable с восстановлением после сбоев

    1 октября команда Earendil выпустила Agent Harness Pi 1.0: у репозитория на GitHub около 11.1 тыс. звёзд и 1.4 тыс. форков, а вместе с ним — экспериментальный пакет Pi Durable.

    Почему это важно: Pi 1.0 и Pi Durable переносят в среду выполнения агентов распределённые концепции — контрольные точки, идемпотентные коммиты, дерево владения, — и по ним можно судить об инженерных компромиссах при долго работающих агентах.

01.10чт
  1. cxuanAI85

    Google DeepMind 发布 Gemini 4 Argon,输出上限提至 1M tokens

    Google DeepMind 发布 Gemini 4 Argon,单次输出上限从 64K 提升到 1M tokens,主打长任务与多步骤推理。

    Ожидает перевода

    Почему это важно: 汇总了 Gemini 4 Argon 的官方评测数据与 Google 内部落地案例,可对照各家旗舰模型的能力差异。

30.09ср
  1. Habr · Codex76

    OpenAI выпустила GPT-6.1 Sol — цена API примерно в пять раз ниже, чем у Astra

    OpenAI выпустила GPT-6.1 Sol для программирования, работы с документами и автоматизации задач. По словам компании, в部分 тестах модель почти догнала GPT-6 Astra. В тесте DeepSWE 1.1 на задачах с реальными кодовыми базами она сравнялась с Astra, а стоимость выполнения оказалась примерно в пять раз ниже. В тесте OSWorld 2.0 на управлении приложениями при максимальном уровне рассуждений модель обошла GPT-6 Sol на 7 процентных пунктов.

    Почему это важно: GPT-6.1 Sol сравнялась с Astra на DeepSWE 1.1, а стоимость — примерно в пять раз ниже; по этим данным можно судить, как изменилось соотношение цены и качества для задач программирования.

29.09вт
  1. Simon Willison · Coding Agents78

    Прямая трансляция с OpenAI DevDay 2026: анонс персонального агента Dots, GPT-6.1 Sol и Ultrafast

    Саймон Уиллисон ведёт прямую трансляцию с основной презентации OpenAI DevDay 2026 из Fort Mason в Сан-Франциско: OpenAI представляет персонального агента Dots, ChatGPT Space, GPT-6.1 Sol и Ultrafast.

    Почему это важно: Подробный репортаж с OpenAI DevDay: что на самом деле представляют собой Dots, GPT-6.1 Sol, Ultrafast и Codex Security.

  2. Tproger · Программирование88

    OpenAI выпустила GPT-6.1 Sol на DevDay — цена всего пятая часть от Astra

    29 сентября на DevDay в Сан-Франциско OpenAI представила GPT-6.1 Sol; API называется gpt-6.1-sol, цена — 2 доллара за миллион входных токенов и 10 долларов за миллион выходных, кэшированный ввод — 0.10 доллара. Это пятая часть стандартной цены GPT-6 Astra.

    Почему это важно: На DevDay OpenAI выпустила GPT-6.1 Sol, снизив цену до пятой части от Astra, а заодно обновила Codex, Agents API и систему плагинов — по этим изменениям можно оценить затраты и эволюцию инструментария.

23.09ср
  1. Tproger · Программирование80

    Anthropic выпустила флагманскую модель Claude Opus 5.5

    22 сентября Anthropic выпустила флагманскую модель Claude Opus 5.5 — для разработчиков и команд, которые поручают ИИ-агентам многошаговые задачи вроде программирования и анализа данных. По заявлению компании, по сравнению с Opus 5 модель работает быстрее и стоит дешевле.

    Почему это важно: Опубликованные Anthropic цены и снижение стоимости при типовой нагрузке помогут разработчикам оценить затраты на переход к длительным задачам ИИ-агентов.

  2. Cursor · Changelog62

    Cursor выпускает двух ботов: Rollouts и Security Review

    Cursor выпустил двух ботов — Rollouts и Security Review, доступных для Team и Enterprise.

    Почему это важно: Официально описаны процессы мониторинга и проверки безопасности для этих двух ботов — читатели могут оценить, можно ли встроить их в существующий конвейер доставки.

  3. Lovable · Blog60

    Lovable выпускает Opus 5.5: сборка быстрее, качество на уровне Opus 5

    Lovable выпустила Opus 5.5; по заявлению компании, результаты сопоставимы с Opus 5, но число шагов до завершения сократилось на треть–половину. На внутреннем бенчмарке Lovable Opus 5.5 сравнялся с Opus 5 в двух задачах — сборке от 0 до -1 и итеративных правках кода — и превзошёл его на 4%–6% по дисциплине проверки; при всех уровнях интенсивности рассуждений число шагов на задачу снизилось на 26%–57%, а объём входных токенов — на 21%–59%; различия значимы при доверительном уровне 95%.

    Почему это важно: Lovable официально приводит данные сравнения Opus 5.5 и Opus 5 по числу шагов и токенов — по ним можно оценить реальное изменение эффективности сборки.

15.09вт
  1. Lovable · Blog64

    Lovable открыла исходный код превью-движка OJ на Rust: холодный старт и потребление памяти лучше, чем у Vite

    Lovable выпустила превью-движок OJ, с нуля реализованный на Rust: он читает существующий vite.config.ts и через слой совместимости запускает настоящие плагины Vite — один бинарник, без установки инструментов в проект.

    Почему это важно: Lovable переписала превью-движок OJ на Rust и привела сравнение с Vite по холодному старту и потреблению памяти, а также данные канареечного развёртывания в продакшене.

  2. Cline · Blog62

    Cline выпускает открытое настольное приложение Cline Desktop для моделей с открытыми весами

    Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.

    Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.

10.09чт
  1. Cursor · Changelog76

    Cursor выпустил функцию «Проекты» — она позволяет координирующему ИИ-агенту брать на себя длительные задачи разработки

    Cursor выпустил функцию «Проекты» для длительной работы — например, над одной фичей, миграцией или целым приложением. Она месяцами удерживает контекст и делегирует задачи тысячам подчинённых ИИ-агентов. Проекты работают на облачных агентах: координирующий агент не пишет код, а только планирует, распределяет задачи и принимает результаты; когда нужны локальные тесты, он запускает локальных агентов. В каждом проекте поддерживается набор файлов, синхронизируемых между облаком и локальными машинами, — так постепенно накапливаются результаты исследований, артефакты и понимание кодовой базы.

    Почему это важно: В официальном описании приведены механизмы совместного использования контекста и автоматического запуска для многолетней работы нескольких агентов в рамках проекта — по ним можно понять, как именно берут на себя длительные задачи.

05.09сб
  1. GitHub Blog · Copilot71

    GitHub Copilot представил Project HydraFusion — многомодельную оркестрацию на уровне рантайма для повышения качества кода

    GitHub выпустил Project HydraFusion в Copilot CLI в статусе исследовательского превью: оркестрация на уровне рантайма выбирает, какая модель из нескольких провайдеров будет выполнять задачу. Пользователь выбирает HydraFusion так же, как обычную модель, а оплата идёт по стандартным тарифам каждой модели.

    Почему это важно: GitHub приводит сравнение трёх режимов оркестрации HydraFusion и трёх базовых вариантов по стоимости и качеству — по нему можно судить, что даёт многомодельная оркестрация на реальных задачах программирования.

04.09пт
  1. DevAgentStack · Field Notes82

    Бенчмарки GPT-6 Astra против Fable 5.1: какие результаты сравнимы, а какие нет

    OpenAI выпустила GPT-6 Astra и Astra Pro 3 сентября 2026 года. Первая партия доступна только компаниям — участникам программы по кибербезопасности Daybreak; платный ChatGPT, API и AWS откроют в ближайшие дни.

    Почему это важно: Разбираем сравнение GPT-6 Astra и Fable 5.1 по бенчмаркам: у всех разные тестовые версии и harness, поэтому читатель может понять, какие результаты вообще можно сопоставлять.

02.09ср
  1. Cursor · Changelog66

    Cursor выпускает self-hosted машины: выполнение инструментов остаётся внутри вашей сети

    Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.

    Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.

27.08чт
  1. Cline · Blog71

    Cline протестировал восемь моделей на задачах IMO 2026: DeepSeek V4 Flash взял золотую планку всего за 0.12 доллара

    Cline прогнал восемь моделей через собственный harness на шести задачах IMO 2026. Решения оценивали вслепую по 0–7-балльной шкале два эксперта — GPT-5.5 и Claude Opus 5, а спорные случаи разбирал Gemini 3.1 Pro. Порог золотой медали — 29 баллов.

    Почему это важно: Cline провёл слепую оценку восьми моделей на задачах IMO 2026 в одном и том же harness и свёл результаты с ценой за попытку — так видно реальную отдачу от моделей с открытыми весами.

21.08пт
  1. OpenAI Developer Blog · Codex65

    OpenAI выпустила Daybreak и рабочий процесс безопасности Codex Security

    OpenAI представила Daybreak — набор инструментов для защиты, объединяющий ChatGPT, Codex Security и открытый CLI Codex Security. Он покрывает проверку пул-реквестов до слияния, разбор репозиториев и накопившихся уязвимостей, а также регулярные проверки в CI.

    Почему это важно: В официальной документации описан полный сценарий работы с Codex Security — от проверки пул-реквестов и сканирования репозиториев до пакетного сканирования через CLI. По нему можно понять, как встроить инструмент в существующие процессы безопасности.

19.08ср
  1. Cursor · Changelog66

    Cursor обновляет облачного агента и Harness: подписка на события, независимая работа субагентов и /goal

    Cursor обновил облачного агента и Cursor harness: теперь облачный агент может подписываться на источники событий и возобновлять работу при новых изменениях в PR, обсуждениях в Slack или по расписанию, продолжая работу до завершения — исправляя проблемы CI и обрабатывая комментарии ботов.

    Почему это важно: Облачный агент переходит от однократного выполнения к подписке на события и постоянному сопровождению PR и обсуждений в Slack — читатели могут оценить, как меняются границы автоматизации.

  2. OpenAI Developer Blog · Codex71

    OpenAI открыла исходный код Codex harness и опубликовала клиентский протокол app-server

    OpenAI выложила в открытый доступ harness, на котором работают приложение Codex, CLI и расширения для IDE, а через клиентский протокол Codex app-server открыла такие возможности, как создание потоков, запуск раундов, получение событий и обработка запросов на утверждение.

    Почему это важно: Компания официально опубликовала harness Codex и протокол app-server — по ним можно понять, как встраивать ИИ-агентов в собственные продукты и где проходят границы такого встраивания.

11.08вт
  1. Cline · Blog60

    NVIDIA Nemotron 3.5 Lightning появился в Cline и доступен бесплатно

    NVIDIA выпустила Nemotron 3.5 Lightning — настраиваемую открытую модель для постоянно работающих ИИ-агентов, которая уже бесплатно доступна в Cline.

    Почему это важно: Новая открытая модель NVIDIA бесплатно доступна в Cline; читатели могут оценить, стоит ли переходить на неё при частых вызовах ИИ-агентов.