Перейти к содержимому

#Агент

Сегодня 0 материалов
06.10вт
  1. 宝玉71

    SemiAnalysis 实测 Anthropic、OpenAI 等九家 AI 订阅套餐后得出,同样 200 美元,Claude 订阅折算的 Token 用量约为 OpenAI 的 5 倍。

    Ожидает перевода

    ЦитатаSemiAnalysis@SemiAnalysis_

    Anthropic Subscriptions Offer 5x+ More Value Than OpenAI Limit testing every AI subscription plan from Anthropic, OpenAI, Meta, SpaceXAI, MiniMax, Moonshot, Zdotai, Cursor, and Cognition https://newsletter.semianalysis.com/p/anthropic-subscriptions-offer-5x

  2. 宝玉71

    据 The Information 10 月 5 日报道,Meta 和微软都在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。

    Ожидает перевода

    ЦитатаNIK@ns123abc

    🚨BREAKING: Microsoft and META are aggressively cutting employee use of Claude ahead of Anthropic's IPO Microsoft has cut internal claude spend by more than 33%, nuked per-employee token budget from $100k/month to $10k/month, and forced Copilot to auto-route to cheaper models META used Claude code to build Muse, then cut active users from 60,000 to 30,000 (50% decline) after launch, and replaced it with Muse Code Palantir and Nvidia are also scaling back claude over soaring prices and data privacy fears it’s OVER…

  3. 宝玉70

    amontlabs/lcu 把 Codex 的 Computer Use 单独拆出,让 Claude Code、Codex CLI、Pi 等 Agent 工具通过 MCP 调用。

    Ожидает перевода

    Цитата向阳乔木@vista8

    发现一个牛逼的东西,让任意 Agent 调用 Codex 的 Computer Use。 Codex 最强的就是 Computer Use。 但最近用 Claude Opus 5.5比较多,这样就强强联合了。 刚测试通过,安装后建议配置个 Hook,指定白名单可控制哪些 App 安装地址见评论区

  4. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    Ожидает перевода

    Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

04.10вс
  1. 宝玉82

    Опираясь на содержание подкаста, Баоюй рассказывает, как Лорен Тан из SpaceXAI, работающая над Grok Bot, за месяц смёрджила 2500 пул-реквестов: вечером она даёт ИИ самостоятельно всё проверить и смёрджить, а утром лишь выборочно просматривает результат, не проверяя каждый PR по отдельности.

    Цитатаlauren@poteto

    i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso

    Почему это важно: На примере Лорен Тан, которая за месяц смёрджила 2500 пул-реквестов, Баоюй показывает, что отказ от построчного ревью возможен только при проверке навыками и ограничениях в виде правил, и описывает условия, при которых этот подход применим у него самого.

03.10сб
  1. 宝玉62

    剑桥大学 AI 科学与政策项目(CASP)9 月发布一篇论文,Hinton、Bengio 等 20 多位研究者联名讨论 AI 研发被自动化后是否会引发智能爆炸,Hinton 在 X 上推荐了该论文。

    Ожидает перевода

    ЦитатаGeoffrey Hinton@geoffreyhinton

    The idea of an intelligence explosion caused by recursive self improvement has been around for a long time but until very recently it did not seem imminent. Now many leading researchers think it may happen quite soon. You can read our paper about it here: https://casp.ac/reports/intelligence-explosion

01.10чт
26.09сб
  1. Boris Cherny60

    Claude Tag 在 Slack 中现已支持个人连接器,可直接访问个人有权限的 Drive 文档、Salesforce 账号或数仓表,今天在 Teams 上线、下周面向 Enterprise 开放。

    Ожидает перевода

    ЦитатаNoah Zweben@noahzweben

    Claude Tag in Slack can now use your personal connectors! You can now securely access that Drive doc, Salesforce account, or Warehouse table that you have personal access to right where the work happens. Avail. on Teams today and Enterprise next week https://claude.com/blog/claude-tag-now-supports-personal-connectors-in-channels

25.09пт
  1. GitHub Blog · Copilot34

    GitHub Copilot 的 canvas:当聊天框不是与 AI 协作的正确界面

    GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,也能在本地执行代码。作者认为 chat 只适合作为通用兜底界面,用户明确任务时更该让智能体生成可复用工具,例如用 canvas 管理 Winget 包或直接操作 SQLite 数据库,避免把 token 浪费在“stage and commit”这类操作上。

    Ожидает перевода

24.09чт
  1. Lovable · Blog71

    Lovable выпустила Chats и раскрыла архитектуру траекторий и входящих сообщений для мультиагентного взаимодействия

    Lovable выпустила Chats — агента, который работает на уровне рабочего пространства, может вести диалог между проектами и запускать сборку. После подтверждения изменений он передаёт задачу builder-агенту внутри проекта и возвращает ход выполнения обратно в диалог.

    Почему это важно: Lovable раскрыла трёхуровневую архитектуру Chats: траектории, входящие сообщения и активация. Её можно перенести на собственную оркестрацию мультиагентных систем.

23.09ср
  1. Cursor · Changelog62

    Cursor выпускает двух ботов: Rollouts и Security Review

    Cursor выпустил двух ботов — Rollouts и Security Review, доступных для Team и Enterprise.

    Почему это важно: Официально описаны процессы мониторинга и проверки безопасности для этих двух ботов — читатели могут оценить, можно ли встроить их в существующий конвейер доставки.

  2. Lovable · Blog60

    Lovable выпускает Opus 5.5: сборка быстрее, качество на уровне Opus 5

    Lovable выпустила Opus 5.5; по заявлению компании, результаты сопоставимы с Opus 5, но число шагов до завершения сократилось на треть–половину. На внутреннем бенчмарке Lovable Opus 5.5 сравнялся с Opus 5 в двух задачах — сборке от 0 до -1 и итеративных правках кода — и превзошёл его на 4%–6% по дисциплине проверки; при всех уровнях интенсивности рассуждений число шагов на задачу снизилось на 26%–57%, а объём входных токенов — на 21%–59%; различия значимы при доверительном уровне 95%.

    Почему это важно: Lovable официально приводит данные сравнения Opus 5.5 и Opus 5 по числу шагов и токенов — по ним можно оценить реальное изменение эффективности сборки.

22.09вт
  1. Sebastian Raschka72

    小米发布开源权重模型 MiMo-V2.6-Pro,在 Artificial Analysis 智能指数上以 46 分成为开源权重模型第一,每任务成本 0.13 美元,输入 0.435 美元/1M tokens、输出 0.87 美元/1M tokens,采用 1.02T 总参数、42B 激活参数的 MoE 架构。

    Ожидает перевода

    ЦитатаArtificial Analysis@ArtificialAnlys

    MiMo-V2.6-Pro debuts as the top open weights model on the Artificial Analysis Intelligence Index (46). At $0.13 per Intelligence Index task, it lands on the Intelligence vs. Cost per Task Pareto frontier @Xiaomi has just released MiMo-V2.6-Pro, an open weights model with major advances in intelligence over its predecessor, MiMo-V2.5-Pro (Intelligence Index: 26). Despite the improvement, it retains the same attractive pricing at $0.435 per 1M input tokens (with a 99% cache-hit discount) and $0.87 per 1M output tokens. This makes MiMo-V2.6-Pro one of the most cost-efficient models to deploy. MiMo-V2.6-Pro is an MoE model with 1.02T total parameters and 42B active parameters. Stay tuned for additional analysis of the model. Check out MiMo-V2.6-Pro full benchmarking breakdown here: https://artificialanalysis.ai

15.09вт
  1. Lovable · Blog64

    Lovable открыла исходный код превью-движка OJ на Rust: холодный старт и потребление памяти лучше, чем у Vite

    Lovable выпустила превью-движок OJ, с нуля реализованный на Rust: он читает существующий vite.config.ts и через слой совместимости запускает настоящие плагины Vite — один бинарник, без установки инструментов в проект.

    Почему это важно: Lovable переписала превью-движок OJ на Rust и привела сравнение с Vite по холодному старту и потреблению памяти, а также данные канареечного развёртывания в продакшене.

  2. Cline · Blog62

    Cline выпускает открытое настольное приложение Cline Desktop для моделей с открытыми весами

    Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.

    Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.

12.09сб
  1. GitHub Blog · Copilot58

    把市场运营写成代码:用 GitHub Copilot 和 Actions 自动跑完活动全流程

    GitHub 日本和韩国市场的营销负责人把活动运营流程自动化:用 Issue 表单收集活动信息,用 event-setup 标签触发 GitHub Actions,自动复制落地页、生成 UTM 链接、提交邀请邮件并同步项目看板,原本要花近一天的工作缩短到几分钟。

    Ожидает перевода

11.09пт
  1. OpenAI Developer Blog · Codex66

    OpenAI рассказал, как переписать Skills и промпты под GPT-6 Astra

    В официальном блоге OpenAI даны рекомендации по настройке Skills, AGENTS.md и промптов задач под GPT-6 Astra: описание Skill должно быть по возможности коротким и чётко указывать, где он применим; для многошаговых Skills корневой документ служит минимальной маршрутизацией — не стоит превращать Skill в слишком детальный список шагов.

    Почему это важно: OpenAI опубликовал рекомендации по чистке Skills, AGENTS.md и промптов под GPT-6 Astra — их можно перенести и на конфигурацию существующих репозиториев.

10.09чт
  1. Cursor · Changelog76

    Cursor выпустил функцию «Проекты» — она позволяет координирующему ИИ-агенту брать на себя длительные задачи разработки

    Cursor выпустил функцию «Проекты» для длительной работы — например, над одной фичей, миграцией или целым приложением. Она месяцами удерживает контекст и делегирует задачи тысячам подчинённых ИИ-агентов. Проекты работают на облачных агентах: координирующий агент не пишет код, а только планирует, распределяет задачи и принимает результаты; когда нужны локальные тесты, он запускает локальных агентов. В каждом проекте поддерживается набор файлов, синхронизируемых между облаком и локальными машинами, — так постепенно накапливаются результаты исследований, артефакты и понимание кодовой базы.

    Почему это важно: В официальном описании приведены механизмы совместного использования контекста и автоматического запуска для многолетней работы нескольких агентов в рамках проекта — по ним можно понять, как именно берут на себя длительные задачи.

05.09сб
  1. GitHub Blog · Copilot71

    GitHub Copilot представил Project HydraFusion — многомодельную оркестрацию на уровне рантайма для повышения качества кода

    GitHub выпустил Project HydraFusion в Copilot CLI в статусе исследовательского превью: оркестрация на уровне рантайма выбирает, какая модель из нескольких провайдеров будет выполнять задачу. Пользователь выбирает HydraFusion так же, как обычную модель, а оплата идёт по стандартным тарифам каждой модели.

    Почему это важно: GitHub приводит сравнение трёх режимов оркестрации HydraFusion и трёх базовых вариантов по стоимости и качеству — по нему можно судить, что даёт многомодельная оркестрация на реальных задачах программирования.

04.09пт
  1. OpenAI Developer Blog · Codex71

    Как построить игру с помощью Astra в Codex: от Void Explorer до оптимизации производительности

    Автор построил в Codex с помощью Astra космическую исследовательскую игру Void Explorer — с 2,048 звёздными системами и более чем 10,000 процедурно генерируемыми планетами — и рассказал о полном процессе: от промпта до архитектуры, тестирования и измерения производительности.

    Почему это важно: Автор использовал Astra в Codex, чтобы сделать полноценную игру, и показал переносимый процесс совместной работы — от промпта до тестирования и измерения производительности.

03.09чт
  1. Cline · Blog74

    Как Cline перевела 1100 тысяч пользователей на крупнейшее обновление harness

    Cline перенесла расширение VS Code с монолитного ядра примерно на 76,000 строк на Cline SDK и построила собственный механизм постепенного выката: в одном установочном пакете лежат loader и две версии расширения — legacy и next, — а функциональный флаг PostHog по проценту решает, какую активировать; при падении происходит автоматический откат к legacy, а флаг в любой момент можно опустить до 0% как kill switch.

    Почему это важно: Официальный разбор того, как Cline перевела расширение VS Code для 1100 тысяч пользователей на новый harness, с механизмом постепенного выката и сравнением метрик до и после.

  2. GitHub Blog · Copilot72

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub Copilot 团队复盘了四项降低 AI 编码成本的改动,核心原则是按完整任务而非单次工具调用衡量效率。

    Ожидает перевода

    Почему это важно: GitHub Copilot 团队复盘四项降本改动,并给出可迁移的评估方法:按完整任务而非单次工具调用衡量成本。

02.09ср
  1. Cursor · Changelog66

    Cursor выпускает self-hosted машины: выполнение инструментов остаётся внутри вашей сети

    Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.

    Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.

30.08вс
26.08ср
  1. Cline · Blog71

    Строим ИИ-агента для код-ревью на базе Cline SDK и цикла Cline

    Команда Cline собрала на Cline SDK ИИ-агента для код-ревью: проверка разбита на два цикла агента — review и judge, — а управляющий скрипт затем отправляет все оставшиеся замечания одним событием COMMENT в пул-реквест на GitHub.

    Почему это важно: Полный разбор плагина, хуков и двухэтапного цикла ИИ-агента для код-ревью, который можно перенести на другие сценарии автоматизированной проверки.

25.08вт
  1. Lovable · Blog62

    Lovable: как подключить собственное приложение к внешним технологическим стекам — от MCP до почти 100 коннекторов

    Lovable официально разобрала, как подключить приложения платформы к сторонним сервисам: сначала поддержали MCP как временное решение для получения контекста в чате, затем создали собственные app connectors, а запросы между опубликованными приложениями и сторонними API проксирует Connector Gateway — он хранит учётные данные и логику их обновления, так что развёрнутые приложения не касаются секретных ключей.

    Почему это важно: Lovable официально разобрала, как превратить коннекторы в переиспользуемую инфраструктуру; этот опыт будет полезен командам, которые занимаются интеграциями со сторонними сервисами и управлением учётными данными.

  2. OpenAI Developer Blog · Codex62

    Автоматизация повторяющихся задач оценки в OpenAI с помощью Codex и ноутбука Runme

    Инженеры OpenAI используют Codex вместе с открытым приложением для ноутбуков Runme, чтобы автоматизировать рутинную работу, например запуск оценки моделей. Делается это так: в ноутбуке Runme пишут целевые ячейки, Codex читает цель, составляет план и ждёт одобрения человека, а затем выполняет его, фиксируя команды, вывод и выводы — включая пройденные тупики.

    Почему это важно: Автор передал процесс оценки Codex с помощью ноутбука Runme и WebMCP; читатели могут перенять его подход к постановке целей, согласованию и накоплению контекста.

21.08пт
  1. OpenAI Developer Blog · Codex65

    OpenAI выпустила Daybreak и рабочий процесс безопасности Codex Security

    OpenAI представила Daybreak — набор инструментов для защиты, объединяющий ChatGPT, Codex Security и открытый CLI Codex Security. Он покрывает проверку пул-реквестов до слияния, разбор репозиториев и накопившихся уязвимостей, а также регулярные проверки в CI.

    Почему это важно: В официальной документации описан полный сценарий работы с Codex Security — от проверки пул-реквестов и сканирования репозиториев до пакетного сканирования через CLI. По нему можно понять, как встроить инструмент в существующие процессы безопасности.

19.08ср
  1. Cursor · Changelog66

    Cursor обновляет облачного агента и Harness: подписка на события, независимая работа субагентов и /goal

    Cursor обновил облачного агента и Cursor harness: теперь облачный агент может подписываться на источники событий и возобновлять работу при новых изменениях в PR, обсуждениях в Slack или по расписанию, продолжая работу до завершения — исправляя проблемы CI и обрабатывая комментарии ботов.

    Почему это важно: Облачный агент переходит от однократного выполнения к подписке на события и постоянному сопровождению PR и обсуждений в Slack — читатели могут оценить, как меняются границы автоматизации.

  2. Cline · Blog71

    Методика оценки и трассировка открытых моделей Cline

    Cline открывает методику оценки своих открытых моделей и выкладывает для скачивания и анализа трассировки и результаты «восхождения», стоившие больше тысячи долларов. В статье приводится Hill Climber's Checklist — пять эвристик: задать метрику-«Полярную звезду», измерить шум, разложить режимы отказа по задачам, моделям и поставщикам, не считать по умолчанию, что чем больше рассуждений, тем лучше, и сохранять закрытый оценочный набор.

    Почему это важно: Cline публикует методику оценки и трассировки на тысячи долларов и даёт пять переносимых эвристик «восхождения», полезных командам, которые собирают собственный harness.

  3. OpenAI Developer Blog · Codex71

    OpenAI открыла исходный код Codex harness и опубликовала клиентский протокол app-server

    OpenAI выложила в открытый доступ harness, на котором работают приложение Codex, CLI и расширения для IDE, а через клиентский протокол Codex app-server открыла такие возможности, как создание потоков, запуск раундов, получение событий и обработка запросов на утверждение.

    Почему это важно: Компания официально опубликовала harness Codex и протокол app-server — по ним можно понять, как встраивать ИИ-агентов в собственные продукты и где проходят границы такого встраивания.

18.08вт
  1. Lovable · Blog74

    Как Lovable перенесла lovable.dev с Next.js на собственный стек TanStack Start

    За шесть месяцев Lovable перевела lovable.dev с месячной аудиторией 4200 на собственный хостинговый стек TanStack Start. Во время миграции оба фреймворка работали параллельно: прокси-воркер распределял трафик по маршрутам и пользователям. В итоге на код, специфичный для Next.js, осталось всего 3%.

    Почему это важно: Lovable официально разобрал, как перенёс 90 тысяч строк кода с Next.js на собственный стек TanStack Start: детали параллельной работы двух фреймворков, массовой миграции силами ИИ-агентов и одного инцидента с переполнением памяти можно смело перенимать.

13.08чт
  1. Augment Code · Blog62

    Augment Code расширяет Cosmos: код-ревью превращается в замкнутый цикл ИИ-агентов от PR до слияния

    Augment Code расширил свою систему ревью Cosmos с код-ревью до полного замкнутого цикла от PR до слияния, добавив четыре возможности: Verifier, PR Fixer, Review Dashboard и cosmos approve. За анализ рисков, построчную проверку корректности, ревью дизайна, проверку во время выполнения и исправление отвечают отдельные специализированные эксперты.

    Почему это важно: Augment расширил код-ревью до замкнутого цикла от PR до слияния, охватывающего исправление, проверку и согласование, — читатели могут оценить, как на практике распределяются роли между несколькими ИИ-агентами.

11.08вт
  1. Cline · Blog60

    NVIDIA Nemotron 3.5 Lightning появился в Cline и доступен бесплатно

    NVIDIA выпустила Nemotron 3.5 Lightning — настраиваемую открытую модель для постоянно работающих ИИ-агентов, которая уже бесплатно доступна в Cline.

    Почему это важно: Новая открытая модель NVIDIA бесплатно доступна в Cline; читатели могут оценить, стоит ли переходить на неё при частых вызовах ИИ-агентов.

09.08вс
  1. Thorsten Ball · Register Spill22

    Joy & Curiosity #94:Amp 团队慕尼黑聚会,orbs 改变工作流

    Amp 团队在慕尼黑聚会,录制视频采访同事过去四周工作流的变化,结果所有人都已转向 orbs,不再关心本地开发环境,至少五人忘记迁移 dotfiles。作者还发布多段关于 AI、agents、orbs 和 jellyware 的原始视频,总时长约十五分钟。

    Ожидает перевода

05.08ср
  1. Vercel · v0 Blog62

    Vercel выпустил новую версию API v0 для программного вызова агентов генерации приложений

    Vercel выпустил новую версию API v0 — программный, безголовый доступ к агентам генерации приложений v0: отправляешь промпт, v0 создаёт приложение, поднимает сервер разработки в Vercel Sandbox и возвращает URL превью, который можно встроить в свой интерфейс. API уже доступен.

    Почему это важно: v0 открыл генерацию приложений через API — читатель может прикинуть, как встроить её в свой продукт или в работу агентов.

03.08пн
  1. OpenAI · Codex Cookbook71

    Итеративная разработка с Codex: от AGENTS.md до поэтапных файлов сборки

    OpenAI Codex Cookbook предлагает набор репозиторных соглашений для встраивания Codex в процесс разработки: AGENTS.md хранит постоянные инструкции для репозитория, PLANS.md служит источником поэтапных планов, а сами этапы разбиваются на файлы сборки в harness/build/ — для каждого этапа указаны цели, критерии приёмки, границы и точки согласования.

    Почему это важно: OpenAI официально описывает полное соглашение о структуре каталогов для ограничения Codex через AGENTS.md, PLANS.md и поэтапные файлы сборки — его можно перенести в свой репозиторий.

02.08вс
30.07чт
  1. Terminal-Bench · News60

    Вышел Terminal-Bench 3.0: 74 задачи, 7 областей, у сильнейших моделей проходимость около 34%

    Команда Terminal-Bench выпустила Terminal-Bench 3.0 — первая версия включает 74 задач в 7 областях, у сильнейших моделей проходимость около 34%. По сравнению с Terminal-Bench 2.1 здесь больше разнообразия задач, а для постоянного улучшения бенчмарка добавили CI/CD, семантическое версионирование и перенос результатов.

    Почему это важно: Terminal-Bench 3.0 пересобирает бенчмарк на 74 задачах и версионировании через CI/CD — читатель увидит, как новый бенчмарк разводит модели по результатам.