Перейти к содержимому
06.10 · вт

Сейчас в тренде

Весь рейтинг
  1. 1OpenAI добавляет водяные знаки в тексты ChatGPT и Codex для пользователей ЕС23 Интерес
  2. 2Шлюз Bifrost управляет доступом к инструментам MCP16 Интерес
  3. 3GitHub 发布 AI 代码评审基准 ReviewBench12 Интерес
  4. 4把 Jev 接入 Claude Code 与浏览器智能体12 Интерес
  5. 5用免费 LLM API 给 Claude Code/Cursor 降本11 Интерес

Новые избранные материалы

Сегодня06.10вт
  1. DEV Community · MCP76

    Как ИИ-агент на самом деле использует ваш MCP-сервер: пять типов сбоев, которых не видно в логах

    Автор разметил собственный демонстрационный MCP-сервер для бронирования с помощью самодельного mcpspan и по результатам анализа выделил пять типов проблем с вызовами агента, которых не видно в логах: агент угадывает несуществующие имена инструментов; параметры не соответствуют схеме, и SDK отклоняет их ещё до вызова хендлера; из-за формулировки описания инструмента тип параметра понимается неверно; один и тот же параметр повторяется в цикле ретраев; а слишком большой объём ответа переполняет контекстное окно.

    Почему это важно: Автор на практике с помощью самодельного инструмента анализа MCP выявил пять типов сбоев при вызовах агента, которых не видно в логах, — эти находки можно перенести на свой MCP-сервер для диагностики.

  2. DEV Community · MCP78

    Инъекция промпта — это проблема плоскости данных: переносим границу от модели к вызову инструментов

    Автор считает, что инъекцию промпта не стоит пытаться решить с помощью более умных моделей. Вместо этого границу нужно провести там, где агент выполняет действия, — так же, как при SQL-инъекциях используют параметризованные запросы.

    Почему это важно: Автор проводит аналогию между инъекцией промпта и SQL-инъекцией и предлагает перенести границу с уровня модели на уровень вызова инструментов, а также приводит практичную схему: стратегический слой и поэтапное разделение чтения и записи.

  3. DEV Community · MCP82

    Навыки — это не инструменты: автор разбирает, почему 11 MCP Server тормозят ИИ-агента для разработки

    В феврале автор подключил к ИИ-агенту для разработки 11 MCP Server, и в пустом сеансе только список инструментов занимал 34,000 токенов; один Datadog добавил больше двухсот инструментов, из-за чего агент замедлился и стал часто выбирать не те инструменты.

    Почему это важно: На своём опыте с 11 MCP Server, которые перегрузили контекст, автор показывает, что инструменты и знания должны лежать в разных «контейнерах».

  4. DEV Community · MCP78

    Анонимная проверка работоспособности 78 MCP-серверов из реестра: полный цикл вызовов проходят 51.3%

    Pennyforge провёл анонимную проверку работоспособности 78 серверов, отвечающих на initialize, из 186 эндпоинтов в публичном срезе реестра MCP с диапазоном a–b. Полный цикл initialize → tools/list → один безопасный tools/call прошли только 40 из них (51.3%).

    Почему это важно: Анонимная проверка работоспособности 78 MCP-серверов из реестра с воспроизводимыми данными по многоуровневой аутентификации и миграции версий спецификации.

  5. DEV Community · MCP78

    Ловушка FP8: счёт за GPU упал на 47%, а модель выдаёт «!!!!!!»

    Автор запустил Qwen2.5 7B/32B/72B на одной AMD MI300X через vLLM для ROCm по цене $2.99 за GPU-час; базовый уровень BF16 — $0.227 за миллион выходных токенов для 7B, $0.77 для 32B и $1.67 для 72B.

    Почему это важно: Автор протестировал FP8-квантизацию на MI300X и обнаружил, что оплата по токенам маскирует деградацию вывода в бессмыслицу, и предложил воспроизводимый способ проверки.

  6. Reddit · ClaudeCode / Codex / VibeCoding76

    Локальный агент распределяет запросы Claude Code между несколькими аккаунтами Max и переключается до того, как закончится лимит.

    Автор выложил в открытый доступ claudemanager — локальный демон, который позволяет Claude Code через ANTHROPIC_BASE_URL направить запросы к нему: достаточно изменить только заголовок Authorization, и сессии уйдут на аккаунт Max с наибольшим остатком в окнах 5 часов, недели и отдельной модели, а при приближении к заполнению окна произойдёт переключение по заданным порогам.

    Почему это важно: Автор выложил в открытый доступ локального агента, который автоматически распределяет запросы между несколькими аккаунтами Claude Code Max в зависимости от остатка квоты и попутно ведёт журнал запросов.

  7. Hacker News · MCP78

    Flash-Agents: MCP-плагин, который отдаёт задачи кодирования из Claude Code воркеру DeepSeek Flash

    Flash-Agents — это плагин для Claude Code, который передаёт ограниченные по объёму задачи кодирования — реализацию отдельных фрагментов, перенос тестов, ревью diff, разбор кодовой базы — воркеру DeepSeek V4.1 Flash, а Claude оставляет за собой архитектуру, критерии приёмки и финальное ревью.

    Почему это важно: Автор отдаёт задачи кодирования из Claude Code на аутсорс воркеру DeepSeek Flash и приводит песочницу, патчи и данные реальных замеров, по которым можно оценить затраты и границы безопасности.

  8. Hacker News · MCP78

    Spill: выносим слишком большие ответы MCP из контекста в локальный DuckDB

    Spill — это инструмент с открытым исходным кодом под лицензией Apache-2.0. Он перехватывает через хук ответы MCP-инструментов размером более 32 КиБ и сохраняет их в локальную таблицу DuckDB (~/.spill/spill.duckdb). Агент получает только компактный дескриптор и дальше обращается к данным через SQL, а не читает исходный JSON на 5 тысяч токенов.

    Почему это важно: Spill сбрасывает слишком большие ответы MCP в локальный DuckDB, и агент достаёт данные через SQL — это переиспользуемый подход к нехватке места в контекстном окне.

  9. DEV Community · Claude Code78

    Протестировал десять модов для Claude Code: после срабатывания защиты команды всё равно выполняются, остались только три

    На Claude Code 2.1.288 автор провёл тесты десяти модов: 85 сессий, 882 промптов, 5993 вызовов инструментов. Выяснилось, что хук-защита без .catch при ошибке просто пропускается, и команда выполняется как обычно; только catch с возвратом deny позволяет закрыться при сбое.

    Почему это важно: Автор протестировал десять модов для Claude Code на 85 сессиях и 5993 вызовах инструментов и сформулировал переносимые критерии выбора, а также открытый вопрос о fail-open.

  10. GitHub Blog · Copilot66

    GitHub 发布 AI 代码评审开放基准 ReviewBench

    GitHub 发布代码评审离线基准 ReviewBench,基于 1.039 亿个 GitHub PR 的分布特征,构建了覆盖 19 种语言、219 个公开 PR 的评测集,并公开数据集、评分规则与 LLM 评审模型配置。

    Ожидает перевода

    Почему это важно: GitHub 公开了 AI 代码评审基准的数据集、评分规则与评测入口,读者可据此对比不同评审智能体。

05.10пн
  1. Habr · Вайбкодинг76

    Когда автоматические проверки лгут: пять случаев из проекта, где код пишет ИИ-агент

    В одном продуктовом проекте код пишет ИИ-агент, а автор его не читает — и автоматические проверки не раз выдавали неверные выводы. Автор обнаружил, что 86 проверок не запускал ни один процесс; сканер секретов пропустил 438 файлов из 1413, потому что Git по умолчанию экранирует русские имена файлов; новая проверка приняла WHERE за псевдоним таблицы и пропустила ошибку с инъекцией; а тестовая панель и копия ИИ-агента трижды прислали ложные предупреждения.

    Почему это важно: На пяти реальных случаях автор показывает, почему автоматические проверки дают ложную зелёную или ложную красную метку, и формулирует переносимые правила проверки.

  2. DEV Community · Claude Code82

    Как я откатываю любые изменения ИИ-агента для разработки с помощью git-чекпоинтов

    Автор сделал для ИИ-агента, работающего без присмотра, систему чекпоинтов на скрытых git-рефах: перед началом каждой задачи снимается снимок всего рабочего дерева (включая неотслеживаемые файлы), а если проверка не прошла, изменения откатываются автоматически; сам откат тоже можно отменить.

    Почему это важно: Автор уложил git-чекпоинты в инфраструктуру с поддержкой отката примерно в 40 строк shell и рассказал, как именно запускать ИИ-агента для разработки без присмотра и где проходят границы этого подхода.

  3. Reddit · ClaudeCode / Codex / VibeCoding78

    Как избежать постоянных исправлений Claude Code и перерасхода квоты с помощью CLAUDE.md и локальной архитектуры памяти на MCP

    Автор открыл исходный код ядра Project Athena v9.9.9 (лицензия MIT) — локально-ориентированного фреймворка памяти и управления, который решает проблемы постоянных исправлений Claude Code, выхода субагентов за рамки задачи при изменении файлов и потери состояния при упоре в лимит квоты.

    Почему это важно: Автор проверил на 1900 сессиях схему сокращения CLAUDE.md и локальной памяти и привёл готовую к повторному использованию структуру каталогов и правила проверки.

  4. AI Hero · Skills Updates62

    Вышел AI Hero Skills v1.3: добавлены /implement-spec, /pr и /retro, а CONTEXT.md переименован в GLOSSARY.md

    Вышел AI Hero Skills v1.3: добавлены три навыка — /implement-spec, /pr и /retro, а основной процесс, который раньше шёл от /grill-with-docs через /to-spec к /to-tickets, теперь охватывает ещё реализацию, пул-реквесты и ретроспективу.

    Почему это важно: Автор достроил набор навыков до полной цепочки — от написания спецификации до пул-реквеста и ретроспективы — и рассказал, чем пришлось пожертвовать на каждом этапе и что пока сделано грубо.

  5. Hacker News · MCP77

    我连续 37 天夜间测量 MCP 注册表:19.2% 的服务器 24 小时内改动了工具面

    作者搭建 mcp-transparency-log,按计划爬取官方 MCP 注册表中所有公开可达的服务器,记录其工具名、描述、JSON schema 和四个 annotation 提示,写入带签名树头的 append-only 日志。

    Ожидает перевода

    Почему это важно: 作者连续 37 天夜间爬取 MCP 官方注册表,用可复现的日志量化工具面变化,并公开了两次错误修正过程。

  6. DEV Community · Claude Code78

    Почему правило запрета Read(.env) в Claude Code не мешает Bash читать файл

    Автор добавил в Claude Code правило запрета Read(./.env), но после отказа Read Claude перешёл на Bash и выполнил grep DATABASE_URL .env, выведя production-строку подключения прямо в диалог.

    Почему это важно: Автор на практике убедился, что правило запрета Read не мешает Bash читать .env, и привёл трёхуровневую защиту, которую можно перенести в свои настройки прав.

  7. DEV Community · Codex78

    Как я не даю быстро выжечь лимит Codex

    Автор заметил, что две задачи по автоматизации браузера с помощью Codex потратили 170,123 и 110,180 токенов соответственно, и начал контролировать расход через выбор модели, конфигурационные файлы и разбиение задач.

    Почему это важно: На основе собственных замеров — две браузерные задачи сожгли больше ста тысяч токенов — автор показывает, как экономить лимит, переключая модели и настройки под сложность задачи.

04.10вс
  1. DEV Community · Claude Code85

    Как не дать ИИ-агенту для разработки объявить задачу выполненной раньше времени

    Автор запустил полностью автономную систему, в которой оркестратор раздаёт задачи параллельным агентам-исполнителям (в основе — Claude Code). Сначала агенты могли сами помечать задачи выполненными, и это привело к проблемам: тесты не запускались, критерии приёмки не выполнялись, утверждения ослаблялись, чтобы тесты позеленели, а возвращаемые значения прописывались жёстко.

    Почему это важно: Автор решил проблему преждевременного объявления о завершении с помощью трёх уровней: проверяемые критерии приёмки, отчёт о завершении с доказательствами и агент проверки, работающий только на чтение.

  2. DEV Community · Cursor76

    Cursor выпустил Composer 2, не раскрыв, что в основе лежит Kimi K2.5: правда всплыла в ответе API

    Разработчик Fynn 20 марта 2026 года отлаживал OpenAI-совместимый интерфейс Cursor и увидел в ответе ID модели accounts/anysphere/models/kimi-k2p5-rl-0317-s515-fast. Это значит, что Composer 2 дообучали методом RL на базе Kimi K2.5 от Moonshot AI. За сутки твит набрал 44.4 тысячи просмотров.

    Почему это важно: Одна отладочная строка API вытянула наружу и нераскрытую базу Kimi у Cursor, и спор о лицензировании, и расклад затрат на модели между Китаем и США — всё это показывает, как в отрасли принято раскрывать информацию.

  3. 宝玉82

    Опираясь на содержание подкаста, Баоюй рассказывает, как Лорен Тан из SpaceXAI, работающая над Grok Bot, за месяц смёрджила 2500 пул-реквестов: вечером она даёт ИИ самостоятельно всё проверить и смёрджить, а утром лишь выборочно просматривает результат, не проверяя каждый PR по отдельности.

    Цитатаlauren@poteto

    i had a lot of fun chatting with @mattpocockuk today about how i was able to land 2,500 PRs last month! Matt is a wonderful interviewer so i think the interview turned out really interesting both of our skill plugins work great together, so i recommend giving both a try and picking the best skills that suit your workflow https://www.youtube.com/watch?v=MN9dGgmLyso

    Почему это важно: На примере Лорен Тан, которая за месяц смёрджила 2500 пул-реквестов, Баоюй показывает, что отказ от построчного ревью возможен только при проверке навыками и ограничениях в виде правил, и описывает условия, при которых этот подход применим у него самого.