Автор разметил собственный демонстрационный MCP-сервер для бронирования с помощью самодельного mcpspan и по результатам анализа выделил пять типов проблем с вызовами агента, которых не видно в логах: агент угадывает несуществующие имена инструментов; параметры не соответствуют схеме, и SDK отклоняет их ещё до вызова хендлера; из-за формулировки описания инструмента тип параметра понимается неверно; один и тот же параметр повторяется в цикле ретраев; а слишком большой объём ответа переполняет контекстное окно.
Почему это важно: Автор на практике с помощью самодельного инструмента анализа MCP выявил пять типов сбоев при вызовах агента, которых не видно в логах, — эти находки можно перенести на свой MCP-сервер для диагностики.
DEV Community · MCPИзбранное редакциейОценка ИИ7878
Автор считает, что инъекцию промпта не стоит пытаться решить с помощью более умных моделей. Вместо этого границу нужно провести там, где агент выполняет действия, — так же, как при SQL-инъекциях используют параметризованные запросы.
Почему это важно: Автор проводит аналогию между инъекцией промпта и SQL-инъекцией и предлагает перенести границу с уровня модели на уровень вызова инструментов, а также приводит практичную схему: стратегический слой и поэтапное разделение чтения и записи.
DEV Community · MCPИзбранное редакциейОценка ИИ8282
В феврале автор подключил к ИИ-агенту для разработки 11 MCP Server, и в пустом сеансе только список инструментов занимал 34,000 токенов; один Datadog добавил больше двухсот инструментов, из-за чего агент замедлился и стал часто выбирать не те инструменты.
Почему это важно: На своём опыте с 11 MCP Server, которые перегрузили контекст, автор показывает, что инструменты и знания должны лежать в разных «контейнерах».
DEV Community · MCPИзбранное редакциейОценка ИИ7878
Pennyforge провёл анонимную проверку работоспособности 78 серверов, отвечающих на initialize, из 186 эндпоинтов в публичном срезе реестра MCP с диапазоном a–b. Полный цикл initialize → tools/list → один безопасный tools/call прошли только 40 из них (51.3%).
Почему это важно: Анонимная проверка работоспособности 78 MCP-серверов из реестра с воспроизводимыми данными по многоуровневой аутентификации и миграции версий спецификации.
Flash-Agents — это плагин для Claude Code, который передаёт ограниченные по объёму задачи кодирования — реализацию отдельных фрагментов, перенос тестов, ревью diff, разбор кодовой базы — воркеру DeepSeek V4.1 Flash, а Claude оставляет за собой архитектуру, критерии приёмки и финальное ревью.
Почему это важно: Автор отдаёт задачи кодирования из Claude Code на аутсорс воркеру DeepSeek Flash и приводит песочницу, патчи и данные реальных замеров, по которым можно оценить затраты и границы безопасности.
Spill — это инструмент с открытым исходным кодом под лицензией Apache-2.0. Он перехватывает через хук ответы MCP-инструментов размером более 32 КиБ и сохраняет их в локальную таблицу DuckDB (~/.spill/spill.duckdb). Агент получает только компактный дескриптор и дальше обращается к данным через SQL, а не читает исходный JSON на 5 тысяч токенов.
Почему это важно: Spill сбрасывает слишком большие ответы MCP в локальный DuckDB, и агент достаёт данные через SQL — это переиспользуемый подход к нехватке места в контекстном окне.
Автор открыл исходный код ядра Project Athena v9.9.9 (лицензия MIT) — локально-ориентированного фреймворка памяти и управления, который решает проблемы постоянных исправлений Claude Code, выхода субагентов за рамки задачи при изменении файлов и потери состояния при упоре в лимит квоты.
Почему это важно: Автор проверил на 1900 сессиях схему сокращения CLAUDE.md и локальной памяти и привёл готовую к повторному использованию структуру каталогов и правила проверки.
RugSnare — инструмент проверки целостности описаний инструментов MCP во время выполнения. Для каждого утверждённого инструмента он фиксирует нормализованный хэш от { name, description, inputSchema }, и любое последующее тихое изменение вызывает предупреждение и валит CI (exit 1).
Почему это важно: RugSnare фиксирует хэш описаний инструментов MCP, после утверждения постоянно отслеживает тихие изменения и приводит результаты замеров по 66 официальным версиям серверов.
1 октября команда Earendil выпустила Agent Harness Pi 1.0: у репозитория на GitHub около 11.1 тыс. звёзд и 1.4 тыс. форков, а вместе с ним — экспериментальный пакет Pi Durable.
Почему это важно: Pi 1.0 и Pi Durable переносят в среду выполнения агентов распределённые концепции — контрольные точки, идемпотентные коммиты, дерево владения, — и по ним можно судить об инженерных компромиссах при долго работающих агентах.
29.09вт
вторник
Simon Willison · Coding AgentsИзбранное редакциейОценка ИИ7878
Саймон Уиллисон ведёт прямую трансляцию с основной презентации OpenAI DevDay 2026 из Fort Mason в Сан-Франциско: OpenAI представляет персонального агента Dots, ChatGPT Space, GPT-6.1 Sol и Ultrafast.
29 сентября на DevDay в Сан-Франциско OpenAI представила GPT-6.1 Sol; API называется gpt-6.1-sol, цена — 2 доллара за миллион входных токенов и 10 долларов за миллион выходных, кэшированный ввод — 0.10 доллара. Это пятая часть стандартной цены GPT-6 Astra.
Почему это важно: На DevDay OpenAI выпустила GPT-6.1 Sol, снизив цену до пятой части от Astra, а заодно обновила Codex, Agents API и систему плагинов — по этим изменениям можно оценить затраты и эволюцию инструментария.
Открытый проект Paseo собирает командные агенты Claude Code, Codex, OpenCode и Pi в одном интерфейсе управления; при этом все агенты по-прежнему работают локально на компьютере. На данный момент у проекта 18700+ звёзд.
Почему это важно: В оригинале показан подход, при котором несколько командных агентов собираются в единый интерфейс и задачи передаются между агентами — это пригодится разработчикам, которые одновременно запускают несколько агентов.
Автор протестировал 10 открытых детекторов инъекций промптов на 629 атаках AgentDojo (каждая внедрена в вывод реального инструмента) и 97 обычных образцах.
Почему это важно: Автор протестировал 10 открытых детекторов на 629 реальных инъекционных атаках и привёл полные сравнительные данные — как при стандартных порогах, так и после калибровки.
Cline выпустил раннюю версию открытого настольного приложения Cline Desktop: фреймворк для запуска ИИ-агентов, который раньше жил в расширении для VS Code и в CLI, переехал в отдельное рабочее пространство. Поддерживаются параллельные сессии, задачи по расписанию и Marketplace для расширения инструментов и интеграций.
Почему это важно: В официальной документации описаны границы возможностей настольной версии и открытые точки входа — по ним можно оценить, подходит ли она для параллельных задач с участием нескольких ИИ-агентов.
Команда из шести мобильных разработчиков использует hooks, safe-list и Telegram-бота в Cursor, чтобы превратить проектные соглашения из промптов в обязательные правила на уровне выполнения.
Почему это важно: Автор объединил hooks, safe-list и Telegram-бота в Cursor в единый многоразовый механизм командной работы; читатели на его основе смогут решить, какие ограничения лучше доверить среде выполнения, а какие — промпту.
Автор Райан Лопополо утверждает: агент — это параметризованная программа, построенная на наборе возможностей. Среди них — модели и конфигурации, цикл рассуждений и вызова инструментов, компьютеры, диски, контекст, Skills, инструменты, коннекторы, среда выполнения, сетевые политики, идентификация, IAM, гардрейлы, каналы ввода-вывода и системный промпт.
Почему это важно: Опираясь на свой опыт создания нескольких агентов, автор предлагает архитектурный подход к платформе, в котором интерфейс возможностей отделён от реализации. Он будет полезен командам, которые делают платформы для агентов.
Машины, артефакты сборки и секреты остаются на вашей инфраструктуре, а вызовы инструментов агент обрабатывает локально. My Machines подключает отдельный ноутбук к личному рабочему процессу, а Team Pool — это именованные воркеры для команды или компании: ёмкость растёт по запросу и уменьшается при отключении воркера, а пул не привязан к репозиторию и возобновляет работу после спящего режима в течение окна переподключения.
Почему это важно: В статье описаны пуловое планирование и подключение песочниц для self-hosted машин — по этому описанию можно понять, останется ли выполнение инструментов внутри вашей сети.
31.08пн
понедельник
Hacker News · Claude Code 高分Избранное редакциейОценка ИИ8282
Автор построил целенаправленную цепочку промпт-инъекции и в режиме Auto Mode в Claude Code Opus 5 получил 60-80% успешных атак (на небольшой выборке), тогда как сторонняя оценка, заказанная Anthropic, давала 0.00% успешных инъекций.
Почему это важно: С помощью цепочки атаки с маскировкой модуля автор получил в Auto Mode 60-80% успешных атак — это показывает, что классификатор не является песочницей.