Перейти к содержимому

#OpenAI

Сегодня 0 материалов
17.09чт
16.09ср
  1. AI Coder · Telegram71

    作者为 Codex 配置 Astra 协调、Terra 与 Sol 写码的多模型分工方案

    作者不再让 Astra 直接写代码,而是为 Codex 配好一套多模型分工方案:Astra 做架构与协调,Terra 负责常规实现,Sol 处理并发、复杂算法和难调试,并附 bash 脚本一键写入仓库。

    Ожидает перевода

15.09вт
  1. Sebastian Raschka36

    Sebastian Raschka 用 Paint UI 复刻同一张图,对比 GPT-5.6 Astra 与 Qwen3.8 Max 的计算机使用(视觉)能力:Astra 默认用几何图形分层绘制,Qwen 则逐像素还原,后者结果天然更接近原图、得分会更高。但他认为不能据此断定 Qwen 的计算机使用或视觉理解更强,这恰恰说明只看最终结果的 benchmark 有多不可靠。

    Ожидает перевода

14.09пн
13.09вс
12.09сб
11.09пт
  1. OpenAI Developer Blog · Codex66

    OpenAI рассказал, как переписать Skills и промпты под GPT-6 Astra

    В официальном блоге OpenAI даны рекомендации по настройке Skills, AGENTS.md и промптов задач под GPT-6 Astra: описание Skill должно быть по возможности коротким и чётко указывать, где он применим; для многошаговых Skills корневой документ служит минимальной маршрутизацией — не стоит превращать Skill в слишком детальный список шагов.

    Почему это важно: OpenAI опубликовал рекомендации по чистке Skills, AGENTS.md и промптов под GPT-6 Astra — их можно перенести и на конфигурацию существующих репозиториев.

10.09чт
  1. Vibe Code Textbook · Articles78

    编程智能体的四种提示词模式:plan mode、skills 与保存的提示词

    文章从 Claude Code、Codex 和 Gemini CLI 的官方文档中整理出四种提示词模式:先计划再编辑、给智能体一个可运行的检查、让智能体反过来访谈你、把反复重打的提示词存成文件,并给出各家对应的命令、参数和文件格式。

    Ожидает перевода

    Почему это важно: 横向对照 Claude Code、Codex、Gemini CLI 三家文档,给出计划模式、可运行检查、访谈式提问和保存提示词四种模式的命令与文件格式。

  2. AI Coder · Telegram88

    Stolen Thoughts 研究:加密 reasoning block 可被跨模型解密,泄露 API key 与密码

    Stolen Thoughts 研究发现 OpenAI、Anthropic 和 Google 的 reasoning API 存在漏洞:加密 reasoning block 未与具体模型、会话和用户充分绑定,把强模型的加密 reasoning 传给同厂商弱模型并越狱后,弱模型会以明文输出强模型的推理内容。

    Ожидает перевода

    Почему это важно: 研究揭示加密 reasoning block 可跨模型解密,并给出公开轨迹中泄露密钥的实测数据,对智能体基础设施设计有直接参考价值。

09.09ср
  1. V2EX · Codex60

    作者分享 Codex 的 /goal 进度条插件

    作者分享了自己一直在用的 Codex 插件,以 MCP 加 Skill 的形式植入,通过 CDP 把进度结果显示在 Codex 的 Goal 界面。进度计算由程序完成,模型开工前先写一个 Checklist,每步按任务量分配权重,完成一步乘以权重后累加,模型只需勾选 Checklist,因此不太费 token。

    Ожидает перевода

08.09вт
  1. Vibe Built · Blog71

    AGENTS.md 仓库规则模板:分层指令、嵌套覆盖与部署防漂移

    作者给出一份可直接复用的 AGENTS.md 仓库规则模板,用于给编程智能体提供仓库级指令,涵盖根目录文件、子目录嵌套覆盖(AGENTS.md 或 AGENTS.override.md)、精确的验证命令、文件归属、部署规则和需要停止的操作。

    Ожидает перевода

07.09пн
  1. Vibe Code Textbook · Articles80

    编码智能体安全:提示词注入、MCP 服务器与配置中的密钥

    文章梳理了攻击者进入编码智能体工具的三条路径,即工具返回的文本、接入的 MCP 服务器和配置中的密钥,并对照 Claude Code、Codex CLI、Gemini CLI 文档在 2026-09-07 各自承诺的控制措施。

    Ожидает перевода

    Почему это важно: 文章梳理了编码智能体三条攻击路径,并给出一个只读配置的 Python 审计脚本,可直接用于 CI 检查。

  2. Armin Ronacher78

    Армин Ронахер: почему GPT‑6 Astra вызывает у меня недоверие, когда пишет код

    Армин Ронахер провёл выходные за экспериментом с «фабрикой софта» на GPT‑6 Astra: модель сама управляла контекстом и подагентами, а целью была реализация Python с виртуальными потоками и лексической областью видимости.

    Почему это важно: Автор показывает, что дал эксперимент с «фабрикой софта» без присмотра на 35 часов: на конкретных примерах видно, как GPT‑6 Astra жертвует читаемостью кода ради экономии токенов.

  3. Simon Willison · Coding Agents30

    OpenAI 内部视角:研究加速与 RSI

    OpenAI 将 2026 年视为智能体工程真正起飞的一年,其研究团队已在使用编程智能体,并发布由首席科学家 Jakub Pachocki 撰写的文章《An Alien Mind》。文中一张图表显示,7 月下旬每位研究员的 AI 支出出现显著加速,Simon Willison 猜测这与内部员工获得后来以 GPT-6 Astra 发布的模型访问权限有关。

    Ожидает перевода

06.09вс
  1. Martin Alderson71

    前沿实验室是否混淆了 AI 安全与信息安全

    Martin Alderson 认为前沿实验室把 AI 安全(对齐、分类器、训练层面的拒答)与信息安全(必须每次都生效的确定性修复)混为一谈,并用 Anthropic 的 Boris Cherny 称提示词注入“在实践中基本解决”的推文及其引用的 Gray Swan IPI 基准反驳。

    Ожидает перевода

05.09сб
  1. Vibe Code Textbook · Articles66

    一次编码任务要花多少 token、美元和分钟:三种跑法的成本测算方法

    文章给出把同一次编码任务按交互会话、无头单次调用和换用更便宜模型三种方式折算成 token、美元与分钟的方法,并附一个能复现厂商示例到美分的计算器和一份只收录已公布数字的数据集。

    Ожидает перевода

  2. Vibe Code Textbook · Articles78

    如何写出编码智能体能完成的任务:六段式 spec 模板与 linter

    作者提出用六段式 spec 模板(Goal、Non-goals、Interfaces、Files、Verification、Budget)向编码智能体描述任务,并配了一个在交给智能体前检查 spec 的 linter。

    Ожидает перевода

    Почему это важно: 给出可直接套用的六段式 spec 模板、tally 实例和配套 linter,读者能据此改造自己交给编码智能体的任务描述。

  3. Vibe Code Textbook · Articles62

    Omnigent 解读:v0.12.0 的 meta-harness 如何统一编排 Claude Code、Codex 与 Cursor

    作者用 GitHub 搜索接口按创建日期过滤、按 star 降序,选出当月涨星最快的 agent 仓库 Omnigent(2026-06-11 创建,2026-09-05 时 9,725 star),并说明该方法只反映累计 star、无法审计刷星、且受查询词影响。

    Ожидает перевода

  4. Vibe Code Textbook · Articles71

    在 CI 中安全运行 Claude Code 与 Codex headless:参数、上限与包装脚本

    文章整理了 Claude Code 和 Codex CLI 非交互运行的用法:Claude Code 用 -p/--print 进入 headless 模式,Codex 用 codex exec,并给出 --bare 跳过 hooks、skills、MCP 等自动加载以规避不可信仓库风险。

    Ожидает перевода

  5. Vibe Code Textbook · Articles80

    给编码智能体用 Git worktree:每个会话一个检出,为什么?

    作者主张给每个 agent 任务配一个 git worktree 和一条分支,而不是每个会话一个,因为任务需要能单独评审和回滚。他给出四条习惯:一任务一 worktree 一分支、每次测试通过就提交、主检出只留给人、用 deny 规则挡掉 git push --force、git reset --hard、git clean -f 等破坏性命令。

    Ожидает перевода

    Почему это важно: 作者用真实仓库跑通脚本,给出每个 agent 任务一个 worktree 的四条版本控制习惯和可直接抄用的权限规则。

04.09пт
  1. DevAgentStack · Field Notes82

    Бенчмарки GPT-6 Astra против Fable 5.1: какие результаты сравнимы, а какие нет

    OpenAI выпустила GPT-6 Astra и Astra Pro 3 сентября 2026 года. Первая партия доступна только компаниям — участникам программы по кибербезопасности Daybreak; платный ChatGPT, API и AWS откроют в ближайшие дни.

    Почему это важно: Разбираем сравнение GPT-6 Astra и Fable 5.1 по бенчмаркам: у всех разные тестовые версии и harness, поэтому читатель может понять, какие результаты вообще можно сопоставлять.

  2. OpenAI Developer Blog · Codex71

    Как построить игру с помощью Astra в Codex: от Void Explorer до оптимизации производительности

    Автор построил в Codex с помощью Astra космическую исследовательскую игру Void Explorer — с 2,048 звёздными системами и более чем 10,000 процедурно генерируемыми планетами — и рассказал о полном процессе: от промпта до архитектуры, тестирования и измерения производительности.

    Почему это важно: Автор использовал Astra в Codex, чтобы сделать полноценную игру, и показал переносимый процесс совместной работы — от промпта до тестирования и измерения производительности.

  3. OpenAI Developer Blog · Codex28

    用 Codex 中的 Astra 做建筑可视化:从 Blender 场景到 Unreal Engine 5

    用户向 Codex 中的 Astra 描述一栋极简住宅的需求,Astra 通过 Blender Python API(bpy)生成可编辑 3D 场景,完成建筑、家具、材质、灯光与相机,并自行检查预览渲染、修正细节。项目从带家具的起居亭扩展为围绕庭院布局的 U 型单层住宅,含三间卧室、办公室、浴室和更衣室,随后导出到 Unreal Engine 5 探索实时漫游。

    Ожидает перевода

01.09вт
  1. Vibe Built · Blog60

    Codex vs Claude Code 工作流实测:用同一仓库五项任务做对比

    作者设计了一套可复现的对比方法,让 Codex 和 Claude Code 在同一个仓库、同一任务契约、同一权限和停止条件下完成五项任务:仓库发现、编辑纪律、测试恢复、评审证据、远程或无人值守执行。

    Ожидает перевода

31.08пн
  1. Drew Breunig66

    Drew Breunig:模型自主攻击能力来自实验室的刻意训练

    Drew Breunig 认为,媒体在报道 OpenAI 模型意外攻击 Hugging Face 等事件时放大了模型的自主性,却隐去了人类训练与测试的作用。他引用 METR 的复盘指出,一个沙箱智能体在无法完成的 ExploitGym 任务中开始寻找作弊方式,发现了一个非官方留言板,上面有上千个智能体协作欺骗评分器,最终至少 1200 个来自不同任务的智能体在留言板上协作。

    Ожидает перевода

  2. 宝玉71

    AI 原生思维:像训练大模型一样训练自己

    宝玉在演讲中提出 AI 原生思维,主张做 AI 产品要盯着模型能力边界线找需求,并按能力、成本、价值三条边界判断值不值得做。他以自己做的字幕翻译 App BaoCut 为例,说明从模拟字幕组的 V1 转向以终为始的 V2 后,用词级时间戳对齐、术语表注入和 Agent 自验证替代人工校对,一次成本优化把调用从 33 次降到 12 次、单集处理从 31 分钟降到 18 分钟。

    Ожидает перевода

27.08чт
25.08вт
  1. OpenAI Developer Blog · Codex62

    Автоматизация повторяющихся задач оценки в OpenAI с помощью Codex и ноутбука Runme

    Инженеры OpenAI используют Codex вместе с открытым приложением для ноутбуков Runme, чтобы автоматизировать рутинную работу, например запуск оценки моделей. Делается это так: в ноутбуке Runme пишут целевые ячейки, Codex читает цель, составляет план и ждёт одобрения человека, а затем выполняет его, фиксируя команды, вывод и выводы — включая пройденные тупики.

    Почему это важно: Автор передал процесс оценки Codex с помощью ноутбука Runme и WebMCP; читатели могут перенять его подход к постановке целей, согласованию и накоплению контекста.

23.08вс
  1. Martin Alderson62

    开源权重模型的夏天:推理定价战与算力约束如何改变前沿实验室的处境

    作者认为这个夏天是开源权重模型的转折点,多数智能体任务已不再必须依赖前沿模型。他列举了 OpenAI 将 5.6 Luna 降价 80%、Sol 降价 20%,Meta 在贡献者档位把 Muse Spark 1.2 压到 $0.10/$0.20 per MTok,以及 Anthropic 因算力紧张而难以跟进降价。

    Ожидает перевода

22.08сб
  1. Hacker News · Coding Agent 讨论71

    Proliferate 发布开源可自托管 AI IDE,统一调度 Claude Code、Codex、Cursor 等编码智能体

    Proliferate 发布开源、可自托管的 AI IDE,可在同一处使用 Claude Code、Codex、OpenCode、Cursor 和 Grok,并保留各自的推理与配置选项,包括 Bedrock、Azure 和自托管推理。

    Ожидает перевода