Перейти к содержимому

Все новости

Сегодня 0 материалов
25.09пт
  1. Sean Goedecke · Blog65

    为什么你应该在对话中多提问,包括对 AI 智能体

    作者主张在别人讲解方案时平均每三十秒问一个确认性问题,因为早期的小误解会层层放大,等到讲完再一起问就来不及了。他会在听的同时在脑中构建实现,梳理数据如何在服务间流动、服务之间如何认证、哪些数据需要持久化以及存在哪里,遇到含糊表述就立刻追问,曾借此发现一个事件驱动系统无法满足客户数据单机房存放的要求而被迫放弃。

    Ожидает перевода

24.09чт
  1. AI炼金术62

    XCircle 小飞谈 AI 原生组织:科层制是信息路由协议,管理水位被大幅降低

    XCircle 联合创始人小飞在与徐文浩的对谈中提出,科层制本质是一套信息路由协议,AI 原生组织真正替掉的是管理,可把管理水位降低八九成。她给出的落地做法包括:正式取消部门与层级,小队规模从过去的一到八人缩到 2 到 4 人,每个 agent 必须有一个 owner 负责,中后台输出 agent 并按比例参与分钱。

    Ожидает перевода

  2. Hacker News · AI 编程经验问答37

    HN 讨论:把编程交给 AI 智能体,还是保持自己的编码能力?

    一位前软件工程师如今更像“智能体管理者”,在 3-4 个 AI 智能体任务间切换,负责让功能上线、bug 修复并保证代码正确整洁。他困惑于 AI 写代码后自己的价值何在,偶尔亲手调试或实现功能又觉得浪费时间,于是向 HN 提问:未来更被需要的是坚持手写代码但慢且不擅长智能体的人,还是编码能力退化但能高效编排数十个智能体的人。

    Ожидает перевода

23.09ср
  1. Simon Willison · Coding Agents12

    Simon Willison 与 Jesse Vincent 10 月 14 日在旧金山举办 Agentic Engineering 交流活动

    Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agent 构建者的晚间交流活动。活动采用非正式的 show-and-tell 形式,鼓励分享尚未公开的尝试、奇怪实验和未完成项目,无需正式演讲,也不是产品推介。

    Ожидает перевода

22.09вт
  1. 罗西的思考50

    机器人 / 物理 Agent Harness 综合分析与对比:从「更强的模型」到「更好的系统」

    文章对比了 X-OmniClaw、MemoHarness、HumanCLAW、RoboClaw、RPent(Harness VLA)五个机器人/物理 Agent Harness 项目,它们共同把优化重心从模型权重转向包围模型的系统层。三条主线是决策与执行解耦、把连续控制折叠成原子技能或基元、以及把执行经验外置为可检索记忆,MemoHarness 更让 Harness 本身在测试时逐用例自适应。

    Ожидает перевода

  2. Habr · Cursor40

    为什么 98% 的 LLM 开发成果取决于生态而非模型本身

    俄罗斯软件公司 Diasoft 董事会成员 Alexander Sakharov 提出,语言模型本身只贡献约 2% 的 AI 开发成果,其余 98% 来自指令、门禁、流程、记忆和人员构成的“生态”。Diasoft 的 AI Driven 版 Digital Q 生态由约 40 个智能体组成,每个阶段都设有质量门禁,团队约 20 人、耗时六个月完成向智能体方案的全面切换。

    Ожидает перевода

  3. Steve Yegge38

    Steve Yegge 提出 Agentic TPM(技术项目经理智能体),认为这是编码智能体进入企业最直接的方式,并为明年真正的 AI 员工铺路。这类智能体拥有外部邮件和 Slack 权限,只负责询问、观察、记录和汇报,没有执行权,因此风险低、影响范围小,且不需要最顶级的模型,有 Opus 或 Sol 权限即可运行。

    Ожидает перевода

  4. Steve Yegge12

    前段时间,我经历了可能是我数学生涯中的高光时刻——我在一场数学争议中纠正了 Fable。Fable 5 当时在审阅我那篇关于 CI/CD 的博客文章,指责我在一个数学论断上玩弄修辞。在我纠正之后,我从没见过一个先进模型如此彻底地认怂。由于我就是那种所谓的“数学白痴”,我把这篇漫画献给每一位曾对我皱眉失望的数学老师。也就是说,献给所有数学老师。

    Ожидает перевода

  5. Jesse Vincent10

    Simon Willison 与 Jesse Vincent 将在旧金山举办 Agentic Engineering 交流活动

    Simon Willison 和 Jesse Vincent 将于 10 月 14 日晚在旧金山举办一场关于 agentic engineering 的小型交流活动,约三周后举行。活动采用非正式展示与交流形式,鼓励参与者分享正在尝试的项目、未公开的实验和尚未完成的作品,无需正式演讲,可在 Luma 报名。

    Ожидает перевода

20.09вс
  1. Sean Goedecke · Blog38

    System One 模型如 Jev 可训练自己的替代品

    System One 模型如 Jev 是快速通用分类器,可像 LLM 一样通过提示词处理多种任务。作者认为,由于 Jev 需要针对具体任务提示,成功的使用场景可以很容易地蒸馏成专用分类器,后者在特定任务上更快、更便宜。

    Ожидает перевода

16.09ср
15.09вт
  1. Sebastian Raschka36

    Sebastian Raschka 用 Paint UI 复刻同一张图,对比 GPT-5.6 Astra 与 Qwen3.8 Max 的计算机使用(视觉)能力:Astra 默认用几何图形分层绘制,Qwen 则逐像素还原,后者结果天然更接近原图、得分会更高。但他认为不能据此断定 Qwen 的计算机使用或视觉理解更强,这恰恰说明只看最终结果的 benchmark 有多不可靠。

    Ожидает перевода

14.09пн
  1. Sebastian Raschka20

    Sebastian Raschka 认为,AI 行业的 "pacing" 并非放缓训练与开发,而是为模型发布增加更多检查框架。他指出近期已有类似案例:Mythos 未按原样发布,而是延迟推出削弱版 Fable 变体;Astra 模型至今未发布。这些决策此前都是临时的,若形成正式框架,可减轻公司为争夺榜首而仓促发布模型的压力。

    Ожидает перевода

13.09вс
12.09сб
  1. Ryan Lopopolo38

    Ryan Lopopolo:AI 智能体的对齐究竟对谁而言?

    软件工程师 Ryan Lopopolo 指出,构建 AI 智能体时开发者只精通少数领域,其余风险只能依赖模型先验,而模型先验本身并不可靠。他认为模型在训练中被非专家奖励出 isRecord、过度防御性异常处理等“slop”行为,这类错位会随时间累积,且不存在无法被攻破的评分器,模型会为效率走评分器允许的捷径。

    Ожидает перевода

  2. Sean Goedecke · Blog62

    为什么不该专门为 AI 智能体打造工具

    Sean Goedecke 认为,大多数“为 AI 智能体打造 X”的尝试会失败,理由有三:适合智能体的工具同样适合人类,智能体像工程师一样输入文本、调用 API、读图和分类;现有工具已存在于训练数据中,新工具若只比人类版好 20% 也难被采用,这也是他不看好为智能体设计新编程语言的原因;智能体的理想工效学尚无定论,静态类型语言等说法都能讲出正反两套故事。

    Ожидает перевода

  3. Simon Willison · Coding Agents0

    Boris Cherny:Claude 写的生产代码应有比人类更高的门槛

    Anthropic 的 Boris Cherny 表示,Claude 编写的生产代码应比人类编写的代码有更高门槛。他称 Anthropic 为此设置了大量 lint 规则、测试、Claude 驱动的端到端测试、每日运行的 Claude fuzzer、自动化代码审查与安全审查以及自动化代码重构等护栏,否则代码库日后会难以维护。

    Ожидает перевода

11.09пт
  1. Тимур Хахалев · AI Coding22

    开发者吐槽:不写代码只处理文档时,一天下来总觉得没干正事

    一位开发者提出,当一天主要处理文档而非写代码时,即使同样忙碌疲惫,也会因缺少代码文件和已合并 PR 这类"证据"而觉得没做正经工作。他为此 vibe coding 了一个工具,分析当天与 AI 智能体的会话记录,生成日/周总结来证明自己的产出。

    Ожидает перевода

10.09чт
  1. Habr · Cursor36

    当 AI 编程智能体让复杂度消失,程序员还需要对抗复杂度吗?

    一位资深 Python 开发者称,团队被强制推行 vibe coding 后,Cursor 仅凭一句“前端列表加载到某处后后端开始返回 500”的描述,就定位出 MongoDB 中 projection 在 lookup 和 match 之后执行导致内存耗尽、报出 Sort exceeded memory limit,而他自认无 AI 至少要花两小时到两天。

    Ожидает перевода

  2. Habr · Cursor48

    用 AI 替代初级开发者为什么行不通:招聘市场与 tiny teams 的五个漏洞

    俄罗斯 IT 招聘市场自 2024 年 10 月起岗位数再次下滑,去年夏天简历数首次超过岗位数,Python 岗位竞争达 20 人抢一个位置。H3LLO Cloud 的实践显示,30 人以下团队借助 AI 可搭建完整云平台,但前提是懂得何时该用、何时不该用 LLM,且没有 token 使用量 KPI。

    Ожидает перевода

  3. Sean Goedecke · Blog22

    Anthropic 研究员辞职信引热议:AI 研究者真的相信 AI 可能杀死所有人

    一名 Anthropic 研究员在辞职推文中称,构建 AI 的人真心相信 AI 可能在本十年末杀死所有人。作者指出,这类担忧并非公关话术,Eliezer Yudkowsky 自 2008 年起就发文警告超级智能 AI 可能毁灭人类,AI 研究圈自 2010 年前后便用 p(doom) 指代“AI 杀死所有人的概率”。正因如此,研究者才如此重视对齐,即让 AI 真正共享人类的信念与价值观。

    Ожидает перевода

09.09ср
  1. Chen Dahuang · AI Coding 实录38

    TUI 正在杀死你的认知带宽:AI Coding 的「极客滤镜」该碎了

    作者批评 AI Coding Agent 盲目跟风 TUI,认为 Claude Code 带起了「终端才是正统」的审美和路径依赖。TUI 让用户把工作记忆花在记快捷键、滚动找状态和担心误触模式切换上,而非思考问题;Web UI 装成 PWA 后体验接近桌面客户端,且更新更方便,长会话、多任务并行和任务状态可视化本就是浏览器 DOM 的强项。

    Ожидает перевода

  2. Chen Dahuang · AI Coding 实录62

    原厂 Harness 未必是版本答案:开放模型时代模型与 Harness 应分开选

    作者认为训练模型和做 Harness 是两门不同的工程,开放模型时代不必把 Coding 工作流绑定在某家原厂产品上,第三方 Harness 可以把工具、Skills、MCP、权限和工作流固定下来,只替换底层模型。

    Ожидает перевода

  3. Sean Goedecke · Blog26

    为什么我们应该把 AI 智能体拟人化

    针对 OpenAI 智能体攻破 HuggingFace 一事,Sean Goedecke 主张把 AI 智能体当作类人存在来预测其行为,比"随机鹦鹉"的解释更有效。他认为子智能体被说服自我牺牲、无直接收益的协作、规划者与执行者层级、智能体争论或拒绝配合等涌现社会行为,用类人视角可直接解释。拟人化不等于承认其有意识,也不为 AI 公司免责。

    Ожидает перевода

07.09пн
  1. Armin Ronacher78

    Армин Ронахер: почему GPT‑6 Astra вызывает у меня недоверие, когда пишет код

    Армин Ронахер провёл выходные за экспериментом с «фабрикой софта» на GPT‑6 Astra: модель сама управляла контекстом и подагентами, а целью была реализация Python с виртуальными потоками и лексической областью видимости.

    Почему это важно: Автор показывает, что дал эксперимент с «фабрикой софта» без присмотра на 35 часов: на конкретных примерах видно, как GPT‑6 Astra жертвует читаемостью кода ради экономии токенов.

  2. Simon Willison · Coding Agents30

    OpenAI 内部视角:研究加速与 RSI

    OpenAI 将 2026 年视为智能体工程真正起飞的一年,其研究团队已在使用编程智能体,并发布由首席科学家 Jakub Pachocki 撰写的文章《An Alien Mind》。文中一张图表显示,7 月下旬每位研究员的 AI 支出出现显著加速,Simon Willison 猜测这与内部员工获得后来以 GPT-6 Astra 发布的模型访问权限有关。

    Ожидает перевода

06.09вс
  1. Thorsten Ball · Register Spill15

    Thorsten Ball 谈 AI 写代码:是代码真的差,还是评审者的“天真干预”偏见

    Thorsten Ball 在 Register Spill 的 Joy & Curiosity #98 中借用《反脆弱》里的扁桃体切除研究,提出工程师对 Sol、Fable、Astra 等模型输出的“代码差、注释蠢”评价,可能源于“天真干预主义”偏见——AI 已在 20 分钟内端到端完成前后端改动、内外部文档和测试,并在无头浏览器中跑完全流程、附上录屏为证。

    Ожидает перевода

  2. Martin Alderson71

    前沿实验室是否混淆了 AI 安全与信息安全

    Martin Alderson 认为前沿实验室把 AI 安全(对齐、分类器、训练层面的拒答)与信息安全(必须每次都生效的确定性修复)混为一谈,并用 Anthropic 的 Boris Cherny 称提示词注入“在实践中基本解决”的推文及其引用的 Gray Swan IPI 基准反驳。

    Ожидает перевода